Mapeamento de transformações de fluxo de dados no fluxo de dados gen2 (versão prévia)

Importante

As transformações de mapeamento de fluxo de dados no Dataflow Gen2 estão atualmente em prévia pública e estão sujeitas a alterações.

As transformações de fluxo de dados de mapeamento (MDF) no Dataflow Gen2 permitem criar, executar e monitorar transformações de dados baseadas em Spark diretamente no Data Factory do Microsoft Fabric.

As transformações MDF trazem os recursos do Mapeamento de Fluxo de Dados do Azure Data Factory e do Azure Synapse Analytics para o Microsoft Fabric por meio de uma experiência familiar de autoria visual de baixo código integrada ao dataflow gen2.

Com transformações de MDF, você pode:

  • Migrar os pipelines existentes de fluxos de dados de mapeamento do Azure Data Factory e do Azure Synapse Analytics para o Fabric.
  • Crie novas transformações baseadas no Spark diretamente no Fabric.
  • Executar transformações de MDF usando os pipelines de dados do Fabric.
  • Monitore a execução da transformação usando experiências de monitoramento integradas.
  • Continue a usar padrões conhecidos de transformação de fluxo de dados de mapeamento no Fabric.

O que são transformações no fluxo de dados de mapeamento?

As transformações MDF estendem o Dataflow Gen2 com recursos de transformação baseados em Spark para cargas de trabalho de preparação e transformação de dados em larga escala.

As transformações de MDF fornecem:

  • Uma experiência de criação visual de baixo código
  • Execução baseada em Spark
  • Orquestração integrada por meio de pipelines Fabric
  • Informações de monitoramento e execução diretamente no Fabric

Use transformações de MDF para:

  • Migre pipelines existentes de fluxos de dados de mapeamento do Azure Data Factory ou do Azure Synapse Analytics para o Fabric.
  • Crie novos pipelines de transformação baseados no Spark nativamente no Fabric.

As transformações do MDF integram-se plenamente ao Dataflow Gen2 e proporcionam uma experiência de autoria familiar, semelhante à do Azure Data Factory e do Azure Synapse Analytics Mapping Data Flows.

Captura de tela da interface de criação da transformação de fluxo de dados de mapeamento incorporada a uma tela de fluxo de dados Gen2 no Microsoft Fabric.

Cenários com suporte

Atualmente, as transformações de MDF são compatíveis com os seguintes cenários.

Migrar fluxos de dados de mapeamento existentes

Você pode migrar fluxos de dados de mapeamento de Azure Data Factory e Azure Synapse Analytics existentes para Fabric usando a experiência de migração interna do Azure Data Factory/Synapse Analytics.

Captura de tela da experiência de migração do Azure Data Factory para a atualização de pipelines de fluxos de dados de mapeamento para o Fabric.

Durante a migração:

  1. Os Fluxos de Dados de Mapeamento são convertidos em transformações MDF no Dataflow Gen2.
  2. Pipelines e lógica de transformação são migrados juntos.
  3. As transformações de MDF são abertas dentro da tela de transformação inserida no fluxo de dados gen2.
  4. A lógica de transformação existente pode continuar a ser criada, validada, executada e monitorada em Fabric.

Criar novas transformações de fluxo de dados de mapeamento no Fabric

Você também pode criar novas transformações de MDF diretamente no fluxo de dados gen2. Essa experiência permite que você:

  • Crie transformações baseadas em Spark usando uma interface visual.
  • Use recursos conhecidos de transformação de fluxo de dados de mapeamento.
  • Execute transformações usando os pipelines de dados do Fabric.
  • Monitore a execução por meio de experiências de monitoramento integradas.

Pré-requisitos

Antes de usar as transformações de MDF no fluxo de dados gen2, verifique se os seguintes pré-requisitos são atendidos:

  • Uma capacidade do Fabric.
  • Permissões de colaborador ou superior para o workspace Fabric.
  • Conexões existentes do Fabric para fontes de dados compatíveis.
  • (Opcional) Um espaço de trabalho existente do Azure Data Factory ou do Azure Synapse Analytics, se você estiver usando cenários de migração.

Limitações

No momento, não há suporte para os seguintes recursos na versão prévia pública:

Area Limitation
Flowlets Sem suporte.
Biblioteca de Fluxo de Dados Sem suporte.
Funções definidas pelo usuário (UDFs) Sem suporte.
Execução de fluxo de dados As transformações de MDF só podem ser executadas por meio da atividade de fluxo de dados do pipeline. No momento, não há suporte para a execução direta do fluxo de dados gen2. Somente a ação Salvar está disponível no menu Salvar &executar .
Rede Virtual Gerenciada O suporte à Rede Virtual Gerenciada (Managed VNet) não está disponível nesta prévia.
Execução de runtime Atualmente, a execução de transformações do MDF usa o runtime subjacente do Synapse Spark, assim como no Azure Data Factory e nos Fluxos de Dados de Mapeamento do Azure Synapse Analytics.
Paridade de funcionalidades Nem todos os recursos de Fluxo de Dados de mapeamento estão disponíveis nesta versão prévia.

Conectores com suporte

As transformações do MDF dão suporte aos conectores de origem e de destino mais usados disponíveis nos Fluxos de Dados de Mapeamento do Azure Data Factory e do Azure Synapse Analytics.

Atualmente, há suporte para os seguintes conectores:

Categoria Armazenamento de dados Transformações de MDF no Dataflow Gen2 (origem/destino) Tipos de autenticação com suporte
Azure Armazenamento de Blobs do Azure ✓/✓ Básica, Identidade Gerenciada / Identidade do Espaço de Trabalho, Entidade de Serviço
Azure Cosmos DB for NoSQL ✓/✓ Básico
Azure Data Explorer ✓/✓ Identidade Gerenciada / Identidade do Espaço de Trabalho
Azure Data Lake Storage Gen1 ✓/✓ Básica, Identidade Gerenciada / Identidade do Espaço de Trabalho, Entidade de Serviço
Azure Data Lake Storage Gen2 ✓/✓ Básica, Identidade Gerenciada / Identidade do Espaço de Trabalho, Entidade de Serviço
Banco de Dados do Azure para MySQL ✓/✓ Básico
Banco de Dados do Azure para PostgreSQL ✓/✓ Básico
Azure Databricks Delta Lake ✓/✓ Usar formato delta Básico
Banco de Dados SQL do Azure ✓/✓ Básica, Identidade Gerenciada / Identidade do Espaço de Trabalho, Entidade de Serviço
Instância Gerenciada de SQL do Azure ✓/✓ Básica, Identidade Gerenciada / Identidade do Espaço de Trabalho, Entidade de Serviço
Azure Synapse Analytics ✓/✓ Básico
Banco de dados Snowflake ✓/✓ Básico
Arquivo Amazon S3 ✓/✓ Básico
SFTP ✓/✓ Básico
REST Genérico ✓/✓ Básico, Service Principal

Durante a criação:

  • As conexões existentes do Fabric podem ser reutilizadas.
  • Novas conexões podem ser criadas diretamente a partir da experiência de criação usando a experiência obter dados .
  • A configuração de origem e destino segue padrões conhecidos de fluxo de dados de mapeamento.

Transformações com suporte

As transformações MDF oferecem uma experiência conhecida de transformação visual de baixo código para criar pipelines escalonáveis de transformação de dados baseados em Spark no Fabric.

No momento, há suporte para as seguintes transformações:

Name Categoria Description
Aggregate Modificador de esquema Defina agregações como SOMA, MIN, MAX e COUNT agrupadas por colunas existentes ou computadas.
Alterar linha Modificador de linha Defina políticas de inserção, exclusão, atualização e upsert em linhas.
Assert Modificador de linha Defina regras de declaração para linhas no fluxo de dados.
Cast Modificador de esquema Alterar tipos de dados da coluna com verificação de tipo.
Divisão condicional Várias entradas/saídas Rotear linhas para fluxos diferentes com base em condições correspondentes.
Coluna derivada Modificador de esquema Gere novas colunas ou modifique campos existentes usando expressões.
Chamada externa Modificador de esquema Chame endpoints externos diretamente para cada linha.
Exists Várias entradas/saídas Verifique se os dados existem em outra fonte ou fluxo.
Filter Modificador de linha Filtrar linhas com base em condições.
Flatten Formatadores Nivele estruturas hierárquicas, como matrizes JSON, em linhas.
Join Várias entradas/saídas Combine dados de duas origens ou fluxos.
Lookup Várias entradas/saídas Dados de referência de outra fonte ou fluxo.
Novo branch Várias entradas/saídas Aplique vários caminhos de transformação no mesmo fluxo.
Parse Formatadores Analisar JSON, texto delimitado ou cadeias de caracteres formatadas em XML.
Pivot Modificador de esquema Transforme valores de linha distintos em colunas.
Rank Modificador de esquema Gere classificações ordenadas com base nas condições de classificação.
Select Modificador de esquema Renomeie, reordene ou remova colunas.
Sink - Defina o destino dos dados transformados.
Sort Modificador de linha Classificar linhas no fluxo de dados atual.
Source - Defina a origem do fluxo de dados.
Stringify Formatadores Converter tipos complexos em valores de cadeia de caracteres.
Chave alternativa Modificador de esquema Gerar valores incrementais de chave substituta.
Union Várias entradas/saídas Combine vários fluxos de dados verticalmente.
Unpivot Modificador de esquema Transformar colunas em valores de linha.
Window Modificador de esquema Defina agregações baseadas em janelas em fluxos de dados.

Criar uma transformação de mapeamento de fluxo de dados no Dataflow Gen2

Para criar uma nova transformação de MDF no Fabric:

  1. Abra o espaço de trabalho do Fabric.

  2. Selecione Novo item.

  3. Selecione Dataflow Gen2.

  4. Forneça um nome para o item gen2 do fluxo de dados e selecione Criar.

  5. Na tela do fluxo de dados gen2, use uma das seguintes opções:

    • Selecione Executar transformações do fluxo de dados de mapeamento no agrupamento de ações Novo na faixa de opções da página inicial do Dataflow Gen2.
    • Selecione o bloco Executar transformações de fluxo de dados de mapeamento (Fluxos de Dados de Mapeamento do ADF) no canvas.

    Captura de tela mostrando a opção de criar uma transformação de fluxo de dados de mapeamento na faixa de opções do Dataflow Gen2 no Microsoft Fabric.

    Captura de tela mostrando a opção de criar uma transformação de fluxo de dados de mapeamento a partir do bloco do Dataflow Gen2 na tela do Microsoft Fabric.

Uma nova ação de transformação MDF aparece no canvas do Dataflow Gen2 e abre a experiência incorporada de criação de transformações MDF.

Dica

A experiência de criação de transformações do MDF usa uma interface visual familiar semelhante ao Azure Data Factory e aos Fluxos de Dados de Mapeamento do Azure Synapse Analytics.

Criar transformações de fluxo de dados de mapeamento

Depois de criar uma transformação MDF, você pode começar a criar lógica de transformação.

Habilitar o modo de depuração

Para criação interativa e visualização de dados:

  1. Ative o botão Depuração de fluxo de dados na barra de ferramentas flutuante.
  2. Aguarde a inicialização da sessão de depuração.
  3. Depois de habilitado, você pode visualizar dados de origem e transformação durante a criação.

Captura de tela da tela de transformação de fluxo de dados de mapeamento com o modo de depuração de fluxo de dados habilitado.

Note

As sessões de depuração podem levar vários minutos para inicializar, dependendo da disponibilidade do runtime do Spark.

Adicionar uma fonte

Para configurar uma fonte:

  1. Selecione Adicionar origem.
  2. Selecione o tipo de conexão.
  3. Selecione uma conexão Fabric existente ou crie novas conexões diretamente por meio da experiência Obter Dados, se necessário.
  4. Navegue e selecione o arquivo de origem, a tabela ou o conjunto de dados.

Captura de tela das configurações de origem na experiência de criação de transformação de fluxo de dados de mapeamento.

Depois de configurar a conexão de origem e o conjunto de dados, use a guia Visualização de dados para validar e visualizar os dados de origem durante a criação interativa.

Captura de tela da guia Pré-visualização de dados mostrando os dados de origem no ambiente de criação da transformação de fluxo de dados de mapeamento.

Adicionar transformações

Para adicionar transformações:

  1. Selecione o + ícone ao lado de uma origem ou transformação.
  2. Selecione o tipo de transformação.
  3. Definir configurações de transformação.

Você pode continuar criando lógica de transformação usando a tela de transformação visual.

Captura de tela do gráfico de transformação visual na experiência de criação de transformações do fluxo de dados de mapeamento.

Configurar um coletor

Após a conclusão da lógica de transformação:

  1. Adicione uma transformação de coletor.
  2. Configure a conexão de destino.
  3. Definir configurações de gravação.

Captura de tela da configuração da transformação de destino na interface de criação de transformações do fluxo de dados de mapeamento.

Validar e salvar

Antes da execução:

  1. Selecione Validar na barra de ferramentas de transformação do MDF.

    Captura de tela do botão Validar na barra de ferramentas de transformação de fluxo de dados de mapeamento.

  2. Resolva problemas de validação se algum for relatado.

  3. Selecione Salvar no menu Salvar & executar.

    Captura de tela da opção Salvar no menu Salvar e executar para uma transformação de fluxo de dados de mapeamento.

Note

No momento, há suporte apenas para a ação Salvar para o fluxo de dados gen2 com transformações de MDF em versão prévia pública.

Executar transformações de fluxo de dados de mapeamento com pipelines do Fabric

Você executa transformações de MDF usando pipelines de dados do Fabric por meio de uma atividade de fluxo de dados.

Para executar uma transformação MDF:

  1. Crie um novo pipeline do Fabric.
  2. Adicione uma atividade de fluxo de dados ao pipeline.
  3. Nas Configurações de atividade, selecione o item de fluxo de dados gen2 que contém a transformação MDF.
  4. Selecione a consulta de transformação MDF a ser executada.
  5. Defina as configurações de runtime do Spark conforme necessário.
  6. Valide e publique o pipeline.
  7. Execute o pipeline manualmente ou configure um agendamento ou gatilhos.

Captura de tela de um pipeline do Fabric com uma atividade do Dataflow configurada para execução da transformação de mapeamento do fluxo de dados.

Definir configurações de runtime do Spark

As transformações de MDF são executadas usando o runtime gerenciado do Spark integrado ao Data Factory no Microsoft Fabric. Você pode definir as configurações de runtime do Spark durante a execução do pipeline, incluindo:

  • Dimensionamento de computação
  • Propriedades do coletor

Captura de tela das configurações de runtime do Spark para uma atividade de fluxo de dados em um pipeline de Fabric.

Monitorar execuções de transformação de fluxo de dados de mapeamento

Você pode monitorar a execução da transformação MDF por meio de:

  • O painel de saída do pipeline

    Captura de tela do painel de saída do pipeline mostrando os resultados da execução da transformação de fluxo de dados de mapeamento.

  • O Hub de Monitoramento

    Captura de tela do Hub de Monitoramento mostrando as execuções de atividade para uma execução de transformação de fluxo de dados de mapeamento.

Para exibir detalhes de monitoramento:

  1. Abra os detalhes da execução do pipeline.
  2. Selecione a atividade de fluxo de dados em Execuções de Atividade.
  3. Examine o status da execução e os detalhes do runtime.

Captura de tela da página de monitoramento da transformação de fluxo de dados de mapeamento que mostra o status da execução e os detalhes do tempo de execução.