Opções de dados em etapas para o Dataflow Gen2

Note

As opções de dados em etapas descritas neste artigo estão atualmente em versão prévia.

Quando você habilita staging em uma consulta, o Dataflow Gen2 grava resultados intermediários em um Lakehouse interno de staging para que o mecanismo possa usar a capacidade de computação do Fabric para transformações ou para carregar dados em um destino.

A seção Dados Preparados nas configurações de Escala de Fluxo de Dados permite ajustar dois aspectos desse pipeline:

  • Cópia otimizada para o Lakehouse (Preview) — Use uma maneira mais rápida de gravar dados preparados em um destino de dados do Fabric Lakehouse.
  • Habilitar compactação V-Order (Prévia) — Aplique a compactação V-Order aos dados gravados no Lakehouse de preparação.

Ambas as opções se aplicam no nível do fluxo de dados e só têm efeito no Dataflow Gen2.

Onde encontrar as configurações

  1. Abra o fluxo de dados no editor do Power Query.
  2. Selecione Opções no menu.
  3. Vá para a guia Escala.
  4. As duas configurações são listadas em Dados Preparados.

Captura de tela da caixa de diálogo Opções com a guia Escala selecionada e a seção Dados Em Etapas realçada.

Cópia otimizada para Lakehouse (versão prévia)

Quando essa opção estiver ativada, o Dataflow Gen2 usará um caminho de movimentação de dados otimizado para consultas que:

  • Ter o staging habilitado e
  • Escreva em um destino de dados Fabric Lakehouse.

No caminho padrão, os dados fluem do Warehouse de preparo para o Lakehouse com serialização extra e saltos de rede. O caminho otimizado reduz essas etapas intermediárias, o que pode encurtar substancialmente o tempo de atualização de fluxos de dados com uso intenso de staging que têm como destino um Lakehouse.

Para um exemplo mensurado do impacto no tempo de atualização e no consumo de CU dessa opção, veja Cenário 3: Cópia otimizada para Lakehouse nos benchmarks de custo e desempenho do Dataflow Gen2.

Quando usar isso

Ative isso quando você preparar consultas cujo destino final seja um destino de dados do Fabric Lakehouse. O preparo é mais útil quando:

  • Sua consulta contém transformações que não podem ser delegadas à fonte de dados.
  • Você deseja contar com a computação de preparo do Fabric (Lakehouse ou Warehouse) para executar operações pesadas, como junções, agrupamentos ou filtros, antes de gravar no destino.

Para saber mais sobre quando o preparo de dados ajuda, consulte Práticas recomendadas para obter o melhor desempenho com o Dataflow Gen2.

Comportamento padrão

A opção está desativada por padrão. Para a maioria dos fluxos de dados que preparam os dados e gravam no Fabric Lakehouse, ativar essa opção é benéfico.

Considerations

  • A opção só se aplica a consultas que têm o staging habilitado e que gravam em um destino de dados do Fabric Lakehouse. Para consultas que gravam em outros destinos (Fabric Warehouse, Fabric banco de dados SQL, SQL do Azure, Snowflake, KQL, Azure Data Lake Storage Gen2, destinos de arquivo), a opção não tem efeito.
  • Se você desativar o staging de uma consulta, o fluxo de cópia otimizado não se aplica a essa consulta.
  • A opção se aplica a todas as consultas qualificadas no fluxo de dados. Não há nenhuma substituição por consulta hoje.

Habilitar compactação de ordem V (versão prévia)

O V-Order é uma otimização aplicada no momento da gravação para o formato de arquivo Parquet que melhora o desempenho de leitura para mecanismos posteriores do Fabric, ao custo de maior uso de CPU durante a gravação. Para informações básicas e diretrizes para diferentes mecanismos, consulte otimização de tabelas Delta Lake e V-Order e manutenção e otimização de tabelas entre cargas de trabalho.

Quando essa opção está ativada, o Dataflow Gen2 aplica a compactação V-Order aos dados gravados no lakehouse de preparo. Quando estiver desativado, os dados em etapas serão gravados sem ordem V.

Quando ativar ou desativar o V-Order para preparação

O Lakehouse de staging contém dados intermediários que são usados apenas pelo próprio Dataflow Gen2: o dataflow relê os dados em staging durante a mesma atualização para aplicar transformações adicionais ou gravar em um destino, e o conector do Dataflow lê a partir dos dados em staging quando outros itens consultam a saída do dataflow. Os mecanismos de consulta para o usuário final (Power BI Direct Lake, Fabric Warehouse, endpoint de análise SQL, Spark) não leem diretamente o Lakehouse de preparação. Em vez disso, esses cenários se aplicam ao destino de dados do Lakehouse . Para obter orientações para o destino, consulte Ativar a compactação V-Order em um destino do Lakehouse.

Como os dados em etapas normalmente são lidos um pequeno número de vezes na mesma atualização, desativar o V-Order para preparo é uma boa opção para a maioria dos fluxos de dados. Ignorar a V-Order reduz o uso de CPU durante a gravação e encurta o tempo de atualização, especialmente para gravações em staging de grande volume. Considere ativar a V-Order no armazenamento temporário se a saída armazenada temporariamente do fluxo de dados for consumida muitas vezes por meio do conector de Fluxo de Dados e você quiser priorizar o desempenho de leitura dessas consultas subsequentes em vez do custo de gravação no armazenamento temporário.

Comportamento padrão

A opção está ativada por padrão. Use as diretrizes acima para decidir o que é certo para o fluxo de dados.

Onde mais o V-Order se aplica

Além da configuração no nível do fluxo de dados que controla o Lakehouse de preparo, o V-Order também pode ser controlado na própria conexão do destino de dados do Lakehouse, por meio da opção avançada Habilitar o uso da compactação V-Order. Essa configuração controla se os dados gravados no Lakehouse de destino são compactados por V-Order. O destino é a estrutura de dados acessada pelo Direct Lake, pelo Fabric Warehouse, pelo endpoint de análise SQL e pelo Spark; portanto, as orientações no nível do destino variam conforme o cenário.

Para obter detalhes sobre a opção no nível do destino, consulte Habilitar a compactação V-Order em um destino do Lakehouse.