Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Note
As opções de dados faseados descritas neste artigo estão atualmente em versão preliminar.
Quando ativa staging numa consulta, o Dataflow Gen2 escreve resultados intermédios num Lakehouse de staging interno para que o motor possa utilizar a capacidade de computação do Fabric para transformações ou para carregar dados num destino.
A secção Dados em Fases nas definições de Escala do fluxo de dados permite-lhe ajustar dois aspetos desse processamento:
- Cópia otimizada para Lakehouse (Pré-visualização) — Use um caminho mais rápido para escrever dados em etapas para um destino de dados Fabric Lakehouse.
- Ativar a compressão V-Order (Pré-visualização) — Aplicar a compressão V-Order aos dados gravados no Lakehouse de staging.
Ambas as opções aplicam-se ao nível do fluxo de dados e só têm efeito no Dataflow Gen2.
Onde encontrar as definições
- Abra o seu fluxo de dados no editor Power Query.
- Selecione Opções no menu.
- Aceda ao separador Escala.
- As duas configurações estão listadas em Dados em Fase.
Cópia otimizada para Lakehouse (Pré-visualização)
Quando esta opção está ativada, o Dataflow Gen2 utiliza um caminho otimizado de movimento de dados para consultas que:
- Ter o staging ativado e
- Escreva num destino de dados Fabric Lakehouse.
No caminho predefinido, os dados fluem do Warehouse de preparação para o Lakehouse, com serialização adicional e passagens adicionais pela rede. O caminho otimizado reduz essas etapas intermédias, o que pode encurtar substancialmente o tempo de atualização de fluxos de dados com várias camadas de preparação que têm como destino um Lakehouse.
Para um exemplo quantificado do impacto desta opção no tempo de atualização e no consumo de CU, consulte Cenário 3: Cópia otimizada para o Lakehouse nos benchmarks de custo e desempenho do Dataflow Gen2.
Quando usar
Ative-a quando organizar consultas que acabem por chegar a um destino de dados Fabric Lakehouse. A encenação é mais útil quando:
- A sua consulta contém transformações que não podem ser delegadas na origem de dados.
- Deves confiar no cálculo de staging do Fabric (Lakehouse ou Warehouse) para executar operações pesadas como joins, group-by ou filtros antes de escrever no destino.
Para saber mais sobre quando o staging ajuda, consulte Melhores práticas para obter o melhor desempenho com o Dataflow Gen2.
Comportamento padrão
A opção está desligada por defeito. Para a maioria dos fluxos de dados que armazenam temporariamente dados e os escrevem num Fabric Lakehouse, ativar esta opção é vantajoso.
Considerações
- A opção só tem efeito em consultas que tenham o staging ativado e que escrevem para um destino de dados do Fabric Lakehouse. Para consultas que escrevem noutros destinos (Fabric Warehouse, base de dados Fabric SQL, SQL do Azure, Snowflake, KQL, Azure Data Lake Storage Gen2, destinos de ficheiros), a opção não tem efeito.
- Se desativares o staging para uma consulta, o caminho de cópia otimizado não se aplica a essa consulta.
- A opção aplica-se a todas as consultas elegíveis no fluxo de dados. Atualmente, não existe substituição ao nível de cada consulta.
Ativar compressão V-Order (Pré-visualização)
V-Order é uma otimização do tempo de escrita para o formato de ficheiro Parquet que melhora o desempenho de leitura para motores Fabric posteriores, ao custo de CPU adicional durante a escrita. Para contexto e orientação entre motores, veja a otimização de tabelas do Delta Lake e V-Order e a manutenção e otimização de tabelas entre cargas de trabalho.
Quando esta opção estiver ativada, o Dataflow Gen2 aplica a compressão V-Order aos dados escritos no Lakehouse de preparação. Quando estiver desativado, os dados preparados são escritos sem V-Order.
Quando ativar ou desativar o V-Order para teste
O Lakehouse de preparação contém dados intermédios que são usados apenas pelo próprio Dataflow Gen2: o dataflow relê os dados preparados durante a mesma atualização para aplicar transformações adicionais ou para gravar num destino, e o conector Dataflow lê os dados preparados quando outros itens consultam a saída do dataflow. Os motores de consultas do utilizador final (Power BI Direct Lake, Fabric Warehouse, ponto final de análise SQL, Spark) não leem diretamente o Lakehouse de preparação. Esses cenários aplicam-se, em vez disso, ao seu destino de dados do Lakehouse. Para orientações relativas ao destino, consulte Ativar a compressão V-Order num destino do Lakehouse.
Como os dados preparados são tipicamente lidos um pequeno número de vezes durante a mesma atualização, desativar a V-Order para preparação é uma boa opção para a maioria dos fluxos de dados. Ignorar a V-Order reduz a utilização da CPU durante a escrita e reduz a duração da atualização, especialmente em operações de escrita de preparação de grande dimensão. Considere ativar a V-Order para staging se a saída faseada do dataflow for consumida muitas vezes através do conector Dataflow e quiser favorecer o desempenho de leitura para essas consultas a jusante em vez do custo de escrita de staging.
Comportamento padrão
A opção está ativada por defeito. Use as orientações acima para decidir o que é melhor para o seu fluxo de dados.
Onde mais se aplica o V-Order
Para além da definição ao nível do fluxo de dados que controla o Lakehouse de preparação, a V-Order também pode ser configurada na própria ligação do destino de dados do Lakehouse, através da opção avançada Ativar a utilização da compressão V-Order. Essa definição controla se os dados escritos para o Lakehouse de destino são comprimidos em ordem V. O destino é a superfície lida pelo Direct Lake, Fabric Warehouse, o endpoint de análise SQL e o Spark, pelo que a orientação ao nível do destino é baseada em cenários.
Para obter detalhes sobre a opção ao nível do destino, consulte Ativar a compressão V-Order num destino Lakehouse.
Conteúdo relacionado
- Benchmarks de custo e desempenho da Gen2 do Dataflow
- Boas práticas para obter o melhor desempenho com o Dataflow Gen2
- Destinos de dados e definições geridas do Dataflow Gen2
- Otimização da tabela Delta Lake e V-Order
- Manutenção e otimização de tabelas de carga de trabalho cruzadas
- Avaliador Moderno para Dataflow Gen2 com CI/CD
- Usar computação particionada no Dataflow Gen2 (Pré-visualização)