Dados em itens de estágio do Dataflow Gen2

Para aprimorar o desempenho e a confiabilidade, o Fluxo de Dados Gen2 usa itens de preparo para armazenar dados intermediários durante a transformação de dados. Este artigo descreve o que são itens de preparo, os padrões ELT que eles desbloqueiam no estágio uma vez, referenciam muitos modelos e como gerenciar os dados que eles contêm.

O que são itens de preparo?

Os itens de preparo são locais intermediários de armazenamento de dados usados pelo Dataflow Gen2 para armazenar dados durante a transformação de dados. Esses itens passam pelos nomes "DataflowsStagingLakehouse" e "DataflowsStagingWarehouse". Os itens de preparo são usados para armazenar dados intermediários durante a transformação de dados para melhorar o desempenho. Esses itens são criados automaticamente quando você cria seu primeiro fluxo de dados e são gerenciados pelo Dataflow Gen2. Esses itens estão ocultos do usuário no espaço de trabalho, mas podem estar visíveis em outras experiências, como Obter Dados ou o explorador do Lakehouse. Recomendamos não acessar nem modificar os dados nos itens de staging diretamente, pois isso pode levar a um comportamento inesperado. Também não há suporte para o armazenamento de dados nos itens de preparação e isso pode resultar em perda de dados.

Padrões ELT: executar uma vez, referenciar muitas vezes

Além de fornecer armazenamento intermediário, o estágio desbloqueia um conjunto de padrões ELT criados em uma única base: estagiar uma vez, referenciar muitas vezes. Uma consulta de origem é marcada como em estágio para que sua saída seja materializada para o armazenamento interno de estágio. Em seguida, as consultas subsequentes fazem referência à consulta intermediária em vez de reler a fonte. A Cópia Rápida (Fast Copy) é um acelerador opcional que torna a consulta em estágio preenchida mais rapidamente, mas não é o que define o padrão.

O padrão é importante porque, depois que os dados são preparados, as consultas downstream podem:

  • Execute em uma cópia indexada e consultável sem atingir a origem novamente.
  • Repassar filtros, junções e agregações de volta ao endpoint SQL de preparação em vez de executar no motor de mashup.
  • Ramificar em várias transformações paralelas ou destinos a partir de um único resultado materializado.

Casos de uso comuns

Os padrões a seguir normalmente são colocados em camadas sobre uma consulta de origem preparada.

Caso de uso DESCRIÇÃO
Formatar dados em etapas em modelos de análise Consultas referenciadas moldam dados em tabelas de fatos e dimensões, resumos, rollups ou KPIs por meio de eliminação de duplicação, agrupamento e geração de chave.
Otimização dobrável de computação Consultas referenciadas escritas em dados em estágio realizam suas junções, filtros e operações de agrupamento no endpoint de SQL de preparação, direcionando o processamento ao mecanismo de warehouse em vez do mecanismo de mashup. Este é frequentemente o maior ganho de desempenho que o ambiente de pré-produção permite.
Setor de Auditoria e Qualidade de Dados As consultas referenciadas validam ou inspecionam dados em etapas (verificações nulas, validação de restrição, contagens de linhas) sem relê-los.
Fan-out para vários destinos Várias consultas referenciadas carregam cada um destino diferente da mesma origem preparada (por exemplo, um Lakehouse e um Warehouse).
Stage-then-merge Cada fonte é preparada em sua própria consulta e, em seguida, uma consulta referenciada downstream mescla ou une os resultados preparados, retornando a junção ao ponto de extremidade de staging SQL.

Quando o preparo não é o ajuste certo

O estágio adiciona um custo de armazenamento e uma gravação extra antes da execução de consultas downstream. Considere ignorá-lo quando:

  • Sua transformação já é completa de ponta a ponta para o sistema de origem, sem processamento no mecanismo de mashup.
  • O fluxo de dados tem uma única saída e nenhuma ramificação downstream, validação ou fator de dispersão.
  • A latência de origem é o gargalo e a origem não pode ser paralelizada por meio de estágios.

Para obter mais orientações sobre quando habilitar ou desabilitar o estágio, consulte Práticas recomendadas para obter o melhor desempenho com o Dataflow Gen2.

Dados em itens de etapa provisória

Os itens de preparo não são projetados para acesso direto por usuários. O Dataflow Gen2 gerencia os dados nos itens de preparo e garante que os dados estão em um estado consistente. Acessar dados em itens intermediários diretamente não é suportado, pois não é possível garantir que os dados estejam em um estado consistente. Se você precisar acessar dados em itens de preparo, poderá usar o conector de fluxo de dados em Power BI, Excel ou outros fluxos de dados.

Importante

A API interna que fornece dados em etapas para consumidores downstream (como modelos semânticos ou outros fluxos de dados usando o conector de fluxos de dados) pode experimentar tempos limite intermitentes. Esses tempos limite podem causar falhas de atualização ao consumir itens, geralmente aparecendo como o erro "A chave não correspondeu a nenhuma linha na tabela". Esse erro não indica um problema nos dados. Isso significa que o back-end não pôde recuperar os resultados em etapas no tempo.

Solução alternativa recomendada: Configure um destino de dados (Lakehouse ou Warehouse) para seu fluxo de dados e atualize itens downstream para ler desse destino diretamente usando o conector Lakehouse ou Warehouse. Isso ignora a API de preparo interno e melhora a confiabilidade de atualização.

Para obter mais informações, consulte as limitações do Data Factory.

A remoção de dados dos itens intermediários pode ser forçada por uma das seguintes ações:

  • Desabilitar o armazenamento temporário no fluxo de dados e atualizar (após 30 dias, fazemos coleta de lixo dos dados).
  • Excluir o fluxo de dados (remove diretamente os dados).
  • Excluir o espaço de trabalho (exclui diretamente o StagingLakehouse e o StagingWarehouse).

Implicações de custo da etapa de testes

O Lakehouse intermediário e o Data Warehouse intermediário armazenam dados intermediários como parte do processamento do fluxo de dados. O armazenamento consumido por esses itens de preparo é cobrado como parte do armazenamento do OneLake. Isso significa que os dados armazenados nos itens de estágio são considerados para o consumo geral de armazenamento do OneLake e seus custos associados.

Para gerenciar os custos de armazenamento efetivamente:

  • Monitorar o uso do armazenamento intermediário: Esteja ciente de que os dados intermediários se acumulam com cada atualização de fluxo de dados até que sejam coletados como lixo ou removidos explicitamente.
  • Desabilite o estágio quando não for necessário: se suas transformações forem integradas ao sistema de origem, talvez você não precise habilitar o estágio. Desabilitar o estágio reduz o consumo de armazenamento.
  • Limpar fluxos de dados não utilizados: excluir fluxos de dados que não são mais necessários imediatamente remove seus dados de preparo associados.
  • Considere a frequência de atualização: Atualizações frequentes com o "staging" habilitado podem levar a um aumento no consumo de armazenamento. Balancee os benefícios de desempenho em relação aos custos de armazenamento.

Para obter mais informações sobre os preços de armazenamento do OneLake, consulte os preços do Microsoft Fabric.