Preços do Dataflow Gen2 para o Data Factory no Microsoft Fabric

O Dataflow Gen2 ajuda você a moldar e transformar dados com facilidade. Ele oferece uma interface de baixo código e mais de 300 transformações internas de dados e IA, todas alimentadas pela experiência familiar de Power Query que você encontrará em Excel, Power BI, Power Platform e Dynamics 365. O Dataflow Gen2 também dá suporte à execução de transformação com suporte do Spark por meio de transformações de MDF (fluxo de dados de mapeamento) para cargas de trabalho nativas e migradas.

Este preço se aplica a todos os SKUs de capacidade do Fabric (F2 e acima). Os preços não se aplicam às capacidades de teste do Fabric. Para benchmarks de consumo de CU em condições reais em cenários comuns, veja os benchmarks de custo e desempenho do Dataflow Gen2.

Quando você publica um fluxo de dados, ele cria uma definição que é executada durante a atualização. O mecanismo do Dataflow Gen2 usa essa definição para planejar e gerenciar como as consultas são executadas em fontes de dados, gateways e mecanismos de computação. Ele cria tabelas no armazenamento de estágio ou as envia para o destino escolhido, para que você obtenha resultados confiáveis sem esforço excessivo.

Diagrama da arquitetura do Dataflow Gen2.

O diagrama mostra componentes da arquitetura do Data Factory Dataflow Gen2, incluindo o Lakehouse usado para preparar dados que estão sendo ingeridos, e o item warehouse usado como um mecanismo de computação para gravar resultados em preparo ou saída mais rapidamente. Quando você não pode usar a capacidade computacional do Warehouse, ou quando desabilita o staging de uma consulta, o Mecanismo de Mashup extrai, transforma ou carrega os dados para o staging ou para destinos de dados. Para saber mais sobre como o Dataflow Gen2 funciona, consulte o Data Factory Spotlight: Dataflow Gen2.

O Dataflow Gen2 pode executar cargas de trabalho usando o Mecanismo de Mashup ou o Mecanismo Spark. Quando as transformações de MDF são usadas no Dataflow Gen2, a computação baseada em Spark é usada para a execução das transformações e o processamento de dados.

Quando você atualiza ou publica um item do Dataflow Gen2, as Unidades de Capacidade do Fabric são consumidas para os seguintes mecanismos:

  • Computação Padrão: você é cobrado por ela com base no tempo de avaliação da consulta em todas as consultas do Dataflow executadas por meio do mecanismo Mashup.
  • Computação de Fluxo de Dados de Alta Escala: você é cobrado quando o staging é habilitado, com base na duração do consumo do mecanismo SQL do Lakehouse (armazenamento de staging) e do Warehouse (computação de armazenamento).
  • Cópia Rápida: você é cobrado quando os conectores de cópia rápida estão habilitados e podem ser usados no Dataflow, com base na duração do trabalho de cópia. O Fast Copy é executado em paralelo em vários núcleos, portanto essa duração corresponde ao tempo total gasto em todos os núcleos usados pela tarefa de cópia, e não ao tempo real decorrido da atualização.
  • Computação do Spark: você é cobrado com base na duração da execução do Spark e no uso principal do Spark quando as transformações de MDF são executadas durante as execuções de pipeline. Atualmente, as cargas de trabalho de transformação do MDF no Dataflow Gen2 são executadas por meio da atividade de fluxo de dados do pipeline Fabric.

Modelo de preços do Dataflow Gen2

Como as taxas de preços são determinadas

O preço do Dataflow Gen2 depende de como cada consulta usa a computação. Para processamento padrão, as consultas são executadas no mecanismo de mashup. Dependendo se o fluxo de dados é CI/CD (Dataflow Gen2), a classificação varia.

No Dataflow Gen2 (CI/CD), há uma taxa de duas camadas aplicada à duração da consulta:

  • Se uma consulta for executada em menos de 10 minutos, ela será classificada como 12
  • Se ele for executado por mais tempo, cada segundo extra será classificado como 1,5 CU.

Se o Dataflow Gen2 não for CI/CD, a taxa será de 16 CU aplicada a toda a duração da consulta.

Note

Quando você usa computação particionada, o Dataflow Gen2 avalia cada partição como sua própria unidade de trabalho. As cargas padrão de computação são baseadas na soma da duração de processamento de cada partição. Executar partições em paralelo reduz o tempo total em tempo real para concluir a execução, enquanto o consumo total de CU reflete a capacidade computacional combinada de todas as partições.

Para cenários de alta escala — quando o staging está ativado —, as consultas são executadas no mecanismo SQL do Lakehouse ou Warehouse. Cada segundo de tempo de computação usa 6 segundos de Unidades de Cálculo (CU), portanto, consultas mais longas consomem mais.

Se você ativar a cópia rápida, haverá uma taxa separada para movimentação de dados: 1.5 UC, com base em quanto tempo a atividade é executada. A Cópia Rápida equilibra automaticamente cada cenário para decidir quantos núcleos usar, e a duração faturada é o tempo total gasto em todos esses núcleos, em vez do tempo decorrido que você vê no histórico de atualização. Distribuir o trabalho entre mais núcleos reduz o tempo total, enquanto a duração faturada leva em conta todos os núcleos usados pela tarefa de cópia.

No final de cada execução, o Dataflow Gen2 soma o uso de cada mecanismo e o cobra de acordo com os preços de capacidade do Fabric em sua região.

Tabela de taxas de CU

Tipo de mecanismo do Dataflow Gen2 Medidores de consumo Taxa de consumo de CU do Fabric Granularidade dos relatórios de consumo
Computação Padrão (Dataflow Gen2 (CI/CD)) Com base na duração, em segundos, de cada execução de consulta do mecanismo de mashup. A Computação Padrão tem preços de dois níveis, dependendo da duração da consulta. - Para cada segundo até 10 minutos, 12 CU
- Para cada segundo além de 10 minutos, 1,5 CU
Por item de Dataflow Gen2
Computação Padrão (não CI/CD) Com base na duração, em segundos, de cada execução de consulta do mecanismo de mashup. 16 UC Por item de Dataflow Gen2
Computação do fluxo de dados em alta escala Com base na duração, em segundos, da execução do mecanismo SQL do Lakehouse/Warehouse (com staging habilitado). 6 créditos Por espaço de trabalho
Movimentação de dados Baseado na duração da execução da Cópia Rápida, medida como o tempo agregado do núcleo em segundos somado em todos os núcleos usados pelo trabalho de cópia. O Dataflow balanceia automaticamente quantos núcleos cada cenário de cópia rápida utiliza. 1.5 UC (assuming CU stands for "Unidade de Crédito") Por item de Dataflow Gen2
Mapeamento Fluxo de Dados transforma a computação (versão prévia) Com base na duração da execução da transformação do MDF em segundos usando a computação apoiada pelo Spark no Dataflow Gen2. 1,5 CU por hora de núcleo do Spark

Exemplo: Um cluster Spark de 8 núcleos consome 12 CU por hora de execução (8 × 1,5 CU).
Por item de Dataflow Gen2

Preços do gateway de dados de rede virtual com o Dataflow Gen2

O gateway de dados da Rede Virtual (VNet) é faturado como uma cobrança de infraestrutura adicional, associada a uma capacidade do Fabric. Isso significa que ele tem seu próprio medidor e incorre em uma cobrança adicional e consistente em todos os itens executados pelo Fabric.

O custo total para executar o Dataflow Gen2 por meio do Gateway de Dados de Rede Virtual é calculado da seguinte forma: Cobrança do Dataflow Gen2 + Cobrança do Gateway de Dados de Rede Virtual.

A cobrança pelo Gateway de Dados de Rede Virtual é proporcional ao seu uso do Gateway de Dados de Rede Virtual, em que o uso é definido como tempo de atividade ou qualquer período em que o Gateway de Dados de Rede Virtual estiver ligado.

Taxa de consumo de CU do Gateway de Dados de Rede Virtual: 4 CU

Saiba mais em: Preços e cobrança dos gateways de dados da rede virtual.

Alterações na taxa de consumo de carga de trabalho do Microsoft Fabric

As taxas de consumo estão sujeitas a alterações a qualquer momento. A Microsoft envida esforços razoáveis para fornecer aviso por email e por meio de notificação no produto. As alterações entram em vigor na data indicada nas Notas de versão e no Blog do Microsoft Fabric. Se qualquer alteração em uma taxa de consumo de carga de trabalho do Microsoft Fabric aumentar materialmente as CU (Unidades de Capacidade) necessárias para usar uma carga de trabalho específica, os clientes poderão usar as opções de cancelamento disponíveis para a forma de pagamento escolhida.

Calcular custos estimados usando o aplicativo Fabric Metrics e o histórico de atualização de fluxo de dados

O Aplicativo de Métricas de Capacidade do Microsoft Fabric oferece visibilidade sobre o uso da capacidade para todos os espaços de trabalho do Fabric vinculados a uma capacidade. É usado por administradores de capacidade para monitorar o desempenho das cargas de trabalho e seu uso, em comparação com a capacidade adquirida. Usar o Aplicativo de Métricas é a maneira mais precisa de estimar os custos das execuções de atualização do Dataflow Gen2. Para entender como os preços em camadas afetaram seus custos de computação padrão, você também precisa usar o histórico de atualização de fluxo de dados.

Esses exercícios mostram como validar os custos para fluxos de dados CI/CD e não CI/CD. Para o fluxo de dados de CI/CD com computação padrão, um exemplo trabalhado é fornecido, seguido de instruções para todos os outros cenários.

Exercício 1: computação padrão para um fluxo de dados de CI/CD

O fluxo de dados a seguir tem duas consultas que envolvem a transformação, e o estágio está desabilitado.

Captura de tela mostrando o Dataflow Gen2 com duas consultas.

Captura de tela mostrando o Dataflow Gen2 com o Staging desabilitado.

O Dataflow Gen2 usa apenas a computação padrão.

Para cada consulta, acesse a duração da consulta no histórico de atualização de consultas e aplique a fórmula a seguir para calcular o consumo de CU por consulta.

Para a primeira consulta, a duração é de 2.131 segundos.

Captura de tela mostrando o histórico de atualizações da Consulta 1.

Da mesma forma, para a segunda consulta, a duração é de 913 segundos

Captura de tela mostrando o histórico de atualizações da Consulta 2.

StandardComputeCapacityConsumptionInCUSeconds = if(QueryDurationInSeconds < 600, QueryDurationInSeconds x 12, (QueryDurationInSeconds - 600) x 1.5 + 600 x 12)

Para a consulta 1, o consumo calculado é de 9497 segundos de CU e, para a consulta 2, o consumo calculado é de 7670 segundos de CU.

Agregar o consumo de capacidade em segundos de CU e validar o consumo no aplicativo de métricas de capacidade do Fabric. Nesse cenário, o aplicativo de métricas mostra 17.180 segundos de CU como uso de Computação Padrão, que se compara bem com o consumo computado de 17.167 segundos de CU. Qualquer discrepância pode ser devida ao arredondamento em relatórios periódicos de uso.

Captura de tela mostrando o aplicativo Fabric Capacity Metrics exibindo o consumo de Dataflow.

Exercício 2: Computação padrão para um fluxo de dados não CI/CD

Quando o fluxo de dados inclui transformação e o preparo de dados está desabilitado, o Dataflow Gen2 usa apenas a computação padrão.

Para cada consulta, acesse a duração da consulta no histórico de atualização de consultas e aplique a fórmula a seguir para calcular o consumo de CU por consulta.

StandardComputeCapacityConsumptionInCUSeconds = QueryDurationInSeconds x 16

Agregar o consumo de capacidade em segundos de CU e validar o consumo no aplicativo de métricas de capacidade do Fabric.

Exercício 3: Noções básicas sobre o consumo de computação em alta escala (fluxos de dados CI/CD e não CI/CD)

Se o fluxo de dados usar armazenamento temporário, para descobrir quanta computação de Alta Escala foi usada, abra o Aplicativo de Métricas de Capacidade do Fabric e filtre pelo nome do seu fluxo de dados. Clique com o botão direito do mouse no nome, procure a computação em Alta Escala na lista de operações e verifique a duração.

HighScaleComputeCapacityConsumptionInCUSeconds = QueryDurationInSeconds x 6

Exercício 4: Noções básicas sobre o consumo de computação de cópia rápida (fluxos de dados CI/CD e não CI/CD)

Se o seu fluxo de dados usa cópia rápida, para descobrir quanta computação de Movimentação de Dados foi usada, abra o Aplicativo de Métricas de Capacidade do Fabric e filtre pelo nome do seu fluxo de dados. Clique com o botão direito do mouse no nome, procure por "Data Movement" na lista de operações e verifique o tempo de execução.

FastCopyComputeCapacityConsumptionInCUSeconds = QueryDurationInSeconds x 1.5