Coste y rendimiento de Dataflow Gen2: pruebas comparativas de capacidad y costes de las CU

Microsoft Fabric Dataflow Gen2 ofrece múltiples formas de ingerir, transformar y cargar datos de forma eficiente. Estos métodos le ayudan a equilibrar el rendimiento, la escalabilidad y el costo.

Este artículo es la referencia de rendimiento y coste para Dataflow Gen2. Evalúa cuatro cargas de trabajo comunes —copia masiva, transformación intensiva de datos, escrituras optimizadas en un lakehouse y combinación de archivos particionados— e informa del tiempo de ejecución y de las unidades de capacidad (CU) que consumió cada una, medidos a partir de la telemetría de capacidad. Úsalo para estimar cuánto cuestan las actualizaciones de tus propios datos y para elegir la capacidad que mejor se adapte a cada carga de trabajo.

A gran escala, Dataflow Gen2 supera sustancialmente a Dataflow Gen1 tanto en velocidad como en coste, y cuanto mayor es la carga de trabajo, mayor es la brecha. Ejecutando el mismo script M, con los mismos datos y con la misma capacidad de Fabric, Dataflow Gen2 completó todos los benchmarks de este artículo entre 1,7× y 21× más rápido que la línea base de Dataflow Gen1. En todos los escenarios en los que se midió el consumo de capacidad de ambas generaciones, Dataflow Gen2 realizó ese trabajo más rápido consumiendo entre un 82 % y un 95 % menos de unidades de capacidad, por lo que este aumento de velocidad no se consigue a costa de una mayor capacidad. Consigues ambas ganancias juntas, sin reescribir ni una sola consulta.

Cuánto ganas depende de tu carga de trabajo, y el factor más importante es cuánto duran tus consultas. El Computo Estándar factura los primeros 10 minutos de cada consulta a 12 CU por cada segundo, y luego solo 1,5 CU por cada segundo adicional, así que cuanto más tiempo se ejecute una consulta, menor será su coste medio por segundo. Un flujo de datos corto termina dentro de ese primer nivel y nunca alcanza la tasa más barata, por lo que la diferencia entre ambas generaciones es pequeña. Las ganancias crecen con el volumen de datos y el tiempo de ejecución, por lo que los benchmarks de este artículo utilizan conjuntos de datos grandes y de alto volumen y actualizaciones de larga duración.

Dataflow Gen2 también sigue abaratándose por sí sola: los precios y las capacidades actuales reducen el consumo de CU del 14 % al 84 %, según la carga de trabajo, en comparación con lo que habría consumido esa misma carga de trabajo antes de 2026.

Note

A lo largo del artículo, el coste y la capacidad se miden en unidades de capacidad de Fabric (CUs). Para ver cómo Dataflow Gen2 consume las CUs y cómo eso se relaciona con la facturación, consulta Dataflow Gen2 pricing (precios de Dataflow Gen2). Estos benchmarks y cifras de CU reflejan el modelo actual de precios y capacidades de Dataflow Gen2, incluyendo precios por niveles de Standard Compute, Fast Copy y Modern Evaluator. Debido a que el rendimiento y la eficiencia de costes de Dataflow Gen2 han mejorado con el tiempo, las cifras publicadas antes de 2026 podrían no reflejar el comportamiento actual.

Las siguientes funcionalidades le ayudan a optimizar los flujos de datos:

  • Copia rápida – Acelera el movimiento masivo de datos antes de la transformación.
  • Evaluador moderno : acelera el modelado intensivo de datos en consultas no plegables.
  • Consultas de preparación – Deposita los datos en una capa intermedia antes de aplicar transformaciones, lo que permite implementar patrones ELT.
  • Copia optimizada en Lakehouse – Acelera la escritura de datos almacenados provisionalmente en un destino de Lakehouse en cargas de trabajo ELT.
  • Computación Particionada (Preview) – Transformaciones a escala entre conjuntos de datos grandes y particionados.

Este artículo cubre casos de uso comunes, ejemplos reales y resultados de benchmarking para ayudarte a elegir la capacidad adecuada para tu carga de trabajo.

Dataflow Gen2 factura a cada motor por separado, a las siguientes tasas actuales:

  • Computación estándar (consultas al motor mashup): 12 CU por cada segundo hasta 10 minutos de cada consulta, luego 1,5 CU por cada segundo adicional.
  • Copia rápida (movimiento de datos) - 1,5 CU por cada segundo de actividad de copia, medido en todos los núcleos utilizados.

Para el modelo completo de tasas, véase Dataflow Gen2 fijación de precios.

Referencia rápida

Haga coincidir la carga de trabajo con la funcionalidad de Dataflow Gen2 correcta. Para obtener un ejemplo de prueba comparativa de cada uno, consulte el escenario vinculado.

Capacidad Úselo cuando... Ventaja clave Pruebas comparativas
Copia rápida Necesita una copia directa y de alto rendimiento desde un origen compatible sin transformaciones. Ingesta más rápida a un costo de proceso más bajo. Escenario 1: Copiar datos
Evaluador moderno Va a dar forma a los datos de conectores no plegables o parcialmente plegables (filtros, derivaciones, limpieza). Ejecución más rápida sin cambiar la lógica. Escenario 2: Modelado intensivo de datos
Copia optimizada para Lakehouse Has activado el staging en una consulta que escribe en un destino de casa del lago. Maximiza el rendimiento al escribir datos escalonados en la casa del lago. Escenario 3: Copia optimizada para Lakehouse
Computación Particionada (Vista previa) Va a transformar conjuntos de datos grandes, particionados o de varios archivos que se pueden ejecutar en paralelo. Combinar con evaluador moderno cuando se admita. Ejecución en paralelo entre particiones. Escenario 4: Combinar archivos

Note

Para obtener información general sobre la evaluación de consultas y el plegado de consultas, consulte Conceptos básicos sobre el plegado de consultas.

Resumen de resultados de pruebas comparativas

La mayoría de los escenarios de este artículo utilizan el conjunto de datos de la Comisión de Taxis y Limusinas de la Ciudad de Nueva York (TLC) – Datos de registros de viajes de la TLC: miles de millones de registros de viajes en taxi almacenados como archivos Parquet en ADLS Gen2, que abarcan de 2021 a 2025 (hasta agosto). El Escenario 3 utiliza una tabla de la casa del lago Fabric con unos 113 millones de registros de viajes en taxi en Nueva York desde 2017 hasta mediados de 2018. El destino es un Fabric lakehouse o un almacén, dependiendo del escenario.

En la tabla siguiente se resumen los resultados de la prueba comparativa en todos los escenarios. Cada escenario también incluye una línea base de Dataflow Gen1 para la comparación.

Escenario Qué hace Capacidad habilitada Tiempo de ejecución de Gen2 Aceleración frente a la línea base basada en Gen1 Gen1 CU Gen2 CU Reducción de CU en Gen2
Escenario 1: Copiar datos Carga masiva de cinco archivos Parquet consolidados desde ADLS Gen2 a un lakehouse, sin transformaciones. Copia rápida 00:09:08 11× más rápido 84,411 14,593 83%
Escenario 2: Modelado intensivo de datos Aplique transformaciones no plegables (filtros, derivaciones, limpieza) a un único archivo parquet grande cargado en un lago. Evaluador moderno 00:46:29 1,7× más rápido 56,855 10,485 82%
Escenario 3: Copia optimizada para Lakehouse Transformar una tabla de taxis de Nueva York de 113 millones de filas desde un lakehouse de Fabric y escribir el resultado en una tabla de lakehouse mediante una ruta de copia acelerada. Este benchmark utiliza copia optimizada para Lakehouse y V-Order. Copia optimizada para Lakehouse 00:03:34 15× más rápido 50,788 2,391 95%
Escenario 4: Combinar archivos Combine y transforme 56 archivos Parquet particionados en paralelo y cárguelos en un almacén. Computación Particionada (Vista previa) 00:04:48 21× más rápido No medido No medido No medido

Gráfico de comparación que muestra el tiempo de ejecución y la velocidad relativa de los cuatro escenarios de pruebas comparativas de la tabla de resumen.

El siguiente gráfico compara los mismos escenarios por consumo de capacidad en lugar de tiempo de ejecución.

Tabla comparativa que muestra los segundos de CU consumidos por la línea base de Dataflow Gen1 frente a la mejor configuración de Dataflow Gen2 para cada escenario de benchmark.

Para obtener detalles paso a paso, configuraciones de conjuntos de datos y patrones de diseño para cada funcionalidad, consulte las secciones del escenario siguientes.

Note

Todos los escenarios de este artículo tienen Evaluador Moderno activado y V-Order deshabilitado, salvo que se indique explícitamente lo contrario. Las columnas Gen1 CU y Gen2 CU reportan segundos de Unidad de Capacidad. La columna de reducción de CU en Gen2 representa la disminución de segundos de CU con respecto al valor de referencia de Dataflow Gen1 hasta la mejor configuración de Dataflow Gen2, calculada como (Gen1 CU − Gen2 CU) ÷ Gen1 CU.

Cómo medimos estos puntos de referencia

Cada escenario ejecuta el mismo script M dos veces: una en Dataflow Gen1 para establecer una línea base, y otra en Dataflow Gen2 con la capacidad en prueba activada.

Cada ejecución de este artículo se realizó bajo las mismas condiciones de prueba:

  • Todos los escenarios y ambas generaciones funcionaban con la misma capacidad de Fabric, por lo que ningún resultado refleja un tamaño de capacidad o SKU diferente.
  • No hubo ninguna pasarela de datos implicada. Cada conexión iba directamente del servicio Fabric a una fuente de datos en la nube.
  • Cada escenario utilizaba los mismos datos fuente y el mismo script M tanto para sus ejecuciones de Dataflow Gen1 como de Dataflow Gen2.

Las cifras reportadas significan lo siguiente:

  • El tiempo de ejecución es la duración total de la actualización reportada para la ejecución del flujo de datos.
  • La CU consumida son los segundos de la Unidad de Capacidad que la ejecución facturó a la capacidad, leídos desde la aplicación Microsoft Fabric Capacity Metrics. Como Dataflow Gen2 factura cada motor por separado, el total de un escenario es la suma de todos los motores que se ejecutaron durante la actualización, y las cifras de CU se redondean al segundo de CU entero más cercano. Para el modelo completo de tasas, véase Dataflow Gen2 fijación de precios.

Cuando compares las dos generaciones, ten en cuenta estas diferencias arquitectónicas:

  • Dataflow Gen1 utiliza una arquitectura fundamentalmente diferente a Dataflow Gen2, y no soporta capacidades como Copia Rápida, Evaluador Moderno, Copia Optimizada a Lakehouse o Computación Particionada.
  • Dataflow Gen1 solo puede cargar datos como archivos CSV, mientras que Dataflow Gen2 carga datos como archivos Parquet en estos escenarios.

Note

Estas cifras se registraron en nuestro propio entorno de prueba en agosto de 2026 y se aplican solo a estas pruebas concretas. Tus propios resultados varían según el volumen de datos, el tamaño de la capacidad y la configuración. Para medir tus propias cargas de trabajo, consulta Calcular costes estimados usando la aplicación Fabric Metrics e historial de actualizaciones de flujo de datos.

Escenario 1: Copiar datos

El equipo de análisis de NYC Taxi necesita cargar millones de registros brutos de viajes de Parquet de ADLS Gen2 en una casa de lago Fabric. El equipo no necesita ninguna transformación, solo una copia directa para admitir el análisis posterior.

Challenges

  • Mueve grandes volúmenes de datos de Parquet rápidamente a la casa del lago.
  • Reduzca el tiempo de ingestión para los refrescos diarios.
  • Minimice el costo de proceso para cargas de trabajo sencillas de carga de extracción (EL).

Dataset

Archivos de NYC Yellow Taxi Parquet combinados por año, cinco particiones consolidadas (2021–agosto de 2025).

Solución

El equipo habilita la Copia Rápida en Dataflow Gen2. Fast Copy optimiza las rutas de desplazamiento de datos y paraleliza las escrituras para los conectores admitidos.

Design

Captura de pantalla del diseño del flujo de datos para copia rápida que muestra la configuración de consulta.

Esta consulta combina los archivos Parquet de cinco años y carga el resultado en el lago.

Consideraciones sobre la copia rápida

  • Admite los formatos de archivo .csv y .parquet.
  • Admite hasta 1M filas por tabla por ejecución para Azure SQL Database.
  • Es más adecuado para flujos de trabajo de extracción (EL) antes de transformaciones.

Results

Gráfico comparando la línea base de Dataflow Gen1 con la mejor configuración de Dataflow Gen2 para el Escenario 1, mostrando el tiempo de ejecución y el consumo de CU como porcentaje de la línea base Gen1.

Cuando activas la Copia Rápida, Dataflow Gen2 ingiere este conjunto de datos aproximadamente un 11× más rápido que la línea base de Dataflow Gen1 (00:09:08 vs. 01:38:59) mientras reduce el uso de cómputo. Sin Copia Rápida, Dataflow Gen2 ya es aproximadamente un 2,8× más rápido que Gen1 con la misma carga de trabajo.

Configuración Tiempo de ejecución (hh:mm:ss) Comparación con Gen1 CU consumida
Línea Base de Flujo de Datos Gen1 01:38:59 84,411
Dataflow Gen2 sin Copia Rápida 00:35:25 2,8× más rápido No medido
Flujo de datos Gen2 con copia rápida 00:09:08 11× más rápido 14,593

Al habilitar Fast Copy —la configuración óptima de Dataflow Gen2 para este escenario—, la ingestión mediante Fast Copy del escenario 1 de cinco archivos Parquet consolidados en un lakehouse consume 14.593 segundos de CU. La siguiente tabla desglosa ese total por operación:

Funcionamiento Motor (medidor) Segundos de CU
Movimiento de datos Copia rápida 8,280
Realizar consultas Proceso estándar 6,313
Total 14,593

El movimiento de datos de Fast Copy se factura a razón de 1,5 CU por cada segundo de actividad de copia, calculado como la suma del tiempo total en todos los núcleos en los que se ejecuta la copia. Dataflow Gen2 equilibra automáticamente cuántos núcleos utiliza cada escenario de Copia Rápida, por lo que una copia que termina rápidamente en tiempo de reloj de pared puede abarcar muchos segundos de núcleo. Cualquier tiempo restante de consulta se factura en Computación Estándar (12 CU por cada segundo hasta 10 minutos, luego 1,5 CU por cada segundo adicional). Para consultar el modelo de tarifa completa, consulta Precios de Dataflow Gen2.

Conclusiones clave

  • Habilitar Fast Copy redujo una ingestión de 99 minutos a aproximadamente nueve minutos, una mejora de orden de magnitud respecto al mismo conjunto de datos y al mismo script M.
  • Dataflow Gen2 también usó 83% menos capacidad que Dataflow Gen1 para el mismo trabajo (14.593 frente a 84.411 segundos cu), por lo que la aceleración no se produjo a costa de un cómputo extra.
  • El aumento de velocidad proviene del movimiento de datos nativo y en paralelo que omite el motor mashup, por lo que solo se aplica a los pasos de extracción y carga que cumplen los requisitos previos de Fast Copy. Cualquier transformación que rompa el plegado recurrirá al motor estándar y perderá las ganancias.
  • Para los orígenes admitidos, considere la copia rápida como el valor predeterminado para la ingesta y reserve motores de transformación más pesados (cubiertos en los escenarios siguientes) para los pasos que realmente vuelven a dar forma a los datos.

Escenario 2: Modelado intensivo de datos

Tras la ingestión, el equipo aplica filtros, sustitución de valores nulos y mapeo de códigos antes de cargar los datos en el lakehouse. Estas transformaciones no se convierten completamente a Parquet y son lentas en la memoria.

Challenges

  • Mejora de la velocidad de transformación para consultas semi plegables o no plegables.
  • Mantener la creación de Power Query sin código.
  • Reduzca el costo y el tiempo de actualización generales.

Dataset

Todos los archivos Parquet de 2021–agosto de 2025 se fusionaron en un solo archivo consolidado.

Solución

El equipo habilita el evaluador moderno, un motor de ejecución de alto rendimiento diseñado para una transformación eficaz especialmente para conectores como ADLS Gen2 y SharePoint.

Design

Captura de pantalla del diseño del flujo de datos para evaluador moderno que muestra la configuración de consulta.

Esta consulta ingiere datos de un archivo Parquet consolidado, filtra las columnas trip_distance y fare_amount para mantener los valores por encima de 0, reemplaza los valores NULL en passenger_count con 1, y crea una nueva columna payment_method asignando los tipos de pago antes de cargar los datos en el lakehouse.

Consideraciones del evaluador moderno

  • Los tiempos de actualización esperados podrían ser significativamente más rápidos (varía según el conjunto de datos y las transformaciones).
  • Optimizado para grandes volúmenes (millones de filas).
  • Beneficioso para consultas no plegables.
  • Escribe más rápido hacia destinos como una casa en el lago.

Results

Gráfico comparando la línea base de Dataflow Gen1 con la mejor configuración de Dataflow Gen2 para el Escenario 2, mostrando el tiempo de ejecución y el consumo de CU como porcentaje de la línea base Gen1.

Cuando activas Modern Evaluator, Dataflow Gen2 ejecuta esta carga de trabajo de modelado aproximadamente 1,7× más rápido que la línea base de Dataflow Gen1 (00:46:29 vs. 01:19:56) mientras preserva la experiencia de Power Query sin código. Sin Modern Evaluator, la misma carga de trabajo es solo aproximadamente un 1,2× más rápida que Gen1 (01:08:37 vs. 01:19:56).

Configuración Tiempo de ejecución (hh:mm:ss) Comparación con Gen1 CU consumida
Línea Base de Flujo de Datos Gen1 01:19:56 56,855
Flujo de datos Gen2 sin evaluador moderno 01:08:37 1.2× más rápido No medido
Flujo de datos Gen2 con evaluador moderno 00:46:29 1,7× más rápido 10,485

Cuando activas Modern Evaluator —la configuración óptima de Dataflow Gen2 para este escenario—, la transformación con Modern Evaluator del escenario 2 de un único archivo Parquet grande en un lakehouse consume 10.485 segundos de CU. La siguiente tabla desglosa ese total por operación:

Funcionamiento Motor (medidor) Segundos de CU
Realizar consultas Proceso estándar 10,485
Total 10,485

El trabajo se ejecuta íntegramente en Computación Estándar, que se factura en dos niveles: 12 CU por cada segundo hasta 10 minutos, y luego 1,5 CU por cada segundo adicional. La siguiente tabla muestra cómo se distribuyen la duración facturada y el total de la CU entre esos niveles:

Nivel de facturación Duración facturada Rate Segundos de CU
Primeros 10 minutos 00:10:00 (600 segundos) 12 CU por segundo 7,200
Más allá de los 10 minutos 00:36:29 (2.189,8 segundos) 1,5 CU por cada segundo 3,284.7
Total 00:46:29 (2.789,8 segundos) 10,484.7

Esta tabla muestra el total medido con una cifra decimal para que los tramos sumen exactamente; el resto del artículo redondea esa cifra a 10.485 CU-segundos.

El desglose muestra cuánto domina el primer nivel la factura: los primeros 10 minutos representan solo aproximadamente el 22 % de la ejecución, pero suponen aproximadamente el 69 % de los segundos de CU, porque cada uno de esos segundos cuesta ocho veces más que un segundo del segundo nivel. Todo lo que pase de los 10 minutos —la mayor parte de una larga etapa de moldeo— se anuncia a una tasa mucho más baja de 1,5 CU. Modern Evaluator reduce aún más la factura acortando la duración facturada en sí, no cambiando la tarifa. Para consultar el modelo de tarifa completa, consulta Precios de Dataflow Gen2.

Conclusiones clave

  • Sin Modern Evaluator, Dataflow Gen2 era solo aproximadamente 1,2× más rápido que la línea base de Dataflow Gen1 en esta carga de trabajo de moldeado. Habilitar Modern Evaluator mejoró el rendimiento a aproximadamente un 1,7× más rápido que Gen1, en el mismo script y conjunto de datos M.
  • El ahorro de capacidad es mayor que el ahorro de tiempo: Dataflow Gen2 terminó un 1,7× más rápido consumiendo 82% menos de capacidad que Dataflow Gen1 (10.485 frente a 56.855 segundos CU).
  • Este aumento de rendimiento proviene de una ruta de ejecución más eficiente para consultas no plegables y semi-plegables. Power Query tradicionalmente dedica más tiempo a estas consultas, especialmente cuando usas conectores como ADLS Gen2 y SharePoint. Aumenta la escala con el volumen de filas y la complejidad de la forma.
  • Usa Modern Evaluator como opción predeterminada para flujos con muchas transformaciones en los que las consultas no se repliegan por completo en el origen. Cuanto mayor sea el conjunto de datos y más transformaciones apliques dentro del motor, mayor será el impacto que deberías esperar.

Escenario 3: Copia optimizada para Lakehouse

El equipo de análisis de NYC Taxi transforma una tabla de gran tamaño y escribe el resultado en un lakehouse de Fabric. Escribir ese volumen en el destino es la parte más lenta de la actualización, así que el equipo quiere acelerar la escritura sin cambiar la lógica de transformación.

Challenges

  • Escribe un resultado grande y transformado para un destino de casa en el lago rápidamente.
  • Evita que la escritura de destino se convierta en el cuello de botella de la actualización.
  • Preserva la experiencia de Power Query sin código y la lógica de transformación existente.

Dataset

Una tabla de Fabric lakehouse con unos 113 millones de viajes en taxi en Nueva York registra desde 2017 hasta mediados de 2018.

Solución

El equipo activa Habilitar almacenamiento provisional y habilita Copia optimizada en Lakehouse en una única consulta que escribe en un destino de Lakehouse. La copia optimizada en Lakehouse mueve el resultado preparado al Lakehouse por una ruta acelerada.

Design

El flujo de datos de referencia utiliza una única consulta con Habilitar almacenamiento provisional activado y un destino de tipo lakehouse que utiliza V-Order. La consulta lee la tabla de taxis de NYC de aproximadamente 113 millones de filas de una casa lacustre de Fabric, ordena las filas por fecha y hora de recogida, y añade dos columnas derivadas: el inicio del mes de recogida y la suma del impuesto y recargo por mejoras de la MTA. Como el almacenamiento provisional está activado, Copia optimizada a Lakehouse escribe el resultado transformado en el lakehouse de destino mediante una ruta acelerada, lo que permite un tiempo de ejecución más rápido.

Consideraciones sobre la copia optimizada a Lakehouse

  • Requiere que se active Habilitar almacenamiento provisional en la consulta y un destino de lakehouse. Para obtener más información, consulte Opciones de datos preconfigurados para Dataflow Gen2.
  • Acelera la escritura en la casa del lago sin cambiar la lógica de transformación.
  • Combínalo con V-Order en el destino para optimizar la salida para análisis posteriores.

Results

Gráfico comparando la línea base de Dataflow Gen1 con la mejor configuración de Dataflow Gen2 para el Escenario 3, mostrando el tiempo de ejecución y el consumo de CU como porcentaje de la línea base Gen1.

Cuando activas la copia optimizada en Lakehouse, Dataflow Gen2 completa esta actualización aproximadamente 15× más rápido que la línea base de Dataflow Gen1 (00:03:34 vs. 00:53:20) sin cambiar la lógica de transformación. Sin él, el mismo flujo de datos escalonado es aproximadamente un 3,6× más rápido que en la Generación 1.

Configuración Tiempo de ejecución (hh:mm:ss) Comparación con Gen1 CU consumida
Línea Base de Flujo de Datos Gen1 00:53:20 50,788
Dataflow Gen2 con almacenamiento provisional + V-Order (sin copia optimizada para Lakehouse) 00:14:45 3,6× más rápido No medido
Dataflow Gen2 con almacenamiento provisional + copia optimizada en Lakehouse + V-Order 00:03:34 15× más rápido 2,391

Cuando activas el almacenamiento provisional, la copia optimizada a Lakehouse y V-Order —la configuración óptima de Dataflow Gen2 para este escenario—, la actualización del Escenario 3 de la tabla de taxis de NYC de 113 millones de filas en una tabla de lakehouse se completa en 00:03:34 y consume 2,391 segundos de CU. La siguiente tabla desglosa ese total por operación:

Funcionamiento Motor (medidor) Segundos de CU
Realizar consultas Proceso estándar 2,391
Total 2,391

El trabajo se factura íntegramente en Computación Estándar (12 CU por cada segundo hasta 10 minutos, luego 1,5 CU por cada segundo adicional). La copia optimizada al lakehouse se realiza a través del motor de mashup, por lo que no hay un contador independiente. Para consultar el modelo de tarifa completa, consulta Precios de Dataflow Gen2.

Conclusiones clave

  • La copia optimizada en Lakehouse acelera la escritura del resultado transformado en el destino de Lakehouse, reduciendo el tiempo de actualización de 00:14:45 (sin esta opción) a 00:03:34: unas 4 veces más rápido que el mismo flujo de datos sin ella y aproximadamente 15 veces más rápido que el valor de referencia de Dataflow Gen1 (00:53:20).
  • Este escenario proporcionó el mayor ahorro de capacidad frente a Dataflow Gen1 en este artículo: Dataflow Gen2 consumió 95% menos capacidad que Dataflow Gen1 (2.391 frente a 50.788 segundos CU).
  • Requiere habilitar el almacenamiento provisional en la consulta y un destino de lakehouse, y no cambia la lógica de transformación.
  • En este escenario se usa explícitamente el orden V en la salida de destino.
  • Utiliza la copia optimizada en Lakehouse siempre que escribas datos almacenados provisionalmente en un destino de Lakehouse y el tiempo de escritura represente la mayor parte del tiempo de actualización.

Escenario 4: Combinar archivos

Note

Partitioned Compute está actualmente en versión preliminar y solo disponible en Dataflow Gen2 con CI/CD. La capacidad sigue recibiendo mejoras, por lo que su comportamiento, transformaciones soportadas y rendimiento pueden cambiar antes de su disponibilidad general. Considere los resultados en este escenario como una instantánea puntual de la versión preliminar.

El equipo debe ahora agregar y enriquecer los datos de los viajes utilizando cientos de archivos Parquet (divididos en particiones mensuales). Las transformaciones incluyen el cálculo de porcentajes de propinas en todo el conjunto de datos.

Challenges

  • Debe procesar cientos de archivos grandes.
  • Las transformaciones requieren agrupación, agregación y enriquecimiento entre particiones.
  • La ejecución secuencial se convierte en un cuello de botella.

Dataset

Cincuenta y seis archivos Parquet (2021–ago. 2025).

Solución

El equipo permite la Computación particionada (Preview), que paraleliza el procesamiento en varias particiones y combina los resultados de forma eficiente.

Design

Captura de pantalla del diseño del flujo de datos para proceso con particiones que muestra la configuración de consulta.

Esta consulta combina 56 archivos Parquet y crea una nueva columna personalizada llamada "Tip Pctg" para el porcentaje de propinas en el archivo Transform Sample antes de cargar los datos en el almacén de datos.

Consideraciones de cálculo particionado

  • Actualmente en vista previa y solo disponible en Dataflow Gen2 con CI/CD; La capacidad sigue recibiendo mejoras.
  • Úselo cuando la fuente no admita el plegado.
  • Proporciona el mejor rendimiento al cargar datos en la zona intermedia o en el almacén.
  • Utiliza el archivo de transformación de ejemplo de los archivos Combine para asegurar una lógica de transformación consistente.
  • Admite un subconjunto de transformaciones; el rendimiento varía.

Results

Gráfico comparando la línea base de Dataflow Gen1 con la mejor configuración de Dataflow Gen2 para el Escenario 4, mostrando el tiempo de ejecución como porcentaje de la línea base Gen1.

Partitioned Compute ofrece un rendimiento aproximadamente un 21× superior al de la línea base de Dataflow Gen1 (00:04:48 frente a 01:40:57) en conjuntos de datos grandes, particionados y de varios archivos.

Configuración Tiempo de ejecución (hh:mm:ss) Comparación con Gen1 CU consumida
Línea Base de Flujo de Datos Gen1 01:40:57 No medido
Flujo de datos Gen2 con cómputo particionado 00:04:48 21× más rápido No medido

La computación particionada se centra en el tiempo real transcurrido en lugar del coste. Ejecuta particiones en paralelo para que la actualización termine antes, pero ese paralelismo reparte el trabajo a más cálculo en lugar de reducirlo, por lo que el coste suele ser similar o superior al de la misma carga de trabajo sin la funcionalidad. El consumo de CU no se midió para este escenario, así que este artículo solo informa del tiempo de ejecución.

Conclusiones clave

  • La Computación particionada superó la velocidad de la línea base de Dataflow Gen1 en 21 veces y finalizó en menos de cinco minutos. Como la funcionalidad se encuentra en versión preliminar y sigue recibiendo mejoras, es de esperar que estas cifras cambien.
  • Trata la computación particionada como una forma de finalizar antes, no de gastar menos. El paralelismo acorta el tiempo de reloj de pared al ejecutar particiones al mismo tiempo, por lo que el coste suele ser similar o superior al de la misma carga de trabajo sin él.
  • La ganancia proviene del procesamiento de cada partición en paralelo y la combinación de los resultados, por lo que es más eficaz en orígenes con varias particiones o archivos en los que el plegado no está disponible y la evaluación secuencial es el cuello de botella.
  • Utiliza el patrón de archivo de transformación Sample de los archivos Combine para que la lógica de transformación se aplique de forma consistente por partición. Actualmente, Partitioned Compute soporta un subconjunto de transformaciones, así que valida que tus pasos de moldeado son compatibles antes de confiar en él y vuelve a revisar a medida que avance la vista previa.
  • Para la ingestión particionada de gran volumen en una zona de preparación o en un almacén de datos, haga que el Procesamiento Particionado sea el valor predeterminado y combínelo con el Evaluador Moderno siempre que sea posible. Como aún está en versión preliminar, valídalo con tu propia carga de trabajo antes de adoptarlo para actualizaciones en producción.

Coste a lo largo del tiempo (antes vs. ahora)

Dataflow Gen2 se ha vuelto más rentable de ejecutar con el tiempo. La misma lógica, con los mismos datos, consume menos CUs hoy que antes, sin necesidad de cambios en tus consultas.

En esta comparación, significa la misma carga de trabajo bajo los precios y capacidades generalmente disponibles antes de 2026. Ahora significa que la misma carga de trabajo se ejecuta hoy en día con los mejores ajustes disponibles en general (como Modern Evaluator y Fast Copy). Ambas columnas utilizan la mejor configuración generalmente disponible de su época. Las cifras actuales se miden a partir de la telemetría de capacidad. Las cifras de entonces son estimaciones de lo que habría consumido la misma carga de trabajo en ese momento, porque las condiciones de servicio anteriores no pueden reproducirse hoy en día.

Escenario Capacidad CU estimada antes de 2026 (mejor estimación para disponibilidad general) CU ahora (mejor GA) Reducción estimada
Escenario 1: Copiar datos Copia rápida 17,055 14,593 14%
Escenario 2: Modelado intensivo de datos Evaluador moderno 66,164 10,485 84%
Escenario 3: Copia optimizada para Lakehouse Copia optimizada para Lakehouse 14,173 2,391 83%

Gráfico comparativo que muestra los segundos estimados de CU antes de 2026 frente a los segundos de CU medidos ahora para cada escenario en la tabla de entonces contra ahora.

Por ejemplo, la carga de trabajo de conformación intensiva del Escenario 2 habría consumido aproximadamente 66.164 segundos de CU antes de 2026, y ahora consume 10.485 segundos de CU. Este cambio supone una reducción de 84% con lógica idéntica y sin necesidad de cambios. Dos mejoras se combinan para crearlo. Primero, los precios de Standard Compute pasaron a ser escalonados: en lugar de una tarifa fija de 16 CU por segundo durante toda la ejecución, solo los primeros 10 minutos se facturan a 12 CU por segundo, y cada segundo posterior se factura a solo 1,5 CU, por lo que la cola larga de una carga de trabajo de conformación ahora cuesta una fracción de lo que costaba antes. En segundo lugar, Modern Evaluator —disponible en general desde abril de 2026— acorta la duración facturada en sí, por lo que hay menos segundos para facturar en cualquiera de los niveles. Un plazo más corto comparado con una tarifa de cola larga mucho más barata es la razón por la que el consumo de CU cae tan bruscamente, y por eso combinar Modern Evaluator con los actuales precios escalonados es tan importante para flujos de datos que dependen mucho de la configuración.

La ingestión de Fast Copy en el escenario 1 habría supuesto un consumo estimado de 17.055 segundos de CU antes de 2026, y ahora consume 14.593 segundos de CU. Este cambio supone una reducción de 14%, impulsada por la tasa de cálculo estándar que baja de 16 CU por segundo a 12 CU por segundo hasta 10 minutos; la parte de movimiento de datos de Copia Rápida no ha cambiado. La copia optimizada para la actualización de Lakehouse en el Escenario 3 habría consumido aproximadamente 14.173 segundos CU antes de 2026, y ahora consume 2.391 segundos CU. Este cambio supone una reducción de 83%. Cada comparación emplea la misma carga de trabajo con las mejores configuraciones de uso general disponibles de cada período.

Note

Esta comparación entre la situación anterior y la actual excluye Partitioned Compute porque el consumo de CU no se midió para ese escenario y la funcionalidad aún está en vista previa.

Preguntas más frecuentes

¿Cómo se factura Dataflow Gen2?

Dataflow Gen2 factura cada motor por separado en Unidades de Capacidad Fabric (CUs). Standard Compute (el motor de mashup) factura 12 CU por segundo durante un máximo de 10 minutos de cada consulta; luego, 1,5 CU por cada segundo adicional. La copia rápida (movimiento de datos) factura 1,5 CU por cada segundo de actividad de copia, medido en todos los núcleos sobre los que se ejecuta la copia. Solo te cobran por el cálculo que cada consulta realmente usa, sin una comisión fija por cada actualización y sin cargo por tiempo inactivo. Para el modelo completo de tasas, véase Dataflow Gen2 fijación de precios.

¿Es elástico el precio de Dataflow Gen2?

Yes. Dataflow Gen2 cobra solo por los recursos de proceso que utiliza realmente cada consulta, medidos en unidades de capacidad de Fabric (CUs). No hay una tarifa fija por cada actualización, ni se aplican cargos por tiempo de inactividad, ni cargos directos durante la autoría por el uso de funciones nativas. En los benchmarks de este artículo, una actualización completa consumía 14.593 segundos CU para una ingestión de Copia Rápida y 10.485 segundos CU para una carga de trabajo de modelado pesada.

¿Cómo puedo estimar el coste de mi Dataflow Gen2 antes de ejecutar toda la carga de trabajo?

Haz una pequeña actualización representativa y mide lo que consume, en lugar de construir la solución completa y descubrir el coste después. Para estimar el coste de esta manera:

  • Construye el flujo de datos sobre una muestra o una única partición de tu fuente en lugar del conjunto de datos completo.
  • Actualízala una vez y luego consulta los segundos de CU que ha consumido en la aplicación Microsoft Fabric Capacity Metrics.
  • Consulta el historial de actualización del flujo de datos para ver qué motores funcionaron, porque Standard Compute y Fast Copy se facturan por separado.
  • Divide los segundos de CU medidos entre las filas o GB que has procesado para obtener una tasa por unidad y luego multiplica por tu volumen total de datos.

Note

Dataflow Gen2 está optimizado para cargas de trabajo a gran escala, por lo que sus beneficios de rendimiento y eficiencia son más evidentes en conjuntos de datos grandes y reales. Una muestra pequeña o sintética puede no mostrar las ganancias completas, y una tasa por unidad extrapolada a partir de una muestra diminuta puede sobreestimar el coste de una tirada completa. Valida contra un volumen de datos representativo siempre que puedas.

Para el método completo, consulte Calcular costes estimados usando la aplicación Fabric Metrics y el historial de actualización de flujo de datos.

¿Cuánto tarda una actualización de Dataflow Gen2?

Depende del volumen de datos y de las transformaciones que apliques. En las pruebas de rendimiento de este artículo, los tiempos de actualización de Dataflow Gen2 oscilaron entre 00:03:34 para una copia optimizada de una tabla de 113 millones de filas en un lakehouse y 00:46:29 para una carga de trabajo intensiva de transformación sobre un archivo Parquet consolidado de gran tamaño. Una copia masiva de cinco archivos Parquet consolidados finalizó en 00:09:08 con Fast Copy, y la combinación de 56 archivos particionados finalizó en 00:04:48 con Partitioned Compute (Vista previa). Para ver los tiempos completos para cada escenario, consulte el resumen de los resultados de la prueba comparativa.

¿Qué capacidad Dataflow Gen2 reduce más el coste?

Depende de la carga de trabajo, porque cada capacidad apunta a un cuello de botella diferente: Copia Rápida para ingestión sin transformaciones, Evaluador Moderno para modelado de datos no plegables, Copia optimizada a Lakehouse para acelerar escrituras a un destino de Lakehouse, y Computación Particionada (Vista previa) para conjuntos de datos grandes de varios archivos. En comparación con la referencia de Dataflow Gen1, la copia optimizada en Lakehouse produjo el mayor ahorro en estas pruebas comparativas, con un 95 % menos de segundos de CU. En comparación con las ejecuciones equivalentes de Dataflow Gen2 antes de 2026, Modern Evaluator produjo la mayor reducción estimada, con 84% segundos de CU menos en una carga de trabajo de modelado pesada. Para adaptar una capacidad a tu carga de trabajo, consulta la referencia rápida.

¿Cómo puedo hacer que una actualización de Dataflow Gen2 sea más rápida?

Ajusta la capacidad al cuello de botella: activa Copia rápida para los orígenes de extracción y carga compatibles, activa el Evaluador moderno para las transformaciones no plegables, activa Copia optimizada en Lakehouse al escribir datos almacenados provisionalmente en un destino de Lakehouse y usa Proceso particionado (versión preliminar) para conjuntos de datos particionados de gran tamaño o de varios archivos. Cada capacidad se compara en este artículo con la aceleración específica que ofreció respecto a la línea base de Dataflow Gen1.

¿Necesito cambiar mis consultas para conseguir estas mejoras?

N.º Cada benchmark en este artículo ejecutaba el mismo script M a lo largo de ambas generaciones y configuraciones. Copia rápida, evaluador moderno y copia optimizada a Lakehouse son configuraciones que activas, y cambian cómo el motor ejecuta tus consultas en lugar de las consultas en sí. Una advertencia: Fast Copy solo se aplica a los pasos que cumplen los requisitos previos, por lo que una transformación que interrumpe el plegado de consultas recurre al motor estándar y pierde esa ventaja. Para esos requisitos previos, véase Copia rápida en Dataflow Gen2.

¿Es Dataflow Gen2 más rápido y barato que Dataflow Gen1?

Para cargas de trabajo de alto volumen como las que se han comparado en este artículo, sí en ambos casos. Dataflow Gen2 funcionaba entre 1,7× y 21× más rápido que la línea base de Dataflow Gen1 con los mismos datos y el mismo script M, y consumía entre 82% y 95% unidades de capacidad menos en los escenarios donde se midían ambas generaciones. Por ejemplo, una copia masiva que tardó 01:38:59 en Dataflow Gen1 terminó en 00:09:08 en Dataflow Gen2 con Copia Rápida, aproximadamente un 11× más rápido. La diferencia es menor para flujos de datos de corta duración, porque una consulta que se completa en los primeros 10 minutos nunca llega al nivel más barato de 1,5 CU, por lo que las ganancias crecen con el volumen de datos y el tiempo de ejecución. Para la comparación completa por escenario, consulte el resumen de los resultados de referencia.

¿Cuánta capacidad consume Dataflow Gen1 en comparación con Dataflow Gen2?

En los escenarios en los que se midieron ambas generaciones, Dataflow Gen1 consumía varias veces más capacidad que Dataflow Gen2 para el mismo trabajo de alto volumen. La ingestión de Copia Rápida consumió 84.411 segundos cu³ en Dataflow Gen1 frente a 14.593 segundos CU en Dataflow Gen2, una reducción de 83%. La pesada carga de trabajo de modelado de datos consumió 56.855 segundos cu³ en Dataflow Gen1 frente a 10.485 segundos cu³ en Dataflow Gen2, una reducción de 82%. La carga de trabajo de copia optimizada a Lakehouse consumió 50.788 segundos de CU en Dataflow Gen1 frente a 2.391 segundos de CU en Dataflow Gen2, una reducción del 95%. Las tres actualizaciones superan con creces los 10 minutos, por lo que la mayor parte de su duración facturable de Dataflow Gen2 se cobra a la tarifa inferior de 1,5 CU. Para las cifras por escenario, véase el resumen de los resultados de referencia.

¿Debería mover mis flujos de datos de Dataflow Gen1 a Dataflow Gen2?

Yes. Dataflow Gen2 es la generación actual de flujos de datos en Microsoft Fabric, así que planea trasladar cualquier flujo de datos de Dataflow Gen1 a él. En las pruebas comparativas de este artículo, Dataflow Gen2 ejecutó el mismo script M entre 1,7 y 21 veces más rápido, mientras consumía entre un 82 % y un 95 % menos de unidades de capacidad que Dataflow Gen1: la misma lógica, ejecutándose más rápido y consumiendo menos capacidad. Las capacidades que ofrecen esas ganancias —Copia Rápida, Evaluador Moderno, Copia optimizada para Lakehouse y Computación Particionada— solo están disponibles en Dataflow Gen2, por lo que la brecha sigue ampliándose a medida que mejoran esas capacidades. Espera las mayores ganancias en renovaciones de alto volumen y larga duración. Mientras migres, prueba la carga de trabajo de un representante para confirmar las ganancias en tus propios datos y capacidad. Para empezar, consulta la visión general de Dataflow Gen2.

¿Se ha vuelto Dataflow Gen2 más eficiente en costes con el tiempo?

Yes. La carga de trabajo con transformaciones intensivas del Escenario 2 habría consumido aproximadamente 66.164 segundos de CU antes de 2026 y ahora consume 10.485 segundos de CU con las capacidades de disponibilidad general actuales, lo que supone una reducción estimada del 84 % con una lógica idéntica y sin necesidad de realizar cambios. Para cifras por escenario, véase Coste a lo largo del tiempo (entonces vs. ahora).

¿Siguen siendo precisas las cifras de coste y rendimiento de Dataflow Gen2 antiguas?

No necesariamente. Las cifras de este artículo reflejan el modelo actual de precios de Dataflow Gen2: 12 CU por cada segundo hasta 10 minutos de Computación Estándar, luego 1,5 CU por cada segundo adicional, junto con capacidades actuales como Copia Rápida y Evaluador Moderno. Dado que la Gen2 de Dataflow se ha vuelto más rápida y rentable con el tiempo, los números de referencia o estimaciones de coste publicadas antes de 2026 podrían sobreestimar el coste actual o subestimar el rendimiento actual. Valida tus propias cargas de trabajo con la aplicación Microsoft Fabric Capacity Metrics.