Precios de Dataflow Gen2 para Data Factory en Microsoft Fabric

Dataflow Gen2 le ayuda a dar forma y transformar datos con facilidad. Ofrece una interfaz de bajo código y más de 300 transformaciones integradas de datos e inteligencia artificial, todo ello gracias a la conocida experiencia de Power Query que encontrará en Excel, Power BI, Power Platform y Dynamics 365. Dataflow Gen2 también admite la ejecución de transformaciones basadas en Spark mediante transformaciones de mapping data flow (MDF) para cargas de trabajo nativas y migradas.

Estos precios se aplican a todos los SKU de capacidad de Fabric (F2 y superiores). Los precios no se aplican a las capacidades de prueba de Fabric. Para comparativos de consumo real de CU en escenarios comunes, véanse los indicadores de coste y rendimiento de Dataflow Gen2.

Al publicar un flujo de datos, crea una definición que se ejecuta durante la actualización. El motor de Dataflow Gen2 usa esa definición para planear y administrar cómo se ejecutan las consultas entre orígenes de datos, puertas de enlace y motores de proceso. Crea tablas en el almacenamiento provisional o las envía al destino elegido, por lo que obtiene resultados confiables sin el trabajo pesado.

Diagrama de la arquitectura de Dataflow Gen2.

En el diagrama se muestran los componentes de la arquitectura de Dataflow Gen2 de Data Factory, incluido el Lakehouse que se usa para almacenar temporalmente los datos que se ingieren, y el elemento Warehouse, que se usa como motor de proceso para escribir más rápidamente los resultados en el área de almacenamiento provisional o en la salida. Cuando no se puede usar la capacidad de proceso de Warehouse, o cuando se deshabilita el almacenamiento provisional para una consulta, el Motor de Mashup extrae, transforma o carga los datos en el almacenamiento provisional o en los destinos de datos. Para más información sobre cómo funciona Dataflow Gen2, consulte Contenido destacado de Data Factory: Dataflow Gen2.

Dataflow Gen2 puede ejecutar cargas de trabajo mediante mashup Engine o Spark Engine. Cuando se usan transformaciones de MDF dentro de Dataflow Gen2, se utiliza capacidad de proceso basada en Spark para ejecutar las transformaciones y procesar los datos.

Al actualizar o publicar un elemento de Dataflow Gen2, las Fabric Capacity Units se consumen para los siguientes motores:

  • Cómputo estándar: se le cobra en función del tiempo de evaluación de consultas en todas sus consultas de Dataflow que se ejecutan a través del motor Mashup.
  • Proceso de flujo de datos a gran escala: se le cobra cuando el almacenamiento de preparación está habilitado, en función de la duración del consumo del motor SQL del Lakehouse (almacenamiento de preparación) y del cómputo de almacenamiento.
  • Copia rápida: se le cobra cuando los conectores de copia rápida están habilitados y se pueden usar en el flujo de datos, en función de la duración del trabajo de copia. Copia Rápida se ejecuta en paralelo en varios núcleos, por lo que esta duración es el tiempo total empleado en todos los núcleos que utiliza la tarea de copia, no el tiempo real transcurrido de la actualización.
  • Proceso de Spark: se le cobra según la duración de la ejecución de Spark y el uso del núcleo de Spark cuando se ejecutan transformaciones de MDF durante las ejecuciones de canalización. Las cargas de trabajo de transformación de MDF en Dataflow Gen2 se ejecutan actualmente mediante la actividad Dataflow de Fabric Pipeline.

Modelo de precios de Dataflow Gen2

Cómo se determinan las tarifas de precios

Los precios de Dataflow Gen2 dependen de cómo cada consulta utiliza los recursos de cómputo. Para la computación estándar, las consultas se ejecutan en el motor de combinación. Dependiendo de si el flujo de datos es Dataflow Gen2 (CI/CD), la clasificación varía.

En Dataflow Gen2 (CI/CD), hay una tasa de dos niveles aplicada a la duración de la consulta:

  • Si una consulta se ejecuta en menos de 10 minutos, se evalúa en 12 CU.
  • Si se ejecuta más tiempo, cada segundo adicional se clasifica en 1,5 CU.

Si dataflow Gen2 no es CI/CD, la tasa es de 16 CU aplicada a toda la duración de la consulta.

Note

Cuando usas computación particionada, Dataflow Gen2 evalúa cada partición como su propia unidad de trabajo. Las cargas de cómputo estándar se basan en la suma de la duración de procesamiento de cada partición. Ejecutar particiones en paralelo acorta el tiempo total (reloj de pared) para completar la ejecución, mientras que el consumo total de CU refleja el cálculo combinado de todas las particiones.

En escenarios a gran escala, cuando el almacenamiento temporal está activado, las consultas se ejecutan en el motor SQL de Lakehouse o Warehouse. Cada segundo de tiempo de proceso usa 6 SEGUNDOS de CU, por lo que las consultas más largas consumen más.

Si activa una copia rápida, hay una velocidad independiente para el movimiento de datos: 1,5 CU, en función de cuánto tiempo se ejecuta la actividad. La copia rápida ajusta automáticamente cada caso para determinar cuántos núcleos debe usar, y la duración facturada es el tiempo total consumido en todos esos núcleos, en lugar del tiempo real que ves en el historial de actualizaciones. Distribuir el trabajo entre más núcleos acorta el tiempo transcurrido, mientras que la duración facturada tiene en cuenta cada núcleo que utiliza el trabajo de copia.

Al final de cada ejecución, Dataflow Gen2 agrega el uso de CU de cada motor y lo factura en función de los precios de capacidad de Fabric en su región.

Tabla de tasas de CU

Tipo de motor de Dataflow Gen2 Medidores de consumo Tasa de consumo de CU de Fabric Granularidad de los informes de consumo
Proceso estándar (Flujo de datos Gen2 (CI/CD)) En función de la duración de la ejecución de cada consulta del motor de mashup, en segundos. Compute estándar tiene dos niveles de precios dependiendo de la duración de la consulta de datos. - Por cada segundo hasta 10 minutos: 12 CU (unidades de computación)
- Por cada segundo más allá de 10 minutos, 1,5 CU
Por elemento de Dataflow Gen2
Proceso estándar (no CI/CD) En función de la duración de la ejecución de cada consulta del motor de mashup, en segundos. 16 Unidades de Computación Por elemento de Dataflow Gen2
Cómputo de flujos de datos a gran escala Se basa en la ejecución del motor SQL de Lakehouse o Warehouse (con el almacenamiento provisional habilitado) en segundos. 6 Unidades de Computación (CU) Por área de trabajo
Movimiento de datos Basado en la duración de la ejecución de Copia Rápida, medida como el tiempo agregado del núcleo en segundos sumado entre todos los núcleos que utiliza el trabajo de copia. Dataflow equilibra automáticamente cuántos núcleos utiliza cada escenario de copia rápida. 1,5 CU Por elemento de Dataflow Gen2
Proceso de cálculo para transformaciones de flujo de datos de asignación (versión preliminar) Basado en la duración de la ejecución de la transformación de MDF en segundos mediante el proceso de cálculo respaldado por Spark dentro de Dataflow Gen2. 1,5 CU por cada hora de núcleo de Spark

Ejemplo: un clúster de Spark de 8 núcleos consume 12 CU para cada hora de ejecución (8 × 1,5 CU).
Por elemento de Dataflow Gen2

Precios de puerta de enlace de datos de red virtual con Dataflow Gen2

La puerta de enlace de datos de Virtual Network (VNET) se factura como un cargo adicional de infraestructura, asociado a una capacidad de Fabric. Esto significa que tiene su propio contador y genera una factura independiente de todas las ejecuciones de elementos de Fabric y adicional a estas.

La factura total por ejecutar Dataflow Gen2 a través de la puerta de enlace de datos de la red virtual se calcula de la siguiente manera: cargo de Dataflow Gen2 + cargo de la puerta de enlace de datos de la red virtual.

La tarifa de Virtual Network Data Gateway es proporcional a su uso de Virtual Network Data Gateway, entendiéndose por uso el tiempo de actividad, es decir, cualquier periodo en que Virtual Network Data Gateway esté activa.

tasa de consumo de CU de la puerta de enlace de datos de red virtual: 4 CU

Obtenga más información en Precios y facturación de las puertas de enlace de datos de red virtual.

Cambios en la tasa de consumo de cargas de trabajo de Microsoft Fabric

Las tasas de consumo están sujetas a cambios en cualquier momento. Microsoft hace todo lo posible para avisar por correo electrónico y mediante una notificación en el producto. Los cambios son efectivos en la fecha indicada en las Notas de la versión y en el Blog de Microsoft Fabric. Si algún cambio en una tasa de consumo de carga de trabajo de Microsoft Fabric aumenta materialmente las unidades de capacidad (CU) necesarias para usar una carga de trabajo determinada, los clientes pueden usar las opciones de cancelación disponibles para el método de pago elegido.

Calcular los costes estimados mediante la aplicación Métricas de Fabric y el historial de actualización del flujo de datos

La aplicación Métricas de capacidad de Microsoft Fabric proporciona visibilidad sobre el uso de la capacidad para todas las áreas de trabajo de Fabric asociadas a una capacidad. Los administradores de capacidad la utilizan para supervisar el rendimiento de las cargas de trabajo y su uso, en comparación con la capacidad adquirida. El uso de la aplicación Métricas es la forma más precisa de calcular los costos de las ejecuciones de actualización de Dataflow Gen2. Para comprender cómo los precios por niveles afectaron a los costes de computación estándar, también debe usar el historial de actualización de Dataflow.

Estos ejercicios muestran cómo validar los costos de los flujos de datos de CI/CD y no-CI/CD. Para el flujo de datos de CI/CD con proceso estándar, se proporciona un ejemplo trabajado, seguido de instrucciones para todos los demás escenarios.

Ejercicio 1: Proceso estándar para un flujo de datos de CI/CD

El siguiente flujo de datos tiene dos consultas que implican transformación y el almacenamiento provisional está deshabilitado.

Captura de pantalla que muestra Dataflow Gen2 con dos consultas.

Captura de pantalla que muestra Dataflow Gen2 con almacenamiento provisional deshabilitado.

Dataflow Gen2 solo usa el proceso estándar.

Para cada consulta, acceda a la duración de la consulta desde el historial de actualización y aplique la fórmula siguiente para calcular el consumo de CU por consulta.

Para la primera consulta, la duración es de 2131 segundos.

Captura de pantalla que muestra el historial de actualización de la consulta 1.

Del mismo modo, para la segunda consulta, la duración es de 913 segundos.

Captura de pantalla que muestra el historial de actualización de la consulta 2.

StandardComputeCapacityConsumptionInCUSeconds = if(QueryDurationInSeconds < 600, QueryDurationInSeconds x 12, (QueryDurationInSeconds - 600) x 1.5 + 600 x 12)

Para la consulta 1, el consumo calculado es de 9497 SEGUNDOS y, para la consulta 2, el consumo calculado es de 7670 SEGUNDOS.

Agregue el consumo de capacidad en segundos de CU y valide el consumo en la aplicación de métricas de capacidad de Fabric. En este escenario, la aplicación de métricas muestra 17 180 segundos de CU como el uso de proceso estándar, que se compara bien con el consumo calculado de 17 167 segundos de CU. Cualquier discrepancia podría deberse al redondeo en los informes periódicos de uso.

Captura de pantalla que muestra la aplicación de métricas de capacidad de Fabric en la que se muestra el consumo de flujo de datos.

Ejercicio 2: Proceso estándar para un flujo de datos que no es de CI/CD

Cuando el flujo de datos incluye transformaciones y el almacenamiento temporal está deshabilitado, Dataflow Gen2 solo usa el cálculo estándar.

Para cada consulta, acceda a la duración de la consulta desde el historial de actualización y aplique la fórmula siguiente para calcular el consumo de CU por consulta.

StandardComputeCapacityConsumptionInCUSeconds = QueryDurationInSeconds x 16

Agregue el consumo de capacidad en segundos de CU y valide el consumo en la aplicación de métricas de capacidad de Fabric.

Ejercicio 3: Comprensión del consumo de procesamiento a gran escala (tanto en flujos de datos de CI/CD como en los que no son de CI/CD)

Si tu flujo de datos usa almacenamiento provisional, para averiguar cuánta capacidad de proceso de High Scale has usado, abre la aplicación Métricas de capacidad de Fabric y filtra por el nombre de tu flujo de datos. Haga clic con el botón derecho en el nombre, busque Proceso a gran escala en la lista de operaciones y compruebe la duración.

HighScaleComputeCapacityConsumptionInCUSeconds = QueryDurationInSeconds x 6

Ejercicio 4: Comprensión del consumo de proceso de copia rápida (flujos de datos de CI/CD y de no CI/CD)

Si el flujo de datos utiliza copia rápida, para averiguar cuántos recursos de proceso de Data Movement ha usado, abra la aplicación Métricas de capacidad de Fabric y filtre por el nombre de su flujo de datos. Haga clic con el botón derecho en el nombre, busque Movimiento de datos en la lista de operaciones y compruebe la duración.

FastCopyComputeCapacityConsumptionInCUSeconds = QueryDurationInSeconds x 1.5