Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
Data Factory en Microsoft Fabric le ayuda a resolver uno de los desafíos más difíciles de la empresa: convertir los datos dispersos en información útil.
Los datos de la organización residen en muchos lugares diferentes: bases de datos, archivos, servicios en la nube y sistemas heredados. Esta variedad dificulta obtener una visión completa de tu negocio. Data Factory se conecta a más de 170 orígenes de datos, incluidos entornos multinube y configuraciones híbridas con puertas de enlace locales. Le ayuda a mover y transformar los datos a escala, convirtiéndolos en formatos que funcionan bien para el análisis y la toma de decisiones.
Diagrama de Data Factory en Microsoft Fabric que muestra una selección de conectores vinculados a herramientas de análisis y desarrollo de datos en Fabric a través del movimiento, orquestación y transformación de datos. Todo esto se encuentra encima de Fabric OneLake, y toda la pila se teje mediante inteligencia impulsada por IA.
Tanto si eres un usuario empresarial que está desarrollando su primera estrategia de análisis de datos como si eres un desarrollador que crea flujos de trabajo complejos, encontrarás las herramientas adecuadas para:
- Reunir los datos
- Limpiarlo
- Hazlo listo para el análisis en tu Lakehouse o Data Warehouse
- Automatización de los flujos de trabajo de datos
¿Qué es la integración de datos?
La integración de datos es el proceso de reunir los datos estratégicos para que pueda acceder a ellos y analizarlos. Es una parte clave de cualquier negocio que quiera tomar decisiones controladas por datos.
Hay muchas maneras de integrar los datos, pero una de las estrategias más comunes es ETL. ETL significa Extract, Transform, Load. Toma información de muchos orígenes diferentes, la transforma en un formato que se puede analizar y la carga en un sistema de destino común para el análisis o los informes. Al implementar un proceso ETL en la plataforma de datos de su empresa, mejora la coherencia, la calidad y la accesibilidad de los datos.
Esto es lo que hace cada fase:
- Extraer: lee los datos de tus fuentes y los mueve a una ubicación de almacenamiento central. Los orígenes pueden ser bases de datos, archivos, API, sitios web y mucho más.
- Transformación: limpia, enriquece y transforma los datos en un formato fácil de analizar. Por ejemplo, puede comparar los datos de ventas de una base de datos SQL con documentos históricos de ventas analizados. Después de extraer los datos, debe transformar los datos de cada origen para que esté en el mismo formato, compruebe si hay daños o duplicados y combine los datos en un único conjunto de datos.
- Cargar: escribe los datos transformados en un sistema de destino, como un almacenamiento de datos o un lago de datos. El sistema de destino es donde puede ejecutar consultas e informes sobre los datos.
¿ETL o ELT?
Cuando trabajas con datos, cómo los mueves y transformas importa, y cada organización tiene necesidades diferentes. Por ejemplo, consideremos ETL (Extract, Transform, Load) y ELT (Extract, Load, Transform). Cada método tiene fortalezas, dependiendo de tus necesidades de rendimiento, escalabilidad y coste.
ETL: transforme los datos antes de cargarlos en su destino. Este método funciona bien cuando necesitas limpiar, estandarizar o enriquecer datos a medida que se mueven. Por ejemplo, use DataFlow Gen2 de Data Factory para aplicar transformaciones a escala antes de cargar datos en un almacén o Lakehouse.
ELT: Primero cargue los datos sin procesar, luego transformélos en el lugar donde están almacenados. Este enfoque usa la eficacia de los motores de análisis, como OneLake de Fabric, Cuadernos de Spark o herramientas basadas en SQL. ELT funciona bien para manejar grandes conjuntos de datos con computación moderna a escala de la nube.
Fabric Data Factory admite ambos. Ustedes pueden:
- Creación de canalizaciones de ETL clásicas para lograr una calidad y preparación inmediatas de los datos
- Uso de flujos de trabajo de ELT para aprovechar las ventajas del proceso integrado y el almacenamiento para las transformaciones a gran escala
- Combinar ambos enfoques en la misma solución para la flexibilidad
Data Factory es una solución de integración de datos eficaz
Data Factory se conecta a los datos, lo mueve, lo transforma y organiza las tareas de movimiento y transformación de datos desde un solo lugar. Decide qué estrategia funciona mejor para su negocio y Data Factory proporciona las herramientas para hacerlo.
Conectarse a los datos: ya sea local, en la nube o en entornos multinube, Data Factory se conecta a los orígenes y destinos de datos. Admite una amplia gama de orígenes de datos, como bases de datos, lagos de datos, sistemas de archivos, API, etc. Consulte los conectores disponibles para obtener una lista completa de los orígenes de datos y destinos admitidos.
Mover datos: Data Factory proporciona varios métodos para mover datos de origen a destino o proporcionar un acceso sencillo a los datos existentes, en función de sus necesidades.
- Trabajo de copia: solución preferida para el movimiento simplificado de datos con soporte nativo para diversos estilos de entrega, incluyendo la copia masiva, la copia incremental y la replicación mediante captura de datos de cambios (CDC). También ofrece la flexibilidad de manejar una amplia variedad de escenarios desde muchas fuentes hasta muchos destinos, todo ello a través de una experiencia intuitiva y fácil de usar.
- Actividad de copia : mueve datos de un lugar a otro a cualquier escala, con una amplia personalización, compatibilidad con una amplia gama de orígenes y destinos, y control manual de la copia en paralelo para mejorar el rendimiento.
- Replicación: cree una réplica casi en tiempo real de su base de datos operativa dentro de OneLake en Microsoft Fabric para facilitar el análisis y la generación de informes.
Consulte la guía de decisión del movimiento de datos para ayudarle a elegir el método de movimiento de datos adecuado para su escenario.
Transformación: Data Factory proporciona actividades para conectarle a los scripts de transformación personalizados o al diseñador eficaz de flujos de datos.
- Actividades de canalización - Fabric notebook, actividad de HDInsight, definición de trabajos de Spark, procedimiento almacenado, scripts SQL, etc. Estas actividades permiten ejecutar scripts o código personalizados para transformar los datos.
- Dataflow Gen2 : transforme los datos mediante una interfaz de código bajo con más de 300 transformaciones. Puede realizar combinaciones, agregaciones, limpieza de datos, transformaciones personalizadas y mucho más.
- dbt job - El trabajo dbt en Microsoft Fabric permite transformaciones de datos basadas en SQL directamente en Microsoft Fabric. Proporcionan una configuración sencilla y sin código para compilar, probar e implementar modelos dbt sobre el almacenamiento de datos de Fabric.
Orquestación: Data Factory permite crear canalizaciones que pueden ejecutar varios movimientos de datos, transformaciones y otras actividades en un único flujo de trabajo.
- Programe canalizaciones para que se ejecuten en momentos específicos o desencadenelas en función de los eventos.
- Las canalizaciones pueden incluir lógica de flujo de control, como bucles y condicionales, para controlar flujos de trabajo complejos y organizar todo el procesamiento de datos mediante una interfaz de usuario sencilla del diseñador de canalizaciones de código bajo.
- Si prefiere expresar los procesos de orquestación en el código, Fabric Data Factory se integra con Apache Airflow para compilar DAG para orquestación mediante Python.
Integración de datos impulsada por IA
La IA aparece en toda Data Factory para ayudarte a hacer más con menos esfuerzo. Copilot para Data Factory te permite diseñar, editar y gestionar pipelines y flujos de datos utilizando lenguaje natural. Puede escribir indicaciones sencillas en inglés, y Copilot las convierte en pasos de ETL operativos.
Copilot también resume las consultas y canalizaciones de flujo de datos existentes, por lo que puede comprender rápidamente lo que hacen. Si se producen errores, Copilot explica lo que salió mal y sugiere maneras de corregirlo.
Para obtener más información, ver Copilot en Fabric en la carga de trabajo de Data Factory.
¿Qué necesita para empezar?
- Una cuenta de inquilino de Microsoft Fabric con una suscripción activa. Si no tiene una, puede crear una cuenta gratuita.
- Un área de trabajo habilitada para Microsoft Fabric. Aprenda a crear un área de trabajo.
¿Qué ocurre si ya usa Azure Data Factory?
Data Factory en Microsoft Fabric es la próxima generación de Azure Data Factory, creada para controlar los desafíos de integración de datos más complejos con un enfoque más sencillo.
Consulte la guía de comparación para conocer las principales diferencias entre estos dos servicios, por lo que puede elegir la opción adecuada para su empresa.
Cuando esté listo para migrar, siga la guía de migración de las canalizaciones de Azure Data Factory y Azure Synapse.
¿Qué es el SLA de la Pipeline de Fabric Data Factory?
El SLA para pipelines en Fabric es equivalente al SLA para pipelines en Azure Data Factory: "Microsoft garantiza que procesa con éxito las solicitudes para realizar operaciones contra recursos de Data Factory al menos el 99,9 % de las veces. También garantiza que todas las ejecuciones de actividad se inicien dentro de los cuatro minutos de sus tiempos programados al menos el 99,9 % de las veces. Lee el acuerdo completo de nivel de servicio (SLA) de Data Factory."
Contenido relacionado
Para obtener más información y empezar a trabajar con Microsoft Fabric, siga estas guías:
- Laboratorio de factoría de datos guiado : demostración de Data Factory en Fabric
- ¿A qué puede conectarse? : todos los orígenes y destinos disponibles para Data Factory
- Tutorial de Data Factory de extremo a extremo - Sigue este tutorial durante todo el proceso ETL, desde la ingestión de datos hasta la transformación y carga en un sistema de destino.