Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
SE APLICA A:
Azure Data Factory
Azure Synapse Analytics
Sugerencia
Data Factory en Microsoft Fabric es la próxima generación de Azure Data Factory, con una arquitectura más sencilla, inteligencia artificial integrada y nuevas características. Si no está familiarizado con la integración de datos, comience con Fabric Data Factory. Las cargas de trabajo de ADF existentes pueden actualizarse a Fabric para acceder a nuevas funcionalidades en ciencia de datos, análisis en tiempo real e informes.
El runtime de integración (IR) es la infraestructura de cómputo utilizada por las pipelines de Azure Data Factory y Azure Synapse para proporcionar las siguientes capacidades de integración de datos en diferentes entornos de red:
- Data Flow: ejecute un flujo de datos en un entorno de proceso de Azure administrado.
- Movimiento de datos: copie datos entre almacenes de datos en una red pública o privada (tanto para redes locales como privadas virtuales). El servicio proporciona compatibilidad con conectores integrados, conversión de formato, asignación de columnas y transferencia de datos escalable y de rendimiento.
- Distribución de actividades: distribuya y supervise actividades de transformación que se ejecuten en varios servicios de proceso, como Azure Databricks, Azure HDInsight, ML Studio (clásico), Azure SQL Database, SQL Server, etc.
- Ejecución de paquetes SSIS: ejecute de forma nativa paquetes de SQL Server Integration Services (SSIS) en un entorno de proceso de Azure administrado.
En las canalizaciones de Data Factory y Synapse, una actividad define la acción que se realizará. Un servicio vinculado define un almacén de datos o un servicio de proceso de destino. Un entorno de ejecución de integración proporciona el puente entre las actividades y los servicios vinculados. El servicio vinculado o la actividad hace referencia y proporciona el entorno de proceso en el que la actividad se ejecuta directamente o se envía. Esta asociación permite que la actividad se pueda realizar en la región más cercana posible al almacén de datos de destino o al servicio de proceso para maximizar el rendimiento, a la vez que permite flexibilidad para cumplir los requisitos de seguridad y cumplimiento.
Los entornos de ejecución de integración se pueden crear en las interfaces de usuario de Azure Data Factory y Azure Synapse por medio del centro de administración directamente y de cualquier actividad, conjunto de datos o flujo de datos que haga referencia a ellos.
Tipos de instancias de Integration Runtime
Data Factory ofrece tres tipos de tiempo de ejecución de integración (IR), y deberías elegir el que mejor se adapte a tus capacidades de integración de datos y a tus necesidades del entorno de red. Los tres tipos de IR son:
- Azure
- Autohospedado
- SSIS de Azure
Nota
Actualmente, las canalizaciones de Synapse solo admiten entornos de ejecución integrados de Azure o autoalojados.
En la tabla siguiente se describen las funcionalidades y la compatibilidad de red para cada uno de los tipos de instancias de Integration Runtime:
| Tipo de IR | Compatibilidad con redes públicas | Compatibilidad con Private Link |
|---|---|---|
| Azure | Flujo de Datos Movimiento de datos Distribución de actividades |
Flujo de Datos Movimiento de datos Distribución de actividades |
| Autohospedado | Movimiento de datos Distribución de actividades |
Movimiento de datos Distribución de actividades |
| SSIS de Azure | Ejecución de paquetes SSIS | Ejecución de paquetes SSIS |
Nota
Los controles de salida varían según el servicio para Azure IR. En Synapse, los espacios de trabajo tienen opciones para limitar el tráfico saliente de la red virtual gestionada cuando usas Azure IR. En Data Factory, todos los puertos se abren para comunicaciones salientes cuando usas Azure IR. Azure-SSIS IR se puede integrar con la red virtual para proporcionar controles de comunicaciones salientes.
Tiempo de ejecución de integración de Azure
Una instancia de Azure Integration Runtime puede:
- Ejecución de flujos de datos en Azure
- Ejecución de actividades de copia entre almacenes de datos en la nube
- Distribuya las siguientes actividades de transformación en una red pública:
- Actividad personalizada de .NET
- Actividad de función de Azure
- Actividad de Notebook, Jar y Python de Databricks
- Actividad de obtención de metadatos
- Actividad de Hive de HDInsight
- Actividad de Pig de HDInsight
- Actividad de MapReduce de HDInsight
- Actividad de HDInsight Spark
- Actividad de HDInsight Streaming
- Actividad de búsqueda
- Actividad de ejecución por lotes de Machine Learning Studio (clásico)
- Actividad de actualización de recursos de Machine Learning Studio (clásico)
- Actividad de procedimiento almacenado
- Actividad de validación
- Actividad web
Entorno de red de Azure Integration Runtime
El entorno de ejecución de integración de Azure permite conectar a almacenes de datos y servicios de cómputo con puntos finales accesibles públicamente. Cuando activas Managed Virtual Network, el runtime de integración de Azure permite conectar a almacenes de datos usando Private Link en un entorno de red privada. En Synapse, las áreas de trabajo tienen opciones para limitar el tráfico saliente de la red virtual administrada por IR. En Data Factory, se abren todos los puertos para las comunicaciones salientes. Azure-SSIS IR se puede integrar con la red virtual para proporcionar controles de comunicaciones salientes.
Recursos de proceso y escalado de Azure Integration Runtime
Azure Integration Runtime ofrece una computación totalmente administrada y sin servidor en Azure. No tiene que preocuparse del aprovisionamiento de la infraestructura, la instalación de software, la aplicación de revisiones ni el escalado de la capacidad. Además, solo pagas por lo que usas.
Integration Runtime de Azure proporciona el proceso nativo para mover datos entre almacenes de datos en la nube de forma segura, confiable y con alto rendimiento. Puedes establecer cuántas unidades de integración de datos usar en la actividad de copia, y el tamaño de cálculo del IR de Azure se escala elásticamente en consecuencia sin necesidad de ajustar explícitamente el tamaño del runtime de integración de Azure.
El despacho de actividades es una operación ligera para enrutar la actividad al servicio de cálculo destino, por lo que no es necesario escalar el tamaño del cálculo en este escenario.
Para obtener información sobre cómo crear y configurar una instancia de Azure IR, consulte Cómo crear y configurar una instancia de Azure Integration Runtime.
Nota
El runtime de integración de Azure tiene propiedades relacionadas con el runtime de Data Flow, que define la infraestructura de cómputo subyacente utilizada para ejecutar los flujos de datos.
Entorno de ejecución de integración autohospedado
Una instancia de Integration Runtime autohospedado es capaz de:
- Ejecutar actividad de copia entre un almacén de datos en la nube y un almacén de datos en una red privada.
- Distribuir las siguientes actividades de transformación frente a los recursos de proceso en el entorno local o Azure Virtual Network:
- Actividad de función de Azure
- Actividad personalizada (se ejecuta en Azure Batch)
- Actividad de obtención de metadatos
- Actividad Hive de HDInsight (BYOC: traiga su propio clúster)
- Actividad Pig de HDInsight (BYOC)
- Actividad MapReduce de HDInsight (BYOC)
- Actividad Spark de HDInsight (BYOC)
- Actividad Streaming de HDInsight (BYOC)
- Actividad de búsqueda
- Actividad de ejecución por lotes de Machine Learning Studio (clásico)
- Actividad de actualización de recursos de Machine Learning Studio (clásico)
- Actividad de ejecución de canalización de Machine Learning
- Actividad de procedimiento almacenado
- Actividad de validación
- Actividad web
Nota
Utiliza runtime de integración autoalojada para soportar almacenes de datos que requieren un controlador propio, como SAP HANA y MySQL. Para más información, consulta almacenes de datos compatibles.
Nota
El Entorno de Ejecución Java (JRE) es una dependencia del IR autoalojado. Asegúrese de que tiene JRE instalado en el mismo host.
Entorno de red de IR autohospedado
Si quiere realizar la integración de datos de forma segura en un entorno de red privada que no tenga una línea de visión directa desde el entorno de nube pública, puede instalar un entorno de ejecución de integración autohospedado en el entorno local detrás de un firewall o dentro de una red privada virtual. El entorno de ejecución de integración autohospedado solo realiza conexiones salientes basadas en HTTP a Internet.
Recursos de proceso y escalado de IR autohospedado
Instale un entorno de ejecución de integración autohospedado en una máquina local o en una máquina virtual dentro de una red privada. Actualmente, el IR autohospedado solo se admite en un sistema operativo Windows. Para una alta disponibilidad y escalabilidad, puede escalar horizontalmente IR autohospedado mediante la asociación de la instancia lógica con varias máquinas locales en modo activo-activo. Para obtener más información, consulte el artículo sobre cómo crear y configurar un entorno de ejecución de integración autohospedado.
Integration Runtime de SSIS de Azure
Para levantar y mover la carga de trabajo de SSIS existente, puede crear una instancia de Integration Runtime de SSIS de Azure para ejecutar paquetes SSIS de forma nativa.
Entorno de red de una instancia de Integration Runtime para la integración de SSIS en Azure
Azure-SSIS IR se puede aprovisionar en una red pública o en una red privada. El acceso a datos locales se admite mediante la unión de Azure-SSIS IR a una red virtual que está conectada a la red local.
Recursos de cálculo y escalado de Azure-SSIS IR
Azure-SSIS IR es un clúster totalmente administrado de máquinas virtuales de Azure dedicado a ejecutar los paquetes SSIS. Puede traer su propia Azure SQL Database o SQL Managed Instance para el catálogo de proyectos y paquetes de SSIS (SSISDB). Puede aumentar la potencia de cálculo especificando el tamaño de nodo y expandirlo especificando el número de nodos en el clúster. Puedes gestionar el coste de ejecutar tu Azure-SSIS el tiempo de ejecución de integración parando y arrancándolo según lo requieran tus necesidades.
Para más información, consulte Crear y configurar una instancia de Azure SSIS IR. Una vez creada, puede implementar y administrar los paquetes de SSIS existentes con poco o ningún cambio utilizando herramientas conocidas, como SQL Server Data Tools (SSDT) y SQL Server Management Studio (SSMS), de manera similar a usar SSIS de forma local.
Para más información sobre el entorno de ejecución de Azure SSIS, consulte los artículos siguientes:
- Tutorial: Implementación de paquetes SSIS en Azure. En este artículo se proporcionan instrucciones paso a paso para crear una instancia de Azure-SSIS IR y se usa una instancia de Azure SQL Database para hospedar el catálogo de SSIS.
- Cómo crear un Integration Runtime de Azure-SSIS. En este artículo se amplía el tutorial y se proporcionan instrucciones sobre el uso de Instancia administrada de SQL y la unión de Integration Runtime a una red virtual.
- Supervisar una instancia de Azure-SSIS IR. En este artículo se muestra cómo recuperar información sobre una instancia de Azure-SSIS IR y se proporcionan descripciones de los estados en la información devuelta.
- Gestionar un Azure-SSIS IR. En este artículo se explica cómo detener, iniciar o eliminar un IR de Azure-SSIS. También muestra cómo escalar horizontalmente el IR de Azure-SSIS mediante la adición de más nodos al IR.
- Unir un Azure-SSIS IR a una red virtual. En este artículo se proporciona información conceptual sobre cómo unir un IR de Azure-SSIS a una red virtual de Azure. También se proporcionan los pasos para usar Azure Portal para configurar una red virtual y unir a ella una instancia de Azure-SSIS IR.
Ubicación de Integration Runtime
Relación entre la ubicación de la factoría y la ubicación de infrarrojos
Cuando creas una instancia de Data Factory o un espacio de trabajo de Synapse, necesitas especificar su ubicación. Los metadatos de la instancia se almacenan aquí y el desencadenador de la canalización se inicia desde aquí. Los metadatos solo se almacenan en la región elegida y no en otras regiones.
Mientras tanto, una canalización puede acceder a almacenes de datos y servicios de proceso de otras regiones de Azure para mover datos entre almacenes de datos o procesar datos mediante servicios de proceso. Este comportamiento se realiza mediante el IR disponible globalmente para asegurar el cumplimiento normativo de los datos, la eficiencia, y la reducción de los costos de salida de red.
La ubicación IR define la ubicación de su cálculo back-end y dónde se realizan el movimiento de datos, el despacho de actividades y la ejecución del paquete SSIS. La ubicación de la instancia de Integration Runtime puede ser diferente de la ubicación de la factoría de datos a la que pertenece.
Ubicación de Azure Integration Runtime
Puede establecer la región de ubicación de un IR de Azure; en ese caso, la ejecución o distribución de la actividad se llevará a cabo en la región seleccionada.
El valor predeterminado es resolver automáticamente Azure IR en la red pública. Con esta opción:
En el caso de la actividad de copia, se hace todo lo posible para detectar automáticamente la ubicación del almacén de datos receptor y, luego, se usa el entorno de ejecución de integración de la misma región, si está disponible, o, en caso contrario, de la más cercana de la misma ubicación geográfica. Si la región del almacén de datos receptor no se puede detectar, se usaría entonces el entorno de ejecución de integración de la región de la instancia.
Por ejemplo, se creó una Data Factory o un espacio de trabajo Synapse en el este de EE. UU.,
- Al copiar datos en un blob de Azure en Oeste de EE. UU., si se detecta que el blob está en esta región, la actividad de copia se ejecuta en el entorno de ejecución de integración del Oeste de EE. UU. Si no se puede detectar la región, la actividad de copia se ejecuta en el entorno de ejecución de integración del Este de EE. UU.
- Al copiar datos en Salesforce para los que no se puede detectar la región, la actividad de copia se ejecuta en el entorno de ejecución de integración del Este de EE. UU.
Sugerencia
Si tienes requisitos estrictos de cumplimiento de datos y necesitas asegurarte de que los datos no salgan de una determinada geografía, puedes crear explícitamente un IR de Azure en una región concreta y apuntar el servicio enlazado a ese IR usando la propiedad ConnectVia. Por ejemplo, si quieres copiar datos de un blob en el sur del Reino Unido a un espacio de trabajo de Azure Synapse en el sur del Reino Unido y quieres asegurarte de que los datos no salgan del Reino Unido, crea un IR de Azure en el sur del Reino Unido y enlaza ambos servicios vinculados a ese IR.
Para la ejecución de actividades de búsqueda/GetMetadata/Eliminación (actividades de Pipeline), despacho de actividades de transformación (actividades externas) y operaciones de autoría (conexión de prueba, lista de carpetas de navegación y lista de tablas, y datos de previsualización), se utiliza el IR en la misma región que la Data Factory o el espacio de trabajo de Synapse.
Para Data Flow, se utiliza el IR en la región Data Factory o Synapse workspace.
Sugerencia
Un procedimiento recomendado es asegurarse de que los flujos de datos se ejecuten en la misma región que los almacenes de datos correspondientes cuando sea posible. Puedes conseguirlo con autoresolución para Azure IR (si la ubicación del almacenamiento de datos es la misma que la de Data Factory o el espacio de trabajo de Synapse), o creando una nueva instancia de Azure IR en la misma región que tus almacenes de datos y luego ejecutando los flujos de datos en ella.
Si activas Managed Virtual Network con resolución automática para Azure IR, se utiliza el IR en la región Data Factory o Synapse workspace.
Puede supervisar qué ubicación de IR tiene efecto durante la ejecución de la actividad en la vista de supervisión de la actividad de canalización en Data Factory Studio o Synapse Studio, o en la carga de supervisión de actividad.
Ubicación de IR autohospedado
El IR autoalojado se registra lógicamente en el espacio de trabajo de Data Factory o Synapse, y tú proporcionas el cálculo utilizado para apoyar sus funcionalidades. Por tanto, no hay ninguna propiedad de ubicación explícita para la instancia de Integration Runtime autohospedada.
Cuando se utiliza para mover datos, el IR autohospedado extrae datos del origen y los escribe en el destino.
Ubicación de Azure-SSIS IR
Nota
Los runtimes de integración de SSIS en Azure no se admiten actualmente en las canalizaciones de Synapse.
Seleccionar la ubicación correcta para Azure-SSIS IR es esencial para lograr un alto rendimiento en los flujos de trabajo de extracción, transformación y carga (ETL).
- La ubicación de su instancia de Azure-SSIS IR no tiene que ser la misma que la ubicación de su instancia de Data Factory, pero debe ser la misma que la ubicación de su propia instancia de Azure SQL Database o SQL Managed Instance donde se encuentra SSISDB. De este modo, tu runtime de integración Azure-SSIS puede acceder fácilmente a la SSISDB sin incurrir en un tráfico excesivo entre diferentes ubicaciones.
- Si no tiene un Azure SQL Database existente o una Instancia administrada de SQL, pero tiene orígenes/destinos de datos locales, debe crear un nuevo Azure SQL Database o una Instancia administrada de SQL en la misma ubicación de una red virtual conectada a su red local. De este modo, puede crear su instancia de Azure-SSIS IR mediante la nueva instancia de Azure SQL Database o SQL Managed Instance, y unirse a esa red virtual. Todo está en la misma ubicación, lo que reduce el movimiento de datos y los costos asociados, a la vez que aumenta el rendimiento.
- Si la ubicación de tu Azure SQL Database o SQL Managed Instance actual no es la misma que la ubicación de una red virtual conectada a tu red local, primero crea tu Azure-SSIS IR usando una Azure SQL Database o SQL Managed Instance existente y unirse a otra red virtual en la misma ubicación. A continuación, configure una conexión de red virtual a red virtual entre las distintas ubicaciones.
En el diagrama siguiente se muestra la configuración de ubicación de Data Factory y sus entornos de ejecución de integración:
Determinar qué IR usar
Si una actividad se asocia a más de un tipo de entorno de ejecución de integración, se resuelve en uno de ellos. El runtime de integración autoalojada tiene prioridad sobre el runtime de integración de Azure en Azure Data Factory o en las instancias de Synapse Workspace que utilizan una red virtual gestionada. Y este último tiene prioridad sobre el entorno de ejecución de integración global de Azure.
Por ejemplo, se usa una actividad de copia para copiar datos del origen al receptor. El entorno de ejecución de integración global de Azure está asociado al servicio vinculado en el caso del origen, y un entorno de ejecución de integración de Azure en una red virtual administrada de Azure Data Factory se asocia con el servicio vinculado para el receptor. El resultado es que los servicios vinculados de origen y receptor usan Azure Integration Runtime en la red virtual administrada por Azure Data Factory. No obstante, si un entorno de ejecución de integración autohospedado se asocia con el servicio vinculado para el origen, tanto el servicio vinculado de origen como el servicio vinculado receptor usan el entorno de ejecución de integración autohospedado.
Actividad de copia
La actividad de copia requiere servicios vinculados tanto de origen como de destino para definir la dirección del flujo de datos. Se utiliza la lógica siguiente para determinar qué instancia de Integration Runtime se utiliza para realizar la copia:
- Copia entre dos orígenes de datos en la nube: si los servicios vinculados de origen y receptor usan Azure IR, se utiliza la instancia regional de Azure IR, si se ha especificado, o se determina automáticamente una ubicación para Azure IR si decidió usar la opción de resolución automática de IR (la opción predeterminada), como se ha descrito en la sección Ubicación de Integration Runtime.
- Copia de datos entre un origen de datos en la nube y un origen de datos en una red privada: si el servicio vinculado de origen o receptor apunta a una instancia de IR autohospedado, la actividad de copia se ejecuta en esa instancia de Integration Runtime autohospedado.
- Copia entre dos orígenes de datos en una red privada: el servicio vinculado de origen y de destino deben apuntar a la misma instancia de Integration Runtime, y esa instancia se utiliza para ejecutar la actividad de copia.
Actividad Lookup y GetMetadata
La actividad Lookup y GetMetadata se ejecuta en el entorno de ejecución de integración asociado al servicio vinculado de almacén de datos.
Actividad de transformación externa
Cada actividad de transformación externa que utiliza un motor de cómputo externo tiene un servicio enlazado de cómputo objetivo, que apunta a un tiempo de ejecución de integración. Esta instancia de IR determina la ubicación desde la que se envía esa actividad de transformación externa codificada a mano.
Actividad de Flujo de Datos
Las actividades de Data Flow se ejecutan en su entorno de ejecución de integración de Azure asociado. Las propiedades del flujo de datos en tu Azure IR determinan el cálculo de Spark utilizado y son gestionadas completamente por el servicio.
Tiempo de ejecución de integración en CI/CD
Los entornos de ejecución de integración no cambian a menudo y son similares en todas las fases de CI/CD. En Data Factory es necesario tener el mismo nombre y tipo de entorno de ejecución de integración en todas las fases de CI/CD. Si quiere compartir entornos de ejecución de integración en todas las fases, considere la posibilidad de usar una factoría dedicada solo para contener los entornos de ejecución de integración compartidos. A continuación, puede usar esta fábrica compartida en todos los entornos como un tipo de entorno de ejecución de integración vinculado.
Contenido relacionado
Vea los artículos siguientes:
- Cómo crear y configurar una instancia de Azure Integration Runtime
- Crear Integration Runtime autohospedado
- Creación de una instancia de Integration Runtime de SSIS de Azure. En este artículo se amplía el tutorial y se proporcionan instrucciones sobre el uso de Instancia administrada de SQL y la unión de Integration Runtime a una red virtual.