Replicación y sincronización de datos del sistema central con Azure

Azure Data Factory
Azure Databricks
Microsoft Fabric

Ideas de soluciones

En este artículo se describe una idea de solución. Su arquitecto de la nube puede usar esta guía para ayudar a visualizar los componentes principales de una implementación típica de esta arquitectura. Utilice este artículo como punto de partida para diseñar una solución bien arquitectada que se alinee con los requisitos específicos de su carga de trabajo.

En este artículo se explica cómo replicar y sincronizar datos con Azure durante la modernización del sistema central. Describe los aspectos técnicos de esta idea de solución, como almacenes de datos, herramientas y servicios. Los sistemas de mainframe y de rango medio actualizan las bases de datos de aplicaciones locales a intervalos regulares. Para mantener la coherencia, esta solución sincroniza los datos más recientes con las bases de datos de Azure.

Arquitectura

Diagrama que representa la arquitectura de replicación y sincronización de datos de mainframe con Azure.

Diagrama que muestra el flujo de datos desde orígenes de Db2, a través de canalizaciones de Azure Data Factory, hasta el almacenamiento de datos y los servicios de análisis y BI en Azure. El diagrama tiene un área para los componentes locales y un área para los componentes de Azure. El área local cuenta con dos cuadros. Un cuadro contiene bases de datos, como Db2 zOS y DB2 LUW. Una flecha apunta de estas bases de datos al segundo cuadro, que enumera las herramientas de integración. Las flechas apuntan desde cada herramienta de integración a un componente de la sección Azure. El Integration Runtime de integración autohospedado apunta al cuadro de canalización dinámica, que contiene una canalización principal y tres canalizaciones secundarias. Una flecha apunta desde estas canalizaciones al cuadro almacenamiento de datos, análisis y inteligencia empresarial (BI). Este cuadro contiene servicios de Azure como Azure SQL Database, Azure Cosmos DB y Azure Blob Storage. Unas flechas punteadas y bidireccionales conectan la ruta de la canalización dinámica con Azure Data Lake Storage Gen2 y Azure Databricks. Las flechas apuntan desde SQL Server Integration Services (SSIS) local y herramientas ajenas a Microsoft hacia el cuadro de almacenamiento de datos, análisis e inteligencia empresarial. La herramienta de integración de la puerta de enlace de datos local apunta a una canalización de datos en Fabric Data Factory. Una flecha apunta desde esta canalización al cuadro almacenamiento de datos, análisis y BI.

Descargue un archivo de Visio de esta arquitectura.

Flujo de trabajo

El siguiente flujo de trabajo corresponde al diagrama anterior:

  1. Azure Data Factory canalizaciones dinámicas orquestan actividades, incluida la extracción de datos y la carga de datos. Puede programar actividades de canalización, iniciarlas manualmente o desencadenarlas automáticamente.

    Las canalizaciones agrupan las actividades que realizan las tareas. Para extraer datos, Azure Data Factory crea dinámicamente una canalización para cada tabla local. A continuación, puede usar una implementación paralela masiva al replicar datos en Azure. Configure el nivel de replicación en función de sus requisitos.

    • Replicación completa. Replique toda la base de datos y modifique los tipos de datos y los campos de la base de datos de destino Azure.

    • Replicación parcial, delta o incremental. Use columnas de marca de agua en tablas de origen para sincronizar las filas actualizadas con bases de datos de Azure. Estas columnas contienen una clave en incremento continuo o una marca de tiempo que indica la última actualización de la tabla.

    Azure Data Factory también usa canalizaciones para las siguientes tareas de transformación:

    • Conversión de tipos de datos

    • Manipulación de datos

    • Formato de datos

    • Derivación de columnas

    • Aplanamiento de datos

    • Clasificación de datos

    • Filtrado de datos

  2. Las bases de datos locales, como Db2 zOS, Db2 para i y DB2 LUW, almacenan los datos de la aplicación.

  3. Un entorno de ejecución de integración (IR) autohospedado proporciona el entorno que Azure Data Factory usa para ejecutar y distribuir actividades.

  4. Azure Data Lake Storage Gen2 y Azure Blob Storage almacenan provisionalmente los datos. Este paso puede ser necesario para transformar y combinar datos de varios orígenes.

  5. Para la preparación de datos, Azure Data Factory usa Azure Databricks, actividades personalizadas y flujos de datos de canalización para transformar los datos de forma rápida y eficaz.

  6. Azure Data Factory carga datos en las siguientes bases de datos de Azure relacionales y no relacionales:

    • Azure SQL

    • Base de Datos de Azure para PostgreSQL

    • Azure Cosmos DB (la base de datos de Azure Cosmos)

    • Azure Data Lake Storage

    • Base de Datos Azure para MySQL

  7. SQL Server Integration Services (SSIS) extrae, transforma y carga datos.

  8. La puerta de enlace de datos local es una aplicación cliente de Windows local que actúa como un puente entre los orígenes de datos locales locales y los servicios de Azure.

  9. Una canalización de datos de Microsoft Fabric es una agrupación lógica de actividades que realizan la ingesta de datos de Db2 a almacenamiento y bases de datos de Azure.

  10. Si la solución requiere replicación casi en tiempo real, puede usar herramientas que no sean de Microsoft.

Si estas herramientas no pueden acceder a las bases de datos db2 locales, extraiga los datos y cree un proceso de migración personalizado para cargar los archivos extraídos en las bases de datos de destino.

Componentes

En esta sección se describen otras herramientas que puede usar durante la modernización de datos, la sincronización de datos y la integración de datos.

Integradores de datos

  • azure Data Factory es un servicio de integración de datos híbrido. Puede utilizar esta solución sin servidor totalmente administrada para crear, programar y organizar flujos de trabajo de extracción, transformación y carga (ETL) y flujos de trabajo de extracción, carga y transformación (ELT).

  • Fabric es una plataforma de análisis empresarial que acelera el tiempo para obtener información sobre la ingeniería de datos, el almacenamiento de datos, la integración de datos, el análisis en tiempo real y la inteligencia empresarial. Fabric es una solución de software como servicio (SaaS) que usa el almacenamiento centralizado en OneLake. Fabric combina las siguientes tecnologías y servicios:

    • Las tecnologías SQL para el almacenamiento de datos empresariales están disponibles mediante Fabric Data Warehouse, que es un almacenamiento transaccional administrado que usa un formato Delta abierto.

    • La ingeniería de datos a gran escala y el aprendizaje automático están disponibles mediante Fabric Ingeniería de datos, que incluye funcionalidades integradas de Apache Spark.

    • El análisis casi en tiempo real está disponible mediante Fabric Real-Time Intelligence, que incluye eventhouses y eventstreams.

    • Los flujos de trabajo ETL y ELT están disponibles mediante Fabric Data Factory, que incluye canalizaciones, Dataflow Gen2 y una gama de conectores con compatibilidad con puertas de enlace híbridas y locales.

    Fabric tiene integraciones nativas con Power BI y con servicios de Azure, como Azure Cosmos DB y Azure Machine Learning.

  • SSIS es una plataforma para soluciones de transformación e integración de datos de nivel empresarial. Use SSIS para administrar, replicar, limpiar y extraer datos.

  • Azure Databricks es una plataforma de análisis de datos basada en el sistema de procesamiento distribuido de código abierto spark. Azure Databricks está optimizado para la plataforma en la nube de Azure. En un flujo de trabajo de análisis, Azure Databricks lee datos de varios orígenes y usa Spark para proporcionar información.

Almacenamiento de datos

  • Azure SQL Database es una plataforma como servicio (PaaS) totalmente administrada y basada en la nube. SQL Database proporciona características automatizadas con tecnología de inteligencia artificial que optimizan el rendimiento y la durabilidad. Las opciones de proceso sin servidor y almacenamiento de Hiperescala escalan automáticamente los recursos a petición.

  • Azure SQL Managed Instance es un servicio de base de datos en la nube totalmente administrado, inteligente y escalable que tiene compatibilidad con SQL Server motor. Utiliza SQL Managed Instance para modernizar aplicaciones existentes a gran escala.

  • SQL Server en Azure Virtual Machines rehospeda cargas de trabajo de SQL Server compatibles con código en la nube. SQL Server en Azure Virtual Machines combina el rendimiento, la seguridad y el análisis de SQL Server con la flexibilidad y la conectividad híbrida de Azure. Para migrar aplicaciones existentes o compilar aplicaciones nuevas, use SQL Server en Azure Virtual Machines.

  • Azure Database for PostgreSQL es un servicio de base de datos relacional totalmente administrado basado en la edición comunitaria del motor de base de datos PostgreSQL de código abierto. Azure Database for PostgreSQL proporciona características escalables de innovación de aplicaciones.

  • Azure Cosmos DB es una base de datos de varios modelos distribuida globalmente. Use Azure Cosmos DB para asegurarse de que las soluciones puedan escalar de forma elástica e independiente el rendimiento y el almacenamiento en varias regiones geográficas.

  • Data Lake Storage es un repositorio de almacenamiento que contiene grandes cantidades de datos nativos y sin procesar. Los lagos de datos están optimizados para escalar a terabytes y petabytes de datos. Normalmente, los datos proceden de varios orígenes heterogéneos y pueden ser estructurados, semiestructurados o no estructurados. Data Lake Storage Gen2 combina las capacidades de Data Lake Storage Gen1 con Blob Storage. Data Lake Storage Gen2 proporciona semántica del sistema de archivos, seguridad de nivel de archivo y escala. También proporciona las capacidades de almacenamiento en capas, alta disponibilidad y recuperación ante desastres de Blob Storage.

  • Azure Database for MySQL es un servicio de base de datos relacional totalmente administrado basado en la edición community del motor de base de datos MySQL de código abierto.

Otras herramientas

Alternatives

Esta arquitectura muestra opciones y destinos de base de datos de Azure para la replicación y sincronización de datos de mainframe. También puede replicar y sincronizar con los siguientes destinos de Azure SQL:

  • SQL Managed Instance es un servicio de base de datos en la nube totalmente administrado. SQL Managed Instance es compatible con el motor de SQL Server. Use SQL Managed Instance para modernizar aplicaciones a gran escala.

  • SQL Server en Azure Virtual Machines rehospeda las cargas de trabajo SQL Server en la nube sin cambios en el código. SQL Server en Azure Virtual Machines combina el rendimiento, la seguridad y el análisis de SQL Server con la flexibilidad y la conectividad híbrida de Azure. Para migrar aplicaciones existentes o para crear nuevas aplicaciones, use SQL Server en Azure Virtual Machines.

Detalles del escenario

La disponibilidad e integridad de los datos son esenciales para el sistema central y la modernización de rango medio. Las estrategias de primeros datos ayudan a mantener los datos intactos y disponibles durante la migración a Azure. Para evitar interrupciones durante la modernización, es posible que tenga que replicar datos rápidamente o sincronizar datos locales con bases de datos de Azure.

En esta solución se describe lo siguiente:

  • Extracción. Conéctese a y extraiga datos de una base de datos de origen.

  • Transformación, entre las que se incluyen:

    • Almacenamiento provisional: Almacene temporalmente los datos en su formato original y prepárelo para la transformación.

    • Preparación. Transforme y manipule datos utilizando reglas de asignación que cumplan los requisitos de la base de datos de destino.

  • Cargando. Insertar datos en una base de datos de destino.

Casos de uso potenciales

Use esta solución en los siguientes escenarios de replicación y sincronización de datos:

  • Arquitecturas de segregación de responsabilidad de consulta de comandos que usan Azure para atender todos los canales de consulta

  • Entornos que prueban aplicaciones locales y aplicaciones paralelas rehospedadas o rediseñadas

  • Sistemas locales que usan aplicaciones estrechamente acopladas que requieren corrección por fases o modernización

Recommendations

Puede aplicar las siguientes recomendaciones a la mayoría de los escenarios. Sígalas a menos que tenga un requisito concreto que las invalide.

Si usa Azure Data Factory para extraer datos, ajuste el rendimiento de la actividad de copia. Cuando se usa Fabric Data Factory para extraer datos, ajustar el paralelismo, el tamaño del lote y la configuración del conector para optimizar el rendimiento de la canalización. Para obtener más información, consulte Introducción a la canalización y Introducción al conector.

Colaboradores

Microsoft mantiene este artículo. Los siguientes colaboradores escribieron este artículo.

Autor principal:

Para ver los perfiles no públicos de LinkedIn, inicie sesión en LinkedIn.

Pasos siguientes