Répliquer et synchroniser les données mainframe vers Azure

Azure Data Factory
Azure Databricks
Microsoft Fabric

Idées de solution

Cet article présente une idée de solution. Votre architecte cloud peut s’appuyer sur ces conseils pour visualiser les principaux composants d’une implémentation typique de cette architecture. Utilisez cet article comme point de départ pour concevoir une solution bien conçue qui répond aux exigences spécifiques de votre charge de travail.

Cet article explique comment répliquer et synchroniser des données sur Azure pendant la modernisation du mainframe. Il décrit les aspects techniques de cette idée de solution, tels que les magasins de données, les outils et les services. Les systèmes mainframe et milieu de gamme mettent à jour les bases de données d’applications locales à intervalles réguliers. Pour maintenir la cohérence, cette solution synchronise les données les plus récentes avec les bases de données Azure.

Architecture

Diagramme illustrant l’architecture de réplication et de synchronisation des données de mainframe vers Azure.

Diagramme montrant le flux de données provenant de sources Db2 par le biais de pipelines Azure Data Factory vers le stockage, l’analytique et les services BI de données sur Azure. Le diagramme comporte une zone pour les composants locaux et une zone pour les composants Azure. La partie locale comporte deux encadrés. Une zone contient des bases de données, telles que Db2 zOS et Db2 LUW. Une flèche pointe de ces bases de données vers la deuxième zone, qui répertorie les outils d’intégration. Des flèches pointent de chaque outil d’intégration vers un composant dans la section Azure. Le runtime d’intégration auto-hébergé pointe vers l'encadré de pipeline dynamique, qui contient un pipeline parent et trois pipelines enfants. Une flèche part de ces pipelines vers l’encadré de stockage de données, d’analytique et de business intelligence (BI). Cette boîte contient des services Azure tels qu’Azure SQL Database, Azure Cosmos DB et Stockage Blob Azure. Les flèches bidirectionnelles pointillées relient le chemin de pipeline dynamique à Azure Data Lake Storage Gen2 et Azure Databricks. Les flèches vont de SQL Server Integration Services (SSIS) local et d’outils non-Microsoft vers l'encadré de stockage de données, d’analytique et de BI. L’outil d’intégration de la passerelle de données sur site pointe vers un pipeline de données dans Fabric Data Factory. Une flèche part de ce pipeline vers la zone de stockage de données, d’analytique et de BI.

Téléchargez un fichier Visio de cette architecture.

Flux de travail

Le workflow suivant correspond au diagramme précédent :

  1. Azure Data Factory les pipelines dynamiques orchestrent les activités, notamment l’extraction de données et le chargement des données. Vous pouvez planifier des activités de pipeline, les démarrer manuellement ou les déclencher automatiquement.

    Les pipelines regroupent les activités qui effectuent des tâches. Pour extraire des données, Azure Data Factory crée dynamiquement un pipeline pour chaque table locale. Vous pouvez ensuite utiliser une implémentation massivement parallèle lorsque vous répliquez des données dans Azure. Configurez le niveau de réplication en fonction de vos besoins.

    • Réplication complète. Répliquez l’intégralité de la base de données et modifiez les types de données et les champs dans la base de données Azure cible.

    • Réplication partielle, delta ou incrémentielle. Utilisez des colonnes de filigrane dans les tables sources pour synchroniser les lignes mises à jour avec Azure bases de données. Ces colonnes contiennent soit une clé à incrémentation continue, soit un horodatage qui indique la dernière mise à jour de la table.

    Azure Data Factory utilise également des pipelines pour les tâches de transformation suivantes :

    • Conversion de type de données

    • Manipulation des données

    • Mise en forme des données

    • Dérivation de colonne

    • Aplatissement des données

    • Tri des données

    • Filtrage des données

  2. Les bases de données locales, telles que Db2 zOS, Db2 pour i et Db2 LUW, stockent les données d’application.

  3. Un runtime d’intégration auto-hébergé fournit l’environnement qu’Azure Data Factory utilise pour exécuter et distribuer des activités.

  4. Azure Data Lake Storage Gen2 et Stockage Blob Azure préparent les données. Cette étape peut être nécessaire pour transformer et fusionner des données à partir de plusieurs sources.

  5. Pour la préparation des données, Azure Data Factory utilise Azure Databricks, des activités personnalisées et des flux de données de pipeline pour transformer les données rapidement et efficacement.

  6. Azure Data Factory charge les données dans les bases de données Azure relationnelles et non relationnelles suivantes :

    • Azure SQL

    • Base de données Azure pour PostgreSQL

    • Base de données Azure Cosmos DB

    • Azure Data Lake Storage

    • Azure Database pour MySQL

  7. SQL Server Integration Services (SSIS) extrait, transforme et charge les données.

  8. La passerelle de données locale est une application cliente Windows locale qui agit comme un pont entre vos sources de données locales et les services Azure.

  9. Un pipeline de données Microsoft Fabric est un regroupement logique d’activités qui effectuent l’ingestion des données de Db2 vers Azure stockage et bases de données.

  10. Si la solution nécessite une réplication quasi en temps réel, vous pouvez utiliser des outils non Microsoft.

Si ces outils ne peuvent pas accéder aux bases de données Db2 locales, extrayez les données et générez un processus de migration personnalisé pour charger les fichiers extraits dans les bases de données cibles.

Composants

Cette section décrit d’autres outils que vous pouvez utiliser lors de la modernisation des données, de la synchronisation des données et de l’intégration des données.

Intégrateurs de données

  • azure Data Factory est un service d’intégration de données hybride. Vous pouvez utiliser cette solution sans serveur entièrement gérée pour créer, planifier et orchestrer des flux de travail d’extraction, de transformation et de chargement (ETL) et des flux de travail d’extraction, de chargement et de transformation (ELT).

  • Fabric est une plateforme d’analyse de données d’entreprise qui réduit le délai d’obtention d’informations exploitables dans l’ingénierie des données, l’entreposage de données, l’intégration des données, l’analyse en temps réel et l’informatique décisionnelle. Fabric est une solution SaaS (Software as a Service) qui utilise un stockage centralisé dans OneLake. Fabric combine les technologies et services suivants :

    Fabric a des intégrations natives avec Power BI et avec des services Azure tels que Azure Cosmos DB et Azure Machine Learning.

  • SSIS est une plateforme pour les solutions d’intégration et de transformation de données au niveau de l’entreprise. Utilisez SSIS pour gérer, répliquer, nettoyer et miner des données.

  • Azure Databricks est une plateforme d’analytique des données basée sur le système de traitement distribué open source Spark. Azure Databricks est optimisé pour la plateforme cloud Azure. Dans un flux de travail analytique, Azure Databricks lit des données provenant de plusieurs sources et utilise Spark pour fournir des informations.

Stockage de données

  • Azure SQL Database est une plateforme en tant que service (PaaS) entièrement managée et basée sur le cloud. SQL Database fournit des fonctionnalités automatisées basées sur l’IA qui optimisent les performances et la durabilité. Les options de calcul sans serveur et de stockage Hyperscale mettent automatiquement à l’échelle les ressources à la demande.

  • Azure SQL Managed Instance est un service de base de données dans le cloud entièrement géré, intelligent et évolutif, compatible avec le moteur SQL Server. Utilisez SQL Managed Instance pour moderniser les applications existantes à grande échelle.

  • SQL Server sur les machines virtuelles Azure réhéberge les charges de travail compatibles avec le code SQL Server dans le cloud. SQL Server sur les machines virtuelles Azure combine les performances, la sécurité et l’analytique de SQL Server avec la flexibilité et la connectivité hybride de Azure. Pour migrer des applications existantes ou créer de nouvelles applications, utilisez SQL Server sur les machines virtuelles Azure.

  • Azure Database pour PostgreSQL est un service de base de données relationnelle entièrement managé basé sur l’édition community du moteur de base de données open source PostgreSQL. Azure Database pour PostgreSQL fournit des fonctionnalités évolutives d’innovation d’application.

  • Azure Cosmos DB est une base de données multi-modèles distribuée à l’échelle mondiale. Utilisez Azure Cosmos DB pour vous assurer que vos solutions peuvent mettre à l’échelle de manière élastique et indépendante le débit et le stockage dans plusieurs régions géographiques.

  • Data Lake Storage est un référentiel de stockage qui contient de grandes quantités de données natives et brutes. Les stockages Data Lake sont optimisés pour évoluer vers des téraoctets et des pétaoctets de données. Les données proviennent généralement de plusieurs sources hétérogènes et peuvent être structurées, semi-structurées ou non structurées. Data Lake Storage Gen2 combine les fonctionnalités de Data Lake Storage Gen1 avec le stockage Blob. Data Lake Storage Gen2 fournit la sémantique du système de fichiers, la sécurité au niveau du fichier et la mise à l’échelle. Il fournit également les fonctionnalités de stockage hiérarchisé, de haute disponibilité et de récupération d’urgence du Stockage Blob.

  • Azure Database pour MySQL est un service de base de données relationnelle entièrement managé basé sur l’édition community du moteur de base de données MySQL open source.

Autres outils

  • Le service Microsoft DRDA (Distributed Relational Database Architecture) est un composant du serveur d’intégration hôte. service Microsoft pour DRDA est un serveur d’applications que les clients demandeurs d’applications DRDA utilisent. Parmi les exemples de clients DRDA AR, citons IBM Db2 pour z/OS et Db2 pour i5/OS. Ces clients utilisent le serveur d’applications pour convertir des instructions SQL Db2 et les exécuter sur SQL Server.

  • Assistant Migration SQL Server (SSMA) pour Db2 automatise la migration de Db2 vers Microsoft services de base de données. L’outil SSMA pour Db2 s’exécute sur une machine virtuelle. Il convertit les objets de base de données Db2 en objets de base de données SQL Server et crée ces objets dans SQL Server.

Autres solutions

Cette architecture présente les options et les cibles de base de données Azure pour la réplication et la synchronisation des données de mainframe. Vous pouvez également répliquer et synchroniser les cibles de Azure SQL suivantes :

  • SQL Managed Instance est un service de base de données cloud entièrement managé. SQL Managed Instance est compatible avec SQL Server moteur. Utilisez SQL Managed Instance pour moderniser les applications à grande échelle.

  • SQL Server sur les machines virtuelles Azure réhéberge SQL Server charges de travail dans le cloud sans modification du code. SQL Server sur les machines virtuelles Azure combine les performances, la sécurité et l’analytique de SQL Server avec la flexibilité et la connectivité hybride de Azure. Pour migrer des applications existantes ou pour créer de nouvelles applications, utilisez SQL Server sur les machines virtuelles Azure.

Détails du scénario

La disponibilité et l’intégrité des données sont essentielles à la modernisation de mainframe et de midrange. Les stratégies data-first aident à conserver les données intactes et disponibles pendant la migration vers Azure. Pour éviter les interruptions lors de la modernisation, vous devrez peut-être répliquer rapidement ou synchroniser des données locales avec des bases de données Azure.

Cette solution couvre les points suivants :

  • Extraction. Connectez-vous à une base de données source et extrayez des données.

  • Transformation, notamment :

    • Staging: Stockez temporairement les données dans son format d’origine et préparez-les pour la transformation.

    • Préparation. Transformez et manipulez des données à l’aide de règles de mappage qui répondent aux exigences de la base de données cible.

  • Chargement. Insérez des données dans une base de données cible.

Cas d’usage potentiels

Utilisez cette solution dans les scénarios de réplication et de synchronisation de données suivants :

  • Architectures de séparation des responsabilités des requêtes de commande qui utilisent Azure pour traiter tous les canaux d’enquête

  • Environnements de test pour les applications sur site et les applications réhébergées ou réarchitecturées exécutées en parallèle

  • Systèmes locaux qui utilisent des applications étroitement couplées qui nécessitent une correction ou une modernisation par phases

Recommandations

Vous pouvez appliquer les recommandations suivantes à la plupart des scénarios. Suivez ces recommandations, sauf si vous avez un besoin spécifique qui vous oblige à les ignorer.

Si vous utilisez Azure Data Factory pour extraire des données, ajustez les performances de l’activité de copie. Lorsque vous utilisez Fabric Data Factory pour extraire des données, ajuster le parallélisme, la taille du lot et les paramètres du connecteur pour optimiser les performances du pipeline. Pour plus d’informations, consultez vue d’ensemble du pipeline et vue d’ensemble du connecteur.

Contributors

Microsoft conserve cet article. Les contributeurs suivants ont écrit cet article.

Auteur principal :

Pour afficher les profils LinkedIn non publics, connectez-vous à LinkedIn.

Étapes suivantes