Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Idées de solution
Cet article présente une idée de solution. Votre architecte cloud peut s’appuyer sur ces conseils pour visualiser les principaux composants d’une implémentation typique de cette architecture. Utilisez cet article comme point de départ pour concevoir une solution bien conçue qui répond aux exigences spécifiques de votre charge de travail.
Cet article explique comment répliquer et synchroniser des données sur Azure pendant la modernisation du mainframe. Il décrit les aspects techniques de cette idée de solution, tels que les magasins de données, les outils et les services. Les systèmes mainframe et milieu de gamme mettent à jour les bases de données d’applications locales à intervalles réguliers. Pour maintenir la cohérence, cette solution synchronise les données les plus récentes avec les bases de données Azure.
Architecture
Téléchargez un fichier Visio de cette architecture.
Flux de travail
Le workflow suivant correspond au diagramme précédent :
Azure Data Factory les pipelines dynamiques orchestrent les activités, notamment l’extraction de données et le chargement des données. Vous pouvez planifier des activités de pipeline, les démarrer manuellement ou les déclencher automatiquement.
Les pipelines regroupent les activités qui effectuent des tâches. Pour extraire des données, Azure Data Factory crée dynamiquement un pipeline pour chaque table locale. Vous pouvez ensuite utiliser une implémentation massivement parallèle lorsque vous répliquez des données dans Azure. Configurez le niveau de réplication en fonction de vos besoins.
Réplication complète. Répliquez l’intégralité de la base de données et modifiez les types de données et les champs dans la base de données Azure cible.
Réplication partielle, delta ou incrémentielle. Utilisez des colonnes de filigrane dans les tables sources pour synchroniser les lignes mises à jour avec Azure bases de données. Ces colonnes contiennent soit une clé à incrémentation continue, soit un horodatage qui indique la dernière mise à jour de la table.
Azure Data Factory utilise également des pipelines pour les tâches de transformation suivantes :
Conversion de type de données
Manipulation des données
Mise en forme des données
Dérivation de colonne
Aplatissement des données
Tri des données
Filtrage des données
Les bases de données locales, telles que Db2 zOS, Db2 pour i et Db2 LUW, stockent les données d’application.
Un runtime d’intégration auto-hébergé fournit l’environnement qu’Azure Data Factory utilise pour exécuter et distribuer des activités.
Azure Data Lake Storage Gen2 et Stockage Blob Azure préparent les données. Cette étape peut être nécessaire pour transformer et fusionner des données à partir de plusieurs sources.
Pour la préparation des données, Azure Data Factory utilise Azure Databricks, des activités personnalisées et des flux de données de pipeline pour transformer les données rapidement et efficacement.
Azure Data Factory charge les données dans les bases de données Azure relationnelles et non relationnelles suivantes :
Azure SQL
Base de données Azure pour PostgreSQL
Base de données Azure Cosmos DB
Azure Data Lake Storage
Azure Database pour MySQL
SQL Server Integration Services (SSIS) extrait, transforme et charge les données.
La passerelle de données locale est une application cliente Windows locale qui agit comme un pont entre vos sources de données locales et les services Azure.
Un pipeline de données Microsoft Fabric est un regroupement logique d’activités qui effectuent l’ingestion des données de Db2 vers Azure stockage et bases de données.
Si la solution nécessite une réplication quasi en temps réel, vous pouvez utiliser des outils non Microsoft.
Si ces outils ne peuvent pas accéder aux bases de données Db2 locales, extrayez les données et générez un processus de migration personnalisé pour charger les fichiers extraits dans les bases de données cibles.
Composants
Cette section décrit d’autres outils que vous pouvez utiliser lors de la modernisation des données, de la synchronisation des données et de l’intégration des données.
Intégrateurs de données
azure Data Factory est un service d’intégration de données hybride. Vous pouvez utiliser cette solution sans serveur entièrement gérée pour créer, planifier et orchestrer des flux de travail d’extraction, de transformation et de chargement (ETL) et des flux de travail d’extraction, de chargement et de transformation (ELT).
Fabric est une plateforme d’analyse de données d’entreprise qui réduit le délai d’obtention d’informations exploitables dans l’ingénierie des données, l’entreposage de données, l’intégration des données, l’analyse en temps réel et l’informatique décisionnelle. Fabric est une solution SaaS (Software as a Service) qui utilise un stockage centralisé dans OneLake. Fabric combine les technologies et services suivants :
Les technologies SQL pour l’entreposage de données d’entreprise sont disponibles à l’aide de Fabric Data Warehouse, qui est un entrepôt transactionnel managé qui utilise un format Delta ouvert.
L’ingénierie des données à grande échelle et le Machine Learning sont disponibles à l’aide de Fabric Data Engineering, qui inclut des fonctionnalités Apache Spark intégrées.
L’analytique en quasi-temps réel est disponible à l’aide de Fabric Real-Time Intelligence, qui comprend des eventhouses et des flux d’événements.
Les flux de travail ETL et ELT sont disponibles à l’aide de Fabric Data Factory, qui inclut des pipelines, Dataflow Gen2 et une gamme de connecteurs avec prise en charge de passerelle hybride et locale.
Fabric a des intégrations natives avec Power BI et avec des services Azure tels que Azure Cosmos DB et Azure Machine Learning.
SSIS est une plateforme pour les solutions d’intégration et de transformation de données au niveau de l’entreprise. Utilisez SSIS pour gérer, répliquer, nettoyer et miner des données.
Azure Databricks est une plateforme d’analytique des données basée sur le système de traitement distribué open source Spark. Azure Databricks est optimisé pour la plateforme cloud Azure. Dans un flux de travail analytique, Azure Databricks lit des données provenant de plusieurs sources et utilise Spark pour fournir des informations.
Stockage de données
Azure SQL Database est une plateforme en tant que service (PaaS) entièrement managée et basée sur le cloud. SQL Database fournit des fonctionnalités automatisées basées sur l’IA qui optimisent les performances et la durabilité. Les options de calcul sans serveur et de stockage Hyperscale mettent automatiquement à l’échelle les ressources à la demande.
Azure SQL Managed Instance est un service de base de données dans le cloud entièrement géré, intelligent et évolutif, compatible avec le moteur SQL Server. Utilisez SQL Managed Instance pour moderniser les applications existantes à grande échelle.
SQL Server sur les machines virtuelles Azure réhéberge les charges de travail compatibles avec le code SQL Server dans le cloud. SQL Server sur les machines virtuelles Azure combine les performances, la sécurité et l’analytique de SQL Server avec la flexibilité et la connectivité hybride de Azure. Pour migrer des applications existantes ou créer de nouvelles applications, utilisez SQL Server sur les machines virtuelles Azure.
Azure Database pour PostgreSQL est un service de base de données relationnelle entièrement managé basé sur l’édition community du moteur de base de données open source PostgreSQL. Azure Database pour PostgreSQL fournit des fonctionnalités évolutives d’innovation d’application.
Azure Cosmos DB est une base de données multi-modèles distribuée à l’échelle mondiale. Utilisez Azure Cosmos DB pour vous assurer que vos solutions peuvent mettre à l’échelle de manière élastique et indépendante le débit et le stockage dans plusieurs régions géographiques.
Data Lake Storage est un référentiel de stockage qui contient de grandes quantités de données natives et brutes. Les stockages Data Lake sont optimisés pour évoluer vers des téraoctets et des pétaoctets de données. Les données proviennent généralement de plusieurs sources hétérogènes et peuvent être structurées, semi-structurées ou non structurées. Data Lake Storage Gen2 combine les fonctionnalités de Data Lake Storage Gen1 avec le stockage Blob. Data Lake Storage Gen2 fournit la sémantique du système de fichiers, la sécurité au niveau du fichier et la mise à l’échelle. Il fournit également les fonctionnalités de stockage hiérarchisé, de haute disponibilité et de récupération d’urgence du Stockage Blob.
Azure Database pour MySQL est un service de base de données relationnelle entièrement managé basé sur l’édition community du moteur de base de données MySQL open source.
Autres outils
Le service Microsoft DRDA (Distributed Relational Database Architecture) est un composant du serveur d’intégration hôte. service Microsoft pour DRDA est un serveur d’applications que les clients demandeurs d’applications DRDA utilisent. Parmi les exemples de clients DRDA AR, citons IBM Db2 pour z/OS et Db2 pour i5/OS. Ces clients utilisent le serveur d’applications pour convertir des instructions SQL Db2 et les exécuter sur SQL Server.
Assistant Migration SQL Server (SSMA) pour Db2 automatise la migration de Db2 vers Microsoft services de base de données. L’outil SSMA pour Db2 s’exécute sur une machine virtuelle. Il convertit les objets de base de données Db2 en objets de base de données SQL Server et crée ces objets dans SQL Server.
Autres solutions
Cette architecture présente les options et les cibles de base de données Azure pour la réplication et la synchronisation des données de mainframe. Vous pouvez également répliquer et synchroniser les cibles de Azure SQL suivantes :
SQL Managed Instance est un service de base de données cloud entièrement managé. SQL Managed Instance est compatible avec SQL Server moteur. Utilisez SQL Managed Instance pour moderniser les applications à grande échelle.
SQL Server sur les machines virtuelles Azure réhéberge SQL Server charges de travail dans le cloud sans modification du code. SQL Server sur les machines virtuelles Azure combine les performances, la sécurité et l’analytique de SQL Server avec la flexibilité et la connectivité hybride de Azure. Pour migrer des applications existantes ou pour créer de nouvelles applications, utilisez SQL Server sur les machines virtuelles Azure.
Détails du scénario
La disponibilité et l’intégrité des données sont essentielles à la modernisation de mainframe et de midrange. Les stratégies data-first aident à conserver les données intactes et disponibles pendant la migration vers Azure. Pour éviter les interruptions lors de la modernisation, vous devrez peut-être répliquer rapidement ou synchroniser des données locales avec des bases de données Azure.
Cette solution couvre les points suivants :
Extraction. Connectez-vous à une base de données source et extrayez des données.
Transformation, notamment :
Staging: Stockez temporairement les données dans son format d’origine et préparez-les pour la transformation.
Préparation. Transformez et manipulez des données à l’aide de règles de mappage qui répondent aux exigences de la base de données cible.
Chargement. Insérez des données dans une base de données cible.
Cas d’usage potentiels
Utilisez cette solution dans les scénarios de réplication et de synchronisation de données suivants :
Architectures de séparation des responsabilités des requêtes de commande qui utilisent Azure pour traiter tous les canaux d’enquête
Environnements de test pour les applications sur site et les applications réhébergées ou réarchitecturées exécutées en parallèle
Systèmes locaux qui utilisent des applications étroitement couplées qui nécessitent une correction ou une modernisation par phases
Recommandations
Vous pouvez appliquer les recommandations suivantes à la plupart des scénarios. Suivez ces recommandations, sauf si vous avez un besoin spécifique qui vous oblige à les ignorer.
Si vous utilisez Azure Data Factory pour extraire des données, ajustez les performances de l’activité de copie. Lorsque vous utilisez Fabric Data Factory pour extraire des données, ajuster le parallélisme, la taille du lot et les paramètres du connecteur pour optimiser les performances du pipeline. Pour plus d’informations, consultez vue d’ensemble du pipeline et vue d’ensemble du connecteur.
Contributors
Microsoft conserve cet article. Les contributeurs suivants ont écrit cet article.
Auteur principal :
- Rodrigo Rodríguez | Architecte de solution cloud senior, IA &Quantum
Pour afficher les profils LinkedIn non publics, connectez-vous à LinkedIn.