Mainframegegevens repliceren en synchroniseren met Azure

Azure Data Factory
Azure Databricks
Microsoft Fabric

Oplossingsideeën

In dit artikel wordt een oplossingsidee beschreven. Uw cloudarchitect kan deze richtlijnen gebruiken om de belangrijkste onderdelen te visualiseren voor een typische implementatie van deze architectuur. Gebruik dit artikel als uitgangspunt om een goed ontworpen oplossing te ontwerpen die overeenkomt met de specifieke vereisten van uw workload.

In dit artikel wordt uitgelegd hoe u gegevens repliceert en synchroniseert naar Azure tijdens de modernisering van het mainframe. Hierin worden de technische aspecten van dit oplossingsidee beschreven, zoals gegevensarchieven, hulpprogramma's en services. Mainframe- en midrange-systemen werken on-premises toepassingsdatabases met regelmatige tussenpozen bij. Om de consistentie te behouden, synchroniseert deze oplossing de meest recente gegevens met Azure-databases.

Architectuur

Diagram van de architectuur voor het repliceren en synchroniseren van mainframegegevens naar Azure.

Een Visio-bestand van deze architectuur downloaden.

Werkproces

De volgende werkstroom komt overeen met het vorige diagram:

  1. Dynamische pijplijnen van Azure Data Factory sturen activiteiten aan, waaronder het extraheren en laden van gegevens. U kunt pijplijnactiviteiten plannen, deze handmatig starten of ze automatisch activeren.

    Pijplijnen groeperen de activiteiten waarmee taken worden uitgevoerd. Om gegevens te extraheren, maakt Azure Data Factory dynamisch één pijplijn voor elke on-premises tabel. U kunt vervolgens een massaal parallelle implementatie gebruiken wanneer u gegevens repliceert in Azure. Configureer het replicatieniveau op basis van uw vereisten.

    • Volledige replicatie. Repliceer de hele database en wijzig gegevenstypen en velden in de doeldatabase Azure database.

    • Gedeeltelijke replicatie, delta of incrementele replicatie. Gebruik watermerkkolommen in brontabellen om de bijgewerkte rijen te synchroniseren met Azure databases. Deze kolommen bevatten een continu oplopende sleutel of een tijdstempel die de laatste update van de tabel aangeeft.

    Azure Data Factory maakt ook gebruik van pijplijnen voor de volgende transformatietaken:

    • Conversie van gegevenstypen

    • Manipulatie van gegevens

    • Opmaak van gegevens

    • Afleiding van kolommen

    • Gegevens platmaken

    • Sorteren van gegevens

    • Gegevensfiltering

  2. On-premises databases, zoals Db2 zOS, Db2 for i en Db2 LUW, slaan de toepassingsgegevens op.

  3. Een zelf-hostende Integration Runtime (IR) biedt de omgeving die Azure Data Factory gebruikt om activiteiten uit te voeren en te verzenden.

  4. Azure Data Lake Storage Gen2 en Azure Blob Storage faseren de gegevens. Deze stap kan nodig zijn om gegevens uit meerdere bronnen te transformeren en samen te voegen.

  5. Voor gegevensvoorbereiding maakt Azure Data Factory gebruik van Azure Databricks, aangepaste activiteiten en pijplijngegevensstromen om gegevens snel en effectief te transformeren.

  6. Azure Data Factory laadt gegevens in de volgende relationele en niet-relationele Azure-databases:

    • Azure SQL

    • Azure-database voor PostgreSQL

    • Azure Cosmos DB

    • Azure Data Lake Storage

    • Azure-database voor MySQL

  7. SQL Server Integration Services (SSIS) extraheert, transformeert en laadt gegevens.

  8. De on-premises-gegevensgateway is een lokale Windows-clienttoepassing die fungeert als een brug tussen uw lokale gegevensbronnen in uw eigen omgeving en Azure-services.

  9. Een Microsoft Fabric gegevenspijplijn is een logische groepering van activiteiten die gegevensopname uitvoeren van Db2 naar Azure opslag en databases.

  10. Als voor de oplossing bijna realtime replicatie is vereist, kunt u niet-Microsoft hulpprogramma's gebruiken.

Als deze hulpprogramma's geen toegang hebben tot de on-premises Db2-databases, extraheert u de gegevens en bouwt u een aangepast migratieproces om de geëxtraheerde bestanden in de doeldatabases te laden.

Onderdeel

In deze sectie worden andere hulpprogramma's beschreven die u kunt gebruiken tijdens het moderniseren van gegevens, gegevenssynchronisatie en gegevensintegratie.

Gegevensintegrators

  • Azure Data Factory is een hybride gegevensintegratieservice. U kunt deze volledig beheerde, serverloze oplossing gebruiken om ETL-werkstromen (extraheren, transformeren en laden) en ELT-werkstromen (extraheren, transformeren en laden) te maken, te plannen en te orkestreren.

  • Fabric is een enterprise analytics-platform waarmee u sneller inzicht krijgt in data engineering, datawarehousing, gegevensintegratie, realtime analyses en business intelligence. Fabric is een SaaS-oplossing (Software as a Service) die gebruikmaakt van gecentraliseerde opslag in OneLake. Fabric combineert de volgende technologieën en services:

    Fabric heeft systeemeigen integraties met Power BI en met Azure services zoals Azure Cosmos DB en Azure Machine Learning.

  • SSIS is een platform voor gegevensintegratie en transformatieoplossingen op ondernemingsniveau. Gebruik SSIS om gegevens te beheren, te repliceren, op te schonen en te mijnen.

  • Azure Databricks is een platform voor gegevensanalyse op basis van het opensource-verwerkingssysteem van Spark. Azure Databricks is geoptimaliseerd voor het Azure cloudplatform. In een analysewerkstroom leest Azure Databricks gegevens uit meerdere bronnen en gebruikt Spark om inzichten te bieden.

Gegevensopslag

  • Azure SQL Database is een volledig beheerd, cloudplatform als een dienst (PaaS). SQL Database biedt geautomatiseerde ai-functies die de prestaties en duurzaamheid optimaliseren. Serverloze rekenkracht en Hyperscale-opslagopties schalen automatisch resources naar behoefte.

  • Azure SQL Managed Instance is een volledig beheerde, intelligente en schaalbare clouddatabaseservice met SQL Server-enginecompatibiliteit. Gebruik SQL Managed Instance om bestaande apps op schaal te moderniseren.

  • SQL Server op virtuele machines in Azure code-compatibele SQL Server workloads opnieuw host in de cloud. SQL Server op virtuele machines in Azure combineert de prestaties, beveiliging en analyses van SQL Server met de flexibiliteit en hybride connectiviteit van Azure. Als u bestaande apps wilt migreren of nieuwe apps wilt bouwen, gebruikt u SQL Server op virtuele machines in Azure.

  • Azure Database for PostgreSQL is een volledig beheerde relationele databaseservice op basis van de communityversie van de opensource-PostgreSQL database-engine. Azure Database for PostgreSQL biedt schaalbare functies voor toepassingsinnovatie.

  • Azure Cosmos DB is een wereldwijd gedistribueerde database met meerdere modellen . Gebruik Azure Cosmos DB om ervoor te zorgen dat uw oplossingen elastisch en onafhankelijk de doorvoer en opslag in meerdere geografische regio's kunnen schalen.

  • Data Lake Storage is een opslagopslagplaats met grote hoeveelheden systeemeigen en onbewerkte gegevens. Data Lake-opslagplaatsen zijn geoptimaliseerd voor het schalen naar terabytes en petabytes aan gegevens. De gegevens zijn doorgaans afkomstig van meerdere heterogene bronnen en kunnen gestructureerd, semigestructureerd of ongestructureerd zijn. Data Lake Storage Gen2 combineert de mogelijkheden van Data Lake Storage Gen1 met Blob Storage. Data Lake Storage Gen2 biedt semantiek van het bestandssysteem, beveiliging op bestandsniveau en schaal. Het biedt ook de gelaagde opslag, hoge beschikbaarheid en mogelijkheden voor herstel na noodgevallen van Blob Storage.

  • Azure Database for MySQL is een volledig beheerde relationele databaseservice op basis van de communityversie van de opensource MySQL-database-engine.

Andere tools

Alternatives

Deze architectuur toont opties en Azure databasedoelen voor de replicatie en synchronisatie van mainframegegevens. U kunt ook de volgende Azure SQL doelen repliceren en synchroniseren:

  • SQL Managed Instance is een volledig beheerde clouddatabaseservice. SQL Managed Instance is compatibel met de SQL Server-engine. Gebruik SQL Managed Instance om apps op schaal te moderniseren.

  • SQL Server op virtuele machines in Azure host SQL Server-workloads opnieuw in de cloud zonder codewijzigingen. SQL Server op virtuele machines in Azure combineert de prestaties, beveiliging en analyses van SQL Server met de flexibiliteit en hybride connectiviteit van Azure. Als u bestaande apps wilt migreren of nieuwe apps wilt bouwen, gebruikt u SQL Server op virtuele machines in Azure.

Scenario-details

Beschikbaarheid en integriteit van gegevens zijn essentieel voor mainframe- en midrange modernisering. Met strategieën voor gegevens eerst kunt u gegevens intact en beschikbaar houden tijdens de migratie naar Azure. Om onderbrekingen tijdens de modernisering te voorkomen, moet u mogelijk gegevens snel repliceren of on-premises gegevens synchroniseren met Azure databases.

In deze oplossing wordt het volgende behandeld:

  • Extractie. Verbinding maken met en gegevens extraheren uit een brondatabase.

  • Transformatie, waaronder:

    • Fasering: Sla gegevens tijdelijk op in de oorspronkelijke indeling en bereid deze voor op transformatie.

    • Voorbereiding. Gegevens transformeren en bewerken met behulp van toewijzingsregels die voldoen aan de vereisten van de doeldatabase.

  • Laden. Voeg gegevens in een doeldatabase in.

Mogelijke gebruiksvoorbeelden

Gebruik deze oplossing in de volgende scenario's voor gegevensreplicatie en synchronisatie:

  • Command Query Responsibility Segregation-architecturen die Azure gebruiken om alle querykanalen te bedienen

  • Omgevingen waarmee on-premises toepassingen en parallelle opnieuw gehoste of opnieuw ontworpen toepassingen worden getest

  • On-premises systemen die nauw gekoppelde toepassingen gebruiken waarvoor gefaseerd herstel of modernisering is vereist

Recommendations

U kunt de volgende aanbevelingen toepassen op de meeste scenario's. Volg deze aanbevelingen tenzij er een specifieke vereiste is die iets anders voorschrijft.

Als u Azure Data Factory gebruikt om gegevens te extraheren, kunt u de prestaties van de kopieeractiviteit afstemmen. Wanneer u Fabric Data Factory gebruikt om gegevens te extraheren, past u parallelle uitvoering, batchgrootte en connectorinstellingen aan om de pijplijnprestaties te optimaliseren. Zie Het overzicht van pijplijnen en het overzicht van de connector voor meer informatie.

Bijdragers

Microsoft onderhoudt dit artikel. De volgende inzenders hebben dit artikel geschreven.

Hoofdauteur:

Als u niet-openbare LinkedIn-profielen wilt zien, meldt u zich aan bij LinkedIn.

Volgende stappen