Replikera och synkronisera stordatordata till Azure

Azure Data Factory
Azure Databricks
Microsoft Fabric

Lösningsidéer

I den här artikeln beskrivs en lösningsidé. Molnarkitekten kan använda den här vägledningen för att visualisera huvudkomponenterna för en typisk implementering av den här arkitekturen. Använd den här artikeln som utgångspunkt för att utforma en välstrukturerad lösning som överensstämmer med arbetsbelastningens specifika krav.

Den här artikeln beskriver hur du replikerar och synkroniserar data till Azure under moderniseringen av stordatorn. Den beskriver de tekniska aspekterna av den här lösningsidén, till exempel datalager, verktyg och tjänster. Stordator- och mellanregistersystem uppdaterar lokala programdatabaser med jämna mellanrum. För att upprätthålla konsekvens synkroniserar den här lösningen de senaste data med Azure-databaser.

Arkitektur

Diagram som visar arkitekturen för att replikera och synkronisera stordatordata till Azure.

Ladda ned en Visio-fil med den här arkitekturen.

Arbetsflöde

Följande arbetsflöde motsvarar föregående diagram:

  1. Azure Data Factorys dynamiska datapipelines orkestrerar aktiviteter, inklusive dataextrahering och dataladdning. Du kan schemalägga pipelineaktiviteter, starta dem manuellt eller utlösa dem automatiskt.

    Pipelines grupperar de aktiviteter som utför arbetsuppgifter. För att extrahera data skapar Azure Data Factory dynamiskt en pipeline för varje lokal tabell. Du kan sedan använda en massivt parallell implementering när du replikerar data i Azure. Konfigurera replikeringsnivån baserat på dina krav.

    • Fullständig replikation. Replikera hela databasen och ändra datatyper och fält i måldatabasen Azure.

    • Partiell, delta- eller inkrementell replikering. Använd vattenstämpelkolumner i källtabeller för att synkronisera de uppdaterade raderna med Azure databaser. Dessa kolumner innehåller antingen en kontinuerligt ökande nyckel eller en tidsstämpel som anger tabellens senaste uppdatering.

    Azure Data Factory använder också pipelines för följande transformeringsuppgifter:

    • Konvertering av datatyp

    • Manipulering av data

    • Formatering av data

    • Härledning av kolumner

    • Utplattade data

    • Sortering av data

    • Datafiltrering

  2. Lokala databaser, till exempel Db2 zOS, Db2 för i och Db2 LUW, lagrar programdata.

  3. En lokalt installerad Integration Runtime (IR) tillhandahåller den miljö som Azure Data Factory använder för att köra och skicka aktiviteter.

  4. Azure Data Lake Storage Gen2 och Azure Blob Storage mellanlagrar data. Det här steget kan krävas för att transformera och sammanfoga data från flera källor.

  5. För förberedelse av data använder Azure Data Factory Azure Databricks, anpassade aktiviteter och pipelinedataflöden för att transformera data snabbt och effektivt.

  6. Azure Data Factory läser in data i följande relationella och icke-relationella Azure-databaser:

    • Azure SQL

    • Azure-databasen för PostgreSQL

    • Azure Cosmos DB

    • Azure Data Lake Storage

    • Azure-databas för MySQL

  7. služba SSIS (SSIS) extraherar, transformerar och läser in data.

  8. Den lokala datagatewayen är en lokal Windows klientprogram som fungerar som en brygga mellan dina lokala datakällor och Azure tjänster.

  9. En Microsoft Fabric datapipeline är en logisk gruppering av aktiviteter som utför datainmatning från Db2 till Azure lagring och databaser.

  10. Om lösningen kräver replikering nästan i realtid kan du använda icke-Microsoft verktyg.

Om dessa verktyg inte kan komma åt de lokala Db2-databaserna extraherar du data och skapar en anpassad migreringsprocess för att läsa in de extraherade filerna i måldatabaserna.

Komponenter

I det här avsnittet beskrivs andra verktyg som du kan använda under datamodernisering, datasynkronisering och dataintegrering.

Dataintegrerare

  • Azure Data Factory är en hybriddataintegreringstjänst. Du kan använda den här fullständigt hanterade, serverlösa lösningen för att skapa, schemalägga och orkestrera ETL-arbetsflöden (extrahering, transformering och inläsning) samt ELT-arbetsflöden (extrahering, inläsning och transformering).

  • Fabric är en plattform för företagsanalys som påskyndar tiden till insikter inom datateknik, datalagerhantering, dataintegrering, realtidsanalys och business intelligence. Fabric är en SaaS-lösning (programvara som en tjänst) som använder centraliserad lagring i OneLake. Fabric kombinerar följande tekniker och tjänster:

    Fabric har interna integreringar med Power BI och med Azure tjänster som Azure Cosmos DB och Azure Machine Learning.

  • SSIS är en plattform för dataintegrering och transformeringslösningar på företagsnivå. Använd SSIS för att hantera, replikera, rensa och datautvinna data.

  • Azure Databricks är en dataanalysplattform baserad på Sparks distribuerade bearbetningssystem med öppen källkod. Azure Databricks är optimerat för Azure molnplattform. I ett analysarbetsflöde läser Azure Databricks data från flera källor och använder Spark för att ge insikter.

Datalagring

  • Azure SQL Database är en fullständigt hanterad, molnbaserad plattform som en tjänst (PaaS). SQL Database tillhandahåller AI-baserade automatiserade funktioner som optimerar prestanda och hållbarhet. Lagringsalternativ för serverlös beräkning och hyperskala skalar automatiskt resurser på begäran.

  • Azure SQL Managed Instance är en fullständigt hanterad, intelligent och skalbar molndatabastjänst som har SQL Server motorkompatibilitet. Använd SQL Managed Instance för att modernisera befintliga appar i stor skala.

  • SQL Server på Azure Virtual Machines omvärdar kodkompatibla SQL Server arbetsbelastningar i molnet. SQL Server på Azure Virtual Machines kombinerar prestanda, säkerhet och analys av SQL Server med flexibiliteten och hybridanslutningen för Azure. Om du vill migrera befintliga appar eller skapa nya appar använder du SQL Server på Azure Virtual Machines.

  • Azure Database for PostgreSQL är en fullständigt hanterad relationsdatabastjänst baserad på communityversionen av PostgreSQL-databasmotorn med öppen källkod. Azure Database for PostgreSQL tillhandahåller skalbara funktioner för programinnovation.

  • Azure Cosmos DB är en globalt distribuerad databas med flera modeller . Använd Azure Cosmos DB för att säkerställa att dina lösningar kan elastiskt och oberoende skala dataflöde och lagring i flera geografiska regioner.

  • Data Lake Storage är en lagringsplats som innehåller stora mängder interna data och rådata. Datasjölager är optimerade för skalning till terabyte och petabyte med data. Data kommer vanligtvis från flera heterogena källor och kan vara strukturerade, halvstrukturerade eller ostrukturerade. Data Lake Storage Gen2 kombinerar Data Lake Storage Gen1-funktioner med Blob Storage. Data Lake Storage Gen2 tillhandahåller filsystemssemantik, säkerhet på filnivå och skalning. Det ger också Blob Storage:s funktioner för nivåindelad lagring, hög tillgänglighet och katastrofåterställning.

  • Azure Database for MySQL är en fullständigt hanterad relationsdatabastjänst baserad på communityversionen av MySQL-databasmotorn med öppen källkod.

Andra verktyg

Alternatives

Den här arkitekturen visar alternativ och Azure databasmål för datareplikering och synkronisering av stordatorer. Du kan också replikera och synkronisera till följande Azure SQL mål:

  • SQL Managed Instance är en fullständigt hanterad molndatabastjänst. SQL Managed Instance är kompatibel med SQL Server motor. Använd SQL Managed Instance för att modernisera appar i stor skala.

  • SQL Server på Azure Virtual Machines gör det möjligt att flytta SQL Server-arbetslaster till molnet utan kodändringar. SQL Server på Azure Virtual Machines kombinerar prestanda, säkerhet och analys av SQL Server med flexibiliteten och hybridanslutningen för Azure. Om du vill migrera befintliga appar eller skapa nya appar använder du SQL Server på Azure Virtual Machines.

Scenarioinformation

Datatillgänglighet och integritet är viktiga för stordator- och mellanregistermodernisering. Data-first-strategier hjälper till att hålla data intakta och tillgängliga under migreringen till Azure. För att förhindra störningar under moderniseringen kan du behöva replikera data snabbt eller synkronisera lokala data med Azure databaser.

Den här lösningen omfattar:

  • Extraktion. Anslut till och extrahera data från en källdatabas.

  • Omvandling, inklusive:

    • Iscensättning: Lagra data tillfälligt i sitt ursprungliga format och förbered dem för transformering.

    • Förberedelse. Transformera och manipulera data med hjälp av mappningsregler som uppfyller måldatabaskraven.

  • Laddar. Infoga data i en måldatabas.

Potentiella användningsfall

Använd den här lösningen i följande scenarier för datareplikering och synkronisering:

  • Arkitekturer för ansvarsfördelning för kommandofrågor som använder Azure för att betjäna alla undersökningskanaler

  • Miljöer som testar lokalt installerade applikationer samt parallella omhostade eller omarbetade applikationer

  • Lokala system som använder tätt kopplade program som kräver stegvis reparation eller modernisering

Recommendations

Du kan tillämpa följande rekommendationer på de flesta scenarier. Följ dessa rekommendationer om du inte har ett visst krav som åsidosätter dem.

Om du använder Azure Data Factory för att extrahera data justerar du kopieringsaktivitetens prestanda. När du använder Fabric Data Factory för att extrahera data justerar du parallellitet, batchstorlek och anslutningsinställningar för att optimera pipelineprestanda. Mer information finns i Översikt över pipelines och Översikt över anslutningsprogram.

Bidragsgivare

Microsoft ansvarar för den här artikeln. Följande bidragsgivare skrev den här artikeln.

Huvudförfattare:

Om du vill se linkedin-profiler som inte är offentliga loggar du in på LinkedIn.

Nästa steg