Replikowanie i synchronizowanie danych komputera mainframe z platformą Azure

Azure Data Factory
Azure Databricks
Microsoft Fabric

Pomysły dotyczące rozwiązań

W tym artykule opisano pomysł rozwiązania. Architekt chmury może użyć tych wskazówek, aby ułatwić wizualizację głównych składników typowej implementacji tej architektury. Skorzystaj z tego artykułu jako punktu wyjścia, aby zaprojektować dobrze zaprojektowane rozwiązanie zgodne z konkretnymi wymaganiami obciążenia.

W tym artykule wyjaśniono, jak replikować i synchronizować dane do platformy Azure podczas modernizacji systemu mainframe. Opisuje on techniczne aspekty tego rozwiązania, takie jak magazyny danych, narzędzia i usługi. Systemy mainframe i średniej klasy aktualizują lokalne bazy danych aplikacji w regularnych odstępach czasu. Aby zachować spójność, to rozwiązanie synchronizuje najnowsze dane z bazami danych platformy Azure.

Architektura

Diagram przedstawiający architekturę replikowania i synchronizowania danych mainframe z Azure.

Pobierz plik programu Visio tej architektury.

Workflow

Poniższy przepływ pracy odpowiada poprzedniemu diagramowi:

  1. Dynamiczne potoki usługi Azure Data Factory koordynują działania, w tym ekstrakcję danych i ładowanie danych. Możesz zaplanować działania procesora, uruchomić je ręcznie lub wyzwolić automatycznie.

    Potoki grupują czynności, które realizują zadania. Aby wyodrębnić dane, Azure Data Factory dynamicznie tworzy jeden przepływ danych dla każdej lokalnej tabeli. Następnie możesz użyć implementacji masowo równoległej podczas replikowania danych na platformie Azure. Skonfiguruj poziom replikacji na podstawie wymagań.

    • Pełna replikacja. Zreplikuj całą bazę danych i zmodyfikuj typy danych i pola w docelowej bazie danych Azure.

    • Replikacja częściowa, różnicowa lub przyrostowa. Użyj kolumn znaku wodnego w tabelach źródłowych, aby synchronizować zaktualizowane wiersze z bazami danych platformy Azure. Te kolumny zawierają klucz stale rosnący lub sygnaturę czasową wskazującą ostatnią aktualizację tabeli.

    Azure Data Factory używa również potoków do następujących zadań przekształcania:

    • Konwersja typu danych

    • Manipulacja danymi

    • Formatowanie danych

    • Pochodzenie kolumny

    • Spłaszczanie danych

    • Sortowanie danych

    • Filtrowanie danych

  2. Lokalne bazy danych, takie jak Db2 zOS, Db2 for i, db2 LUW, przechowują dane aplikacji.

  3. Własne środowisko Integration Runtime (IR) zapewnia środowisko używane przez Azure Data Factory do uruchamiania i wysyłania działań.

  4. Azure Data Lake Storage Gen2 i Azure Blob Storage przygotowują dane. Ten krok może być wymagany do przekształcania i scalania danych z wielu źródeł.

  5. Na potrzeby przygotowywania danych Azure Data Factory używa usługi Azure Databricks, działań niestandardowych i przepływów danych potoku w celu szybkiego i efektywnego przekształcania danych.

  6. Azure Data Factory ładuje dane do następujących relacyjnych i nierelacyjnych baz danych platformy Azure:

    • Azure SQL

    • Azure Database for PostgreSQL

    • Azure Cosmos DB

    • Azure Data Lake Storage

    • Azure Database for MySQL

  7. Usługi SQL Server Integration Services (SSIS) wyodrębniają, przekształcają i ładują dane.

  8. Lokalna brama danych to lokalna aplikacja kliencka Windows, która działa jako most między lokalnymi lokalnymi źródłami danych i usługami Azure.

  9. Potok danych Microsoft Fabric to logiczna grupa działań służących do pozyskiwania danych z systemu Db2 do magazynu Azure i baz danych.

  10. Jeśli rozwiązanie wymaga replikacji niemal w czasie rzeczywistym, możesz użyć narzędzi innych niż Microsoft.

Jeśli te narzędzia nie mogą uzyskać dostępu do lokalnych baz danych Db2, wyodrębnij dane i skompiluj niestandardowy proces migracji, aby załadować wyodrębnione pliki do docelowych baz danych.

Komponenty

W tej sekcji opisano inne narzędzia, których można używać podczas modernizacji danych, synchronizacji danych i integracji danych.

Integratorzy danych

  • Azure Data Factory to hybrydowa usługa integracji danych. Za pomocą tego w pełni zarządzanego, bezserwerowego rozwiązania można tworzyć, planować i organizować przepływy pracy wyodrębniania, przekształcania i ładowania (ETL) oraz przepływów pracy wyodrębniania, ładowania i przekształcania (ELT).

  • Fabric to platforma do analizy przedsiębiorstwa, która skraca czas na wgląd w inżynierię danych, magazynowanie danych, integrację danych, analizę w czasie rzeczywistym i analizę biznesową. Fabric to rozwiązanie oprogramowania jako usługi (SaaS), które korzysta ze scentralizowanego magazynu w usłudze OneLake. Fabric łączy następujące technologie i usługi:

    • Technologie SQL do magazynowania danych przedsiębiorstwa są dostępne przy użyciu Fabric Data Warehouse, który jest zarządzanym magazynem transakcyjnym korzystającym z otwartego formatu delty.

    • Inżynieria danych na dużą skalę i uczenie maszynowe są dostępne przy użyciu Fabric Inżynieria danych, która obejmuje wbudowane funkcje platformy Apache Spark.

    • Analityka niemal w czasie rzeczywistym jest dostępna za pomocą Fabric Real‑Time Intelligence, które obejmuje eventhouses i eventstreams.

    • Przepływy pracy ETL i ELT są dostępne w Fabric Data Factory, które obejmuje potoki danych, Dataflow Gen2 oraz szereg łączników z obsługą bram hybrydowych i bram lokalnych.

    Fabric ma natywną integrację z usługami Power BI i Azure, takimi jak Azure Cosmos DB i Azure Machine Learning.

  • SSIS to platforma do integracji i przekształcania danych na poziomie przedsiębiorstwa. Za pomocą usług SSIS można zarządzać, replikować, czyścić i wydobywać dane.

  • Azure Databricks to platforma do analizy danych oparta na systemie przetwarzania rozproszonego typu open source platformy Spark. Azure Databricks jest zoptymalizowana pod kątem platformy Azure w chmurze. W przepływie pracy analizy usługa Azure Databricks odczytuje dane z wielu źródeł i używa platformy Spark do dostarczania szczegółowych informacji.

Magazyn danych

  • Azure SQL Database to w pełni zarządzana platforma jako usługa oparta na chmurze (PaaS). Usługa SQL Database udostępnia zautomatyzowane funkcje oparte na sztucznej inteligencji, które optymalizują wydajność i trwałość. Opcje obliczeń bezserwerowych i magazynu w warstwie Hiperskala są automatycznie skalowane na żądanie.

  • Azure SQL Managed Instance to w pełni zarządzana, inteligentna i skalowalna usługa bazy danych w chmurze, która ma zgodność z aparatem SQL Server. Użyj SQL Managed Instance, aby zmodernizować istniejące aplikacje na dużą skalę.

  • SQL Server on Azure Virtual Machines ponownie hostuje obciążenia SQL Server zgodne z kodem w chmurze. SQL Server on Azure Virtual Machines łączy wydajność, zabezpieczenia i analizę SQL Server z elastycznością i łącznością hybrydową Azure. Aby przeprowadzić migrację istniejących aplikacji lub utworzyć nowe aplikacje, użyj SQL Server on Azure Virtual Machines.

  • Azure Database for PostgreSQL to w pełni zarządzana usługa relacyjnej bazy danych oparta na społecznościowej wersji open-source silnika bazy danych PostgreSQL. Azure Database for PostgreSQL oferuje skalowalne funkcje innowacji aplikacji.

  • Azure Cosmos DB to globalnie rozproszona, wielomodelowa baza danych. Użyj Azure Cosmos DB, aby upewnić się, że rozwiązania mogą elastycznie i niezależnie skalować przepływność i magazyn w wielu regionach geograficznych.

  • Data Lake Storage to repozytorium pamięci masowej przechowujące duże ilości danych w formacie natywnym i surowych danych. Zbiorniki danych typu data lake są zoptymalizowane do skalowania na terabajty i petabajty danych. Dane zazwyczaj pochodzą z wielu heterogenicznych źródeł i mogą być ustrukturyzowane, częściowo ustrukturyzowane lub nieustrukturyzowane. Data Lake Storage Gen2 łączy możliwości Data Lake Storage Gen1 z usługą Blob Storage. Data Lake Storage Gen2 zapewnia semantykę systemu plików, zabezpieczenia na poziomie plików i skalowalność. Zapewnia również magazyn warstwowy, wysoką dostępność i możliwości odzyskiwania po awarii usługi Blob Storage.

  • Azure Database for MySQL jest w pełni zarządzaną usługą relacyjnej bazy danych opartą na wersji społecznościowej silnika bazy danych MySQL typu open source.

Inne narzędzia

Alternatives

Ta architektura przedstawia opcje i docelowe bazy danych platformy Azure do replikacji i synchronizacji danych z systemu mainframe. Można również replikować i synchronizować z następującymi obiektami docelowymi Azure SQL:

  • SQL Managed Instance jest w pełni zarządzaną usługą bazy danych w chmurze. SQL Managed Instance jest zgodny z silnikiem SQL Server. Użyj SQL Managed Instance, aby zmodernizować aplikacje na dużą skalę.

  • SQL Server on Azure Virtual Machines umożliwia ponowne hostowanie obciążeń SQL Server w chmurze bez zmian w kodzie. SQL Server on Azure Virtual Machines łączy wydajność, zabezpieczenia i analizę SQL Server z elastycznością i łącznością hybrydową Azure. Aby przeprowadzić migrację istniejących aplikacji lub utworzyć nowe aplikacje, użyj SQL Server on Azure Virtual Machines.

Szczegóły scenariusza

Dostępność i integralność danych są niezbędne w modernizacji systemów mainframe i średniej klasy. Strategie oparte na danych pomagają zachować nienaruszone i dostępne dane podczas migracji do Azure. Aby zapobiec zakłóceniom podczas modernizacji, może być konieczne szybkie replikowanie danych lokalnych lub zsynchronizowanie danych lokalnych z Azure bazami danych.

To rozwiązanie obejmuje:

  • Ekstrakcja. Nawiąż połączenie i wyodrębnij dane ze źródłowej bazy danych.

  • Przekształcanie, w tym:

    • Strefa przejściowa: Tymczasowo przechowuj dane w ich oryginalnym formacie i przygotuj je do transformacji.

    • Przygotowanie. Przekształcanie danych i manipulowanie nimi przy użyciu reguł mapowania spełniających docelowe wymagania bazy danych.

  • Ładowanie. Wstaw dane do docelowej bazy danych.

Potencjalne przypadki użycia

Użyj tego rozwiązania w następujących scenariuszach replikacji danych i synchronizacji:

  • Architektury CQRS korzystające z platformy Azure do obsługi wszystkich kanałów zapytań

  • Środowiska do testowania aplikacji lokalnych oraz równolegle ponownie hostowanych lub przeprojektowanych aplikacji

  • Systemy lokalne, które używają ściśle powiązanych aplikacji wymagających etapowego korygowania lub modernizacji

Recommendations

Poniższe zalecenia można zastosować do większości scenariuszy. Należy się do nich stosować, jeśli nie ma konkretnych wymagań, które byłyby z nimi sprzeczne.

Jeśli używasz Azure Data Factory do wyodrębniania danych, dostosuj wydajność działania kopiowania. Podczas korzystania z Fabric Data Factory do wyodrębniania danych dostosuj równoległość, rozmiar partii i ustawienia łącznika, aby zoptymalizować wydajność potoku danych. Aby uzyskać więcej informacji, zobacz Omówienie potoku i Omówienie łącznika.

Contributors

Microsoft utrzymuje ten artykuł. Następujący współautorzy napisali ten artykuł.

Główny autor:

  • Rodrigo Rodríguez | Starszy architekt rozwiązań w chmurze, sztuczna inteligencja i kwant

Aby wyświetlić niepubliczne profile serwisu LinkedIn, zaloguj się do serwisu LinkedIn.

Dalsze kroki