本文說明如何使用精確連線,將大型主機和中層系統移轉至 Azure。 Connect 透過變更資料擷取(CDC)提供從舊有系統即時複製到 Azure 的資料。
此解決方案在本地大型主機環境與 Azure 之間提供資料一致性,同時將對來源系統效能的影響降到最低。 此架構支援多種大型主機與中型資料來源,並將資料複製至 Azure SQL 資料庫、Azure 事件中樞 及 Microsoft Fabric 等 Azure 目標。
Apache®、Spark 和火焰標誌是 Apache Software Foundation 在美國和/或其他國家/地區的註冊商標或商標。 使用這些標記不會隱含 Apache Software Foundation 的背書。
架構
下載此架構的 Visio 檔案。
Workflow
下列工作流程會對應至上圖:
- Connect 代理程式元件會使用大型主機或中層原生公用程式擷取變更記錄,並在暫存記憶體中快取記錄。
- 針對大型主機系統,大型主機上的發行者元件會管理數據遷移。
- 對於中階系統,監聽器元件負責管理資料遷移,而非發佈者。 監聽者位於 Windows 或 Linux 電腦上。
- 發佈者或監聽者會透過 Azure ExpressRoute 將資料從本地端遷移到 Azure。 發布者或接收者負責管理每個工作單元的交易提交與回滾,維持資料的完整性。
- Connect 複寫器引擎會從發行者或訂閱者擷取數據,並將其套用至目標。 它會散發數據以進行平行處理。
- Event Hubs 會即時擷取 Connect Replicator Engine 的變更資料,以實現近乎即時的處理。
- Azure Databricks 或 Fabric 會處理所接收的資料。 處理後的資料會儲存在 Azure 目標中,例如 SQL Database、適用於 PostgreSQL 的 Azure 資料庫 Flexible Server、Azure Data Lake Storage,或用於下游分析與商業智慧(BI)的 Fabric 湖屋與倉庫。
- Connect Controller 精靈會驗證要求,並在發行者或接聽程式與復寫器引擎之間建立套接字連線。
元件
此架構會使用下列元件。
網路和身分識別
Azure ExpressRoute 是一種連線服務,可透過連線提供者的私人連線,將您的內部部署網路延伸至 Azure 雲端平台。 在此架構中,ExpressRoute 提供安全的高頻寬連線,可將大型主機資料複寫至 Azure。
Azure VPN 閘道 是一項虛擬網路閘道服務,可讓您建立虛擬網路閘道,透過公用網際網路在 Azure 虛擬網路與內部部署位置之間傳送加密流量。 在這個架構中,當沒有私人連線時,你可以使用 VPN 閘道 作為 ExpressRoute 的替代方案,將大型主機系統連接到 Azure。
Microsoft Entra ID 是身分識別和存取管理服務,可與內部部署 Active Directory 同步處理。 在此架構中,Microsoft Entra ID 管理存取 Azure 資源的 Connect 元件的認證與存取控制。
儲存體
適用於 MySQL 的 Azure 資料庫 是以開放原始碼 MySQL 資料庫引擎的社群版本為基礎的受控關聯式資料庫服務。 在此架構中,適用於 MySQL 的 Azure 資料庫 提供了複製大型主機資料的目標選項。
適用於 PostgreSQL 的 Azure 資料庫 彈性伺服器是一個基於 PostgreSQL 資料庫引擎社群版的完整管理關聯式資料庫服務。 在此架構中,適用於 PostgreSQL 的 Azure 資料庫 Flexible Server 作為大型主機資料複寫的目標資料庫。
Azure SQL 資料庫是 Azure SQL 系列一部分的平台即服務 (PaaS) 資料庫引擎。 它專為雲端打造,並提供管理型且永續的 PaaS 的所有優勢。 SQL 資料庫也會提供受 AI 支援,能將效能與持久性最佳化的自動化功能。 無伺服器計算和超大規模儲存體選項會自動視需要縮放資源。 在此架構中,SQL 資料庫作為透過開放資料庫連接(ODBC)或原生資料庫連線接收複製大型主機資料的目標資料庫。
Azure SQL 受控執行個體 是一項雲端資料庫服務,提供管理型且永續 PaaS 的所有優勢。 SQL 管理實例幾乎完全相容於最新的 SQL Server Enterprise 版本資料庫引擎。 它也提供解決常見安全性考量的原生虛擬網路實作。 在此架構中,SQL 受控執行個體可以作為需要 SQL Server 相容性之大型主機資料的目標。
Azure 儲存體 是雲端記憶體解決方案,其中包含物件、檔案、磁碟、佇列和數據表記憶體。 服務包括混合式記憶體解決方案和工具,可用於傳輸、共用和備份數據。 在此架構中,儲存體為複製的大型主機數據和臨時快取提供可擴充的儲存空間。
OneLake 是 Fabric 的統一資料湖。 在此架構中,OneLake 作為儲存從 Event Hubs 擷取資料的儲存體。 使用 OneLake 捷徑,提供對 Data Lake Storage 或其他雲端儲存中資料零複製存取,且不重複資料。
Fabric 是一個整合資料流動、資料處理、資料擷取、轉換、即時事件路由與報告建立的分析平台。 在此架構中,Fabric(湖屋、倉庫或 Fabric 內的 SQL 資料庫)作為分析與 BI 層的關聯式儲存目的地。
分析和報告
- Power BI 是一組商務分析工具,可在整個組織中提供深入解析。 Power BI 能連接數百個資料來源,簡化資料準備,並推動突發分析。 在此架構中,Power BI 提供分析複製大型主機資料的 BI 功能。 Power BI 原生整合於 Fabric 以實現統一分析。
監視
- Azure 監視器 是一項監控服務,提供來自雲端及本地環境的遙測資料收集、分析及執行相關行動的解決方案。 功能包括 Application Insights、Azure 監視器記錄和 Log Analytics。 在此架構中,Azure 監視器 為用作複製大型主機資料目標的 Azure 服務及 Azure 資料庫提供監控與可觀察性。
資料整合者
Azure Databricks 是一個基於 Spark 的統一分析平台,能整合開源函式庫。 它提供協同作業工作區來執行分析工作負載。 你可以使用 Python、Scala、R 和 SQL 語言來建立擷取、轉換與載入(ETL)管線並協調工作。 在此架構中,Azure Databricks 會處理和轉換複寫的大型主機資料,以供 Azure 資料平臺服務取用。
Fabric 是一個端對端的 AI 驅動分析平台,運作於受管理的 Spark 運算平台上。 在此架構中,Fabric Spark 會匯入並轉換複製的大型主機資料,使其具備分析準備,供下游 Azure 資料平台及 Fabric 服務使用。
事件中樞 是一項即時資料擷取服務,每秒可處理數百萬個事件。 你可以從多個來源匯入資料並用於即時分析,並根據資料量擴展事件中心。 在此架構中,Connect Replicator Engine 將 Connect 的即時變更資料推送至 Event Hubs,後者將其匯入,進行近乎即時的處理與分析。
Precisely Connect 是一個資料整合平台,可以整合來自多個來源的資料,並提供即時複製到 Azure。 您可以使用它來復寫數據,而不需對應用程式進行變更。 Connect 還可以提高 ETL 任務的效能。 在此架構中,Connect 作為主要的資料複製引擎,負責即時擷取並遷移大型主機資料至 Azure。 你可以從 Azure Marketplace 設定。
案例詳細資料
您可以使用各種策略將大型主機和中層系統移轉至 Azure。 數據遷移在此過程中扮演重要角色。 組織通常會先從大型主機或中階系統的大量資料遷移到 Azure 資料平台開始。 在初期遷移後,在混合雲架構中,你必須在大型主機或中階系統與 Azure 資料平台之間建立持續的資料複製,以保持資料同步。 若要維護資料的完整性,您需要商務關鍵應用程式的即時複寫。 Connect 可支援初期批次遷移及長期複製。 使用 CDC 進行即時變更,或使用批次攝取以進行週期性傳輸。
Precisely Connect 支援下列大型主機與中階資料來源:
- 適用於 z/OS 的 Db2
- Db2 適用於 Linux、UNIX 與 Windows(LUW)
- Db2 for i(AS/400)
- IBM 資訊管理系統(IMS)
- IBM 虛擬儲存存取方法(VSAM)
- 檔案與手冊
Connect 將資料轉換為可消耗格式,並串流至 Event Hubs 以進行低延遲擷取。 Azure Databricks 或 Fabric 接著以近乎即時的方式處理所接收的資料,供 Azure 目標下游的存取與儲存。 這些目標包括 SQL Database、適用於 PostgreSQL 的 Azure 資料庫 彈性伺服器、適用於 MySQL 的 Azure 資料庫 彈性伺服器、Data Lake Storage,以及 Fabric(Fabric 湖屋、Fabric 資料倉儲或 Fabric 中的 SQL 資料庫)。 這條端對端的流程——從 CDC 擷取、事件中心擷取,再到 Databricks 或 Fabric 處理——共同實現了近乎即時的數據可用性,用於分析與營運工作負載。 精確連接也支援根據資料量與客戶需求進行擴展性。 它會復寫數據,而不會影響效能或讓網路緊張。
潛在使用案例
- 從大型主機及中階資料來源複製至 Azure 資料平台
- 在混合雲架構中,大型主機或中階系統與 Azure 資料平台之間的資料同步
- 基於大型主機或中階系統的營運資料,在 Azure 上進行近即時分析
- 將資料從大型主機或中階系統遷移到 Azure,無需修改原始應用程式
考量
這些考量能實作 Azure Well-Architected Framework 的支柱,這是一組指導原則,可以用來改善工作負載的品質。 如需詳細資訊,請參閱 Well-Architected Framework。
可靠性
可靠性有助於確保您的應用程式可以符合您對客戶的承諾。 如需詳細資訊,請參閱 可靠性的設計檢閱檢查清單。
使用 Azure 監視器 來監控 Event Hubs、Azure Databricks 及 Target Azure 資料庫的健康狀況與效能。 使用 Fabric 中的 Monitor hub 來監控 Fabric 工作。 設定警示,以在初始資料遷移及持續的近即時複製期間,實現主動管理。
成本優化
成本優化著重於減少不必要的費用,並提升營運效率的方式。 如需詳細資訊,請參閱 成本優化的設計檢閱檢查清單。
- 將資料複製到 Azure 並在 Azure 服務中處理,可能比在大型主機系統中維護資料更省錢。
- 請使用成本管理中的成本分析視圖來分析支出。 作為起點,請參閱 Azure 價格計算機中預先設定的估算。 調整它以符合你的工作量。
- 為了優化成本,你可以使用 Azure Databricks 透過自動擴展來調整叢集大小。 這種方式可能比固定配置更便宜。
- Azure Advisor 提供優化效能與成本管理的建議。
效能效率
效能效率是指工作負載能夠有效率地調整以符合使用者需求。 如需詳細資訊,請參閱 效能效率的設計檢閱檢查清單。
- Precisely Connect 可根據資料量進行擴展,並優化資料複製。
- Connect 複寫器引擎可以散發數據以進行平行處理。 您可以根據工作負載的輸入來平衡分配。
- SQL 資料庫 無伺服器可以根據工作負載量自動調整。
- 事件中樞可以根據輸送量單位和分割區數目進行調整。 根據你 CDC 工作負載預期的峰值吞吐量來決定分割區數量。
如需詳細資訊,請參閱 Azure 中的自動調整最佳做法。
參與者
本文由 Microsoft 維護。 下列參與者撰寫本文。
主要作者:
- Seetharaman Sankaran |資深工程架構師
其他投稿人:
- 吉亞尼·辛哈 |高級解決方案工程師
若要查看非公開的 LinkedIn 個人檔案,請登入 LinkedIn。