總結

已完成

在本單元中,你探索了Azure Databricks中用於將資料載入 Unity Catalog的完整資料擷取技術。 從管理型連接器到自訂筆記本程式碼,從宣告式 SQL 指令到即時串流,每種方法都針對特定的資料模式與組織需求。

你瞭解 Lakeflow Connect 如何透過提供內建變更資料擷取與 SCD 支援的管理連接器,簡化從企業來源的資料匯入流程。 您已探索使用 DataFrame 與 Spark 結構化串流 API 的筆記本型擷取,以完全掌控擷取邏輯。 你發現 SQL 指令 如 COPY INTO 和 CREATE TABLE AS SELECT 提供用于檔案批次載入的宣告性選項,並具備自動檔案追蹤功能。

在增量處理方面,你是利用 AUTO CDC API 實作 CDC 流程 ,以有效地對目標資料表套用插入、更新和刪除。 您已設定 Spark 結構化串流,以在即時處理 Kafka 與 Event Hubs 的事件時提供確實一次的保證。 你可以設定 Auto Loader 自動偵測並匯入新檔案,並具備結構推論和演化功能。 最後,您使用 Lakeflow 管線來協調端對端擷取工作流程,並具備自動協調與錯誤處理功能。

在為組織建立資料管線時,請考慮哪種擷取方式最適合每個來源系統的特性。 在常見企業來源可用時,請使用受控連接器。 若需要自訂邏輯或複雜轉換,請選擇筆記本。 應用 Auto Loader 以進行基於檔案的串流,並自動處理結構定義。 利用 Lakeflow 管線協調您的攝取流程,享受內建的可靠性功能。 透過這些技術,您可以建立穩健的擷取流程,有效且可靠地將高品質資料傳送到您的湖屋。