Lakeflow Connect 提供連接器,可從本地檔案、熱門企業應用程式、資料庫、雲端儲存、訊息匯流排等中擷取資料。 此頁面概述 Lakeflow Connect 可以改善 ETL 效能的一些方式。 它也涵蓋常見的使用案例和支援的擷取工具範圍,從完全受控連接器到可完全自定義的架構。
接頭類型分類
Lakeflow Connect 依據您所接收的來源類型來組織連接器。 每種類型都有一組連接器及其運作概述:
| 連接器類型 | 說明 |
|---|---|
| 資料庫連接器 | 使用變更資料擷取(CDC),從 MySQL、PostgreSQL、Oracle 和 SQL Server 等關聯式資料庫匯入資料。 |
| SaaS 連接器 | 從 Salesforce、HubSpot、Jira 和 Workday 等企業 SaaS 應用程式匯入資料。 |
| 檔案連接器 | 從雲端物件儲存及企業檔案服務(如 Google Drive 和 SharePoint)擷取結構化與非結構化檔案。 |
| 串流連接器 | 持續從訊息匯流排及事件串流來源(如 Apache Kafka 和 RabbitMQ)擷取資料。 |
| 基於查詢的連接器 | 直接查詢來源資料,無需擷取變更資料,從資料庫中擷取資料。 |
| 直接寫入(Zerobus Ingest API) | 使用 Zerobus Ingest API 直接從應用程式寫入記錄到串流資料表。 |
彈性服務模型
Lakeflow Connect 為企業應用程式、雲端記憶體、資料庫、訊息總線等提供廣泛的連接器。 它也可讓您彈性地選擇下列各項:
| 選項 | 說明 |
|---|---|
| 完全受控的服務 | 開箱即用的連接器,讓更多人可透過使用者介面和 API 存取資料。 這讓你能建立資料擷取管線,同時降低長期維護成本。 |
| 自訂管線 | 如果你需要更多自訂,可以使用 Lakeflow pipelines 或 Structured Streaming。 最後,這種多功能性可讓 Lakeflow Connect 符合貴組織的特定需求。 |
使用核心 Databricks 工具進行統一
Lakeflow Connect 使用核心 Databricks 功能來提供完整的數據管理。 例如,它提供使用 Unity Catalog 的管理、使用 Lakeflow Jobs 的工作流程協作,以及對整個管線的全方位監控。 這有助於組織管理數據安全性、品質和成本,同時將擷取程式與其他數據工程工具統一。 Lakeflow Connect 建立在開放的資料 + AI 平台上,具備完全彈性,可整合您偏好的第三方工具。 這可確保量身打造的解決方案,符合您現有的基礎結構和未來的數據策略。
快速、可擴展的擷取
Lakeflow Connect 使用增量讀取和寫入來提高資料擷取的效率。 與 下游累加轉換結合時,這可以大幅改善 ETL 效能。
常見使用案例
客戶擷取數據以解決其組織最具挑戰性的問題。 範例使用案例包括下列專案:
| 用例 | 說明 |
|---|---|
| 客戶全景360 | 衡量活動成效及潛在客戶評分 |
| 投資組合管理 | 使用歷程記錄和預測模型將 ROI 最大化 |
| 取用者分析 | 個人化客戶的購買體驗 |
| 集中式人力資源 | 支援貴組織的員工 |
| 數位雙胞胎 | 提高製造效率 |
| RAG 聊天機器人 | 建置聊天機器人以協助使用者了解原則、產品等等 |
ETL 堆疊的圖層
某些連接器會在 ETL 堆疊的一個層級運作。 例如,Databricks 為 Salesforce 等企業應用程式提供完全受控的連接器,以及 SQL Server 等資料庫。 其他連接器則運作於 ETL 堆疊的不同層。 例如,你可以在 Lakeflow pipelines 中使用 SQL 和 Spark API,以取得更多自訂選項。 同樣地,你也可以選擇 Apache Kafka、Amazon Kinesis、Google Pub/Sub 和 Apache Pulsar 的串流資料自訂程度。
Databricks 建議從最受控層開始。 如果它不符合您的需求(例如,如果不支援您的數據源),請下拉至下一層。
下表描述了攝取產品的各層次:
| 層 | 說明 |
|---|---|
| 湖流量管線 | Lakeflow 管線提供了一個宣告式框架來建立資料管線。 定義您的轉換,Lakeflow 管線負責管理編排、監控、資料品質、錯誤等多項事務。 以結構化串流為基礎來支援串流處理,並支援大多數結構化串流功能。 對於 Lakeflow pipelines 尚未提供的任何結構化串流功能,你可以直接使用 Structured Streaming API。 |
| 完全受控連接器 | 全管理連接器建立在 Lakeflow 管線之上,為最受歡迎的資料來源提供更多自動化功能。 他們擴展 Lakeflow 管線功能,還包括來源特定認證、CDC、邊緣案例處理、長期 API 維護、自動重試、自動化結構演化等功能。 因此,它們為任何支援的數據來源提供更高程度的自動化。 |
受控連接器
您可以使用完全受控的連接器,從企業應用程式和資料庫內嵌。 完整支援連接器清單請參閱 Lakeflow Connect 連接器概念 。
支援的介面包括:
- Databricks 使用者介面
- 宣告式自動化套件組
- Databricks API 介面
- Databricks SDK
- Databricks 命令行介面
社區連接線
社區連接器將 Lakeflow Connect 擴展至沒有管理連接器支援的來源。 它們是開源的,由社群建置與維護,且不受 Databricks SLA 支持。 使用社群已註冊的連接器,從受支援的來源擷取資料。 請參閱 Lakeflow Connect 中的社區連接點。
客製化連接器
自訂連接器讓你能為沒有管理連接器的來源打造自己的連接器。 你可以在自己的 Azure Databricks 工作空間中建置、測試、部署並執行自訂連接器,且不需要向社群註冊。 請參見 「為 Lakeflow Connect 製作自訂連接器」。
SQL 與 Spark API
除了受管理連接器外,Databricks 還提供可自訂的 SQL 與 Spark API,用於從雲端物件儲存與訊息匯流排匯流排匯入。 請參閱 使用 SQL 與 Spark API 進行 Ingest。
從檔案上傳建立或修改資料表(新增資料介面)
你可以匯入位於本地網路的檔案、上傳到磁碟區的檔案,或者從網路地點下載的檔案。 請參閱 使用檔案上傳建立或修改數據表。
資料導入合作夥伴
許多第三方工具支援批次或串流的數據匯入至 Databricks。 Databricks 會驗證各種第三方整合,不過設定來源系統的存取權和內嵌數據的步驟會因工具而異。 如需已驗證的工具清單,請參閱 擷取合作夥伴。 Databricks Partner Connect 中也提供一些技術合作夥伴,其 UI 可簡化第三方工具與 Lakehouse 數據的連線。
DIY 匯入
Databricks 提供一般計算平臺。 因此,您可以使用 Databricks 所支援的任何程式設計語言,例如 Python 或 Java 來建立自己的擷取連接器。 您也可以匯入和使用熱門的開放原始碼連接器連結庫,例如數據載入工具、Airbyte 和 Debezium。
攝取替代方案
Databricks 建議針對大部分使用案例進行擷取,因為它會調整以容納高數據量、低延遲查詢和第三方 API 限制。 資料匯入會將資料從來源系統複製到 Azure Databricks,這可能會導致重複資料隨著時間變得過時。 如果您不想複製資料,您可以使用下列工具:
| 工具 | 說明 |
|---|---|
| Lakehouse 聯盟 | 可讓您在不移動資料的情況下查詢外部數據來源。 |
| 開放共享 | 可讓您安全地跨平臺、雲端和區域共享數據。 |