Databricks 參考架構提供架構指導,涵蓋資料來源、擷取、轉換、查詢與處理、服務、分析及儲存。
每個參考架構都有 11 x 17 (A3) 格式的可下載 PDF。
雖然 Databricks 是一個開放平台,能整合龐大的合作夥伴工具生態系,但參考架構僅聚焦於 Azure 服務及 Databricks 平台。 所顯示的雲端提供者服務會選取來說明概念,而且並不詳盡。
Azure 參考架構顯示下列用於引入、存儲、提供和分析的 Azure 特定服務:
- 作為 Lakehouse Federation 之來源系統的 Azure Synapse 和 SQL Server
- 用於串流資料傳入的 Azure IoT 中樞和 Azure 事件中樞
- 用於批次匯入的 Azure Data Factory
- Azure Data Lake Storage Gen 2 (ADLS) 作為數據和 AI 資產的物件記憶體
- 用作操作資料庫的 Azure SQL DB 和 Azure Cosmos DB
- Azure Purview 作為企業目錄,UC 將架構和血統資訊匯出至此處。
- 用作 BI 工具的 Power BI
- Azure OpenAI 可用於模型服務,作為外部 LLM
參考架構的組織
參考架構會沿著泳道來源、攝取、轉換、查詢/處理、提供、分析和儲存進行結構化:
Source
將外部資料整合進 Data + AI 平台有三種方式:
- ETL:平臺可讓您與提供半結構化和非結構化數據的系統整合(例如感測器、IoT 裝置、媒體、檔案和記錄),以及關係資料庫或商務應用程式的結構化數據。
- Lakehouse Federation:SQL 來源,如關聯式資料庫,可在無需 ETL 的情況下整合至 Databricks 與 Unity Catalog 。 在此情況下,來源系統數據會受到 Unity 目錄的控管,而查詢會向下推送至來源系統。
- 目錄同盟:Hive 中繼存放區目錄也可以透過 目錄同盟整合到 Unity 目錄,讓 Unity 目錄控制 Hive 中繼存放區中儲存的數據表。
Ingest
透過批次或串流方式將資料匯入 Databricks:
- Databricks Lakeflow Connect 提供內建連接器,可從企業應用程式和資料庫擷取。 產生的擷取管線受 Unity Catalog 控管,並由無伺服器計算和 管線提供支援。
- 傳遞至雲端記憶體的檔案可以直接使用 Databricks 自動載入器來載入。
- 對於將企業應用程式中的資料批次匯入Delta Lake,Databricks 平台仰賴具備這些記錄系統專用介面卡的合作夥伴匯入工具。
- 串流事件可以從事件串流系統,如 Kafka,直接引入,並使用 Databricks 結構化串流來處理。 串流來源可以是感測器、IoT 或 異動數據擷取 程式。
Storage
- 數據通常儲存在雲端儲存系統中,ETL 管線使用 medallion 架構以策劃的方式將數據儲存為 Delta 檔案/表格或 Apache Iceberg 表格。
轉換 和 查詢/ 進程
Databricks 平台使用其引擎 Apache Spark 和 Photon 進行所有轉換與查詢。
管線 是一個宣告式框架,用於簡化和優化可靠、可維護和可測試的資料處理管線。
由 Apache Spark 和 Photon 驅動的 Databricks Data + AI 平台支援兩種工作負載:透過 SQL 倉庫進行 SQL 查詢,以及透過工作空間叢集處理 SQL、Python 和 Scala 工作負載。
在資料科學(機器學習建模與人工智慧)方面,Databricks AI 與 機器學習 平台提供專門的機器學習執行時,用於自動機器學習及機器學習工作編碼。 MLflow 最能支援所有數據科學和 MLOps 工作流程。
Serving
針對資料倉儲(DWH)與商業智慧(BI)應用,Databricks 平台提供 Databricks SQL、由 SQL 倉庫驅動的資料倉儲,以及 無伺服器 SQL 倉庫。
在機器學習方面, 模型服務 是一種可擴展、即時、企業級模型服務能力,託管於 Databricks 控制平面。 Unity Gateway 是 Databricks 用於管理與監控支援的 AI 模型及其相關模型服務端點存取權的解決方案。
Collaboration:
商業夥伴透過 OpenSharing 能安全存取所需資料。
基於 OpenSharing,Databricks 市集 是一個開放式論壇,用於交換資料產品。
清理室 是安全且隱私權保護的環境,用戶可以在敏感數據上共同作業,而不需要直接存取彼此的數據。
Analysis
最終的商務應用程式位於這個泳道中。 例如包括自訂用戶端,例如連接至 Model Serving 以進行即時推論的 AI 應用程式,或存取由 Databricks 推送至營運資料庫之資料的應用程式。
針對 BI 使用案例,分析師通常會使用 BI 工具來存取數據倉儲。 SQL 開發者也可以另外使用 Databricks SQL 編輯器(未顯示在圖表中)進行查詢和儀表板操作。
Data + AI 平台也提供 儀表板 ,用以建立資料視覺化並分享洞見。
Integrate
- Databricks 平臺會與標準身分識別提供者整合,以進行使用者管理和單一登錄 (SSO)。
外部 AI 服務如 OpenAI、 LangGraph 或 HuggingFace 可直接在 Databricks 智慧平台內使用。
外部協調器可以使用完整的 REST API,或者可以使用專用連接器來連接像 Apache Airflow 這樣的外部協調工具。
Unity 目錄用於 Databricks Intelligence Platform 中的所有數據和 AI 治理,並可透過 Lakehouse 同盟將其他資料庫整合到其治理中。
此外,Unity 目錄也可以整合到其他企業目錄,例如 Purview。 如需詳細資訊,請連絡企業目錄廠商。
所有工作負載的常見功能
此外,Databricks 平台具備支援所有工作負載的管理功能:
數據和 AI 治理
Databricks Data + AI 平台的核心資料與 AI 治理系統為 Unity Catalog。 Unity 目錄提供一個統一的地方來管理適用於所有工作區的資料存取政策,並支援所有在 Databricks 中建立或使用的資產,例如資料表、磁碟區、功能(功能儲存)及模型(模型登錄)。 Unity Catalog 也可以用來捕捉在 Databricks 上執行的查詢之間的運行時資料血統。
Databricks 資料品質監視 可讓您監視帳戶中所有資料表的資料品質。 它 會偵測 所有資料表的異常情況,並為每個資料表提供 完整的資料設定檔 。
為了可觀察性,系統數據表 是由 Databricks 託管的帳戶作業數據的分析存放區。 系統資料表可用於提供帳戶的歷史觀察性。
數據智能引擎
Databricks Data + AI 平台讓您的整個組織都能使用資料與 AI,結合 AI 與 Databricks 的統一優勢,以理解您資料的獨特語意。 請參閱 Databricks AI 輔助功能。
Genie Code 可用於 Databricks 筆記本、SQL 編輯器、檔案編輯器及其他平台,作為使用者的情境感知 AI 助理。
自動化與協調流程
Lakeflow Jobs 在 Databricks Data + AI 平台上協調資料處理、機器學習與分析流程。 Lakeflow 管線 讓你能建立可靠且易於維護的宣告語法 ETL 管線。 平台也支援 CI/CD 和 MLOps
Azure 上 Data + AI 平台的高階使用案例
使用 Lakeflow Connect 從 SaaS 應用程式和資料庫進行內建資料擷取
下載:適用於 Azure Databricks 的 Lakeflow Connect 參考架構。
Databricks Lakeflow Connect 提供內建連接器,可從企業應用程式和資料庫擷取。 最終產生的擷取管線由 Unity Catalog 管理,並由無伺服器運算與 Lakeflow 管線驅動。
Lakeflow Connect 利用有效率的累加式讀取和寫入,讓數據擷取更快、可調整且更具成本效益,而您的數據仍可供下游取用。
批次擷取和 ETL
下載:適用於 Azure Databricks 的 Batch ETL 參考架構
匯入工具使用特定來源的轉接器從來源讀取資料,然後將其儲存到雲端儲存空間,讓自動載入器能讀取,或直接呼叫 Databricks(例如,合作夥伴擷取工具整合於 Databricks 平台)。 若要載入數據,Databricks ETL 和處理引擎會透過 管線執行查詢。 使用 Lakeflow 作業 協調單一或多任務作業,並使用 Unity 目錄加以控管(訪問控制、稽核、譜系等等)。 若要為低延遲的操作系統提供特定黃金表格的存取權,請將表格匯出至操作性資料庫,例如在 ETL 管線末端的 RDBMS 或索引鍵/值存放區。
串流和變動資料擷取(CDC)
下載:適用於 Azure Databricks 的 Spark 結構化串流架構
Databricks ETL 引擎會使用 Spark 結構化串流 從 Apache Kafka 或 Azure 事件中樞等事件佇列讀取。 下游步驟遵循上述批處理使用案例的方法。
即時 變更資料擷取 (CDC) 通常會將擷取的事件儲存在事件佇列中。 從那裡開始,使用案例會遵循串流使用案例。
若 CDC 以批次方式執行,先將擷取紀錄儲存在雲端儲存,Databricks 自動載入器即可讀取,使用情境遵循批次 ETL。
機器學習和 AI(傳統)
下載:適用於 Azure Databricks 的機器學習和 AI 參考架構
在機器學習方面,Databricks Data + AI 平台提供最先進的 機器與深度學習函式庫。 它提供功能庫和模型註冊表等功能(這兩者皆已整合進 Unity 目錄),具備 AutoML 的低程式代碼功能,以及將 MLflow 整合到資料科學生命週期中。
Unity 目錄會控管所有資料科學相關資產 (資料表、功能和模型),而資料科學家可以使用 Lakeflow 作業 來協調其作業。
若要以可調整且企業級的方式部署模型,請使用 MLOps 功能在模型服務中發佈模型。
代理應用
下載:Azure Databricks 的 AI 應用參考架構
若要以可調整且企業級的方式部署模型,請使用 MLOps 功能在模型服務中發佈模型。
BI 和 SQL 分析
下載:適用於 Azure Databricks 的 BI 和 SQL 分析參考架構
針對 BI 使用案例,商務分析師可以使用 儀錶板、 Databricks SQL 編輯器 或 BI 工具 ,例如 Tableau 或 Power BI。 在所有情況下,引擎都是 Databricks SQL(無伺服器或非無伺服器),而 Unity 目錄會提供數據探索、探索和存取控制。
商業應用程式
下載:適用於 Azure Databricks 的商業應用程式
Databricks Apps 可讓開發人員直接在 Databricks 平臺上建置及部署安全的數據和 AI 應用程式,而不需要個別的基礎結構。 應用程式裝載於 Databricks 無伺服器平臺,並與主要平臺服務整合。 如果應用程式需要從 Databricks 同步的 OLTP 資料,請使用 Lakebase 。
湖屋同盟
下載:適用於 Azure Databricks 的 Lakehouse 同盟參考架構
Lakehouse 同盟 可讓外部數據 SQL 資料庫(例如 MySQL、Postgres、SQL Server 或 Azure Synapse)與 Databricks 整合。
所有工作負載 (AI、DWH 和 BI) 可以從中受益,而不需要先將資料 ETL 到物件儲存體。 外部來源目錄已映射到 Unity 目錄,可以應用更細緻的訪問控制,通過 Databricks 平臺進行訪問。
目錄同盟
目錄同盟 可讓外部 Hive 中繼存放區(例如 MySQL、Postgres、SQL Server 或 Azure Synapse)與 Databricks 整合。
所有工作負載 (AI、DWH 和 BI) 可以從中受益,而不需要先將資料 ETL 到物件儲存體。 外部來源目錄會新增至 Unity 目錄,其中會透過 Databricks 平臺套用更細緻的訪問控制。
使用第三方工具共享數據
下載:使用 Azure Databricks 的第三方工具參考架構共享數據
OpenSharing 提供企業級與第三方的資料共享。 它可讓您直接存取 Unity 目錄所保護之物件存放區中的數據。 這項功能也用於 Databricks Marketplace,這是交換數據產品的開放論壇。
從 Databricks 取用共享數據
下載:從 Azure Databricks 的 Databricks 參考架構取用共享數據
OpenSharing Databricks-to-Databricks 通訊協定允許使用者安全地與任何 Databricks 使用者分享資料,無論其帳戶或雲端主機為何,只要該使用者可存取已啟用 Unity Catalog 的工作區。