Databricks 參考架構(下載)

Databricks 參考架構提供架構指導,涵蓋資料來源、擷取、轉換、查詢與處理、服務、分析及儲存。

每個參考架構都有 11 x 17 (A3) 格式的可下載 PDF。

雖然 Databricks 是一個開放平台,能整合龐大的合作夥伴工具生態系,但參考架構僅聚焦於 Azure 服務及 Databricks 平台。 所顯示的雲端提供者服務會選取來說明概念,而且並不詳盡。

Azure Databricks platform 的參考架構.

下載:Azure Databricks 平台參考架構

Azure 參考架構顯示下列用於引入、存儲、提供和分析的 Azure 特定服務:

  • 作為 Lakehouse Federation 之來源系統的 Azure Synapse 和 SQL Server
  • 用於串流資料傳入的 Azure IoT 中樞和 Azure 事件中樞
  • 用於批次匯入的 Azure Data Factory
  • Azure Data Lake Storage Gen 2 (ADLS) 作為數據和 AI 資產的物件記憶體
  • 用作操作資料庫的 Azure SQL DB 和 Azure Cosmos DB
  • Azure Purview 作為企業目錄,UC 將架構和血統資訊匯出至此處。
  • 用作 BI 工具的 Power BI
  • Azure OpenAI 可用於模型服務,作為外部 LLM

參考架構的組織

參考架構會沿著泳道來源、攝取、轉換、查詢/處理、提供、分析和儲存進行結構化:

  • Source

    將外部資料整合進 Data + AI 平台有三種方式:

    • ETL:平臺可讓您與提供半結構化和非結構化數據的系統整合(例如感測器、IoT 裝置、媒體、檔案和記錄),以及關係資料庫或商務應用程式的結構化數據。
    • Lakehouse Federation:SQL 來源,如關聯式資料庫,可在無需 ETL 的情況下整合至 Databricks 與 Unity Catalog 。 在此情況下,來源系統數據會受到 Unity 目錄的控管,而查詢會向下推送至來源系統。
    • 目錄同盟:Hive 中繼存放區目錄也可以透過 目錄同盟整合到 Unity 目錄,讓 Unity 目錄控制 Hive 中繼存放區中儲存的數據表。
  • Ingest

    透過批次或串流方式將資料匯入 Databricks:

  • Storage

  • 轉換 和 查詢/ 進程

    • Databricks 平台使用其引擎 Apache Spark 和 Photon 進行所有轉換與查詢。

    • 管線 是一個宣告式框架,用於簡化和優化可靠、可維護和可測試的資料處理管線。

    • 由 Apache Spark 和 Photon 驅動的 Databricks Data + AI 平台支援兩種工作負載:透過 SQL 倉庫進行 SQL 查詢,以及透過工作空間叢集處理 SQL、Python 和 Scala 工作負載。

    • 在資料科學(機器學習建模與人工智慧)方面,Databricks AI 與 機器學習 平台提供專門的機器學習執行時,用於自動機器學習及機器學習工作編碼。 MLflow 最能支援所有數據科學和 MLOps 工作流程。

  • Serving

    • 針對資料倉儲(DWH)與商業智慧(BI)應用,Databricks 平台提供 Databricks SQL、由 SQL 倉庫驅動的資料倉儲,以及 無伺服器 SQL 倉庫。

    • 在機器學習方面, 模型服務 是一種可擴展、即時、企業級模型服務能力,託管於 Databricks 控制平面。 Unity Gateway 是 Databricks 用於管理與監控支援的 AI 模型及其相關模型服務端點存取權的解決方案。

    • 營運資料庫:

      • Lakebase 是一個基於 Postgres 的線上交易處理(OLTP)資料庫,並完整整合於 Databricks Data + AI 平台。 它允許你在 Databricks 上建立 OLTP 資料庫,並將 OLTP 工作負載整合到 Databricks 中。
      • 外部系統,例如作資料庫,可用來儲存和傳遞最終數據產品給使用者應用程式。
  • Collaboration:

    • 商業夥伴透過 OpenSharing 能安全存取所需資料。

    • 基於 OpenSharing,Databricks 市集 是一個開放式論壇,用於交換資料產品。

    • 清理室 是安全且隱私權保護的環境,用戶可以在敏感數據上共同作業,而不需要直接存取彼此的數據。

  • Analysis

    • 最終的商務應用程式位於這個泳道中。 例如包括自訂用戶端,例如連接至 Model Serving 以進行即時推論的 AI 應用程式,或存取由 Databricks 推送至營運資料庫之資料的應用程式。

    • 針對 BI 使用案例,分析師通常會使用 BI 工具來存取數據倉儲。 SQL 開發者也可以另外使用 Databricks SQL 編輯器(未顯示在圖表中)進行查詢和儀表板操作。

    • Data + AI 平台也提供 儀表板 ,用以建立資料視覺化並分享洞見。

  • Integrate

    • 外部 AI 服務如 OpenAI、 LangGraph 或 HuggingFace 可直接在 Databricks 智慧平台內使用。

    • 外部協調器可以使用完整的 REST API,或者可以使用專用連接器來連接像 Apache Airflow 這樣的外部協調工具。

    • Unity 目錄用於 Databricks Intelligence Platform 中的所有數據和 AI 治理,並可透過 Lakehouse 同盟將其他資料庫整合到其治理中。

      此外,Unity 目錄也可以整合到其他企業目錄,例如 Purview。 如需詳細資訊,請連絡企業目錄廠商。

所有工作負載的常見功能

此外,Databricks 平台具備支援所有工作負載的管理功能:

  • 數據和 AI 治理

    Databricks Data + AI 平台的核心資料與 AI 治理系統為 Unity Catalog。 Unity 目錄提供一個統一的地方來管理適用於所有工作區的資料存取政策,並支援所有在 Databricks 中建立或使用的資產,例如資料表、磁碟區、功能(功能儲存)及模型(模型登錄)。 Unity Catalog 也可以用來捕捉在 Databricks 上執行的查詢之間的運行時資料血統。

    Databricks 資料品質監視 可讓您監視帳戶中所有資料表的資料品質。 它 會偵測 所有資料表的異常情況,並為每個資料表提供 完整的資料設定檔 。

    為了可觀察性,系統數據表 是由 Databricks 託管的帳戶作業數據的分析存放區。 系統資料表可用於提供帳戶的歷史觀察性。

  • 數據智能引擎

    Databricks Data + AI 平台讓您的整個組織都能使用資料與 AI,結合 AI 與 Databricks 的統一優勢,以理解您資料的獨特語意。 請參閱 Databricks AI 輔助功能。

    Genie Code 可用於 Databricks 筆記本、SQL 編輯器、檔案編輯器及其他平台,作為使用者的情境感知 AI 助理。

  • 自動化與協調流程

    Lakeflow Jobs 在 Databricks Data + AI 平台上協調資料處理、機器學習與分析流程。 Lakeflow 管線 讓你能建立可靠且易於維護的宣告語法 ETL 管線。 平台也支援 CI/CD 和 MLOps

Azure 上 Data + AI 平台的高階使用案例

使用 Lakeflow Connect 從 SaaS 應用程式和資料庫進行內建資料擷取

在 Azure Databricks 上使用 LFC 進行資料載入。

下載:適用於 Azure Databricks 的 Lakeflow Connect 參考架構。

Databricks Lakeflow Connect 提供內建連接器,可從企業應用程式和資料庫擷取。 最終產生的擷取管線由 Unity Catalog 管理,並由無伺服器運算與 Lakeflow 管線驅動。

Lakeflow Connect 利用有效率的累加式讀取和寫入,讓數據擷取更快、可調整且更具成本效益,而您的數據仍可供下游取用。

批次擷取和 ETL

Azure Databricks 上的批次 ETL 參考架構。

下載:適用於 Azure Databricks 的 Batch ETL 參考架構

匯入工具使用特定來源的轉接器從來源讀取資料,然後將其儲存到雲端儲存空間,讓自動載入器能讀取,或直接呼叫 Databricks(例如,合作夥伴擷取工具整合於 Databricks 平台)。 若要載入數據,Databricks ETL 和處理引擎會透過 管線執行查詢。 使用 Lakeflow 作業 協調單一或多任務作業,並使用 Unity 目錄加以控管(訪問控制、稽核、譜系等等)。 若要為低延遲的操作系統提供特定黃金表格的存取權,請將表格匯出至操作性資料庫,例如在 ETL 管線末端的 RDBMS 或索引鍵/值存放區。

串流和變動資料擷取(CDC)

Azure Databricks 上的 Spark 結構化串流架構。

下載:適用於 Azure Databricks 的 Spark 結構化串流架構

Databricks ETL 引擎會使用 Spark 結構化串流 從 Apache Kafka 或 Azure 事件中樞等事件佇列讀取。 下游步驟遵循上述批處理使用案例的方法。

即時 變更資料擷取 (CDC) 通常會將擷取的事件儲存在事件佇列中。 從那裡開始,使用案例會遵循串流使用案例。

若 CDC 以批次方式執行,先將擷取紀錄儲存在雲端儲存,Databricks 自動載入器即可讀取,使用情境遵循批次 ETL。

機器學習和 AI(傳統)

適用於 Azure Databricks 的機器學習和 AI 參考架構。

下載:適用於 Azure Databricks 的機器學習和 AI 參考架構

在機器學習方面,Databricks Data + AI 平台提供最先進的 機器與深度學習函式庫。 它提供功能庫和模型註冊表等功能(這兩者皆已整合進 Unity 目錄),具備 AutoML 的低程式代碼功能,以及將 MLflow 整合到資料科學生命週期中。

Unity 目錄會控管所有資料科學相關資產 (資料表、功能和模型),而資料科學家可以使用 Lakeflow 作業 來協調其作業。

若要以可調整且企業級的方式部署模型,請使用 MLOps 功能在模型服務中發佈模型。

代理應用

Azure Databricks 的 AI 應用參考架構。

下載:Azure Databricks 的 AI 應用參考架構

若要以可調整且企業級的方式部署模型,請使用 MLOps 功能在模型服務中發佈模型。

BI 和 SQL 分析

適用於 Azure Databricks 的 BI 和 SQL 分析參考架構。

下載:適用於 Azure Databricks 的 BI 和 SQL 分析參考架構

針對 BI 使用案例,商務分析師可以使用 儀錶板、 Databricks SQL 編輯器 或 BI 工具 ,例如 Tableau 或 Power BI。 在所有情況下,引擎都是 Databricks SQL(無伺服器或非無伺服器),而 Unity 目錄會提供數據探索、探索和存取控制。

商業應用程式

適用於 Azure Databricks 的商務應用程式。

下載:適用於 Azure Databricks 的商業應用程式

Databricks Apps 可讓開發人員直接在 Databricks 平臺上建置及部署安全的數據和 AI 應用程式,而不需要個別的基礎結構。 應用程式裝載於 Databricks 無伺服器平臺,並與主要平臺服務整合。 如果應用程式需要從 Databricks 同步的 OLTP 資料,請使用 Lakebase 。

湖屋同盟

Azure Databricks 的 Lakehouse 同盟參考架構。

下載:適用於 Azure Databricks 的 Lakehouse 同盟參考架構

Lakehouse 同盟 可讓外部數據 SQL 資料庫(例如 MySQL、Postgres、SQL Server 或 Azure Synapse)與 Databricks 整合。

所有工作負載 (AI、DWH 和 BI) 可以從中受益,而不需要先將資料 ETL 到物件儲存體。 外部來源目錄已映射到 Unity 目錄,可以應用更細緻的訪問控制,通過 Databricks 平臺進行訪問。

目錄同盟

Azure Databricks 的目錄同盟參考架構。

下載:Azure Databricks 的目錄同盟參考架構

目錄同盟 可讓外部 Hive 中繼存放區(例如 MySQL、Postgres、SQL Server 或 Azure Synapse)與 Databricks 整合。

所有工作負載 (AI、DWH 和 BI) 可以從中受益,而不需要先將資料 ETL 到物件儲存體。 外部來源目錄會新增至 Unity 目錄,其中會透過 Databricks 平臺套用更細緻的訪問控制。

使用第三方工具共享數據

Azure Databricks 的企業數據共享參考架構。

下載:使用 Azure Databricks 的第三方工具參考架構共享數據

OpenSharing 提供企業級與第三方的資料共享。 它可讓您直接存取 Unity 目錄所保護之物件存放區中的數據。 這項功能也用於 Databricks Marketplace,這是交換數據產品的開放論壇。

從 Databricks 取用共享數據

在 Azure Databricks 上取用 Databricks 的共享數據。

下載:從 Azure Databricks 的 Databricks 參考架構取用共享數據

OpenSharing Databricks-to-Databricks 通訊協定允許使用者安全地與任何 Databricks 使用者分享資料,無論其帳戶或雲端主機為何,只要該使用者可存取已啟用 Unity Catalog 的工作區。