Azure Databricks 的術語涵蓋資料工程、分析、機器學習、治理及湖屋架構。 本詞彙表依字母順序定義關鍵術語。
A
存取控制清單 (ACL)
附加至工作區、叢集、作業、數據表或實驗的權限清單。 ACL 會指定哪些使用者或系統進程被授與物件存取權,以及資產上允許哪些作業。 一般 ACL 中的每個項目都會指定主體和作業。 請參閱 訪問控制清單。
存取模式
安全性功能,決定誰可以使用計算資源,以及他們在使用計算資源時可以存取的數據。 Azure Databricks 中的每個運算資源都有存取模式。 請參閱 存取模式。
ACID 交易
可靠地處理的資料庫交易。 ACID 代表原子性、一致性、隔離、持久性。 請參閱 可靠性的最佳做法。
探員布里克斯
Azure Databricks 具備讓您打造高品質 AI 解決方案的功能。
人工智慧 (AI)
計算機模仿智慧人類行為的能力。 請參考機器學習,Azure Databricks。
AI 代理
具有複雜推理功能的應用程式,可讓它建立自己的計劃,並根據其處置的工具執行工作。 請參閱 代理系統設計模式。
AI功能
內建的 SQL 函式,讓你能直接從 Azure Databricks 的 SQL 應用 AI 來處理你的資料。 請參見 「利用 AI 函式轉換非結構化資料」。
人工智慧網關
Azure Databricks 解決方案用於管理與監控 LLM 端點、編碼代理及模型服務端點。 使用 AI 閘道來分析使用情況、設定權限,並管理跨供應商的容量。 請參考 Unity Gateway 的 AI 治理。
AI遊樂場
Azure Databricks 功能讓使用者能與您 Azure Databricks 工作空間中提供的 AI 模型互動、測試及比較。 請參閱 與 LLM 對話並使用 AI Playground 製作 AI 應用程式原型。
異常偵測
用來識別不符合數據集預期行為的異常模式的技術與工具。 Azure Databricks 透過其機器學習與資料處理能力促進異常偵測。
阿帕奇冰山
一種開源的分析工作負載表格格式,支援結構演化、時間旅行及隱藏分割。 Azure Databricks 支援由 Unity 目錄及外國目錄管理的 Iceberg 資料表。 參見 什麼是 Azure Databricks 中的 Apache Iceberg?
阿帕契火花
用於巨量數據工作負載的開放原始碼分散式計算系統。 請參閱 Apache Spark 概觀。
人工神經網路 (ANN)
類似於人類大腦神經元運作的計算系統。
asset
Azure Databricks 工作空間中的一個實體(例如物件或檔案)。
稽核記錄
記錄 Azure Databricks 環境中的使用者活動與行為,對安全性、合規性及營運監控至關重要。 請參閱 診斷記錄參考。
自動裝載機
數據擷取功能,可累加且有效率地在抵達雲端記憶體時處理新的數據檔,而不需要進行任何額外的設定。 請參閱 什麼是自動載入器?。
AutoML
這是 Azure Databricks 的一項功能,能簡化將機器學習應用於資料集的過程,自動幫你找到最適合的演算法和超參數配置。 請參閱 什麼是 AutoML?。
自動化數據譜系
自動追蹤並可視化數據從來源經過各種轉換至最終形式的流程,對於偵錯、合規性以及了解數據依賴性至關重要。 Azure Databricks 透過與資料血統工具的整合來促進此過程。
自動縮放, 水平
根據等候排程的工作數目新增或移除執行程式。 這會在單一更新期間動態發生。
自動縮放, 垂直
根據記憶體壓力(或缺乏記憶體壓力),增加或減少機器(驅動器或執行器)的大小。 只有在新的更新開始時才會發生這件事。
Azure Databricks
Databricks 的一個版本,專為 Microsoft Azure 雲端平台優化。
B
批次處理
數據處理方法,可讓您定義明確的指示,以將固定數量的靜態、非變更的數據當作單一作業來處理。 Azure Databricks 使用 Spark SQL 或 DataFrames。 請參見 選擇標準連接器。
偏差偵測和風險降低
為了確保公平性和正確性,識別和解決數據與機器學習模型中的偏差的過程。 Databricks 提供工具和整合,以協助偵測和減輕偏差。 請參閱 監視分類模型的公平性和偏差。
商業智慧 (BI)
企業用於商務信息數據分析和管理的策略和技術。
C
Catalog (Unity Catalog)
Unity 目錄三層命名空間(catalog.schema.table-etc)的第一層。 目錄是一種容器,儲存結構,而結構中又包含表格、檢視、卷、模型和函式。 參見什麼是 Azure Databricks 目錄?。
目錄瀏覽器
Azure Databricks 的一個功能,提供一個使用者介面來探索和管理資料、架構(資料庫)、資料表、模型、函式及其他 AI 資產。 您可以使用它來尋找數據對象和擁有者、了解數據表之間的數據關聯性,以及管理許可權和共用。 請參閱 什麼是目錄總管?。
子執行個體
子實例是原始 資料庫實例的寫入複製。 它可以從目前的時間點或保留時間範圍內的歷史時間點建立。 請參閱時間點還原。
CICD 或 CI/CD
持續整合(CI)和持續交付(CD)的結合做法。 請參見Azure Databricks上的CI/CD。
清理資料
經過數據清理程序的數據,這是從記錄集、數據表或資料庫中偵測和更正(或移除)損壞或不正確的記錄的過程,指的是識別數據中不完整、錯誤、不準確或不相關的部分,然後取代、修改或刪除有瑕疵或粗糙的數據。
無塵室
這是 Azure Databricks 的一項功能,利用 OpenSharing 與無伺服器運算,提供一個安全且保護隱私的環境,讓多方能共享敏感企業資料並協作,而不必直接存取彼此的資料。 使用 Clean Rooms 時,來自其他 Databricks 帳戶的使用者可以共同作業以產生共用專案的見解,例如廣告活動、投資決策或研發,而不需共享機密基礎數據的存取權。 參見 什麼是Azure Databricks潔淨室?。
雲端平臺提供者
提供雲端運算平臺的公司。 例如,Microsoft Azure、Amazon Web Services(AWS)和 Google Cloud Platform(GCP)。
cluster
用於筆記本、作業和 Lakeflow 管線的非無伺服器運算資源。 compute 一詞已取代 Azure Databricks 介面中cluster,但仍用於 Clusters API 及元資料中。
compute
是指計算資源,無論是硬體還是軟體,都是基礎結構元素,可透過接收、分析及儲存數據來啟用解決問題和解決方案的建立。 Compute.
連續管線
一個資料管線,會隨著新數據抵達輸入時,持續不斷地更新所有數據表。 請參閱 觸發式與連續管線模式。
D
導向無循環圖 (DAG)
方法,表示工作流程或管線中工作之間的相依性。 在 DAG 處理模型中,工作會表示為有向無循環圖形中的節點,其中邊緣代表工作之間的相依性。
Data + AI 平台
統一的 Azure Databricks 平台,專注於資料工程、分析、機器學習與生成式 AI,建基於湖屋架構,並由 Unity Catalog 管理。 前稱 Databricks Lakehouse 平台及資料智慧平台。 參見 什麼是Azure Databricks?。
資料目錄
用來管理數據源的元數據管理工具,提供數據結構、位置和使用方式的相關信息。 Azure Databricks 可整合外部資料目錄以強化元資料管理。
資料治理
管理數據的可用性、完整性、安全性和可用性的做法,涉及原則、程序和技術,以確保數據品質和合規性。
資料擷取
將資料從各種來源匯入、傳輸、載入及處理到 Azure Databricks 進行儲存、分析與處理的過程。
資料湖
大型記憶體存放庫,其原生格式會保存大量的原始數據,直到需要為止。
數據湖倉
結合數據湖和數據倉儲優點的數據管理系統。 Data Lakehouse 為新式組織提供可調整的記憶體和處理功能,這些組織想要避免隔離系統來處理不同的工作負載,例如機器學習 (ML) 和商業智慧 (BI)。 Data Lakehouse 可協助建立單一事實來源、消除備援成本,並確保數據新鮮度。 請參閱 什麼是 Data Lakehouse?。
資料分析
監視您帳戶中所有數據表中數據的統計屬性和品質。 您也可以透過監視包含模型輸入和預測的推斷數據表,來追蹤機器學習模型和模型服務端點的效能。 請參閱 資料分析。
資料管線
產生、收集、處理及移至目的地數據的一系列階段。 Databricks 有助於建立和管理複雜的數據管線,以進行批次和實時數據處理。
資料隱私
保護個人資料免於未經授權的存取、使用、洩漏或竊取的做法。 Azure Databricks 強調強大的資料隱私與安全功能,包括端對端加密、基於角色的存取控制,以及遵守主要資料保護法規,以保護敏感資訊並確保資料治理。
資料虛擬化
數據管理方法,可讓應用程式擷取和操作數據,而不需要數據的技術詳細數據,例如其格式化方式或實際位置。 Azure Databricks 可作為資料虛擬化層的一部分,提供跨不同來源的無縫存取與分析。
資料倉儲
是指從多個來源收集和儲存數據,以便快速存取商務見解和報告。 Lakehouse 架構和 Databricks SQL 會將雲端數據倉儲功能帶入您的數據湖。 請參閱 數據倉儲架構。
資料庫目錄
Unity Catalog 目錄實體,代表一個實例中的 Postgres 資料庫。 這在概念上類似於 Unity 目錄中的 外國目錄 。 請參閱在 Unity Catalog 中註冊 Lakebase 資料庫。
資料庫實例
資料庫實例會管理記憶體和計算資源,並提供用戶連線的端點。 請參見Lakebase Provisioned。
Databricks
統一、開放式分析平臺,可大規模建置、部署、共用和維護企業級數據、分析和 AI 解決方案。 Databricks Data + AI 平台能整合您的雲端儲存與雲端安全,並代表您管理與部署雲端基礎設施。 參見 什麼是Azure Databricks?。
Databricks AI/BI
商業智慧產品,可讓您了解數據的語意,並啟用自助式數據分析。 AI/BI 是以複合 AI 系統為基礎,從 Databricks 平台數據的完整生命週期中取得見解,包括 ETL 管線、譜系和其他查詢。 請參閱 Databricks AI/BI。
支援 Databricks 平台的數據智能引擎。 它是複合 AI 系統,結合 AI 模型、擷取、排名和個人化系統的用法,以瞭解組織數據和使用模式的語意。 請參閱 Databricks AI 輔助功能。
Databricks AI 搜尋
一個整合於 Databricks Data + AI 平台,並與其治理與生產力工具整合的向量搜尋索引。 請參閱 Databricks AI 搜尋。
Databricks AI 搜尋前身為 Databricks 向量搜尋。
Databricks 應用程式
一項Azure Databricks功能,讓開發者能直接在Azure Databricks平台上使用Python或 Node.js 框架,建立並部署安全的資料與人工智慧應用程式。 應用程式運行於無伺服器運算,並整合 Unity Catalog、Databricks SQL 及 OAuth。 請參閱 Databricks Apps。
宣告式自動化套件
協助您採用軟體工程最佳做法的工具,包括原始檔控制、程式代碼檢閱、測試和持續整合和傳遞(CI/CD),用於您的數據和 AI 專案。 Bundles 使 Azure Databricks 資源,如工作、管線和筆記本,可以描述為來源檔案。 請參閱「什麼是宣告式自動化套件?」。
Databricks CLI
Azure Databricks 的命令列介面,讓使用者能管理與自動化 Databricks 工作區,並部署工作、筆記本及函式庫。 請參見 Databricks CLI。
Databricks Connect
一個客戶端函式庫,讓開發者能將喜愛的 IDE、筆記本及其他工具與 Azure Databricks 連接,遠端計算並執行 Spark 程式碼。 請參閱 Databricks Connect。
Databricks 容器服務
Azure Databricks 的功能允許你在建立運算時指定 Docker 映像。 關於專用運算,請參見 Databricks 容器服務。
Databricks 市場
交換數據產品的開放論壇。 提供者必須擁有 Azure Databricks 帳號,但收件人可以是任何人。 市場資產包括資料集、Azure Databricks筆記本、Azure Databricks解決方案加速器,以及機器學習(AI)模型。 資料集通常以表格式資料目錄形式提供,但也支援非表格式資料,以 Azure Databricks 卷的形式呈現。 請參閱 什麼是 Databricks Marketplace?。
Databricks 執行環境
針對巨量數據分析優化的運行時間。 Databricks 也提供針對 Machine learning 工作負載優化的 Databricks Runtime for 機器學習。 請參閱 Databricks Runtime 版本資訊與相容性。
Databricks SQL (DBSQL)
將數據倉儲功能和效能帶入您現有資料湖的服務集。 Databricks SQL 支援開放格式和標準 ANSI SQL。 平台內建的 SQL 編輯器與儀表板工具,讓團隊成員能直接在工作空間中與其他 Azure Databricks 使用者協作。 請參見Azure Databricks 上的資料倉儲。
DBUs
Databricks 單位(DBU)是 Databricks Data + AI 平台上用於測量與定價的標準化處理能力單位。 工作負載取用的 DBU 數目是由處理計量所驅動,這可能包括所使用的計算資源和已處理的數據量。 參見 Azure Databricks components。
Databricks 檔案系統(DBFS)
一個分散式檔案系統掛載於 Azure Databricks 工作空間,並可於 Azure Databricks 運算中使用。 Azure Databricks 建議使用 Unity 目錄卷來管理非表格資料的存取,而非 DBFS。 請參閱 什麼是 DBFS?。
DataFrame
將數據組織成行和列的二維表格的數據結構,很像試算表。 DataFrame 是新式數據分析中使用的最常見數據結構之一,因為它們是儲存和使用數據的靈活直覺方式。 請參閱 教學課程:使用 Apache Spark DataFrame 載入和轉換數據。
dataset
組織並儲存在一起進行分析或處理之數據的結構化集合。 數據集中的數據通常會以某種方式相關,並取自單一來源或用於單一專案。
三角洲湖
開放原始碼儲存層,為 Data Lake 帶來可靠性。 Delta Lake 提供 ACID 交易、可調整的元數據處理,以及統一串流和批次數據處理。 參見Azure Databricks 中的 Delta Lake 是什麼?。
Pipelines
以 Apache Spark™ 宣告式管線(SDP)建構的資料處理管線。 你可以定義要對資料執行的轉換,而 Lakeflow 管線則負責管理任務協調、叢集管理、監控、資料品質及錯誤處理。 參見 Spark 宣告式管線。
管線資料集
串流資料表、具體化視圖和視圖是作為宣告式查詢結果進行維護的。
開放共享
讓您能與組織外的使用者分享 Azure Databricks 中的資料與 AI 資產,無論這些使用者是否使用 Azure Databricks。 該專案也作為開放原始碼專案用於分享表格資料,在 Azure Databricks 中使用後,能提供非表格、非結構化資料(卷)、AI 模型、檢視、篩選資料及筆記本。 請參閱什麼是開放共享(OpenSharing?)。
Delta 資料表
Azure Databricks 中的預設資料表格式,是 Delta Lake 開放原始碼 data framework 的一項功能。 Delta 表通常用於資料湖泊,資料會透過串流或大量批次進行導入。 請參見Azure Databricks表格。
DLT
Lakeflow 管線的已棄用名稱。 原本稱為 Delta Live Tables(DLT)的產品已更名;現有程式碼不要求遷移。 請參閱 Delta Live Tables(DLT)發生了什麼事?。
E
嵌入 (名詞)
一種將資料的語意內容(例如文字或圖片)以數字向量形式表達的數學表示。 嵌入被用於 Azure Databricks 的向量搜尋、檢索增強生成及其他 AI 應用。 這和「嵌入」這個詞不同,也就是在介面中嵌入儀表板。 請參閱 Databricks AI 搜尋。
ETL (擷取、轉換、載入)
從來源擷取數據、將數據載入目標系統,然後在目標系統中轉換數據的新式方法。 請參考 教學:用 Lakeflow 管線建置 ETL 管線。
外部表格
一個在 Unity 目錄中註冊的資料表,資料存放在外部雲端儲存位置。 Unity Catalog 管理元資料和存取控制,但資料生命週期則是在 Azure Databricks 外部管理。 請參閱 使用外部數據表。
F
功能商店
用於儲存、管理及服務機器學習模型的中央存放庫。 請參閱 Databricks 功能存放區。
微調
將預先訓練好的機器學習模型,並進一步訓練於較小且領域特定的資料集上,以優化其特定應用的效能。 請參閱 訓練 AI 和 ML 模型。
flow
流程是 Lakeflow 管線中的一個流程,負責讀取資料、轉換資料並將其寫入目的地。
外部資料表
Unity 目錄中的唯讀資料表,其資料由 Unity 目錄外的目錄管理,例如 AWS Glue 或 Snowflake。 Azure Databricks 使用 Lakehouse Federation 來擷取元資料並從物件儲存讀取資料表。 參見 操作外國表格。
基礎模型
大型 ML 模型預先定型,目的是要針對更具體的語言理解和產生工作進行微調。 請參閱 Databricks Foundation 模型 API。
G
精靈代碼
一個專為 Azure Databricks 資料工作設計的自主 AI 合作夥伴。 Genie Code 深度整合於 Unity Catalog,提供對資料表、欄位與血緣的情境感知,加速複雜且多步驟的資料任務。 請參考 精靈密碼。
精靈特工
Azure Databricks 的 AI/BI 功能,讓業務團隊能以自然語言互動他們的資料。 領域專家會用資料集、範例查詢和指引配置 Genie 代理,讓 Genie 能將商業問題轉換成 SQL 查詢。 請參考 《精靈特工》。
精靈一號
一個簡化的 Azure Databricks 介面,專為商業用戶設計,提供單一入口點,讓你能與 AI/BI 儀表板、Genie 代理及 Databricks 應用程式互動,無需操作技術性工作空間概念。 請參考 使用精靈一號。
生成式 AI
一種人工智慧,著重於計算機使用模型來建立影像、文字、程式代碼和綜合數據等內容的能力。 生成式 AI 應用程式是以生成式 AI 模型:大型語言模型 (LLM) 和基礎模型為基礎建置的。 請參考機器學習,Azure Databricks。
Git 資料夾
一個整合於 Azure Databricks 工作空間中的視覺化 Git 用戶端,提供筆記本與檔案的版本控制、協作及 CI/CD 功能。 前稱 Repos。 請參見 Azure Databricks Git 資料夾。
I
推論
利用訓練好的機器學習模型,從新的輸入資料中產生預測或輸出的過程。 Azure Databricks 支援透過 Model Serving 進行即時及批次推論。 請參見 使用模型服務部署模型。
初始化腳本
一個在啟動 Azure Databricks 運算資源時執行的 shell 腳本。 Init 腳本可以安裝套件、修改設定或設定環境變數。 請參閱什麼是 init 指令碼?。
J
job
這是 Azure Databricks 上排程與協調生產工作負載的主要單位。 任務由一個或多個工作組成。 請參閱 Lakeflow 職位。
L
湖流連接
提供內建連接器,可從企業應用程式和資料庫匯入。 所產生的資料擷取管線受 Unity Catalog 管理,並由無伺服器運算和 Lakeflow 管線提供支援。 詳見 Lakeflow Connect 連接器概念。
湖庫聯盟
Azure Databricks 嘅查詢聯盟平台。 查詢同盟一詞描述一組功能,可讓用戶和系統對多個數據源執行查詢,而不需要將所有數據遷移至統一系統。 Azure Databricks 使用 Unity Catalog 來管理查詢聯盟。 請參閱 「連接外部資料庫與目錄」。
Lakebase
Azure Databricks Lakebase 是一個與 Lakehouse 整合的 OLTP 資料庫。 在線事務處理 (OLTP) 資料庫是一種特殊類型的資料庫系統,其設計目的是要有效率地處理大量的即時事務數據。 Lakebase 允許你在 Azure Databricks 上建立 OLTP 資料庫,並將 OLTP 工作負載帶入你的 Lakehouse。
湖底端點
Lakebase 端點是您 Lakebase Postgres 資料庫的主要存取點。 每個端點都有獨特的端點 ID 來識別,並在單一雲端區域內運作。 端點可以配置為單一運算或高可用性,後者會將一個主要運算實例與一個或多個次要運算實例配對以實現自動故障轉移。 你透過端點連接字串來連接你的資料庫。
詳見 高可用性。
大型語言模型 (LLM)
自然語言處理 (NLP) 模型專為回答開放式問題、聊天、內容摘要、執行近乎任意指令、翻譯和內容和程式碼產生等工作所設計。 LLM 透過進階機器學習演算法從龐大數據集訓練,以學習人類語言的模式和結構。 請參閱Azure Databricks 上的建置代理程式。
library
在叢集上執行的筆記本或作業中可使用的程式碼套件。 Databricks Runtime 包含許多程式庫,您也可以上傳自己的程式庫。 請參閱 安裝連結庫。
液體聚集
Azure Databricks 針對 Delta 和 Iceberg 資料表的資料版面優化功能,根據指定欄位逐步聚類資料,以提升查詢效能。 與傳統分割不同,液態分群會隨著資料模式的變化而調整。 請參閱 針對數據表使用液體叢集。
M
管理表
一個資料檔案與元資料皆由 Unity Catalog 完全管理的資料表。 受管理的資料表總是以 Delta 或 Iceberg 格式儲存,並透過預測優化過程中的自動維護功能而受益。 請參閱 Unity Catalog 管理的 Delta Lake 與 Apache Iceberg 表格。
具體化視圖
已預先計算並儲存的檢視,以便可在減少延遲的情況下進行查詢,並避免重複計算。 請參閱 具體化檢視。
獎章架構
數據設計模式,用於在 Lakehouse 中以邏輯方式組織數據,目標是隨著數據流經架構的每一層(從銅⇒銀⇒金層級數據表)逐步改進其結構和品質。 什麼是獎章湖式建築?
metastore
元件,儲存數據倉儲中各種數據表和數據分割的所有結構資訊,包括數據行和數據行類型資訊、讀取和寫入數據所需的串行化程式和還原串行化程式,以及儲存數據的對應檔案。 請參閱 Metastore。
公制視角
Unity Catalog 物件提供集中式方式來定義和管理可重複使用的商業指標。 度量檢視將度量定義與維度分組分開,讓你只需定義一次度量,並能靈活地跨任何維度查詢。 請參閱 Unity 目錄計量檢視。
MLflow
最大的開放原始碼 AI 工程平台,涵蓋代理、大型語言模型(LLM)及機器學習模型。 MLflow 讓各種規模的團隊能夠除錯、評估、監控及優化 AI 應用,同時控制成本並管理模型與資料的存取。 Azure Databricks 上的 MLflow 是一項全託管服務,為企業客戶提供額外功能,提供可擴展且安全的管理式 MLflow 部署。 請參考 Databricks 上的 MLflow。
MLflow 追蹤
MLflow for GenAI 的一項功能,透過記錄代理或應用程式的每一步,提供端到端的可觀察性。 使用 MLflow 追蹤來除錯、監控及稽核開發與生產環境中代理的行為。 請參閱 追蹤概述。
模型內容通訊協定 (MCP)
一個開源標準,透過標準化介面將代理人員與工具、資源、提示符及其他情境資訊連結起來。 Azure Databricks 提供管理型、外部型及自訂 MCP 伺服器。 請參閱 MCP 與代理工具。
模型訓練
利用許多熱門開源函式庫在 Azure Databricks 上訓練機器學習與深度學習模型的過程。 請參閱 訓練 AI 和 ML 模型。
模特兒服務
用來部署、控管和查詢 AI 模型的統一介面,以進行即時和批次推斷。 請參見 使用模型服務部署模型。
Databricks 模型訓練
此功能可讓您使用您的資料來自定義基礎模型,以優化特定應用程式的效能。 對基礎模型進行完整的參數微調或持續訓練後,相較於從頭訓練模型,自行訓練模型耗用的資料、時間和運算資源可大幅減少。 請參見基礎模型微調 (EoL)。
N
notebook
一個互動式網頁介面,供資料科學家和工程師使用,在同一文件中撰寫並執行多種語言(例如 Python、Scala、SQL)程式碼。 請參閱 Databricks 筆記本。
O
OAuth
OAuth 是存取委派的開放標準,通常用來讓因特網使用者授與其他網站上的網站或應用程式存取其資訊,但未提供密碼。 請參見授權存取Azure Databricks資源。
P
合作夥伴連接
Databricks 計劃,提供由獨立軟體廠商維護的整合,以連線到大部分的企業數據系統。 請參閱 什麼是 Databricks Partner Connect?。
個人存取權杖 (PAT)
存取電腦系統而非密碼時,用來驗證使用者的字元字串。 請參見授權存取Azure Databricks資源。
Photon
高效能 Databricks 原生向量化查詢引擎,可更快速地執行 SQL 工作負載和 DataFrame API 呼叫,以降低每個工作負載的總成本。 Photon 與 Apache Spark API 相容,因此可與現有程式碼搭配使用。 請參閱 什麼是 Photon?。
預測優化
Azure Databricks 的一項功能,能自動識別並執行維護作業,針對 Unity 目錄管理的資料表進行維護,以提升查詢效能並降低儲存成本。 請參閱 Unity Catalog 管理資料表的預測性優化。
pipeline
一張由表格、視圖、具體化視圖、流程和匯組成的圖,這些資料會依系統決定的相依順序懶散更新。
R
檢索增強生成(RAG)
一種技術,可讓大型語言模型 (LLM) 藉由增強使用者的提示,並支援從外部資訊來源擷取的數據,以產生豐富的回應。 藉由納入此擷取的資訊,RAG 可讓 LLM 生成比未增強提示內容時更精確、更高品質的回應。 請參見Azure Databricks 上的 RAG(檢索增強生成)。
S
架構 (Unity 目錄)
Unity Catalog 中目錄的子項,可包含資料表、檢視表、磁碟區、模型和函數。 架構是 Unity 目錄三層命名空間的第二層(catalog.schema.table-etc)。 請參閱 什麼是 Unity 目錄?。
無伺服器運算
計算由 Azure Databricks 管理,降低管理負擔並提供即時運算,提升使用者生產力。 請參閱 連線到無伺服器計算。
服務主體
建立用於自動化工具、執行作業和應用程式的身分識別。 你可以用權限限制服務主體對資源的存取,就像 Azure Databricks 使用者一樣。 與 Azure Databricks 使用者不同,服務主體是僅 API 的身份;它無法直接存取 Azure Databricks 的 UI 或 Databricks CLI。 請參閱 服務主體。
匯點(管線)
資料接收端是資料流寫入外部系統的目的地(例如 Kafka、Kinesis、Delta)。
SQL 倉儲
一個運算資源,讓你可以查詢並探索 Azure Databricks 上的資料。 請參閱 連線到 SQL 倉儲。
串流處理
數據處理方法,可讓您針對未系結且持續成長的數據集定義查詢,然後以小型累加批次處理數據。 Azure Databricks 串流處理使用 Structured Streaming。 請參閱 結構化串流概念。
streaming
串流是指透過因特網傳遞至計算機和行動裝置並即時播放的任何媒體內容,也就是即時或錄製的數據流。 請參閱 結構化串流概念。
串流分析
分析由不同來源持續產生之數據的程式。 Azure Databricks 支援透過結構化串流進行串流分析,允許即時處理與分析即時數據以獲取洞察。
結構化串流
基於 Spark SQL 引擎的可擴展且容錯的串流處理引擎,支持將複雜計算轉化為串流查詢。 請參閱 結構化串流概念。
串流表
具有資料流寫入的管理資料表。 請參閱 串流數據表。
系統表
Azure Databricks 託管的分析資料儲存,涵蓋您帳號的營運資料,如稽核日誌、可計費使用量及血統。 系統資料表可在 Unity Catalog 中的 system 目錄中找到。 請參閱 系統表格參考資料。
同步資料表
同步數據表是 Unity Catalog 的唯讀 Postgres 數據表,會自動將資料從 Unity Catalog 數據表同步到您的資料庫執行個體。 請參見 「提供與同步資料表的湖屋資料服務」。
T
table
數據表位於架構中,並包含數據列。 Databricks 中建立的所有數據表預設都會使用 Delta Lake。 Delta Lake 支援的數據表也稱為 Delta 數據表。 請參見Azure Databricks表格。
被觸發的作業流程
管線輸入每個資料表在更新開始時可用的所有資料,並按照相依順序執行,然後終止。 請參閱 觸發式與連續管線模式。
U
使用者定義函數(UDF)
使用者創建的自訂函式,用以擴充 SQL 或程式語言的內建功能。 在 Azure Databricks 中,UDF 可以註冊到 Unity 目錄中,以便治理並在多個工作空間間重複使用。 請參閱什麼是使用者定義函式 (UDF)?。
Unity 目錄
Azure Databricks 的一項功能,提供跨 Azure Databricks 工作空間的集中存取控制、稽核、血統及資料發現功能。 請參閱 什麼是 Unity 目錄?。
V
向量資料庫
已優化以儲存與擷取嵌入向量的資料庫。 內嵌是資料語意內容的數學表示法,通常是文字或影像資料。 Databricks 提供 AI 搜尋索引,讓你能在 Delta 表格中使用向量資料庫功能。 請參閱 Databricks AI 搜尋。
view
SQL 查詢所定義的虛擬數據表。 它本身不會儲存數據,而是提供一種方式,以特定格式或抽象呈現來自一或多個數據表的數據。 請參閱 什麼是檢視?。
磁碟區 (Unity 目錄)
用於治理非表格式資料集的 Unity Catalog 物件。 卷代表雲端物件儲存位置中的邏輯存儲容量。 磁碟區提供存取、儲存、控管和組織檔案的功能。 請參閱 什麼是 Unity 目錄磁碟區?。
W
Lakeflow 職位
這組工具讓你能在 Azure Databricks 上排程和協調資料處理任務。 請參閱 Lakeflow 職位。
workload
執行工作或工作群組所需的處理功能量。 Azure Databricks 識別了兩種工作負載類型:資料工程(工作)和資料分析(多用途)。 參見 Azure Databricks components。
workspace
組織環境,可讓 Databricks 用戶開發、流覽及共享物件,例如筆記本、實驗、查詢和儀錶板。 請參閱 工作區 UI。
Z
Zerobus 匯入
一個基於推送、無伺服器擷取的 API,可直接將資料寫入 Unity Catalog 中的受管理 Delta 資料表中。 Zerobus Ingest 會隨著傳入連線增加而自動擴展,無需管理任何訊息匯流排基礎架構、分區或代理程式。 請參閱 Zerobus Ingest 概覽。