Databricks 基礎模型 API

本文提供 Azure Databricks 上基礎模型 API 的概觀。 其中包含使用需求、支援的模型和限制。

什麼是 Databricks Foundation 模型 API?

Model Serving 現在支援 Foundation Model API,讓你能從服務端點存取並查詢最先進的開放模型。 這些模型是由 Databricks 所裝載,您可以快速且輕鬆地建置使用這些模型的應用程式,而不需要維護自己的模型部署。 基礎模型 API 是 Databricks 指定的服務,這表示它會使用 Databricks Geos 在處理客戶內容時管理數據駐留。

基礎模型 API 會以下列模式提供:

  • 按令牌付費:這是在 Databricks 上開始存取基礎模型的最簡單方式,建議您使用基礎模型 API 開始旅程。 對於生產工作負載,Databricks 建議針對需要更高效能且需更穩定效能的延遲敏感工作負載,採用 優先權按令牌付費模式(Priority-pay-per-token)。

  • 預配的吞吐量:建議將此模式用於所有生產環境的工作負載,特別是那些需要高吞吐量、性能保證、精細調整模型或有額外安全需求的工作負載。 配置的吞吐量端點具有 HIPAA 等合規性認證。

  • AI 函式優化模型:建議針對批次推斷工作負載使用此模式。 你可以選擇使用任何 AI 或機器學習模型,使用 AI 函式來執行批次推論。

如需如何使用這些模式和支援模型的指導,請參閱 Use Foundation Model API。

使用基礎模型 API,您可以執行下列動作:

  • 查詢一般化 LLM,以在投資更多資源之前,先確認專案的有效性。
  • 查詢一個一般化的 LLM,以快速建立基於 LLM 的應用程式的概念驗證,再進一步投資於訓練和部署自定義模型。
  • 使用基礎模型以及向量索引,使用擷取增強式產生 (RAG) 來建置聊天機器人。
  • 將專屬模型取代為開放式替代方案,以優化成本和效能。
  • 有效率地比較 LLM 以查看使用案例的最佳候選專案,或將生產模型交換為效能較佳的模型。
  • 在可擴展、SLA 支援的 LLM 服務解決方案之上,建置用於開發或生產的 LLM 應用程式,以支援生產環境的流量尖峰。

需求規格

使用基礎模型 API

您有多個使用基礎模型 API 的選項。

大多數 Foundation Model API 都相容 OpenAI,所以你可以用 OpenAI 客戶端來查詢。 您也可以使用UI、基礎模型 API Python SDK、MLflow 部署 SDK 或 REST API 來查詢支援的模型。 OpenJev 模組使用 TypeSafe System One API。 Databricks 建議使用 OpenAI 用戶端 SDK 或 API,以便與相容模型進行延伸互動,並使用介面試用此功能。

如需評分範例,請參閱 使用基礎模型 。

按令牌付費基礎模型 API

您的 Azure Databricks 工作區中可存取預先配置的端點,這些端點提供按使用次數付費的模型。 建議使用這些按令牌付費模型以作為起步。 要在工作區中存取這些內容,請點擊工作區側邊欄的 AI 閘道 。 按代幣付費的模型在 模型 標籤中列為系統提供的模型服務。 參見 系統提供的模型服務 。

服務端點清單

優先按代幣付費

優先按代幣付費,也稱為優先模式,是一種針對延遲敏感的即時應用的按代幣付費功能。 當你發送參數為 service_tier"priority"的請求時,Azure Databricks 會比標準的 best effort-pay-per-token 流量更早接受請求,以提升負載時的穩定性。 優先模式可針對每個請求選擇啟用,無需任何承諾,並以較高的每權杖費率計費。

請參閱 Foundation Model API 的優先按代幣付費。

提供吞吐量基礎模型 API

預配置的吞吐量為需要效能保證的基礎模型工作負載提供優化的推論。 Databricks 建議為生產負載提供預配置的吞吐量。

配置的輸送量支援包括:

  • 各種尺寸的基礎模型。 您可以使用 Databricks Marketplace 來存取基底模型,或者您也可以從擁抱臉部或其他外部來源下載模型,並在 Unity 目錄中註冊它們。 後者的方法適用於所支援模型的任何微調變體。
  • 經過微調的基礎模型變體,例如在專有數據上微調的模型。
  • 完全自定義的權重和分詞器,例如從零開始訓練、接續預訓練,或 使用基礎模型架構 的其他變體(例如 CodeLlama)。

用於批次推斷的 AI 函式

請參見 「利用 AI 函式轉換非結構化資料」。

如需如何使用 AI Functions 建立批次推論管線,請參閱部署批次推論管線。

局限性

請參閱 基礎模型 API 限制。

其他資源