AI 模型維護政策

本頁說明了基礎模型 API 的模型維護政策:按代幣付費、基礎模型 API 的配置吞吐量,以及帶有ai_query供應的批次推論。

為了持續支援最先進的模型,Databricks 會管理模型從遺留狀態到淘汰,再到最終退休的生命週期。

  • 遺留性:當模型被標記為舊有時,不再建議用於新工作負載,但仍可在已有模型使用空間中使用。 當模型進入舊版狀態時,尚未使用的工作區將無法存取該模型。 使用此類模型的客戶應評估新模型並考慮遷移。
  • 淘汰:當某型號被淘汰時,會公布一個 30 天或 90 天後的退役日期。 不建議用於新工作負載,但在已有模型使用空間時仍可使用。 在淘汰時未使用該模型的工作空間,無法存取該模型。 使用此模型的客戶應評估較新的模型,並計劃在退休日前遷移工作負載。
  • 退役:當某個型號退役時,該型號將不再可取得,且對該型號的支援將完全停止。 使用該模型的任何工作負載都不再運作。

模型生命週期政策

以下章節將總結模型生命週期政策。 有關已棄用模型及退役日期,請參見 「棄用型號 」。

在決定退役時程時會考慮多項因素,包括車型受歡迎程度、合適的替換機型以及生產使用量。 Databricks 會在模型棄用時公布其退休日期,並依照以下通知時間表公布。

基礎模型 API 介面

下表總結了 Foundation Model API 產品的模型生命週期政策:按代幣付費、配置吞吐量及 ai_query (批次推論)。

Legacy 退役通知與退休過渡 在退休日期
Databricks 採取以下步驟通知客戶該模型被標記為舊有模型:
  • 在 Databricks 介面中,該模型被標記為舊有。
  • 相關文件顯示該模型為舊有模型。

當模型被標記 為舊有時:
  • 該模型 仍僅適用於已使用此模型的工作負載工作區。
  • 舊有模型無法從未被標記為舊有的工作區存取。
  • 擁有現有工作負載的客戶應評估較新的模型並考慮遷移工作負載。
Databricks 採取以下步驟通知客戶模型 淘汰:
  • 在 Databricks 介面中,會顯示警告訊息表示該模型已被棄用。
  • 相關文件包含告知該模型已棄用,並附有退役日期。

當某個模型被棄用時,Databricks 會宣布一個 30 天或 90 天 後的退休日期。 在此過渡期間:
  • 擁有現有工作負載的客戶應遷移至推薦的替代模型,否則工作負載會受到終止影響。
該模型已不再提供使用,並從產品中移除。 任何使用該模型的現有工作負載都會停止運作。 相關文件會更新,標示該模型已不再可用,並建議使用替換型號。

合作夥伴模式退休政策

合作夥伴模型是由第三方合作夥伴——特別是 OpenAI、Anthropic 和 Google——透過 Foundation Model API 提供的模型。 對於這些合作夥伴模型,Databricks 通常遵循上述相同的棄用時程與政策。

然而,合作夥伴可能會提供比 Databricks 公布的一個月過渡期更短的退休日期。 在這些情況下,Databricks 嘗試透過暫時將模型重新導向到類似版本來彌補差距,讓客戶獲得完整的轉換時間。

例如,若合作夥伴模型的退休公告提前兩週而非一個月,Databricks 會將模型重新導向兩週,以避免立即中斷並留出遷移時間。 查詢會在完整一個月期間結束時失敗。

Note

這種重定向只有在替換機型價格相同且向下相容時才會發生。 替換的型號通常是增量版本,例如 3.0 與 3.1。

已淘汰與退役的機型

以下章節列出已棄用(不再建議用於新工作負載)或已停用(已終止生命週期且不再可用)的模型。 已淘汰機型的退役日期會至少提前一個月公布。

Foundation Model API 的退休

下表顯示模型退休、其退休日期,以及建議用於基礎模型 API 付費代幣與配置吞吐服務工作負載的替代模型。 Databricks 建議您在指定的淘汰日期之前,移轉應用程式以使用取代模型。

Note

OpenAI 與 Google Gemini 模型,以及 Zhipu AI GLM 5.3、GLM 5.3 Flash、GLM 5.2、Moonshot AI Kimi K3、Thinking Machine Labs 的 Inkling 以及 DeepSeek V4 Flash,僅能透過 Databricks 提供的 ADI 服務提供。

夥伴模式 退休日期 建議的取代模型
人類克勞德十四行詩 4 按代幣付費: 2026年10月9日 克勞德 十四行詩 4.6
OpenAI GPT-5.1 Codex Max 按代幣付費: 2026年7月16日 OpenAI GPT-5.5
OpenAI GPT-5.1 Codex Mini 按代幣付費: 2026年7月16日 OpenAI GPT-5.4 Codex Mini
OpenAI GPT-5.2 編碼本 按代幣付費: 2026年7月16日 OpenAI GPT-5.5
人類克勞德 3.7 十四行詩 按代幣付費: 2026年4月12日 使用最新的 Claude Sonnet 模型
雙子座 2.5 閃光燈 按代幣付費: 2026年10月2日
配置吞吐量: 2026年10月2日
Gemini 3.1 Pro 或 Gemini 3.5 閃光燈
雙子星 2.5 Pro 配置吞吐量: 2026年10月2日 Gemini 3.1 Pro 或 Gemini 3.5 閃光燈
雙子座 3 專業版 配置吞吐量: 2026年3月26日 雙子星 3.1 專業版。 為了爭取更多遷移時間,從 2026 年 3 月 26 日到 2026 年 6 月 7 日,對 Gemini 3 Pro 的 API 呼叫將暫時重新導向至 Gemini 3.1 Pro。 兩款車的價格完全相同。
開放模型 退休日期 建議的取代模型
思考機器實驗室 Inkling 按代幣付費: 2026年10月30日 GLM 5.3 或 Kimi K3
DeepSeek V4 Pro(0813) 按代幣付費: 2026年10月30日 DeepSeek V4.1 閃光
Kimi K2.7 按代幣付費: 2026年10月30日 Kimi K3
Meta Llama 3.1 405B 按代幣付費: 2026年2月15日
配置吞吐量: 2026年5月15日
OpenAI GPT OSS 120B
DBRX / DBRX 教練 按代幣付費: 2025年4月30日
配置吞吐量: 2025年12月19日
按代幣付費: 元-駱馬-4-獨行俠
配置吞吐量: 同一款產品中的類似型號,比如 Llama 3.2、3.3 或 4 型號,尺寸相近。
Mixtral 8x7B / Mixtral-8x7B 指導 按代幣付費: 2025年4月30日
配置吞吐量: 2026年2月27日
按代幣付費: 元-駱馬-4-獨行俠
配置吞吐量: 同一款產品中的類似型號,比如 Llama 3.2、3.3 或 4 型號,尺寸相近。
Meta Llama 3(70B) 按代幣付費: 2024年7月23日(Meta-Llama-3-70B-Instruct);2024年12月11日(Meta-Llama-3.1-70B-Instruct)
配置吞吐量: 2026年2月27日
按代幣付費: 元-駱馬-4-獨行俠
配置吞吐量: 同一款產品中的類似型號,比如 Llama 3.2、3.3 或 4 型號,尺寸相近。
Meta Llama 3 8B 配置吞吐量: 2026年2月27日 同一產品上的可比型號,例如類似尺寸的 Llama 3.2、3.3 或 4 型號。
Meta Llama 2 70B / Meta-Llama-2-70B-聊天 按代幣付費: 2024年10月30日
配置吞吐量: 2026年2月27日
按代幣付費: 元-駱馬-4-獨行俠
配置吞吐量: 同一款產品中的類似型號,比如 Llama 3.2、3.3 或 4 型號,尺寸相近。
Llama 2 13B 配置吞吐量: 2026年2月27日 同一產品上的可比型號,例如類似尺寸的 Llama 3.2、3.3 或 4 型號。
Meta Llama 2 7B 配置吞吐量: 2026年2月27日 同一產品上的可比型號,例如類似尺寸的 Llama 3.2、3.3 或 4 型號。
米斯特拉爾 7B 配置吞吐量: 2026年2月27日 同一產品上的可比型號,例如類似尺寸的 Llama 3.2、3.3 或 4 型號。
MPT 30B / MPT 30B 教官 按代幣付費: 2024年8月30日
配置吞吐量: 2025年12月19日
按代幣付費: 元-駱馬-4-獨行俠
配置吞吐量: 同一款產品中的類似型號,比如 Llama 3.2、3.3 或 4 型號,尺寸相近。
MPT 7B / MPT 7B 教官 按代幣付費: 2024年8月30日
配置吞吐量: 2025年12月19日
按代幣付費: 元-駱馬-4-獨行俠
配置吞吐量: 同一款產品中的類似型號,比如 Llama 3.2、3.3 或 4 型號,尺寸相近。

如果您需要特定模型版本的長期支援,Databricks 建議您針對服務工作負載,使用基礎模型 API 設定的流量。

找使用已退休模型的工作負載

請使用以下查詢找出使用已棄用模型的作業負載並識別其擁有者。

SELECT
   eu.requester,
   se.endpoint_name,
   se.entity_name,
   COUNT(*) AS request_count,
   SUM(eu.input_token_count) AS total_input_tokens,
   SUM(eu.output_token_count) AS total_output_tokens,
   MIN(eu.request_time) AS first_request,
   MAX(eu.request_time) AS last_request
 FROM system.serving.endpoint_usage eu
 JOIN system.serving.served_entities se
   ON eu.served_entity_id = se.served_entity_id
 WHERE LOWER(se.entity_name) LIKE '%<retired-model-name>%'
 GROUP BY eu.requester, se.endpoint_name, se.entity_name
 ORDER BY request_count DESC