Microsoft Foundry 中的優化調整

微調透過針對特定任務資料的額外訓練,將預訓練模型調整到適合你的任務。 它調整模型權重,而不是在每個提示中加入範例。 你可以在模型現有能力上建立基礎,而不必從零開始訓練模型。

微調可在以下情況提供幫助:當你擁有高品質、針對特定任務的訓練資料,並希望:

  • 提升準確性與相關性。 使用超出單一提示可容納數量的更多範例進行訓練,可以學會針對特定任務的模式。
  • 減少提示詞開銷。 較少的提示範例可以降低代幣成本與延遲。
  • 風格與結構保持一致。 回應可以遵循一致的語氣、格式或架構。
  • 改善工具使用方式。 訓練範例能提升工具選擇與引數準確性。
  • 有效利用擷取的內容脈絡。 模型可以學會優先處理相關情境,忽略無關資訊。
  • 專精於較小的模型。 教師產生的範例能幫助較小的模型以較低的成本與延遲達成任務需求。

效益並非保證;保留集評估有助於你將微調模型與基線進行比較。 微調會增加 訓練與託管成本,且也無法以檢索取代取得最新資訊,或取代應用層級的安全控管。

選擇你的訓練方式

Microsoft Foundry 提供兩種訓練方式。 管理式微調 會根據你的資料和設定執行訓練工作。 互動式訓練(預覽)讓你用 Python 控制訓練步驟。

兩者皆採用 Foundry 管理的訓練基礎設施;你不會配置訓練 GPU。

Note

互動式訓練目前處於預覽階段,並且需要明確的存取核准。 請透過 預覽報名表單 申請存取權限,並等待核准後再建立培訓課程。

受管理的微調 互動式訓練(預覽)
運作方式 提交資料與設定;Foundry 負責訓練工作。 寫一個 Python 迴圈;Foundry 執行訓練與取樣作業。
適用對象 初學者和偏好預先定義工作流程勝過低階訓練操作的 AI 工程師。 經驗豐富的機器學習從業者建立客製化的訓練工作流程。
您的控制項 資料、支援的超參數,以及 RFT 分級器。 損失、獎勵、rollout、梯度累積、更新與檢查點。
訓練方法 特定模型的 SFT、DPO 及 RFT;透過教師生成的 SFT 資料進行蒸餾。 SFT、強化學習、偏好學習、蒸餾及自訂損失的範例。
範例使用案例 提煉出一個更大的模型,從支援對話中學習,或透過評分器改善回應。 收集工具使用 rollout、套用自訂獎勵,或改變訓練循環的更新與評估行為。

Tip

如果你是模型自訂新手,建議先從代管微調開始。 它提供預先定義的工作流程,且不需你實作個別訓練作業。

模型需求可能會限制這種選擇。 一個模型在一種方式、方法或模態上被支援,並不代表其他方式也自動被支援。 食譜支援也無法確定服務可用性。 請參考下方 支援的模型表 ,了解可用的組合。

客製化方法

客製化方法決定模型如何從訓練資料或回饋中學習,例如期望的回應、偏好或獎勵。

方法 訓練信號 當它合適時
監督微調(SFT) 提示與期望回應。 你可以展示模型應該學習的行為。
偏好微調,使用直接偏好優化(DPO) 對相同輸入的偏好與被拒絕的回應。 品質取決於偏好,如語氣或完整性,而非單一正確答案。
強化式微調(RFT) 題目和為產生的回應評分的評分器。 多種解決方案可行,且你能可靠地評分其品質。

本表中預設的方法僅適用於受管理微調。 互動式訓練提供可用於建立自訂訓練工作流程的訓練原語。

訓練類型

訓練類型定義訓練的執行地點,以及容量、價格和服務保證的適用方式。 它們與部署類型是分開的,部署類型決定了你如何提供已訓練模型。

訓練類型 Description
標準 訓練在目前 Foundry 資源的區域內進行,並提供資料駐留的保證。 非常適合需要將資料保留在特定區域的工作負載。
資料區 訓練是在支援的資料區域內進行,而非單一區域。 非常適合資料必須留在該區域內的工作負載。 目前僅支援美國資料區。
全域 透過使用超出你目前區域的容量,提供比標準更實惠的價格。 資料與權重會被複製到訓練進行的區域。 如果資料駐留不是限制,而且您想要更快的佇列時間,則這是理想的選擇。
開發人員 利用閒置容量進行訓練,帶來顯著的成本節省。 此層級的工作沒有延遲或SLA保證,因此可能會被自動中斷並稍後恢復。 關於資料駐留的問題,也沒有任何保證。 非常適合試驗用途和價格敏感型工作負載。

部署選項

Foundry 提供三種部署選項,具備不同的服務基礎設施與計費模式。

  • 無伺服器運算:Foundry 會託管微調後的模型,並管理服務基礎設施。
  • 受管運算(預覽):專用 GPU 容量可搭配一個或多個相容的 LoRA 轉接器運行相符的基礎模型。
  • Fireworks on Foundry(預覽):Fireworks 執行環境提供一個已合併到基礎模型完整權重副本中的配接器。

無伺服器與 Fireworks 提供不同的部署類型,決定處理所在區域、容量及計費模式。 可用性取決於模型、部署選項及成品。

部署類型 Description
標準 在部署區域內進行推論,並依每個代幣計費及適用的微調模型託管費用。
數據區標準 在支援的資料區域內執行推論,並以每個代幣計費。 目前只支援美國資料區。
全域標準 使用全球容量並按代幣計費。 自訂模型權重可能會暫時儲存在資源地理範圍之外。
開發人員 全球進行推論,按代幣計費,且無按小時託管費用或資料駐留保證。 僅供評估;持續24小時,且沒有可用性SLA。
預置的吞吐量 提供以配置吞吐量單位(PTUs)計費的區域容量,以實現可預測的吞吐量。
全域配置 對進口客製化模型使用全域容量並以 PTU 計費。

支援的模型

你的需求可能需要特定的模型或訓練方法。 請使用表格檢查哪些組合支援您的客製化方法、訓練類型及部署選項。

對於支援的無伺服器部署,除非有說明,否則可使用全域標準、資料區標準及開發者。 請檢查標準 部署區域 與 Provisioned Throughput 部署區域 ,針對這些部署類型。

型號識別碼 Approach 訓練類型 部署選項
MAI-Code-1.1-Flash
(預覽版)
已管理: ✅ (RFT)
互動式: ❌
標準: ❌
資料區: ❌
全球: ✅
開發者: ✅
無伺服器: ✅2
管理運算: ❌
煙火: ❌
Muse-Glimmer-30B
(預覽版)
管理: ✅ (SFT、RFT)
互動式: ✅
標準: ❌
資料區: ❌
全球:✅
開發人員: ✅
無伺服器: ❌
管理運算: ✅
煙火: ✅1
Llama-3.3-70B-Instruct 受管理:✅(SFT)
互動式: ❌
標準: ❌
資料區: ✅
全球: ✅
開發人員: ❌
無伺服器運算:✅2
管理運算: ❌
煙火: ❌
Qwen3-32B 管理: ✅ (SFT)
互動式: ❌
標準: ❌
資料區: ✅
全球: ✅
開發人員: ❌
無伺服器: ✅2
受管理的運算: ❌
煙火: ❌
Qwen3.6-35B-A3B
(預覽版)
受管理: ✅ (SFT、RFT)
互動式: ✅
標準: ❌
資料區: ❌
全球: ✅
開發人員: ✅
無伺服器: ❌
管理運算: ✅
煙火: ✅1
Qwen3.8-27B
(預覽版)
受管理:✅ (SFT, RFT)
互動式: ✅
標準: ❌
資料區: ❌
全球: ✅
開發人員: ✅
無伺服器: ❌
管理運算: ✅
煙火: ✅1
gpt-oss-20b 管理: ✅ (SFT)
互動式: ✅
標準: ❌
資料區: ✅
全球: ✅
開發者: ❌
無伺服器: ✅2
管理運算: ❌
煙火: ❌
gpt-oss-120b
(預覽版)
受管理:✅(SFT, RFT)
互動式: ✅
標準: ❌
資料區: ❌
全球:✅
開發者: ✅
無伺服器: ❌
管理運算: ✅
煙火: ✅1
Ministral-3B
(2411)
管理: ✅ (SFT)
互動式: ❌
標準: ❌
資料區: ✅
全球: ✅
開發人員: ❌
無伺服器: ✅2
管理運算: ❌
煙火: ❌
gpt-4o-mini
(2024-07-18)
受管理:✅(SFT)
互動式: ❌
標準: ✅
資料區: ✅
全球: ✅
開發人員: ✅
無伺服器: ✅5
管理運算: ❌
煙火: ❌
gpt-4o
(2024-08-06)
管理: ✅ (SFT、DPO)
互動式: ❌
標準: ✅
資料區: ✅
全球: ✅
開發人員: ✅
無伺服器: ✅5
管理運算: ❌
煙火: ❌
gpt-4.1
(2025-04-14)
管理: ✅ (SFT、DPO)
互動式: ❌
標準: ✅
資料區: ✅
全球:✅
開發人員: ✅
無伺服器: ✅
受管理的運算資源:❌
煙火: ❌
gpt-4.1-mini
(2025-04-14)
管理: ✅ (SFT、DPO)
互動式: ❌
標準: ✅
資料區: ✅
全球: ✅
開發人員: ✅
無伺服器: ✅
管理運算: ❌
煙火: ❌
gpt-4.1-nano
(2025-04-14)
管理: ✅ (SFT、DPO)
互動式: ❌
標準: ✅
資料區: ✅
全球: ✅
開發人員: ✅
無伺服器: ✅
管理運算: ❌
煙火: ❌
o4-mini
(2025-04-16)
受管理: ✅ (RFT)
互動式: ❌
標準: ✅
資料區: ✅
全球: ✅
開發人員: ✅
無伺服器: ✅
管理運算: ❌
煙火: ❌
gpt-5
(2025-08-07)3
受管理: ✅ (RFT)
互動式: ❌
標準: ✅
資料區: ✅
全球: ✅
開發人員: ❌
無伺服器:✅4
管理運算: ❌
煙火: ❌
MedImageInsight-Premium
(預覽版)
管理: ✅ (SFT)
互動式: ❌
全域 無伺服器: ✅2
管理運算: ❌
煙火: ❌
CXRReportgen-Premium
(預覽版)
管理: ✅ (SFT)
互動式: ❌
全域 無伺服器: ✅2
管理運算: ❌
煙火: ❌

圖例

  • 1 僅支援已佈建輸送量部署類型。
  • 2 僅支援全球標準部署類型。
  • 3 GPT-5 強化微調需要邀請。 請聯絡您的 Microsoft 帳戶團隊以註冊。
  • 4 僅支援標準部署類型。 請參閱 標準部署區域。
  • 5 不支援開發者部署類型。

支援的全球訓練區域

Note

全球訓練提供每筆代幣更具成本效益的訓練,但不提供資料駐地。

表格列出了使用 Global 管理微調與互動式訓練所需的 Foundry 專案區域(預覽)。 請選擇支援您模型與訓練方法的區域,包括以下限制。 標準區與資料區訓練區各有區域支援。

Foundry 專案區域 受管理的微調 互動式訓練(預覽)
Australia East ✅ ✅
Brazil South ✅ 1 ❌
加拿大中部 ✅ 1 ❌
加拿大東部 ✅ 1 ✅
美國東部 ✅ ✅
美國東部 2 ✅ ✅
法國中部 ✅ 1 ❌
德國中西部 ✅ 1 ❌
義大利北部 ✅ 1 ❌
日本東部 ✅ 1,2 ❌
南韓中部 ✅ ✅
美國中北部 ✅ ✅
挪威東部 ✅ 1 ❌
波蘭中部 ✅ 1,3 ❌
南非北部 ✅ 1 ❌
美國中南部 ✅ 1 ❌
印度南部 ✅ 1 ❌
東南亞 ✅ 1 ❌
西班牙中部 ✅ 1 ❌
瑞典中部 ✅ ✅
瑞士北部 ✅ ✅
瑞士西部 ✅ 1 ❌
阿拉伯聯合大公國北部 ✅ 4 ✅
英國南部 ✅ ✅
西歐 ✅ 1 ❌
美國西部 ✅ 1 ❌
美國西部 3 ✅ ✅
  • 1 此區域不支援 Qwen3.6-35B-A3B、Qwen3.8-27B、Muse-Glimmer-30B 和 gpt-oss-120b 的受控微調。
  • 2 日本東部不支援視覺微調。
  • 3 波蘭中央不支援 gpt-4.1-nano 的受控微調。
  • 4 UAE North 僅針對 Qwen3.6-35B-A3B、Qwen3.8-27B、Muse-Glimmer-30B 及 gpt-oss-120b 支援全域受控微調。

支援的標準部署區域

僅以下模型支援無伺服器標準部署。 請查看表格中的區域可用性。

型號識別碼 美國東部 2 美國中北部 瑞典中部
gpt-4o-mini ❌ ✅ ✅
gpt-4o ✅ ❌ ✅
gpt-4.1 ❌ ✅ ✅
gpt-4.1-mini ❌ ✅ ✅
gpt-4.1-nano ❌ ✅ ✅
o4-mini ✅ ❌ ✅
gpt-5 ❌ ✅ ✅

支援已佈建輸送量的部署區域

僅以下模型支援在以下列出的區域中進行無伺服器已佈建輸送量部署。

型號識別碼 美國中北部 瑞典中部
gpt-4o-mini ✅ ✅
gpt-4o ✅ ✅
gpt-4.1 ❌ ✅

挑戰與限制

微調是一個反覆的工程過程,並非保證的改進。

挑戰 如何處理
資料品質與覆蓋範圍 使用準確、一致且具代表性的例子。 在上傳資料前,檢查遺漏的情境、重複情境、偏見及敏感資訊。
過擬合與評估洩漏 訓練、驗證與最終測試資料分開。 比較留出任務的檢查點,而不只是訓練損失。
誤導性的獎勵訊號 測試RFT評分員針對正確、錯誤及對抗性回應的表現。 如果模型利用評分器,報酬上升並不會證明任務表現更好。
實驗與成本 為重複執行、評分、評估、託管和推論做預算。 停止那些無法提升目標指標的實驗。
模型與服務相容性 在訓練前確認方法、層級、版本及是否符合部署資格。 轉接頭在名稱相近的基礎機型間無法互換。
Maintenance 隨著任務資料變動或基底模型接近退休,重新評估品質。 重新訓練和重新部署可能是必要的。
安全與治理 檢視資料處理與受管理的安全性評估。 維持應用層級的安全控管,並評估最終服務執行階段。
互動式執行階段職責 維護你的驅動程式、環境、標記化、檢查點和復原邏輯。 會話中取樣並不能證明線上服務行為。

下一步

先從訓練方法的指南開始,然後部署並評估你微調過的模型。