Microsoft Foundry Models 是發現與部署各種生成式 AI 應用模型的樞紐。 要讓模型可供推理請求使用,你必須部署它。 Foundry 根據模型類型和基礎設施需求提供兩種部署選項。
提示
你不一定總是需要進行部署。 透過 即時存取(預覽),你可以直接呼叫支援的模型名稱並立即開始執行推論——無需部署。
部署選項
Foundry 提供兩種部署選項:
- Serverless API — 適用於 Foundry 模型,包括 Azure 銷售的 Foundry 模型及合作夥伴與社群的特定模型。 此選項是首選且最有能力的部署路徑。 它包含標準型、配置吞吐量、批次及開發者部署類型。
- 託管運算(預覽版) — 適用於開源、合作夥伴及自訂模型,這些模型運行於 Foundry 為你管理的專用 GPU 容量上。
Foundry 會根據你選擇的模型,選擇合適的部署選項。
如果你只需要試用支援的模型,可以完全跳過部署,直接使用 即時存取(預覽),它可以直接呼叫模型名稱,無需建立無伺服器 API 或管理式運算部署。
完整能力比較請參見 部署選項比較。
無伺服器 API
Foundry 中 首選 部署選項是無伺服器 API。 它支援最廣泛的功能與部署類型。
哪些模型使用無伺服器 API 部署?
所有 Foundry 模型,包括 Azure 銷售的 Foundry 模型,以及部分合作夥伴和社群的模型,都採用無伺服器 API 部署。 Azure 銷售的 Foundry 模型包含所有 Azure OpenAI 模型及頂尖供應商的部分模型,這些模型透過您的 Azure 訂閱計費,並受 Azure 服務層級協議涵蓋,並由 Microsoft 支援。 來自合作夥伴與社群中採用無伺服器 API 部署的模型包括 Anthropic 模型,以及合作夥伴如 Mistral、Cohere 和 Meta 的特定模型。
無伺服器 API 功能
無伺服器 API 部署支援:
- 多種部署類型(或部署 SKU) ——全球標準、資料區標準、標準(單一區域)、配置型、批次等。 每種類型都控制資料處理的地點以及付款方式。 詳情請參見 Microsoft Foundry 模型的部署類型。
- 資料處理彈性 — 根據您的合規需求,選擇區域、資料區(美國、歐盟或亞太區)或全球處理。
- 內容過濾 — 內建 Azure AI 內容安全過濾器,具備可自訂設定。
- 無鑰匙認證 — Microsoft Entra ID(推薦)及基於金鑰的認證。
- 私人網路 — 虛擬網路整合以提供安全存取。
- 配置輸送量 — 使用配置輸送量單位(PTU)預留容量,以提供可預測的低延遲效能。 詳情請參見 「配置吞吐量」。
資源需求
無伺服器 API 部署可於以下方式進行:
- 鑄造廠資源 — 新鑄造廠專案的主要資源類型。 不需要 AI Hub。
- Azure OpenAI 資源 — 如果您使用 Azure OpenAI 資源,模型目錄中只會顯示用於部署的 Azure OpenAI 模型。 升級到 Foundry 資源,才能取得完整的 Foundry 模型套件。
欲開始無伺服器 API 部署,請參閱 Foundry 入口網站中的部署 Microsoft Foundry 模型,或使用 Azure CLI 與 Bicep 部署模型。
管理式運算部署(預覽版)
Note
Foundry 中的管理運算目前處於公開預覽階段。 此預覽版本沒有服務等級協定,不建議將其用於生產工作負載。 某些功能可能不被支援或功能受限。 欲了解更多資訊,請參閱 Microsoft Azure 預覽版補充使用條款。
Foundry 中的管理運算(預覽版)是一個託管 GPU 平台即服務(PaaS),可在專用 GPU 容量上承載開源及自訂權重模型。 你可以透過與其他部署類型相同的 Foundry 專案端點來存取受控運算部署,無需自行管理虛擬機、叢集或服務執行環境。 Foundry 會按部署需求調整規模、佈建加速器,並持續為執行階段環境套用修補程式。
重要
託管運算支援開源、合作夥伴、產業及自訂模型。 管理式運算部署則在 統一的 Foundry 專案端點上執行,使用相同的認證、網路與 SDK 表面。
哪些模型使用託管運算?
你可以透過管理計算部署 Hugging Face Collection 的模型。 範例包括:
- Qwen 模型
- NVIDIA Nemotron 型號
- 已選取的 Meta 模型
- 精選 Mistral 型號
Microsoft Foundry 的目錄包含大量且持續成長的開源及合作夥伴模型。 有關最新型錄,請參見 型號型錄。
管理式運算能力
受管理運算 (預覽版) 支援:
-
Unified Foundry 端點與認證 — 使用相同的專案端點、API 金鑰、Microsoft Entra ID及私有網路作為按代幣付費及已配置吞吐量部署。 推論路徑使用
<endpoint>/managed-deployments/<deployment-name>/。 相容於聊天補全的執行階段也可以在標準/openai/v1/路由上搭配 OpenAI SDK 運作。 - 模型實例大小 — 部署規模是以模型為中心的。 你不需要特別挑選虛擬機 SKU,因為 Foundry 會根據模型大小、架構、上下文長度,以及工作負載是否優化延遲或吞吐量來選擇 GPU。
- 優化推論執行時 — Microsoft 策劃的 vLLM、SGLang 及 NVIDIA NIM 容器,具備連續批次處理與張量平行處理。
- 加速器家族 — A100(80 GB)、H100(80 GB)及 MI300X(192 GB)。
- 由 Microsoft 管理的執行階段 — Microsoft 負責提供執行階段環境、基礎容器映像和安全性修補程式。 更新會自動套用到即時部署。
- 可觀察性指標 — 每次部署都會依狀態碼和回應時間百分位數發出 API 呼叫計數。 聊天補全模型也會發出輸入和輸出詞元計數、第一個詞元時間 (TTFT) 百分位數,以及總回應時間百分位數,並依時間分組。
計費與配額
受控計算計費為每小時每個加速器 SKU,且以每個 GPU 的輸送量作為基礎計費單位。
配額是透過Foundry配額流程依每個地區的加速器SKU分配,且與Azure虛擬機配額分開。 Azure 虛擬機是基礎設施即服務(IaaS)產品,擁有區域 SKU ;管理運算則是以全域與資料區處理為先驅的 PaaS 產品。 現有的 Azure VM 配額無法套用到受管理的運算部署。
目前可管理的運算支援全球部署。 如需費率估算,請參閱 Azure 價格計算器。
開始
欲開始管理式運算部署,請參閱 「部署與受管運算的開源模型」。
部署選項比較
盡可能使用 無伺服器 API 。 下表比較了兩種部署選項的能力:
Note
在此比較中,即時存取(預覽)並非部署選項。 它會以名稱呼叫支援的模型,且不會建立無伺服器 API 或管理式運算部署。
| 能力 | 無伺服器 API | 管理型運算 |
|---|---|---|
| 哪些模型可以部署? | 所有 Foundry 模型,包括由 Azure 銷售的 Foundry 模型以及來自合作夥伴與社群的精選模型 | 開源及合作夥伴模型,來自模型目錄、NVIDIA NIM 及產業模型 |
| 部署資源 | 鑄造資源 | 鑄造廠計畫 |
| 需要 AI Hub | 不 | 不 |
| 資料處理選項 | 區域、資料區、全球 | 全球 |
| 私人網路 | 是的 | 是的 |
| 內容過濾 | 內建且可自訂 | 未公開預覽 |
| 無鑰匙認證 | 是(Microsoft Entra ID 和金鑰式驗證) | 是(Microsoft Entra ID 和金鑰式驗證) |
| 計費 | 詞元使用量或佈建輸送量單位 | 每小時每個加速器 SKU |
提示
如需詳細定價資訊,請參閱 Microsoft Foundry 的成本規劃與管理。