影像分析的多模態模型
小提示
有關更多詳細信息,請參閱 文本和圖像 選項卡!
越來越多新的人工智慧模型採用多模態化。 換句話說,它們支援多種輸入資料,包括圖片和文字。 多模態模型 是能同時理解並處理多種資料的 AI 模型,例如文字、影像、音訊或影片。 例如,多模態模型可以用自然語言描述影像,或回答關於照片的問題。
多模態模型通常用於以下領域:
- AI 應用,透過影像理解提升使用者工作流程
- AI 代理人,視覺輸入幫助代理人做出更好的決策
範例包括:
- 一位會審查上傳文件和截圖的業務員
- 一款分析顧客提交照片的支援應用程式
- 一個用簡單語言解釋圖解或圖表的學習工具
由於多模態模型同時接受文字與圖片,減少了獨立視覺流程的需求,並使建構端到端智慧體驗變得更容易。
模型能夠將視覺理解與自然語言回應結合的能力,稱為視覺 啟用的 GPT 模型 或 GPT 與視覺。 視覺驅動模型設計用於靈活且通用的視覺推理。 他們能分析視覺輸入並以自然語言回應,使得建立智慧應用程式變得容易,無需深厚的電腦視覺專業知識。
Microsoft Foundry 中的多模態模型
Microsoft Foundry 包含許多接受影像輸入的模型,讓您能打造智慧且以視覺為基礎的解決方案。 Microsoft Foundry 中的多模態模型允許應用程式與代理理解、分析並推理影像與視覺內容。
例如,Foundry 中的視覺驅動 GPT 模型可以:
- 用自然語言描述一張圖片的內容
- 回答有關圖片中物件、文字或場景的問題
- 從圖表、截圖、文件或照片中提取意義
- 將影像理解與文字指令結合於單一提示中
Foundry 的模型目錄包含許多多模態模型,包括:
GPT-4.1 / GPT-4.1-mini / GPT-4.1-nano:這些通用多模態 GPT 模型能同時處理文字與影像。 它們常用於圖片描述與視覺問答、文件與截圖分析,以及圖表與圖表解讀。
GPT-5 系列(例如 GPT-5.1、GPT-5.2):Foundry 提供的 GPT-5 家族包含為企業與代理場景設計的先進多模態模型。 這些模型支援多模態輸入(包括文字與圖片)、結構化輸出,以及工具使用,跨模態進行大脈絡推理。 GPT-5 系列模型通常用於生產級 AI 代理及複雜的多模態應用。
Foundry 也在其模型目錄中提供合作夥伴提供的多模態模型,包括 Anthropic 等支援文字與影像理解的供應商模型。
鑄造廠遊樂場的影像分析
備註
Foundry 入口網站擁有 經典 的使用者介面(UI)及 新的 使用者介面。
在 新的 Microsoft Foundry 入口網站中,你可以利用模型遊樂場與已部署的模型進行對話。 你可以選擇啟用視覺的模型,上傳圖片,並互動式測試提示,以了解模型如何解讀視覺資訊。
舉例來說,你可以附上一張影像檔,取得多模態模型(例如 gpt-4.1 mini)來分析和描述它。
驗證後,可透過 API 程式化存取相同功能,允許在應用程式碼中與文字提示一同提交圖片。
使用 Azure OpenAI API 進行影像分析
要開發應用程式,你需要從 Foundry 的遊樂場轉到程式碼。 在程式碼編輯器中,你可以使用 Foundry 的 OpenAI 回應 API 來撰寫應用程式程式碼。 OpenAI 回應 API 專為代理型應用程式設計,並支援原生多模態輸入(包括圖片)。
概括而言:
- 單一請求可以同時包含文字輸入與圖片輸入
- 影像可以作為網址或 base64 編碼的影像資料提供。
- 模型同時處理兩個輸入以產生回應
概念上,提示結構如下:
- 文字指令(例如, 這張圖片中可見哪些物體?)
- 會附加一或多個圖像輸入到同一要求
這種方式讓開發者能建立應用程式,讓使用者即時上傳圖片並提出相關問題。
使用 Azure OpenAI Python SDK
您可以搭配使用 Microsoft Foundry 資源和 OpenAI API 來進行圖像分析,包括在提示中傳送圖像及取得文字回覆,方法是使用具備視覺‑能力模型部署的回覆 API。
Python SDK 可透過以下方式安裝於 Visual Studio Code 終端機 中:
pip install openai
在程式碼編輯器中,我們可以建立一個包含應用程式程式碼的 Python 檔案。 重要的是,你需要 Foundry 資源金鑰 和 端點,以及 已部署模型的名稱。
備註
當你在 Foundry 部署模型時,它有一個 基底 名稱或 原始 名稱,並且你給它一個原始 部署名稱 。 Foundry 會架設已部署的模型(例如帶有視覺的 GPT 類模型),並提供一個端點。
在程式碼範例中,你建立 客戶端,指向你的端點,並將你的 模型部署名稱 (你給模型命名的名稱)傳給 MODEL_NAME。
import os
from openai import OpenAI
# Environment variables you set locally or in your app service:
FOUNDRY_KEY = "... your key ..."
ENDPOINT = "https://YOUR-RESOURCE-NAME.openai.azure.com/openai/v1/"
MODEL_NAME = "your-model-deployment-name" # e.g., "gpt-4.1-mini" deployed as "my-vision-deploy"
client = OpenAI(
api_key=os.getenv("FOUNDRY_KEY"),
base_url=os.getenv("ENDPOINT"),
)
image_url = ""
response = client.responses.create(
model=os.getenv("MODEL_NAME"), # your deployment name
input=[
{
"role": "user",
"content": [
{"type": "input_text", "text": "What is in this image? Provide 3 bullet points."},
{"type": "input_image", "image_url": image_url}
],
}
],
)
print(response.output_text)
客戶端應用程式範例
你可以用 OpenAI Python SDK 建立一個使用視覺驅動模型來分析影像的自訂應用程式。 舉例來說,假設你想打造一款能辨識在 Safari 上拍攝的動物的應用程式。 你可以上傳照片,並在程式碼編輯器中建立 Python 檔案。
接著你可以撰寫應用程式碼,利用 OpenAI API 連接到 Foundry 中的模型端點。
應用程式碼需要載入影像資料,並從使用者那裡取得自然語言提示。 要將輸入提交給模型,你需要建立包含圖片和文字資料的多部分訊息。 模型能根據提示中的文字與圖片,做出適當的輸出。
接著,學習如何使用 Foundry 模型和 Azure OpenAI SDK 來生成影像。