影像分析的多模態模型

已完成

小提示

有關更多詳細信息,請參閱 文本和圖像 選項卡!

越來越多新的人工智慧模型採用多模態化。 換句話說,它們支援多種輸入資料,包括圖片和文字。 多模態模型 是能同時理解並處理多種資料的 AI 模型,例如文字、影像、音訊或影片。 例如,多模態模型可以用自然語言描述影像,或回答關於照片的問題。

多模態模型通常用於以下領域:

  • AI 應用,透過影像理解提升使用者工作流程
  • AI 代理人,視覺輸入幫助代理人做出更好的決策

範例包括:

  • 一位會審查上傳文件和截圖的業務員
  • 一款分析顧客提交照片的支援應用程式
  • 一個用簡單語言解釋圖解或圖表的學習工具

由於多模態模型同時接受文字與圖片,減少了獨立視覺流程的需求,並使建構端到端智慧體驗變得更容易。

模型能夠將視覺理解與自然語言回應結合的能力,稱為視覺 啟用的 GPT 模型 或 GPT 與視覺。 視覺驅動模型設計用於靈活且通用的視覺推理。 他們能分析視覺輸入並以自然語言回應,使得建立智慧應用程式變得容易,無需深厚的電腦視覺專業知識。

Microsoft Foundry 中的多模態模型

Microsoft Foundry 包含許多接受影像輸入的模型,讓您能打造智慧且以視覺為基礎的解決方案。 Microsoft Foundry 中的多模態模型允許應用程式與代理理解、分析並推理影像與視覺內容。

例如,Foundry 中的視覺驅動 GPT 模型可以:

  • 用自然語言描述一張圖片的內容
  • 回答有關圖片中物件、文字或場景的問題
  • 從圖表、截圖、文件或照片中提取意義
  • 將影像理解與文字指令結合於單一提示中

Foundry 的模型目錄包含許多多模態模型,包括:

  • GPT-4.1 / GPT-4.1-mini / GPT-4.1-nano:這些通用多模態 GPT 模型能同時處理文字與影像。 它們常用於圖片描述與視覺問答、文件與截圖分析,以及圖表與圖表解讀。

  • GPT-5 系列(例如 GPT-5.1、GPT-5.2):Foundry 提供的 GPT-5 家族包含為企業與代理場景設計的先進多模態模型。 這些模型支援多模態輸入(包括文字與圖片)、結構化輸出,以及工具使用,跨模態進行大脈絡推理。 GPT-5 系列模型通常用於生產級 AI 代理及複雜的多模態應用。

Foundry 也在其模型目錄中提供合作夥伴提供的多模態模型,包括 Anthropic 等支援文字與影像理解的供應商模型。

鑄造廠遊樂場的影像分析

備註

Foundry 入口網站擁有 經典 的使用者介面(UI)及 新的 使用者介面。

在 新的 Microsoft Foundry 入口網站中,你可以利用模型遊樂場與已部署的模型進行對話。 你可以選擇啟用視覺的模型,上傳圖片,並互動式測試提示,以了解模型如何解讀視覺資訊。

Foundry Playground 的截圖,部署了 GPT-4.1 迷你模型,使用者上傳動物圖片。

舉例來說,你可以附上一張影像檔,取得多模態模型(例如 gpt-4.1 mini)來分析和描述它。

Foundry Playground 的截圖,提示模型描述圖片中的內容,並回應說明。

驗證後,可透過 API 程式化存取相同功能,允許在應用程式碼中與文字提示一同提交圖片。

使用 Azure OpenAI API 進行影像分析

要開發應用程式,你需要從 Foundry 的遊樂場轉到程式碼。 在程式碼編輯器中,你可以使用 Foundry 的 OpenAI 回應 API 來撰寫應用程式程式碼。 OpenAI 回應 API 專為代理型應用程式設計,並支援原生多模態輸入(包括圖片)。

概括而言:

  • 單一請求可以同時包含文字輸入與圖片輸入
  • 影像可以作為網址或 base64 編碼的影像資料提供。
  • 模型同時處理兩個輸入以產生回應

概念上,提示結構如下:

  • 文字指令(例如, 這張圖片中可見哪些物體?)
  • 會附加一或多個圖像輸入到同一要求

這種方式讓開發者能建立應用程式,讓使用者即時上傳圖片並提出相關問題。

使用 Azure OpenAI Python SDK

您可以搭配使用 Microsoft Foundry 資源和 OpenAI API 來進行圖像分析,包括在提示中傳送圖像及取得文字回覆,方法是使用具備視覺‑能力模型部署的回覆 API。

Python SDK 可透過以下方式安裝於 Visual Studio Code 終端機 中:

pip install openai

在程式碼編輯器中,我們可以建立一個包含應用程式程式碼的 Python 檔案。 重要的是,你需要 Foundry 資源金鑰 和 端點,以及 已部署模型的名稱。

備註

當你在 Foundry 部署模型時,它有一個 基底 名稱或 原始 名稱,並且你給它一個原始 部署名稱 。 Foundry 會架設已部署的模型(例如帶有視覺的 GPT 類模型),並提供一個端點。

在程式碼範例中,你建立 客戶端,指向你的端點,並將你的 模型部署名稱 (你給模型命名的名稱)傳給 MODEL_NAME。

import os
from openai import OpenAI

# Environment variables you set locally or in your app service:
FOUNDRY_KEY = "... your key ..."
ENDPOINT = "https://YOUR-RESOURCE-NAME.openai.azure.com/openai/v1/"
MODEL_NAME = "your-model-deployment-name"  # e.g., "gpt-4.1-mini" deployed as "my-vision-deploy"

client = OpenAI(
    api_key=os.getenv("FOUNDRY_KEY"),
    base_url=os.getenv("ENDPOINT"),
)

image_url = ""

response = client.responses.create(
    model=os.getenv("MODEL_NAME"),  # your deployment name 
    input=[
        {
            "role": "user",
            "content": [
                {"type": "input_text", "text": "What is in this image? Provide 3 bullet points."},
                {"type": "input_image", "image_url": image_url}
            ],
        }
    ],
)

print(response.output_text)

客戶端應用程式範例

你可以用 OpenAI Python SDK 建立一個使用視覺驅動模型來分析影像的自訂應用程式。 舉例來說,假設你想打造一款能辨識在 Safari 上拍攝的動物的應用程式。 你可以上傳照片,並在程式碼編輯器中建立 Python 檔案。

用於影像分析的圖片截圖。

接著你可以撰寫應用程式碼,利用 OpenAI API 連接到 Foundry 中的模型端點。

Visual Studio Code 的截圖,包含包含影像分析應用程式程式碼的 Python 檔案。

應用程式碼需要載入影像資料,並從使用者那裡取得自然語言提示。 要將輸入提交給模型,你需要建立包含圖片和文字資料的多部分訊息。 模型能根據提示中的文字與圖片,做出適當的輸出。

Visual Studio 程式碼的截圖,包含影像分析結果。

接著,學習如何使用 Foundry 模型和 Azure OpenAI SDK 來生成影像。