影像產生模型

已完成

小提示

有關更多詳細信息,請參閱 文本和圖像 選項卡!

具備視覺能力的模型通常會將影像中的視覺資訊與相應的文字匹配。 有些模型設計成反向執行此過程,產生對應文字描述的影像。

使用 Foundry 的影像生成模型

Microsoft Foundry 包含支援文字轉圖像推理的模型,你可以用來產生視覺輸出。

對於大多數新專案,Microsoft 建議從 GPT-Image-1 家族開始,特別是 GPT-Image-1.5,因其品質提升、編輯支援及企業級準備度。

Foundry 中常見的影像生成模型範例包括:

  • GPT-Image-1.5:GPT-Image-1.5 是 Microsoft Foundry 最新且最先進的影像生成模型。 它專為高畫質、企業級影像製作與編輯而設計,具備強烈的提示對齊性及更佳的迭代一致性。 該模型支援 文字對圖像、 圖像對圖像及精確影像編輯,非常適合重視視覺準確性的品牌、行銷與設計工作流程。

  • GPT-Image-1:GPT-Image-1 是一個強大的通用影像生成模型,建立在早期 DALL-E 模型的基礎上。 它支援 文字對圖像生成、影像變化及精確的影像編輯。 它常用於創意應用、原型製作和視覺內容產生。 GPT-Image-1 在 Foundry 工具與 API 中廣泛支援,包括回應 API 與代理工具。

  • GPT-Image-1-Mini:GPT-Image-1-Mini 是 GPT-Image-1 的輕量化且更具成本效益的版本。 它支援相同的核心影像生成任務,但針對更重視低延遲或降低成本而非最大視覺真實度的情境進行優化。 此模型適合用於實驗、內部工具或大量影像生成。

所有這些影像生成模型都可以是:

  • 部署於 Foundry (Azure OpenAI) 資源中
  • 在「Foundry Playground」測試
  • 可透過 OpenAI 回應 API 或影像生成 API 進行程式化存取

備註

你也可以在 Foundry 中存取第三方影像生成模型。 例如, FLUX 是由 Black Forest Labs 創建的一系列開源影像生成模型。 它們設計用來從文字提示中產生高品質、照片級寫實且風格靈活的圖片。

Foundry 遊樂場中的圖像產生

你可以部署具備視覺功能的模型,並在 Foundry 入口遊樂場中測試。 要測試模型,你可以描述你想建立的影像。 幾分鐘後,會產生符合你描述的圖片。

Foundry 遊樂場中圖像產生的螢幕截圖。

Foundry 遊樂場程式碼範例截圖。

使用 OpenAI Python SDK 進行影像生成

你可以寫程式碼來建立一個應用程式,使用Azure OpenAI API的影像類別來生成影像。 OpenAI Python SDK 中的 OpenAI 影像類別允許你產生新影像並編輯現有影像。 你可以透過 Python 介面呼叫 OpenAI Images API 端點來使用 OpenAI Python SDK。

從描述動態生成原創圖片的能力,在媒體、出版及內容創作等情境中極具價值。

要使用 OpenAI Python SDK 生成圖片,你需要:

  • 鑄造廠資源
  • 已部署具備視覺‑處理能力的模型 (部署名稱為看起來像MODEL_NAME)
  • 透過 API 金鑰或 Microsoft Entra ID進行認證
  • 包含影像輸入(URL 或 base64 資料 URL)的 OpenAI 回應 API 呼叫

備註

Base64 指的是像影像是二進位(原始位元組)這樣的檔案。 JSON 和 URL 都是純文字。 Base64 編碼將二進位資料轉換為安全的 ASCII 文字,並允許將二進位檔案嵌入 JSON 或 URL。

例如,請考慮以下 Python 程式碼:

import os
import base64
from openai import OpenAI

# Required environment variables (example names)
FOUNDRY_KEY="..."
ENDPOINT="https://YOUR-RESOURCE-NAME.openai.azure.com/openai/v1/"
MODEL_NAME="your-gpt-image-deployment-name"  # e.g., "gpt-image-1"

client = OpenAI(
    api_key=os.environ["FOUNDRY_KEY"],
    base_url=os.environ["ENDPOINT"],
)

prompt = "A modern flat illustration of a robot holding a potted plant, clean vector style, pastel colors."

response = client.responses.create(
    model=os.environ["MODEL_NAME"],  # your deployment name in Foundry
    input=prompt,
    tools=[{"type": "image_generation"}],
)

image_base64 = next(
    item.result for item in response.output
    if item.type == "image_generation_call"
)

with open("foundry_generated.png", "wb") as f:
    f.write(base64.b64decode(image_base64))

print("Saved: foundry_generated.png")

接著,學習如何使用 Foundry 的影片生成模型。