Modeller för bildgenerering

Slutförd

Tip

Mer information finns på fliken Text och bilder !

Visionskompatibla modeller matchar ofta visuell information i en bild med lämplig motsvarande text. Vissa modeller är utformade för att utföra den här processen omvänt och generera bilder som motsvarar textbeskrivningar.

Använda bildgenereringsmodeller från Foundry

Microsoft Foundry innehåller modeller som stöder text-till-bild-slutsatsdragning, som du kan använda för att generera visuella utdata.

För de flesta nya projekt rekommenderar Microsoft att du börjar med GPT-Image-1-familjen, särskilt GPT-Image-1.5, på grund av dess förbättrade kvalitet, redigeringsstöd och företagsberedskap.

Vanliga exempel på bildgenereringsmodeller i Foundry är:

  • GPT-Image-1.5: GPT-Image-1.5 är den senaste och mest avancerade bildgenereringsmodellen som finns i Microsoft Foundry. Den är utformad för hög återgivning, skapande och redigering av avbildningar i företagsklass, med stark snabbjustering och förbättrad konsekvens mellan iterationer. Modellen stöder text-till-bild, bild-till-bild och exakt bildredigering, vilket gör den väl lämpad för varumärkes-, marknadsförings- och designarbetsflöden där visuell noggrannhet är viktig.

  • GPT-Image-1: GPT-Image-1 är en kraftfull, generell modell för bildgenerering som bygger på funktionerna i tidigare DALL-E modeller. Den stöder text-till-bild-generering, bildvariationer och exakt bildredigering. Det används ofta för kreativa program, prototyper och generering av visuellt innehåll. GPT-Image-1 stöds i stor utsträckning i Foundry-verktyg och API:er, inklusive API:et för svar och agentverktyg.

  • GPT-Image-1-Mini: GPT-Image-1-Mini är en lättare och mer kostnadseffektiv version av GPT-Image-1. Den stöder samma kärnuppgifter för bildgenerering men är optimerad för scenarier där lägre svarstid eller lägre kostnad är viktigare än maximal visuell återgivning. Den här modellen är ett bra val för experimentering, interna verktyg eller bildgenerering med stora volymer.

Alla dessa bildgenereringsmodeller kan vara:

  • Distribuerad i en Azure OpenAI Foundry-resurs
  • Testad i Foundry Playground
  • Används programmatiskt med hjälp av API:et för OpenAI-svar eller API:er för bildgenerering

Anmärkning

Du kan också komma åt bildgenereringsmodeller från tredje part i Foundry. FLUX är till exempel en familj av bildgenereringsmodeller med öppen källkod som skapats av Black Forest Labs. De är utformade för att producera högkvalitativa, fotorealistiska och stilistiskt flexibla bilder från textprompter.

Bildgenerering i Foundry Playground

Du kan distribuera en visionsaktiverad modell och testa den i Foundry-portalens lekplats. Om du vill testa modellen kan du beskriva den bild som du vill skapa. Och efter några minuter genereras en bild som matchar beskrivningen.

Skärmbild av bildgenerering i Foundry Playground.

Skärmbild av kodexemplet i Foundry Playground.

Använda OpenAI Python SDK för avbildningsgenerering

Du kan skriva kod för att skapa ett program som använder en bildgenereringsmodell med hjälp av Azure OpenAI API:s avbildningsklass. Med klassen OpenAI-avbildningar i OpenAI Python SDK kan du generera nya bilder och redigera befintliga bilder. Du kan använda OpenAI Python SDK genom att anropa OPENAI Images API-slutpunkten via ett Python-gränssnitt.

Möjligheten att dynamiskt generera originalbilder från beskrivningar kan vara oerhört värdefull i scenarier som omfattar skapande av media, publicering och innehåll.

Om du vill generera avbildningar med OpenAI Python SDK behöver du:

  • en Foundry-resurs
  • En visionskompatibel modell distribuerad (distributionsnamnet är det du skickar som MODEL_NAME)
  • Autentisering via API-nyckel eller Microsoft Entra-ID
  • Api-anrop för OpenAI-svar som innehåller bildindata (URL eller base64-data-URL)

Anmärkning

Base64 refererar till hur filer som bilder, som är binära (rådata), hanteras. JSON och URL:er är endast text. Base64-kodning konverterar binära data till säker ASCII-text, tillåter att binära filer bäddas in i JSON eller URL:er.

Tänk till exempel på följande Python-kod:

import os
import base64
from openai import OpenAI

# Required environment variables (example names)
FOUNDRY_KEY="..."
ENDPOINT="https://YOUR-RESOURCE-NAME.openai.azure.com/openai/v1/"
MODEL_NAME="your-gpt-image-deployment-name"  # e.g., "gpt-image-1"

client = OpenAI(
    api_key=os.environ["FOUNDRY_KEY"],
    base_url=os.environ["ENDPOINT"],
)

prompt = "A modern flat illustration of a robot holding a potted plant, clean vector style, pastel colors."

response = client.responses.create(
    model=os.environ["MODEL_NAME"],  # your deployment name in Foundry
    input=prompt,
    tools=[{"type": "image_generation"}],
)

image_base64 = next(
    item.result for item in response.output
    if item.type == "image_generation_call"
)

with open("foundry_generated.png", "wb") as f:
    f.write(base64.b64decode(image_base64))

print("Saved: foundry_generated.png")

Lär dig sedan hur du använder videogenereringsmodeller från Foundry.