Modele generowania obrazów

Ukończone

Wskazówka

Aby uzyskać więcej szczegółów, zobacz kartę Tekst i obrazy .

Modele przetwarzające obrazy często dopasowują informacje wizualne w obrazie do odpowiedniego tekstu. Niektóre modele zostały zaprojektowane tak, aby wykonać ten proces w odwrotnej kolejności, generując obrazy odpowiadające opisom tekstu.

Używanie modeli generowania obrazów z rozwiązania Foundry

Rozwiązanie Microsoft Foundry zawiera modele, które obsługują przekształcanie tekstu na obraz, których można użyć do generowania danych wyjściowych w formie wizualnej.

W przypadku większości nowych projektów firma Microsoft zaleca rozpoczęcie od rodziny GPT-Image-1, zwłaszcza GPT-Image-1.5, ze względu na lepszą jakość, obsługę edycji i gotowość przedsiębiorstwa.

Typowe przykłady modeli generowania obrazów w narzędziu Foundry obejmują:

  • GPT-Image-1.5: GPT-Image-1.5 to najnowszy i najbardziej zaawansowany model generowania obrazów dostępny w usłudze Microsoft Foundry. Służy do tworzenia i edytowania obrazów o wysokiej wierności klasy korporacyjnej, zapewniając silne dopasowanie ciągów poleceń i lepszą spójność między iteracjami. Model obsługuje tekst-obraz, obraz do obrazu i precyzyjne edytowanie obrazów, dzięki czemu nadaje się do znakowania, marketingu i projektowania przepływów pracy, w których dokładność wizualizacji ma znaczenie.

  • GPT-Image-1: GPT-Image-1 to zaawansowany model generowania obrazów ogólnego przeznaczenia, który opiera się na możliwościach wcześniejszych modeli DALL-E. Obsługuje generowanie tekstu do obrazu, odmiany obrazów i precyzyjne edytowanie obrazów. Jest ona często używana do tworzenia kreatywnych aplikacji, tworzenia prototypów i generowania zawartości wizualnej. GPT-Image-1 jest powszechnie obsługiwany w narzędziach i interfejsie API Foundry, w tym w Responses API i narzędziach agenta.

  • GPT-Image-1-Mini: GPT-Image-1-Mini to lżejsza i bardziej opłacalna wersja GPT-Image-1. Obsługuje on te same podstawowe zadania generowania obrazów, ale jest zoptymalizowany pod kątem scenariuszy, w których mniejsze opóźnienia lub obniżony koszt jest ważniejszy niż maksymalna dokładność wizualizacji. Ten model jest dobrym wyborem w przypadku eksperymentowania, narzędzi wewnętrznych lub generowania obrazów o dużej ilości.

Wszystkie te modele generowania obrazów mogą być następujące:

  • Wdrożone w zasobie rozwiązania Foundry (Azure OpenAI)
  • Przetestowane w Foundry Playground
  • Dostęp programowy za pomocą interfejsu API OpenAI Responses lub interfejsów API do generowania obrazów

Uwaga / Notatka

Możesz również uzyskać dostęp do modeli generowania obrazów innych firm w narzędziu Foundry. Na przykład FLUX to rodzina modeli generowania obrazów typu open source utworzonych przez black forest labs. Są one przeznaczone do tworzenia wysokiej jakości, fotorealistycznych i stylistycznie elastycznych obrazów z monitów tekstowych.

Generowanie obrazu w Foundry playground

Model z obsługą przetwarzania obrazów można wdrożyć i przetestować go na placu zabaw portalu Foundry. Aby przetestować model, możesz opisać obraz, który chcesz utworzyć. Po kilku minutach zostanie wygenerowany obraz pasujący do opisu.

Zrzut ekranu przedstawiający generowanie obrazu na placu zabaw z narzędziem Foundry.

Zrzut ekranu przedstawiający przykład kodu na placu zabaw z narzędziem Foundry.

Używanie zestawu SDK języka Python openAI na potrzeby generowania obrazów

Możesz napisać kod w celu utworzenia aplikacji korzystającej z modelu generowania obrazów przy użyciu klasy obrazów interfejsu API usługi Azure OpenAI. Klasa Obrazów OpenAI w zestawie SDK języka Python openAI umożliwia generowanie nowych obrazów i edytowanie istniejących obrazów. Można użyć OpenAI Python SDK, wywołując punkt końcowy OpenAI Images API za pośrednictwem interfejsu języka Python.

Możliwość dynamicznego generowania oryginalnych obrazów na podstawie opisów może być niezwykle cenna w scenariuszach obejmujących multimedia, publikowanie i tworzenie zawartości.

Aby wygenerować obrazy przy użyciu zestawu SDK języka Python openAI, potrzebne są następujące elementy:

  • Zasób odlewni
  • Wdrożony model z obsługą przetwarzania obrazów (nazwa wdrożenia jest przekazywana jako MODEL_NAME)
  • Uwierzytelnianie za pomocą klucza API lub Microsoft Entra ID
  • Wywołania API Odpowiedzi OpenAI zawierające obraz jako dane wejściowe (adres URL lub dane w formacie base64)

Uwaga / Notatka

Base64 odnosi się do plików, takich jak obrazy, które są w postaci binarnej (nieprzetworzone bajty). Pliki JSON i adresy URL są tylko tekstem. Kodowanie Base64 konwertuje dane binarne na bezpieczny tekst ASCII, umożliwia osadzanie plików binarnych w formacie JSON lub adresach URL.

Rozważmy na przykład następujący kod w języku Python:

import os
import base64
from openai import OpenAI

# Required environment variables (example names)
FOUNDRY_KEY="..."
ENDPOINT="https://YOUR-RESOURCE-NAME.openai.azure.com/openai/v1/"
MODEL_NAME="your-gpt-image-deployment-name"  # e.g., "gpt-image-1"

client = OpenAI(
    api_key=os.environ["FOUNDRY_KEY"],
    base_url=os.environ["ENDPOINT"],
)

prompt = "A modern flat illustration of a robot holding a potted plant, clean vector style, pastel colors."

response = client.responses.create(
    model=os.environ["MODEL_NAME"],  # your deployment name in Foundry
    input=prompt,
    tools=[{"type": "image_generation"}],
)

image_base64 = next(
    item.result for item in response.output
    if item.type == "image_generation_call"
)

with open("foundry_generated.png", "wb") as f:
    f.write(base64.b64decode(image_base64))

print("Saved: foundry_generated.png")

Następnie dowiedz się, jak używać modeli generowania wideo z witryny Foundry.