Modèle de génération d’images

Effectué

Tip

Pour plus d’informations, consultez l’onglet Texte et images !

Les modèles de vision associent souvent les informations visuelles d'une image à un texte correspondant. Certains modèles sont conçus pour effectuer ce processus en inverse, générant des images qui correspondent à des descriptions de texte.

Utilisation de modèles de génération d’images à partir de Foundry

Microsoft Foundry inclut des modèles qui prennent en charge l’inférence de texte à image, que vous pouvez utiliser pour générer une sortie visuelle.

Pour la plupart des nouveaux projets, Microsoft recommande de commencer par la famille GPT-Image-1, en particulier GPT-Image-1.5, en raison de sa qualité améliorée, de son support d’édition et de sa préparation à l’entreprise.

Voici quelques exemples courants de modèles de génération d’images dans Foundry :

  • GPT-Image-1.5 : GPT-Image-1.5 est le modèle de génération d’images le plus récent et le plus avancé disponible dans Microsoft Foundry. Il est conçu pour la création et la modification d'images haute fidélité, de qualité professionnelle, avec un alignement précis sur les requêtes et une cohérence améliorée d'une itération à l'autre. Le modèle prend en charge le texte à image, l’image à image et la modification précise de l’image, ce qui le rend bien adapté aux workflows de personnalisation, de marketing et de conception où la précision visuelle importe.

  • GPT-Image-1 : GPT-Image-1 est un modèle puissant de génération d’images à usage général qui s’appuie sur les fonctionnalités des modèles DALL-E antérieurs. Il prend en charge la génération de texte à image, les variations d’image et la modification précise de l’image. Il est couramment utilisé pour les applications créatives, le prototypage et la génération de contenu visuel. GPT-Image-1 est largement pris en charge dans les outils et API Foundry, y compris l’API Réponses et les outils d’agent.

  • GPT-Image-1-Mini : GPT-Image-1-Mini est une version plus légère et plus économique de GPT-Image-1. Il prend en charge les mêmes tâches de génération d’images principales, mais est optimisé pour les scénarios où une latence inférieure ou un coût réduit est plus important que la fidélité visuelle maximale. Ce modèle est un bon choix pour l’expérimentation, les outils internes ou la génération d’images à volume élevé.

Tous ces modèles de génération d’images peuvent être :

  • Déployé dans une ressource Foundry (Azure OpenAI)
  • Testé dans le terrain de jeu Foundry
  • Accessible par programmation à l’aide de l’API Réponses OpenAI ou des API de génération d’images

Note

Vous pouvez également accéder aux modèles de génération d’images tiers dans Foundry. Par exemple, FLUX est une famille de modèles de génération d’images open source créés par Black Forest Labs. Ils sont conçus pour produire des images de haute qualité, photoréalistes et flexibles sur le plan stylistique à partir de requêtes textuelles.

Génération d’images dans le terrain de jeu Foundry

Vous pouvez déployer un modèle compatible vision et le tester dans le terrain de jeu du portail Foundry. Pour tester le modèle, vous pouvez décrire l’image que vous souhaitez créer. Après quelques minutes, une image correspondant à votre description est générée.

Capture d’écran de la génération d’images dans le terrain de jeu Foundry.

Capture d’écran de l’exemple de code dans le terrain de jeu Foundry.

Utilisation du Kit de développement logiciel (SDK) Python OpenAI pour la génération d’images

Vous pouvez écrire du code pour créer une application qui utilise un modèle de génération d’images à l’aide de la classe d’images de l’API Azure OpenAI. La classe d’images OpenAI dans le Kit de développement logiciel (SDK) Python OpenAI vous permet de générer de nouvelles images et de modifier des images existantes. Vous pouvez utiliser le Kit de développement logiciel (SDK) Python OpenAI en appelant le point de terminaison de l’API Images OpenAI via une interface Python.

La possibilité de générer dynamiquement des images d’origine à partir de descriptions peut être extrêmement utile dans les scénarios qui incluent les médias, la publication et la création de contenu.

Pour générer des images avec le Kit de développement logiciel (SDK) Python OpenAI, vous avez besoin des éléments suivants :

  • Une ressource Foundry
  • Un modèle compatible avec la vision déployé (le nom du déploiement est ce que vous passez en tant que MODEL_NAME)
  • Authentification via la clé API ou l’ID Microsoft Entra
  • Appels d’API Réponses OpenAI qui incluent l’entrée d’image (URL ou URL de données base64)

Note

Base64 fait référence à des fichiers tels que des images sont binaires (octets bruts). JSON et URL sont du texte uniquement. L’encodage Base64 convertit les données binaires en texte ASCII sécurisé, permet aux fichiers binaires d’être incorporés à l’intérieur de JSON ou d’URL.

Par exemple, considérez le code Python suivant :

import os
import base64
from openai import OpenAI

# Required environment variables (example names)
FOUNDRY_KEY="..."
ENDPOINT="https://YOUR-RESOURCE-NAME.openai.azure.com/openai/v1/"
MODEL_NAME="your-gpt-image-deployment-name"  # e.g., "gpt-image-1"

client = OpenAI(
    api_key=os.environ["FOUNDRY_KEY"],
    base_url=os.environ["ENDPOINT"],
)

prompt = "A modern flat illustration of a robot holding a potted plant, clean vector style, pastel colors."

response = client.responses.create(
    model=os.environ["MODEL_NAME"],  # your deployment name in Foundry
    input=prompt,
    tools=[{"type": "image_generation"}],
)

image_base64 = next(
    item.result for item in response.output
    if item.type == "image_generation_call"
)

with open("foundry_generated.png", "wb") as f:
    f.write(base64.b64decode(image_base64))

print("Saved: foundry_generated.png")

Découvrez ensuite comment utiliser des modèles de génération vidéo à partir de Foundry.