Modellen voor het genereren van afbeeldingen
Tip
Zie het tabblad Tekst en afbeeldingen voor meer informatie.
Vision capable modellen koppelen vaak visuele informatie in een afbeelding aan de juiste bijbehorende tekst. Sommige modellen zijn ontworpen om dit proces omgekeerd uit te voeren en afbeeldingen te genereren die overeenkomen met tekstbeschrijvingen.
Modellen voor het genereren van afbeeldingen van Foundry gebruiken
Microsoft Foundry bevat modellen die ondersteuning bieden voor de deductie van tekst-naar-afbeelding, die u kunt gebruiken om visuele uitvoer te genereren.
Voor de meeste nieuwe projecten raadt Microsoft aan om te beginnen met de GPT-Image-1-familie, met name GPT-Image-1.5, vanwege de verbeterde kwaliteit, bewerkingsondersteuning en bedrijfsgereedheid.
Veelvoorkomende voorbeelden van modellen voor het genereren van afbeeldingen in Foundry zijn:
GPT-Image-1.5: GPT-Image-1.5 is het meest recente en meest geavanceerde model voor het genereren van afbeeldingen dat beschikbaar is in Microsoft Foundry. Het is ontworpen voor het maken en bewerken van hoogwaardige afbeeldingen van ondernemingskwaliteit, met sterke afstemming en verbeterde consistentie over iteraties heen. Het model ondersteunt tekst-naar-afbeelding, afbeelding-naar-afbeelding en nauwkeurige afbeeldingsbewerking, waardoor het goed geschikt is voor huisstijl-, marketing- en ontwerpwerkstromen waar de nauwkeurigheid van de visual van belang is.
GPT-Image-1: GPT-Image-1 is een krachtig model voor het genereren van afbeeldingen voor algemeen gebruik dat voortbouwt op de mogelijkheden van eerdere DALL-E modellen. Het biedt ondersteuning voor het genereren van tekst-naar-afbeelding, afbeeldingsvariaties en het nauwkeurig bewerken van afbeeldingen. Het wordt vaak gebruikt voor creatieve toepassingen, prototypen en het genereren van visuele inhoud. GPT-Image-1 wordt breed ondersteund in Foundry-hulpprogramma's en API's, waaronder de Response-API en agenthulpprogramma's.
GPT-Image-1-Mini: GPT-Image-1-Mini is een lichtere en rendabelere versie van GPT-Image-1. Het ondersteunt dezelfde kerntaken voor het genereren van afbeeldingen, maar is geoptimaliseerd voor scenario's waarbij lagere latentie of lagere kosten belangrijker zijn dan maximale visuele beeldkwaliteit. Dit model is een goede keuze voor experimenten, interne tools of het genereren van afbeeldingen met een hoog volume.
Al deze modellen voor het genereren van beelden kunnen zijn:
- Geïmplementeerd in een Foundry-resource (Azure OpenAI)
- Getest in de Foundry Playground
- Programmatisch toegankelijk met behulp van de Api voor openAI-antwoorden of api's voor het genereren van afbeeldingen
Opmerking
U hebt ook toegang tot modellen voor beeldgeneratie van derden in Foundry. Flux is bijvoorbeeld een serie opensource-modellen voor het genereren van afbeeldingen die zijn gemaakt door Black Forest Labs. Ze zijn ontworpen om hoogwaardige, fotorealistische en stijlflexibele afbeeldingen van tekstprompts te produceren.
Beeldgeneratie in de Foundry-speeltuin
U kunt een vision-ondersteund model implementeren en testen in de Foundry-portalomgeving. Als u het model wilt testen, kunt u de afbeelding beschrijven die u wilt maken. En na een paar minuten wordt er een afbeelding gegenereerd die overeenkomt met uw beschrijving.
De OpenAI Python SDK gebruiken voor het genereren van afbeeldingen
U kunt code schrijven om een toepassing te bouwen die gebruikmaakt van een model voor het genereren van afbeeldingen met de afbeeldingenklasse van de Azure OpenAI API. Met de Klasse OpenAI-installatiekopieën in de OpenAI Python SDK kunt u nieuwe installatiekopieën genereren en bestaande installatiekopieën bewerken. U kunt de OpenAI Python SDK gebruiken door het API-eindpunt voor OpenAI Images aan te roepen via een Python-interface.
De mogelijkheid om dynamisch originele afbeeldingen te genereren op basis van beschrijvingen kan enorm waardevol zijn in scenario's met media, publiceren en inhoud maken.
Om afbeeldingen te genereren met de OpenAI Python SDK, heeft u het volgende nodig:
- Een Foundry-resource
- Een voor vision geschikt model dat geïmplementeerd is (de implementatienaam is wat u doorgeeft als
MODEL_NAME) - Verificatie via API-sleutel of Microsoft Entra-id
- OpenAI-antwoorden-API-aanroepen die afbeeldingsinvoer (URL of base64-gegevens-URL) bevatten
Opmerking
Base64 verwijst naar bestanden zoals afbeeldingen die binair zijn (onbewerkte bytes). JSON en URL's zijn alleen tekst. Met Base64-codering worden binaire gegevens geconverteerd naar veilige ASCII-tekst, zodat binaire bestanden kunnen worden ingesloten in JSON of URL's.
Denk bijvoorbeeld aan de volgende Python-code:
import os
import base64
from openai import OpenAI
# Required environment variables (example names)
FOUNDRY_KEY="..."
ENDPOINT="https://YOUR-RESOURCE-NAME.openai.azure.com/openai/v1/"
MODEL_NAME="your-gpt-image-deployment-name" # e.g., "gpt-image-1"
client = OpenAI(
api_key=os.environ["FOUNDRY_KEY"],
base_url=os.environ["ENDPOINT"],
)
prompt = "A modern flat illustration of a robot holding a potted plant, clean vector style, pastel colors."
response = client.responses.create(
model=os.environ["MODEL_NAME"], # your deployment name in Foundry
input=prompt,
tools=[{"type": "image_generation"}],
)
image_base64 = next(
item.result for item in response.output
if item.type == "image_generation_call"
)
with open("foundry_generated.png", "wb") as f:
f.write(base64.b64decode(image_base64))
print("Saved: foundry_generated.png")
Leer vervolgens hoe u modellen voor het genereren van video's van Foundry gebruikt.