Sammanfattning

Slutförd

Tip

Mer information finns på fliken Text och bilder !

I den här modulen utforskade vi visionskompatibla modeller i Microsoft Foundry och hur du använder dem för att analysera bilder och generera originalbilder och videor.

Modulen omfattade multimodala modeller som stöder bildanalys. Vi har även gått igenom modeller för bildgenerering, till exempel de i GPT-Image-familjen, för att skapa och redigera bilder från prompter med hjälp av Foundry-verktyg och API:er. Slutligen introducerade vi videogenerering med Sora-modeller, som möjliggör text-till-video- och bild-till-video-skapande via både interaktiva lekplatser och programmatiska, asynkrona REST-arbetsflöden.

Överlag hjälper visuella AI-modeller i Microsoft Foundry till att överbrygga klyftan mellan visuella data och språkbaserad AI. De möjliggör scenarier som dokument- och bildanalys, visuella assistenter, hjälpmedelsverktyg och multimodala AI-agenter – vilket gör bildtolkning till en naturlig förlängning av moderna AI-program.

Mer information finns på följande länkar: