Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Foundry Tools hjälper utvecklare och organisationer att skapa AI-baserade, avancerade, produktionsklara program som överensstämmer med ansvarsfulla AI-metoder med hjälp av färdiga, fördefinierade och anpassningsbara API:er och modeller.
Den här artikeln beskriver funktionerna för video- och bildbearbetning i Verktyg, till exempel visuell analys och generering av bilder, objektidentifiering, bildklassificering och ansiktsigenkänning. Sviten innehåller följande tjänster:
Azure OpenAI i Foundry Models ger åtkomst till följande OpenAI-språkmodeller:
Den senaste generationen GPT-modeller som har visions- och ljudfunktioner
DALL-E för bildgenerering
Ljudmodeller för röstkonversationer i realtid, ljudgenerering, tal-till-text-transkription (STT), översättning och text till tal (TTS)
Använd Azure OpenAI för bildgenerering från naturligt språk, bred och icke-specifik bildanalys eller ljudscenarier som inte kräver en dedikerad taltjänst.
Azure Vision i Foundry Tools tillhandahåller avancerade algoritmer som bearbetar bilder och returnerar information baserat på visuella funktioner. Den innehåller funktioner för optisk teckenigenkänning (OCR), bildanalys och ansiktsidentifiering.
Microsoft Azure AI Custom Vision är en tjänst för bildigenkänning som du kan använda för att skapa, distribuera och förbättra dina bildidentifierarmodeller för specifika krav som andra tjänster inte kan uppfylla.
Azure Content Understanding i Foundry Tools använder generativ AI för att extrahera strukturerade fält från bilder och video. Använd Azure Content Understanding när du behöver schemadefinierad extrahering, scensegmentering eller RAG-redo videoutdata (retrieval-augmented generation).
Microsoft Azure AI Video Indexer är en AI-lösning som organisationer kan använda för att extrahera djupa insikter från video- och ljudinnehåll. Den stöder både live- och uppladdade källor med hjälp av avancerade maskininlärnings- och generativa AI-modeller.
Azure OpenAI
Azure OpenAI ger åtkomst till OpenAI:s kraftfulla språkmodeller, inklusive den senaste generationen GPT-modeller som har bild-, video- och ljudfunktioner. DALL-E och GPT-bildgenereringsmodeller och ljudmodeller för röstkonversationer i realtid, ljudgenerering och transkription, STT, talöversättning och TTS finns också tillgängliga.
| Använd Azure OpenAI för dessa uppgifter | Använd inte Azure OpenAI för dessa uppgifter |
|---|---|
| Generera bilder från beskrivningar av naturligt språk med hjälp av DALL-E- eller GPT-bildmodeller. | Utför specifika bildbearbetningsuppgifter, till exempel extrahering av formulär eller domänspecialiserad identifiering. Använd Azure Document Intelligence för dessa uppgifter. |
| Gör bred, icke-specifik analys av bilder med hjälp av visionskompatibla modeller som GPT-4o. | Extrahera strukturerade fält från bilder med hjälp av ett schema som du definierar. För schemadriven extrahering använder du Azure Content Understanding. |
| Transkribera STT eller översätta talat ljud med hjälp av whisper- eller GPT-4o-transkriptionsmodeller. | Upptäcka, identifiera eller analysera mänskliga ansikten. För ansiktsrelaterade uppgifter använder du Azure Vision. |
| Aktivera röstkonversationer med låg latens i realtid med hjälp av GPT-4o Realtidsljudmodeller. | Utför talranskription med hög volym som behöver avancerad anpassning, talardiarisering eller anpassad vokabulär. I dessa scenarier använder du Azure Speech i Foundry Tools. |
| Generera hjälpmedelsbeskrivningar för bilder. | Använd modeller för bildgenerering med öppen källkod. För modeller med öppen källkod använder du Azure Machine Learning. |
Ljudmodeller
Azure OpenAI tillhandahåller ljudmodeller via följande API:er:
API:et för chattslutsättningar med ljud för flexibel ljudgenerering och transkription i ett enda modellanrop
Ljud-API:et
/audiovia slutpunkten för filbaserad STT-transkription i whisper- och GPT-4o-transkriptionsmodeller, talöversättning och TTS
Azure Vision
Azure Vision är en tjänst i Verktyg. Den innehåller avancerade algoritmer som bearbetar bilder och returnerar information baserat på de visuella funktioner som du anger. Azure Vision innehåller OCR, bildanalys och ansiktsidentifieringsfunktioner.
| Använda Azure Vision för dessa uppgifter | Använd inte Azure Vision för dessa uppgifter |
|---|---|
| Extrahera tryckt och handskriven text från bilder och dokument med ocr. | Utför avancerad videoanalys som transkription, översättning eller innehållssammanfattning. Använd Video Indexer för dessa uppgifter. |
| Analysera bilder för att extrahera visuella funktioner som objekt, ansikten och automatiskt genererade beskrivningar. | Måttligt innehåll för säkerhet. För innehållsmoderering använder du Content Safety i Foundry Control Plane. |
| Detektera, identifiera och analysera ansikten i bilder. | Gör en analys av stora, multimodala grundläggande modeller som redan stöds av GPT-4o. |
Tillgängliga Funktioner i Azure Vision
Följande tabell innehåller en lista över funktioner som är tillgängliga i Azure Vision.
| Feature | beskrivning |
|---|---|
| OCR | Extraherar text från bilder. Du kan använda Läs-API:et för att extrahera tryckt och handskriven text från foton och dokument. Den använder djupinlärningsbaserade modeller och fungerar med text på olika ytor och bakgrunder, inklusive affärsdokument, fakturor, kvitton, affischer, visitkort, brev och whiteboards. |
| Bildanalys | Extraherar många visuella funktioner från bilder, till exempel objekt, ansikten, vuxet innehåll och automatiskt genererade textbeskrivningar. Du kan skapa anpassade bildidentifierarmodeller med hjälp av Bildanalys 4.0 baserat på Grundmodellen i Florens. |
| Ansiktsigenkänning och analys | Identifierar regionerna i en bild som innehåller ett mänskligt ansikte, vanligtvis genom att returnera koordinater för avgränsningsrutor som bildar en rektangel runt ansiktet. |
| Hitta liknande ansikten | Matchar ett målet ansikte med en uppsättning kandidatansikten och identifierar en mindre grupp av ansikten som liknar målet ansikte. Den här funktionen är användbar för ansiktssökning efter bild. |
| Gruppansikten | Delar upp en uppsättning okända ansikten i flera mindre grupper baserat på likhet. |
| Ansiktsidentifiering | Utför "ett-till-många"-matchning av ett ansikte i en bild mot en uppsättning ansikten i ett säkert arkiv. Matchningskandidater returneras baserat på hur nära deras ansiktsinformation matchar frågeansiktet. |
| Ansiktsverifiering | En-till-en matchning utförs för att verifiera att en användare är den de utger sig för att vara. |
| Levande igenkänning | En funktion för förfalskningsskydd som kontrollerar om en användare är fysiskt närvarande framför kameran. Förhindrar förfalskningsattacker som använder ett tryckt foto, inspelad video eller en 3D-mask av användarens ansikte. |
Användningsfall för Azure Vision
Följande tabell innehåller en lista över möjliga användningsfall för Azure Vision.
| Användningsfall | beskrivning |
|---|---|
| Generera alternativ bildtext (alternativ text) | Använd bildanalysmodeller för bildtextning för att automatiskt generera alt texter för bilder. Alternativtext förbättrar tillgängligheten för användare som är blinda eller har nedsatt syn, hjälper till att uppfylla kraven på juridisk efterlevnad och gör din webbplats mer identifierbar genom förbättrad SEO. Microsoft-produkter som PowerPoint, Word och Edge använder den här funktionen. |
| Identitetsverifiering | Använd Azure Face för att bekräfta att användarna är de som de påstår sig vara. Verifiering jämför en provbild med en registrerad mall, till exempel ett myndighets-utfärdat ID, för åtkomstkontrollscenarion. Den här metoden hjälper till att förbättra användarupplevelsen och säkerheten jämfört med kunskapsbaserade metoder. |
| Ansiktsredigering | Redigera eller sudda ut identifierade ansikten på personer som spelats in i en video för att skydda deras integritet. |
| Beröringsfri åtkomstkontroll | Använd opt-in ansiktsidentifiering för förbättrad åtkomstkontroll samtidigt som du minskar underhålls- och säkerhetsriskerna med fysisk mediedelning, förlust eller stöld. Ansiktsigenkänning underlättar incheckningsprocessen med mänsklig övervakning för incheckning på flygplatser, arenor, nöjesparker; i byggnader, receptionskiosker på kontor, sjukhus, gym, klubbar eller skolor. |
Custom Vision-tjänsten
Custom Vision är en tjänst för bildigenkänning som du kan använda för att skapa, distribuera och förbättra dina bildidentifierarmodeller. En bildidentifierare tillämpar etiketter på bilder baserat på deras visuella egenskaper. Varje etikett representerar en klassificering eller ett objekt. Använd Custom Vision för att ange egna etiketter och träna anpassade modeller för att identifiera dem.
| Använd Custom Vision för dessa uppgifter | Använd inte Custom Vision för dessa uppgifter |
|---|---|
| Identifiera ovanliga objekt och tillverkningsfel som standardavbildningsanalysen inte kan identifiera. | Gör grundläggande objektidentifiering eller ansiktsidentifiering. Använd Azure Vision i stället. |
| Ange detaljerade anpassade klassificeringar för specifika affärskrav. | Utför grundläggande visuell analys. Använd visionskompatibla modeller från Azure OpenAI eller modeller med öppen källkod i strojové učenie i stället. |
| Träna modeller med egna etiketterade bilder för specialiserade scenarier. |
Custom Vision använder en maskininlärningsalgoritm för att analysera bilder för anpassade funktioner. Du skickar uppsättningar med bilder med och utan de visuella egenskaper som du vill ha. Sedan etiketterar du bilderna med egna etiketter eller taggar när de skickas in. Algoritmen använder dessa data för att träna och beräkna sin egen noggrannhet genom att testa sig själv på samma bilder. När du har tränat din modell kan du testa, träna om och så småningom använda modellen i bildigenkänningsappen för att klassificera bilder eller identifiera objekt. Du kan också exportera modellen för offlineanvändning.
Tillgängliga Custom Vision-funktioner
Följande tabell innehåller en lista över funktioner som är tillgängliga i Custom Vision.
| Feature | beskrivning |
|---|---|
| Bildklassificering | Förutsäga en kategori, eller klass, baserat på en uppsättning indata, som kallas funktioner. Beräkna en sannolikhetspoäng för varje möjlig klass och returnera en etikett som anger vilken klass objektet troligen tillhör. För att använda den här modellen behöver du data som består av funktioner och deras etiketter. |
| Objektigenkänning | Hämta koordinaterna för ett objekt i en bild. För att använda den här modellen behöver du data som består av funktioner och deras etiketter. |
Användningsfall för Custom Vision
Följande tabell innehåller en lista över möjliga användningsfall för Custom Vision.
| Användningsfall | beskrivning |
|---|---|
| Använd Custom Vision med en IoT-enhet (Internet of things) för att rapportera visuella tillstånd. | Använd Custom Vision för att träna en enhet som har en kamera för att identifiera visuella tillstånd. Du kan köra det här identifieringsscenariot på en IoT-enhet med hjälp av en exporterad ONNX-modell. Ett visuellt tillstånd beskriver innehållet i en bild, till exempel ett tomt rum, ett rum med personer, en tom uppfart eller en uppfart med en lastbil. |
| Klassificera bilder och objekt. | Analysera foton och sök efter specifika logotyper genom att träna en anpassad modell. |
Azure Innehållsförståelse
Azure Content Understanding är en tjänst i Verktyg. Den använder generativ AI för att extrahera strukturerade fält från bilder och video. Du definierar ett schema som anger vad som ska extraheras, och Azure Content Understanding tillämpar generativa modeller för att producera strukturerade JSON- eller RAG-klara Markdown-utdata. Det ger också förtroendepoäng och grund för varje extraherat värde, som stöder automatiserade arbetsflöden med riktad mänsklig granskning.
| Använda Azure Content Understanding för dessa uppgifter | Använd inte Azure Content Understanding för dessa uppgifter |
|---|---|
| Extrahera anpassade strukturerade fält från bilder med hjälp av ett schema som du definierar, till exempel produkt, varumärke eller defekt identifiering. | Utför standardbildanalys, till exempel objektidentifiering eller OCR. Använd Azure Vision för dessa uppgifter. |
| Generera resultat redo för RAG från video, inklusive scenbeskrivningar, transkriptioner och nyckelramar, för användning i sökindex eller chattrobottar. | Extrahera djupa videoinsikter, till exempel kändisidentifiering, talaruppräkning eller attitydanalys i långformatsinnehåll. Använd Video Indexer för dessa uppgifter. |
| Segmentera video i scener och extrahera anpassade metadata för varje segment, till exempel varumärkesnärvaro eller annonskategori. | |
| Generera ansiktsbeskrivningar i bilder eller video, till exempel ansiktsuttryck eller kändisidentifiering. Dessa funktioner har begränsad åtkomst. |
Tillgängliga Funktioner för Azure Content Understanding
Följande tabell innehåller en lista över bild- och videofunktioner som är tillgängliga i Azure Content Understanding.
| Feature | beskrivning |
|---|---|
| Extrahering av bildfält | Extraherar anpassade strukturerade fält från bilder baserat på ett schema som du definierar. Du kan extrahera fält direkt, klassificera dem från en uppsättning kategorier eller generera dem med hjälp av en generativ modell. Den här funktionen är användbar för butikshyllanalys, kvalitetskontroll för tillverkning och diagrambaserad business intelligence (BI). |
| Extrahering av nyckelramar | Extraherar representativa nyckelramar från varje bild i en video. Säkerställer att varje segment har tillräcklig visuell kontext för nedströms fältextrahering. |
| Bildidentifiering | Identifierar klippgränser i en video baserat på visuella signaler. Skapar en lista över tidsstämplar för exakt redigering, omformatering och segmentering. |
| Scensegmentering | Delar upp en video i logiska scener som beskrivs i naturligt språk. Du definierar segmenteringslogik, till exempel att dela upp en nyhetssändning efter artikelämne, och den generativa modellen skapar matchande segment. |
| Extrahering av videofält | Genererar anpassade strukturerade fält för varje videosegment baserat på ett schema, till exempel varumärkeslogotyper, annonskategorier eller scensentiment, med hjälp av en generativ modell. |
| Ansiktsbeskrivning | Genererar textbeskrivningar av ansikten i bilder eller video, inklusive ansiktshår, uttryck och kändisidentifiering. Ansiktsbeskrivning är en funktion med begränsad åtkomst som kräver att du inaktiverar ansiktsoskärpa i analyssystemkonfigurationen. |
Användningsfall för Azure Content Understanding
Följande tabell innehåller en lista över möjliga användningsfall för Azure Content Understanding som tillämpas på bilder och video.
| Användningsfall | beskrivning |
|---|---|
| RAG på video | Generera RAG-klart Markdown från videofiler, inklusive infogade transkriptioner, miniatyrbilder av nyckelramar och beskrivningar av segment i naturligt språk. Placera utdata direkt i ett vektorlager för att tillåta agent- eller sökarbetsflöden utan efterbearbetning. |
| Hantering av medietillgångar | Tagga videotillgångar med metadata på scennivå som innehållskategori, varumärkesnärvaro och viktiga ögonblick. Den här metoden hjälper redigerare, producenter och marknadsföringsteam att organisera och hämta innehåll från stora videobibliotek. |
| Kvalitetskontroll för tillverkning | Analysera produktbilder mot ett anpassat schema för att identifiera defekter, avvikelser eller feljusteringar i produktionslinjer. |
| Detaljhandelshyllaanalys | Extrahera strukturerade data från hyllbilder för att räkna produkter, identifiera felplaceringar och övervaka lagernivåer. |
| Annons- och varumärkesanalys | Identifiera varumärkeslogotyper och annonskategorier i marknadsföringsvideosegment för att utvärdera varumärkesexponering och efterlevnad av varumärkesriktlinjer. |
Videoindexerare
Video Indexer är en AI-lösning som organisationer kan använda för att extrahera djupa insikter från live- och uppladdat video- och ljudinnehåll. Den använder avancerade maskininlärnings- och generativa AI-modeller och stöder en mängd olika funktioner, inklusive transkription, översättning, objektidentifiering och videosammanfattning. Video Indexer är flexibelt. Du kan använda den i molnet eller distribuera den till gränsplatser via Azure Arc.
| Använd Video Indexer för dessa uppgifter | Använd inte Video Indexer för dessa uppgifter |
|---|---|
| Extrahera insikter från uppladdade videor, inklusive transkription, översättning och innehållsanalys. | Utför grundläggande videoanalysuppgifter som personräkning och rörelseidentifiering. Azure Vision är ett mer kostnadseffektivt verktyg för dessa uppgifter. |
| Analysera livevideoströmmar i realtid för detaljhandels-, tillverknings- eller säkerhetsscenarier. | Extrahera text från statiska bilder. För OCR på bilder använder du Azure Vision. |
| Kör videoanalys på gränsenheter som har strikta krav på datahemvist eller låg latens med hjälp av Azure Arc. |
Implementeringsalternativ
Video Indexer innehåller följande distributionsalternativ.
| Option | beskrivning |
|---|---|
| Molnbaserad videoindexerare | Ett molnprogram som bygger på verktyg, inklusive Azure Face, Azure Translator i Foundry Tools, Azure Vision och Azure Speech. Den analyserar video- och ljudinnehåll genom att köra fler än 30 AI-modeller för att generera detaljerade insikter. |
| Video Indexer aktiverat av Azure Arc | Ett Azure Arc-tillägg som kör video- och ljudanalys och generativ AI på gränsenheter. Det stöder både uppladdade och live videoströmmar, vilket möjliggör realtidsanalys direkt vid datakällan. Den passar branscher som har strikta krav på datahemvist eller driftsbehov med låg latens. |
Videomodeller
Följande tabell innehåller en lista över videoanalysfunktioner som är tillgängliga i Video Indexer.
| Feature | beskrivning |
|---|---|
| Ansiktsigenkänning | Identifierar och grupperar ansikten som visas i en video. |
| Kontobaserad ansiktsidentifiering | Tränar en modell för ett specifikt konto och identifierar ansikten i videor baserat på den tränade modellen. |
| Identifiering av observerade personer | Identifierar observerade personer i videor och tillhandahåller platsinformation med hjälp av avgränsningsrutor, med exakta tidsstämplar och konfidensnivåer. Innehåller matchade personer, identifierade kläder och utvalda klädinsikter. |
| Objektigenkänning | Identifierar och spårar unika objekt så att de kan identifieras om de återgår till ramen. |
| OCR | Extraherar text från bilder som bilder, gatuskyltar och produkter i mediefiler för att skapa insikter. |
| Identifiering av etiketter | Identifierar visuella objekt och åtgärder som visas. |
| Scensegmentering | Avgör när en scen ändras i video baserat på visuella tips. En scen visar en enda händelse som består av en serie på varandra följande bilder. |
| Bildidentifiering | Avgör när en bild ändras i video baserat på visuella tips. Ett skott är en serie ramar tagna från samma filmkamera. |
| Extrahering av nyckelramar | Identifierar stabila nyckelramar i en video. |
| Skifferidentifiering | Identifierar insikter om film efterproduktion, inklusive klappbrädsidentifiering, identifiering av digitala mönster och textlös filmskyltsidentifiering. |
Ljudmodeller
Följande tabell innehåller en lista över ljudanalysfunktioner som är tillgängliga i Video Indexer.
| Feature | beskrivning |
|---|---|
| Ljudavskrift | Konverterar STT på fler än 50 språk och stöder tillägg. |
| Automatisk språkidentifiering | Identifierar det dominerande talade språket. |
| Talidentifiering med flera språk | Identifierar det talade språket i olika segment av ljud, skickar varje segment som ska transkriberas och kombinerar dem till en enhetlig transkription. |
| Undertextning | Skapar undertextning i WebVTT-format (Web Video Text Tracks), TTML (Timed Text Markup Language) och SubRip Subtitle (SRT). |
| Bearbetning med två kanaler | Identifierar separata avskrifter automatiskt och sammanfogar dem till en enda tidslinje. |
| Brusreducering | Rensar telefoniljud eller bullriga inspelningar baserat på Skype-filter. |
| Talaruppräkning | Mappar och förstår vilken talare som talade vilka ord och när. Den kan identifiera 16 högtalare i en enda ljudfil. |
| Översättning | Skapar översättningar av ljudavskriften på många olika språk. |
| Identifiering av ljudeffekter | Identifierar ljudeffekter i nonspeech-segment, inklusive larm eller sirener, en hund som skäller, publikreaktioner, höga slagljud, skratt, krossat glas och tystnad. |
Kombinerade ljud- och videomodeller
Följande funktioner analyserar ljud- och videoinnehåll.
| Feature | beskrivning |
|---|---|
| Nyckelordsextraktion | Extraherar nyckelord från tal- och visuell text |
| Extrahering av namngivna entiteter | Extraherar varumärken, platser och personer från tal- och visuell text via bearbetning av naturligt språk (NLP) |
| Ämnesslutsats | Extraherar ämnen baserade på olika nyckelord med hjälp av International Press Telecommunications Council (IPTC), Wikipedia och Video Indexer hierarkisk ämnes ontologi |
| Känsloanalys | Identifierar positiva, negativa och neutrala sentiment från tal- och visuell text |
Mer information finns i Översikt över Video Indexer.
Användningsfall för molnbaserad Video Indexer
Följande tabell innehåller en lista över möjliga användningsfall för molnbaserad Video Indexer.
| Användningsfall | beskrivning |
|---|---|
| Djupsökning | Förbättra sökupplevelsen i ett videobibliotek med hjälp av de insikter som Video Indexer extraherar. När du till exempel indexar talade ord och ansikten kan användarna hitta ögonblick i en video när en person talar specifika ord eller när två personer ses tillsammans. Dessa användningsfall gäller för alla branscher som har ett videobibliotek som användarna behöver söka i, inklusive nyhetsbyråer, utbildningsinstitut, programföretag, ägare av underhållningsinnehåll och verksamhetsspecifika appar (LOB). |
| Innehållsskapande | Skapa trailers, höjdpunktsvideor, material för sociala medier eller nyhetsklipp baserat på de insikter som Video Indexer extraherar från ditt innehåll. Nyckelramar, scenmarkörer och tidsstämplar för personer och etikettutseenden förenklar skapandeprocessen. |
| Tillgänglighet | Gör ditt innehåll tillgängligt för personer med funktionshinder eller distribuera innehåll till regioner som använder olika språk med hjälp av de transkriptions- och översättningsfunktioner som Video Indexer tillhandahåller. |
| Skapa intäkter | Öka värdet för videor. Branscher som förlitar sig på annonsintäkter, till exempel nyhetsmedier och sociala medier, kan leverera relevanta annonser genom att använda de extraherade insikterna som extra signaler till annonsservern. |
| Innehållsmoderering | Skydda användarna från olämpligt innehåll och bekräfta att innehållet som du publicerar matchar organisationens värden med hjälp av modeller för textmoderering och visuell innehållsmoderering. |
| Rekommendationer | Förbättra användarengagemanget genom att markera relevanta videoögonblick för användare. Genom att tagga varje video med extra metadata kan du rekommendera de mest relevanta videorna och markera de delar som matchar användarnas behov. |
Användningsfall för Video Indexer aktiverat av Azure Arc
Följande tabell innehåller en lista över möjliga användningsfall för Video Indexer som aktiveras av Azure Arc.
| Användningsfall | beskrivning |
|---|---|
| Detaljhandel | Optimera butikslayouter och förbättra kundupplevelsen och säkerheten. Övervaka antalet kunder i utcheckningslinjer i realtid för att optimera bemanningen och minska väntetiderna. |
| Tillverkning | Säkerställ kvalitetskontroll och arbetarsäkerhet genom videoanalys. Identifiera arbetare som inte bär skyddsutrustning med realtidsidentifiering av kritiska händelser. |
| Modern säkerhet | Identifiera och upptäck säkerhets- och trygghetsproblem innan de medför en risk. |
| Dataförvaltning | Ta AI till innehållet. Använd Video Indexer aktiverat av Arc när du inte kan flytta indexerat innehåll från lokalt till molnet på grund av regler, arkitekturbeslut eller stora datalager. |
| Förindexering | Indexering av innehåll innan du laddar upp det till molnet. Försortera ditt lokala video- eller ljudarkiv och ladda sedan bara upp det för standardindexering eller avancerad indexering i molnet. |