Sammanfattning
Tip
Mer information finns på fliken Text och bilder !
I den här modulen introduceras taligenkänning (tal till text) som grund för röstaktiverade program och agenter. Eleverna utforskar hur talat ljud samlas in från en mikrofon eller ljudfil och konverteras till skriftlig text med Hjälp av Azure Speech. Modulen förklarar var tal till text passar i ett program – antingen i en klientapp eller en serverdelstjänst – och belyser vanliga scenarier som live-transkription, bildtexter, röstbrevlådebearbetning och textinmatning till AI-agenter.
Modulen beskriver sedan talsyntes (text-till-tal), som gör det möjligt för program att generera naturligt klingande talat ljud från text. Eleverna ser hur Azure Speech använder neurala röster för att styra uttal, ton, hastighet och tonhöjd och hur syntetiserat ljud kan spelas upp omedelbart eller sparas för senare användning. Det här avsnittet betonar hur text-till-tal gör att program och agenter kan svara hörbart, förbättra tillgängligheten, handsfree-interaktionen och den övergripande användarupplevelsen.
Slutligen sammanför modulen dessa funktioner med tal-till-tal-teknik genom Voice Live. Eleverna upptäcker hur Voice Live kombinerar tal till text, AI-resonemang och text-till-tal till en enda, fullständigt hanterad tjänst för realtidskonversationer. I stället för att sammanfoga flera komponenter kan utvecklare använda Voice Live för att skapa dynamiska, naturliga röstagenter som kan lyssna, tänka och tala , vilket gör det enklare att skapa produktionsklara konversationsupplevelser med Azure Speech och Microsoft Foundry.
Använd länkarna nedan om du vill veta mer.
- Azure Speech i tjänstdokumentationen
- Läs mer om Azure Speechs SDK:er (Software Development Kits)
- Läs mer om Azure Speech – Voice Live i dokumentationen