Introduction

Slutförd

Med AI-talfunktioner kan vi hantera system med röstinstruktioner, få svar från datorer för talade frågor, generera bildtexter från ljud och mycket mer. Röstbaserade gränssnitt ger ett mer naturligt sätt att interagera med AI-programvara. Möjligheten att interagera via talat språk kan öka tillgängligheten och inkluderingen för program och agenter.

För att aktivera den här typen av interaktion måste AI-systemet ha stöd för minst två funktioner:

  • Taligenkänning: möjligheten att identifiera och tolka talade indata
  • Talsyntes: möjligheten att generera talade utdata

Exempel på dessa funktioner är:

  • Klinisk diktering och anteckningar inom hälso- och sjukvården: Läkare kan säga patientanteckningar högt under eller efter möten. En AI-talapp omvandlar ljudet till korrekt medicinsk text, vilket minskar manuell skrivning och sparar tid.

  • Samtalstranskription i kundsupport: Kontaktcenter transkriberar kundsamtal i realtid, vilket gör det enklare att granska konversationer, identifiera problem och analysera sentiment.

  • Automatiserad textning i media och underhållning: Videoplattformar genererar live- eller inspelade bildtexter för shower och strömmar, vilket förbättrar tillgängligheten och stöder flerspråkiga målgrupper.

  • Feedback om språkinlärning och uttal i utbildning: Utbildningsappar använder AI-talfunktioner för att lyssna på elevernas tal och ge uttalsfeedback, hjälpa eleverna att öva och förbättra kunskaper i talat språk.

  • Röstaktiverade assistenter inom detaljhandel och e-handel: Virtuella shoppingassistenter använder taligenkänning för att förstå talade kundförfrågningar och text-till-tal för att svara med produktinformation eller orderstatus.

Azure Speech i Microsoft Foundry Tools tillhandahåller funktioner för tal till text, text till tal och talöversättning via taligenkänning och syntes. Du kan använda fördefinierade och anpassade Speech Service-modeller för en mängd olika uppgifter, från transkribering av ljud till text med hög noggrannhet, till att identifiera talare i konversationer, skapa anpassade röster med mera. Lär dig sedan hur du införlivar taligenkänning i ett program med Azure Speech.

Anmärkning

Vi inser att olika personer gillar att lära sig på olika sätt. Du kan välja att slutföra den här modulen i videobaserat format eller läsa innehållet som text och bilder. Texten innehåller mer detaljer än videorna, så i vissa fall kanske du vill referera till den som kompletterande material till videopresentationen.