Vælg hvordan du håndterer tale

Efter du har valgt samtalekontrol, skal stemmeagenter træffe endnu en beslutning: talearkitektur.

Mønster 1: Basistilstand for stemme

Tale > Tekst >NLU/NLU+>Klassisk orkestrering> Tale

Opkalderens tale transskriberes først i dette mønster, hvorefter Copilot Studio-dialogflowene bearbejder teksten. Til sidst konverteres teksten tilbage til tale.

Brug dette mønster, når

  • Du bruger et fuldt klassisk, deterministisk flow.

  • Omkostningsminimering er afgørende.

  • Du har brug for en tilpasset eller neural stemme.

  • Du har brug for finjusteret kontrol over talegenkendelse.

  • Du arbejder med DTMF-tunge flow.

Kompromiser

  • Fungerer kun med klassisk orkestrering.

  • Understøtter ikke hybrid eller generativ orkestrering.

  • Understøttelse af flersproget og blandet sproginput kræver mere arbejde. Det kræver sprogregistrering, sprogspecifikke prompter og grammatik, opsætning af landestandard for tale til tekst (STT) og håndtering af reserve.

Vigtigt!

Grundlæggende stemmetilstand er ikke bare et "valg af stemmemodel". Det begrænser orkestreringen grundlæggende.

Mønster 2: Streaming-tilstand

Tale > AI-model > Tale

En stemmearkitektur, hvor en enkelt sprogmodel behandler lyd fra ende til ende og håndterer lydinput og output direkte. Der er ikke separate STT- eller tekst-til-tale (TTS)-trin. Modellen modtager opkalderens lydstrøm direkte og returnerer et syntetiseret lydsvar i realtid.

Denne arkitektur anvender en tæt integreret, realtidsmodel-pipeline til at levere ultrakort ventetid, naturligt samtaleforløb og enklere udrulning. Denne tilgang fungerer bedst, når hastighed og naturlig samtale er topprioriteter, for eksempel ved mange kundeinteraktioner i velunderstøttede sprog og regioner. Denne tilgang har et begrænset antal stemmer og begrænsede tilpasningsmuligheder.

Vigtig fordel: Ultrakort ventetid, naturlig turtagning i samtaler.

Brug dette mønster, når

  • Naturlighed i samtalen og forbedret prosodi er en topprioritet.

  • Virksomheden ønsker en førsteklasses samtaleoplevelse.

  • Overlegen håndtering af flersproget og blandet sproginput kræves, herunder problemfri sprogskift.

  • Kontekstuel forståelse er vigtig (tone, hensigt og samtalenuancer), hvilket reducerer afhængigheden af eksplicitte oversættelseslag.

  • Kort ventetid og hurtig respons i realtid er afgørende for oplevelsen.

  • Teamet er klar til at investere i test, fintuning, evaluering og sikkerhedsforanstaltninger.

Kompromiser

  • Færre tilpasningspunkter.

  • Begrænsede stemmemuligheder.

  • Stærk afhængighed af promptkvalitet.

  • Prissætning og valg af model har større betydning.

  • Realtids-talemodellen begrænser dybden af ræsonnement. Det giver dig også mindre fleksibilitet til at bruge tekstbaseret sprogmodelorkestrering med større kapacitet eller specialiserede agenter til avanceret ræsonnement.

  • Ræsonnementsdybden med realtids-talemodellen er relativt lavere end ved tekstbaseret sprogmodelorkestrering, da sidstnævnte giver dig mulighed for at anvende den mest avancerede model, når det er nødvendigt.