Bemærk
Adgang til denne side kræver godkendelse. Du kan prøve at logge på eller ændre mapper.
Adgang til denne side kræver godkendelse. Du kan prøve at ændre mapper.
Efter du har valgt samtalekontrol, skal stemmeagenter træffe endnu en beslutning: talearkitektur.
Mønster 1: Basistilstand for stemme
Tale > Tekst >NLU/NLU+>Klassisk orkestrering> Tale
Opkalderens tale transskriberes først i dette mønster, hvorefter Copilot Studio-dialogflowene bearbejder teksten. Til sidst konverteres teksten tilbage til tale.
Brug dette mønster, når
Du bruger et fuldt klassisk, deterministisk flow.
Omkostningsminimering er afgørende.
Du har brug for en tilpasset eller neural stemme.
Du har brug for finjusteret kontrol over talegenkendelse.
Du arbejder med DTMF-tunge flow.
Kompromiser
Fungerer kun med klassisk orkestrering.
Understøtter ikke hybrid eller generativ orkestrering.
Understøttelse af flersproget og blandet sproginput kræver mere arbejde. Det kræver sprogregistrering, sprogspecifikke prompter og grammatik, opsætning af landestandard for tale til tekst (STT) og håndtering af reserve.
Vigtigt!
Grundlæggende stemmetilstand er ikke bare et "valg af stemmemodel". Det begrænser orkestreringen grundlæggende.
Mønster 2: Streaming-tilstand
Tale > AI-model > Tale
En stemmearkitektur, hvor en enkelt sprogmodel behandler lyd fra ende til ende og håndterer lydinput og output direkte. Der er ikke separate STT- eller tekst-til-tale (TTS)-trin. Modellen modtager opkalderens lydstrøm direkte og returnerer et syntetiseret lydsvar i realtid.
Denne arkitektur anvender en tæt integreret, realtidsmodel-pipeline til at levere ultrakort ventetid, naturligt samtaleforløb og enklere udrulning. Denne tilgang fungerer bedst, når hastighed og naturlig samtale er topprioriteter, for eksempel ved mange kundeinteraktioner i velunderstøttede sprog og regioner. Denne tilgang har et begrænset antal stemmer og begrænsede tilpasningsmuligheder.
Vigtig fordel: Ultrakort ventetid, naturlig turtagning i samtaler.
Brug dette mønster, når
Naturlighed i samtalen og forbedret prosodi er en topprioritet.
Virksomheden ønsker en førsteklasses samtaleoplevelse.
Overlegen håndtering af flersproget og blandet sproginput kræves, herunder problemfri sprogskift.
Kontekstuel forståelse er vigtig (tone, hensigt og samtalenuancer), hvilket reducerer afhængigheden af eksplicitte oversættelseslag.
Kort ventetid og hurtig respons i realtid er afgørende for oplevelsen.
Teamet er klar til at investere i test, fintuning, evaluering og sikkerhedsforanstaltninger.
Kompromiser
Færre tilpasningspunkter.
Begrænsede stemmemuligheder.
Stærk afhængighed af promptkvalitet.
Prissætning og valg af model har større betydning.
Realtids-talemodellen begrænser dybden af ræsonnement. Det giver dig også mindre fleksibilitet til at bruge tekstbaseret sprogmodelorkestrering med større kapacitet eller specialiserede agenter til avanceret ræsonnement.
Ræsonnementsdybden med realtids-talemodellen er relativt lavere end ved tekstbaseret sprogmodelorkestrering, da sidstnævnte giver dig mulighed for at anvende den mest avancerede model, når det er nødvendigt.