Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
Dopo aver scelto il controllo della conversazione, gli agenti vocali devono prendere un'altra decisione: l'architettura del parlato.
Modello 1: modalità vocale di base
Riconoscimento vocale > Testo >NLU/NLU+>Orchestrazione classica> Riconoscimento vocale
In questo modello, il parlato del chiamante viene prima trascritto, quindi i flussi di interazione di Copilot Studio elaborano il testo. Infine, il testo viene riconvertito in parlato.
Usa questo modello quando
Stai usando un flusso del tutto deterministico e classico.
Il contenimento dei costi al minimo è fondamentale.
È necessaria una voce personalizzata o neurale.
Serve un controllo dettagliato sul riconoscimento vocale.
Stai usando flussi DTMF pesanti.
Compromessi
Funziona solo con l'orchestrazione classica.
Non supporta l'orchestrazione ibrida o l'orchestrazione generativa.
Supportare gli input multilingue e misti richiede più impegno. Richiede il rilevamento della lingua, prompt e grammatica specifici per lingua, impostazioni locali del Riconoscimento vocale e gestione dei fallback.
Importante
La modalità vocale di base non è solo una "scelta del modello vocale". Vincola fondamentalmente l'orchestrazione.
Modello 2: modalità streaming
Riconoscimento vocale > Modello IA > Riconoscimento vocale
Un'architettura vocale in cui un singolo modello linguistico elabora l'audio end-to-end e gestisce nativamente l'input e l'output audio. Non esiste un passaggio separato per Riconoscimento vocale (STT) o Sintesi vocale (TTS). Il modello riceve direttamente il flusso audio del chiamante e restituisce una risposta audio sintetizzata in tempo reale.
Questa architettura usa una pipeline di modelli in tempo reale strettamente integrata per garantire latenza ultra-bassa, flusso della conversazione naturale e implementazione più semplice. Questo approccio è ottimale quando rapidità e naturalezza della conversazione sono priorità assolute, come nelle interazioni con i clienti ad alto volume in lingue e aree ben supportate. Questo approccio offre un numero limitato di voci disponibili e opzioni di personalizzazione limitate.
Vantaggio chiave: latenza ultra-bassa, alternanza dei turni di conversazione naturale.
Usa questo modello quando
La naturalezza della conversazione e la prosodia avanzata sono una priorità assoluta.
L'azienda vuole un'esperienza di conversazione di livello premium.
È richiesta una gestione avanzata degli input multilingue e misti, incluso un cambio di lingua fluido.
La comprensione contestuale è importante (tono, finalità e sfumature della conversazione), riducendo la dipendenza da livelli di traduzione esplicita.
Una risposta in tempo reale e a bassa latenza è fondamentale per l'esperienza.
Il team è pronto a investire in test, ottimizzazione, valutazione e misure di protezione.
Compromessi
Meno punti di personalizzazione.
Opzioni vocali limitate.
Forte dipendenza dalla qualità dei prompt.
Il prezzo e la scelta del modello sono più importanti.
Il modello del parlato in tempo reale limita la profondità del ragionamento. Ti offre anche meno flessibilità nell'usare l'orchestrazione di modelli linguistici testuali ad alta capacità o agenti specializzati per ragionamenti complessi.
La profondità del ragionamento con il modello vocale in tempo reale è relativamente inferiore rispetto all'orchestrazione del modello linguistico testuale, poiché quest'ultima offre la flessibilità di usare il modello più potente disponibile quando necessario.