Scegliere come gestire il parlato

Dopo aver scelto il controllo della conversazione, gli agenti vocali devono prendere un'altra decisione: l'architettura del parlato.

Modello 1: modalità vocale di base

Riconoscimento vocale > Testo >NLU/NLU+>Orchestrazione classica> Riconoscimento vocale

In questo modello, il parlato del chiamante viene prima trascritto, quindi i flussi di interazione di Copilot Studio elaborano il testo. Infine, il testo viene riconvertito in parlato.

Usa questo modello quando

  • Stai usando un flusso del tutto deterministico e classico.

  • Il contenimento dei costi al minimo è fondamentale.

  • È necessaria una voce personalizzata o neurale.

  • Serve un controllo dettagliato sul riconoscimento vocale.

  • Stai usando flussi DTMF pesanti.

Compromessi

  • Funziona solo con l'orchestrazione classica.

  • Non supporta l'orchestrazione ibrida o l'orchestrazione generativa.

  • Supportare gli input multilingue e misti richiede più impegno. Richiede il rilevamento della lingua, prompt e grammatica specifici per lingua, impostazioni locali del Riconoscimento vocale e gestione dei fallback.

Importante

La modalità vocale di base non è solo una "scelta del modello vocale". Vincola fondamentalmente l'orchestrazione.

Modello 2: modalità streaming

Riconoscimento vocale > Modello IA > Riconoscimento vocale

Un'architettura vocale in cui un singolo modello linguistico elabora l'audio end-to-end e gestisce nativamente l'input e l'output audio. Non esiste un passaggio separato per Riconoscimento vocale (STT) o Sintesi vocale (TTS). Il modello riceve direttamente il flusso audio del chiamante e restituisce una risposta audio sintetizzata in tempo reale.

Questa architettura usa una pipeline di modelli in tempo reale strettamente integrata per garantire latenza ultra-bassa, flusso della conversazione naturale e implementazione più semplice. Questo approccio è ottimale quando rapidità e naturalezza della conversazione sono priorità assolute, come nelle interazioni con i clienti ad alto volume in lingue e aree ben supportate. Questo approccio offre un numero limitato di voci disponibili e opzioni di personalizzazione limitate.

Vantaggio chiave: latenza ultra-bassa, alternanza dei turni di conversazione naturale.

Usa questo modello quando

  • La naturalezza della conversazione e la prosodia avanzata sono una priorità assoluta.

  • L'azienda vuole un'esperienza di conversazione di livello premium.

  • È richiesta una gestione avanzata degli input multilingue e misti, incluso un cambio di lingua fluido.

  • La comprensione contestuale è importante (tono, finalità e sfumature della conversazione), riducendo la dipendenza da livelli di traduzione esplicita.

  • Una risposta in tempo reale e a bassa latenza è fondamentale per l'esperienza.

  • Il team è pronto a investire in test, ottimizzazione, valutazione e misure di protezione.

Compromessi

  • Meno punti di personalizzazione.

  • Opzioni vocali limitate.

  • Forte dipendenza dalla qualità dei prompt.

  • Il prezzo e la scelta del modello sono più importanti.

  • Il modello del parlato in tempo reale limita la profondità del ragionamento. Ti offre anche meno flessibilità nell'usare l'orchestrazione di modelli linguistici testuali ad alta capacità o agenti specializzati per ragionamenti complessi.

  • La profondità del ragionamento con il modello vocale in tempo reale è relativamente inferiore rispetto all'orchestrazione del modello linguistico testuale, poiché quest'ultima offre la flessibilità di usare il modello più potente disponibile quando necessario.