Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
Note
Questo articolo descrive le caratteristiche utilizzate negli agenti o nei flussi di agenti alimentati dall'imbracatura standard.
Per distribuire un agente in tempo reale, abilita il modello in tempo reale, configura le impostazioni core dell'agente e poi imposta le funzionalità specifiche per canale necessarie. Puoi schierare lo stesso agente sul canale vocale, sui canali di messaggistica digitale, o entrambi.
Note
Real-time agents è in anteprima per i canali di messaggistica digitale. Le funzionalità di anteprima non sono destinate ad essere utilizzate per la produzione e sono soggette a restrizioni. Queste funzionalità sono soggette a condizioni supplementari per l'utilizzo. Microsoft li fornisce prima di una release ufficiale affinché i clienti possano accedere anticipatamente e fornire feedback.
Configurare e abilitare agenti in tempo reale
Creare un nuovo agente e configurarne i dettagli di base, ad esempio un nome descrittivo e lo scopo dell'agente nella descrizione.
Vai nelle impostazioni Voce dell'agente e attiva Abilita la voce. Nel tipo Voce, seleziona Tempo reale.
Important
Questa impostazione è una selezione una tantum. Dopo aver selezionato Real-time, non puoi tornare a un tipo base di agente. Per usare un agente base, crea un nuovo agente. Questa impostazione è richiesta anche se usi l'agente su un canale di messaggistica digitale.
Seleziona il modello che vuoi usare: GPT-Realtime, GPT-Realtime-Mini o GPT-5-Chat (Anteprima). GPT-5-Chat (Anteprima) è un modello vocale testuale LLM che genera risposte vocali tramite Microsoft Neural Text-to-Speech (TTS).
Scopri di più su come funzionano questi modelli in base alle loro regioni supportate e alle considerazioni di implementazione. La tabella seguente descrive gli scenari in cui puoi utilizzare modelli diversi.Scenario GPT-Realtime GPT-5-Chat (Anteprima) Stile conversazione Interazioni native da voce a voce Il parlato viene convertito in testo per ragionamento e poi sintetizzato nuovamente in parlato Latenza Latenza più bassa per conversazioni naturali Latenza più alta di GPT-Realtime Personalizzazione vocale Supporta le opzioni vocali in tempo reale integrate disponibili per gli operatori vocali in tempo reale Supporta Microsoft Neural Text-to-Speech (TTS), inclusi un catalogo vocale più ampio e modelli vocali personalizzati Esperienze vocali di marca Opzioni di personalizzazione limitate Consigliato quando hai bisogno di un'esperienza vocale personalizzata o con un marchio Flessibilità nel dispiegamento regionale Limitato alle regioni di modello in tempo reale supportate Maggiore flessibilità attraverso il riconoscimento vocale e i servizi TTS Ideale per Conversazioni vocali naturali e a bassa latenza e interazioni aperte Scenari che richiedono personalizzazione avanzata della voce, voci personalizzate, requisiti di conformità o flessibilità regionale nel deployment Tip
- Usa GPT-Realtime quando la qualità naturale della conversazione e la bassa latenza sono i requisiti principali.
- Usa GPT-Realtime-Mini (Anteprima) per scenari che richiedono interazioni vocali rapide con minore latenza e uso delle risorse.
- Usa GPT-5-Chat (Anteprima) quando la personalizzazione vocale, i modelli vocali personalizzati o la flessibilità di distribuzione sono più importanti della latenza di risposta.
Passare alle impostazioni di sicurezza dell'agente e selezionare Nessuna autenticazione.
Conoscenza e strumenti
È possibile configurare l'agente per l'uso di informazioni e strumenti. Per altre informazioni, vedere Riepilogo delle origini delle informazioni, Aggiungere strumenti a agenti personalizzati e strumenti, conoscenza, MCP e API.
Agenti annidati (anteprima)
Gli agenti in tempo reale supportano solo gli agenti bambini.
Important
Assicurarsi che le descrizioni degli agenti figli non si sovrappongano alle descrizioni degli argomenti. Definire in modo esplicito l'ordine di chiamata nelle istruzioni dell'agente.
Argomenti
Gli agenti in tempo reale supportano tutti gli argomenti configurati in Copilot Studio. Usa argomenti per definire comportamenti deterministici come saluti, regole di business e escalation, mentre il modello selezionato gestisce le risposte conversazionali in tempo reale. Per altre informazioni, vedere Scegliere come controllare la conversazione.
Procedure consigliate
Usare gli argomenti solo quando è necessario un comportamento deterministico.
Usare il testo statico nei messaggi di saluto per la prima risposta più veloce. I messaggi dinamici con variabili ed espressioni aumentano la latenza iniziale.
Disabilita l'argomento Inizio conversazione se vuoi che il modello dell'agente in tempo reale gestisca il saluto. In caso contrario, il messaggio di saluto configurato nell'argomento Avvio conversazione viene riprodotto anziché il messaggio di saluto del modello vocale.
Lascia che il modello dell'agente in tempo reale gestisca la conversazione generale e le domande di follow-up.
Includi un'azione esplicita nella sezione On Error, ad esempio il trasferimento o la terminazione della chiamata. La gestione degli errori basata solo su messaggi non è sufficiente. Senza un passo successivo deterministico, i clienti potrebbero sperimentare silenzio per gli operatori vocali o chiamate bloccate nei canali di messaggistica, causando confusione e una cattiva esperienza del cliente.
Usare descrizioni esplicite di argomenti e strumenti per dichiarare la proprietà della raccolta dati. Per altre informazioni, vedere Scrivere descrizioni di strumenti e argomenti efficaci.
Supporto per i nodi tematici
Il seguente elenco descrive il supporto tematico negli agenti in tempo reale:
Nodo di condizione
| Feature | Support |
|---|---|
| Diramazione if/Else | Supportato |
| Espressioni Power Fx | Supportato |
| Rielaborazione del riempimento degli slot | Supportato |
Nodo messaggio
| Feature | Support |
|---|---|
| Messaggio di base | Supportato |
| Varianti dei messaggi | Sostenuto |
| Inserimento di variabili | Sostenuto |
| SSML | Solo canale vocale |
| Rich Media/Schede adattive | Supportato solo per canali di messaggistica digitale. Questa funzionalità è in versione di anteprima. |
| Risposte rapide | Supportato solo per canali di messaggistica digitale. Questa funzionalità è in versione di anteprima. |
Nodo di domanda
| Feature | Support |
|---|---|
| Testo del prompt | Sostenuto |
| Blocco automatico | Non supportato |
| Riempimento degli slot | Sostenuto |
| Ignorare il comportamento/riempimento dello slot Greedy | Sostenuto |
| Esegui prompt nuovamente/Riprova | Sostenuto |
| Gestione delle risposte non valida | Sostenuto |
| Interruzione dell'argomento | Sostenuto |
| Intrusione | Supportato solo per il canale vocale. |
| Messaggio di ripetizione personalizzato | Sostenuto |
| Input DTMF | Supportato solo per il canale vocale. |
| Rilevamento del silenzio | Supportato solo per il canale vocale. |
Nodo HTTP
| Feature | Support |
|---|---|
| Metodi HTTP: GET, POST, PUT, PATCH, DELETE | Supportato |
| Endpoint URL | Supportato |
| Intestazioni e payload | Supportato |
| Analisi e schema delle risposte | Supportato |
| Mapping delle variabili | Supportato |
| Gestione degli errori | Supportato |
Nodo dello strumento
| Feature | Support |
|---|---|
| Flusso di Power Automate | Sostenuto |
| Chiamata allo strumento | Sostenuto |
| Mappatura di input/output | Sostenuto |
| Nuovo prompt | Sostenuto |
Imposta il valore della variabile nodo
| Feature | Support |
|---|---|
| Assegnazione letterale | Supportato |
| Assegnazione di espressione | Supportato |
| Variabile a variabile | Supportato |
Nodo di gestione degli argomenti
| Feature | Support |
|---|---|
| Terminare l'argomento corrente | Supportato |
| Terminare tutti gli argomenti | Supportato |
| Terminare la conversazione | Supportato |
| Vai alla fase | Supportato |
| Input dell'utente per riconoscere la finalità | Supportato |
| Passare a un altro argomento | Supportato |
Trasferire il nodo della conversazione
| Feature | Support |
|---|---|
| Trasferisci ad agente | Supportato |
| Trasferimento di numeri di telefono esterni | Supportato solo per il canale vocale. |
Advanced
| Feature | Support |
|---|---|
| Creare risposte generative | Supportato |
Supporto del trigger di sistema
| Trigger | Support | dettagli |
|---|---|---|
| All'inizio della conversazione | Sostenuto | Viene generato quando inizia una nuova conversazione |
| Parla con un rappresentante | Sostenuto | Trasferimento a un agente umano |
| Argomento sconosciuto/Su finalità sconosciuta | Non supportato | Fallback quando nessun argomento corrisponde |
| OnSelectIntent (più argomenti corrispondenti) | Non supportato | Disambiguazione tra argomenti simili |
| Reimposta conversazione (OnSystemRedirect) | Sostenuto | Cancella le variabili e riavvia il flusso |
| On Sign in (Accedi) | Non supportato | |
| Tasto DTMF sconosciuto | Sostenuto | Immissione dal tastierino non assegnata. Applicabile solo al canale vocale. |
| L'agente sceglie/L'utente dice una frase | Sostenuto | Agent seleziona l'argomento in base alla finalità |
| Viene ricevuto un messaggio | Non supportato | Aumenta la latenza |
| Si verifica un evento client personalizzato | Non supportato | Solo all'avvio della sessione |
| Aggiornamento della conversazione | Non supportato | Membri aggiunti o rimossi, modifiche alla sessione |
| Viene richiamato | Non supportato | Richiede l'interfaccia utente sincrona |
| Viene reindirizzato | Sostenuto | |
| L'utente è inattivo per un periodo specificato. | Sostenuto | Timeout di inattività dell'utente. Applicabile solo ai canali di messaggistica digitale. |
| Rilevamento del silenzio | Sostenuto | Applicabile solo al canale vocale. |
| Viene completato il piano | Non supportato | |
| Risposta di intelligenza artificiale generata | Non supportato | |
| In caso di errore | Sostenuto | Gestisce gli errori di orchestrazione |
Trasferire variabili tra argomenti e il modello linguistico
Quando si usano argomenti in un flusso di conversazione ibrida, comprendere come passare variabili tra argomenti e il modello linguistico in tempo reale è fondamentale per la creazione di interazioni affidabili e con stato. Questo processo si applica a tutti i canali.
Questa funzionalità funziona tramite il processo seguente:
Le variabili di input definite in un argomento vengono passate all'argomento in fase di chiamata, in modo che il modello linguistico possa fornire dati strutturati al flusso deterministico.
Le variabili di output definite in un argomento vengono restituite al modello linguistico alla fine dell'esecuzione dell'argomento come coppie chiave-valore strutturate.
Gli output delle chiamate agli strumenti seguono lo stesso schema.
Il modello linguistico viene popolato con il contesto conversazionale, comprese le coppie chiave-valore di output delle chiamate dello strumento. Tuttavia, si restituiscono solo variabili di output definite in modo esplicito come dati strutturati.
La descrizione della variabile aiuta il modello a capire come usarla durante una conversazione. Fornisci definizioni chiare e descrittive.
Per altre informazioni, vedere Gestire gli input e gli output degli argomenti.
Supporto multilingue
Aggiungere tutte le lingue secondarie desiderate. Le stringhe di localizzazione non sono necessarie per i flussi in tempo reale. Tuttavia, per i messaggi degli argomenti deterministici, è necessario fornire i messaggi tradotti. Per altre informazioni, vedere Configurare e creare agenti multilingue.
Il modello in tempo reale può comprendere e rispondere in molte lingue. Tuttavia, Microsoft non convalida formalmente tutte le lingue per la disponibilità generale.
A giugno 2026, le seguenti lingue sono formalmente validate:
- Olandese (Paesi Bassi) (nl-NL)
- Inglese (Australia) (en-AU)
- inglese (stati uniti) (en-us)
- Inglese (Regno Unito) (en-GB)
- Francese (Canada) (fr-CA)
- Francese (Francia) (fr-FR)
- Tedesco (Germania) (de-DE)
- Italiano (Italia) (it-IT)
- Portoghese (Brasile) (pt-BR)
- Spagnolo (Spagna) (es-ES)
- Spagnolo (Stati Uniti) (es-US)
Microsoft continua a convalidare altre lingue e aggiungerle dopo il completamento della certificazione. È possibile aggiungere qualsiasi lingua supportata da Copilot Studio. Tuttavia, le lingue non completamente certificate per la qualità a livello di GA devono essere testate accuratamente prima della distribuzione in produzione.
Important
La funzionalità del linguaggio tecnico non è uguale a un linguaggio supportato o certificato. Se si prevede di distribuire agenti in lingue diverse dall'inglese, è consigliabile eseguire test estesi con chiamanti e flussi di chiamata reali prima di andare in tempo reale.
Variabili del contesto
Un agente in tempo reale supporta variabili di contesto che gli permettono di comportarsi in modo più intelligente trasportando informazioni sulla conversazione e sul cliente. Le variabili di contesto disponibili dipendono dal canale. Questo set include:
| Variabile di contesto | Descrizione |
|---|---|
| ID canale | Identifica il canale di comunicazione usato per l'interazione. Applicabile solo al canale vocale. |
| Numero di telefono chiamante (ANI) | Numero di telefono di origine del chiamante. Applicabile solo al canale vocale. |
| Numero del chiamato (DNIS) | Numero di telefono di destinazione composto dal chiamante. Applicabile solo al canale vocale. |
| ID conversazione | Identificatore univoco per la sessione di chiamata attiva. |
| Intestazioni SIP | Supportano le coppie chiave-valore di intestazione SIP associate alla chiamata. Applicabile solo al canale vocale. |
| Data corrente (UTC) | Data corrente nell'ora UTC (Coordinated Universal Time), fornita in fase di esecuzione per consentire risposte con riconoscimento della data. |
| Ora corrente (UTC) | Ora corrente nel tempo universale coordinato (UTC), fornita al tempo di esecuzione per consentire risposte consapevoli del tempo. |
Scopri di più su tutte le altre variabili di contesto, inclusi i messaggi digitali e le variabili di contesto personalizzate, in Configura le variabili di contesto per agenti.
Impostazioni specifiche del canale
Voce agente
Selezionare la voce usata dall'agente selezionando l'agente e passare a Impostazioni>Voce>Seleziona voce. Gli agenti in tempo reale supportano le seguenti voci:
- Lega
- Cenere
- Ballata
- Corallo
- Echo
- Sage
- Shimmer
- Verso
- Marin
- Cedar
Note
- La voce dell'agente è per il tuo agente in tempo reale e non è quella configurata nel centro di amministrazione del servizio Copilot.
- Per abbinare le voci dei messaggi del sistema Dynamics con il tuo agente in tempo reale, usa solo le seguenti voci supportate: Alloy, Echo, Shimmer o Ash.
- Gli agenti che utilizzano Text LLM, GPT-5-Chat (Anteprima) generano risposte vocali tramite Microsoft Neural Text-to-Speech (TTS). Questo modello supporta un catalogo vocale più ampio e modelli vocali personalizzati, rendendolo adatto a organizzazioni che richiedono esperienze vocali brandizzate o personalizzazione avanzata della voce.
Sensibilità vocale
Il rilevamento delle attività vocali con sensibilità vocale (VAD) determina quando l'agente deve rispondere dopo che il chiamante ha terminato di parlare.
Comprendere i tipi di VAD
Gli agenti in tempo reale supportano due approcci di VAD:
VAD basato su server - Basato sul suono (silenzio)
Rileva la fine del parlato in base ai segnali audio (durata del silenzio, volume)
Risponde rapidamente una volta rilevato il silenzio
Ideale per interazioni strutturate, risposte brevi, ambienti rumorosi
VAD semantico - Basato sul contesto della frase
Determina il completamento dei turni in base al significato di ciò che è stato detto
Si adatta alle pause naturali, alle parole riempitrici, al parlato finale
Ideale per: interazioni conversazionali, domande complesse, discussioni aperte
Seleziona il VAD giusto
Usare VAD basato su server quando tutte le condizioni seguenti sono vere:
- Le interazioni sono strutturate (spostamento tramite menu in stile IVR).
- Le risposte sono brevi e prevedibili.
- Il rumore di fondo è un problema (il VAD semantico potrebbe aspettare troppo a lungo).
- Vuoi un turno veloce e dinamico.
Usare VAD semantico quando tutte le condizioni seguenti sono vere:
- Le conversazioni sono aperte.
- I chiamanti potrebbero esitare o usare parole riempitive ("um", "lasciami pensare...").
- Le domande sono complesse (i chiamanti spiegano le situazioni).
- Il flusso di conversazione naturale è prioritario.
Configura il VAD basato su server
Passare a Impostazioni>Voce>Configurazione telefono>Input vocale>Sensibilità>Basata sul suono (silenzio).
| Parametro | Descrizione | Predefinito | Intervallo consigliato |
|---|---|---|---|
| Soglia | Sensibilità alla voce e rumore (scala 0-1) | 0,6 | 0.5-0.7 |
| Riempimento del prefisso (ms) | Audio acquisito prima dell'avvio del riconoscimento vocale | 300 ms | 200-500 ms |
| Durata silenzio (ms) | Silenzio necessario per terminare il turno | 750 millisecondi | 750-1000 ms |
Threshold
- Inferiore (0,3-0,4): più sensibile; raccoglie il parlato silenzioso, potrebbe attivare il rumore di fondo.
- Superiore (0,7-0,9): meno sensibile; richiede un parlato più forte, riduce le falsi attivazioni.
- Consigliato: Inizia con 0,5; Aumenta se il rumore di fondo causa falsi trigger.
Riempitura del prefisso
- Acquisisce l'audio prima del rilevamento vocale (impedisce di tagliare la prima parola).
- Inferiore (200 ms): risposta più veloce; potrebbe perdere la prima sillaba.
- Superiore (500 ms): acquisizione più sicura; lieve ritardo.
- Consigliato: 300 ms (buon equilibrio).
Durata del silenzio
- Per quanto tempo il chiamante deve essere invisibile all'utente prima che l'agente risponda.
- Inferiore (500 ms): rapido cambio di turno; potrebbe interrompere se il chiamante fa una pausa a metà pensiero.
- Superiore (1000 ms): più paziente; potrebbe sentirsi lento.
- Consigliato: iniziare con 750 ms.
Configura il VAD semantico
Passare a Impostazioni>Voce>Configurazione telefono>Input vocale>Sensibilità>In base al contesto della frase.
Parametro: Zelo (la velocità con cui l'agente risponde dopo il completamento semantico)
| Impostazione | Behavior | Ideale per |
|---|---|---|
| Low | Attende più a lungo, molto paziente | Chiamanti che pensano ad alta voce, pause frequenti |
| Intermedio | Bilanciato (impostazione predefinita) | Conversazioni generali |
| Alto | Risponde rapidamente | Interazioni veloci, domande semplici |
Configurazione DTMF
Dual-Tone Multi-Frequency (DTMF) permette ai chiamanti di inserire informazioni utilizzando la tastiera del telefono.
È possibile attivare DTMF per l'agente sia a livello di argomento che a livello globale. Per impostarlo a livello globale, selezionare l'agente e passare a Impostazioni>Comportamento> conversazionevocale>DTMF.
Important
Quando si costruiscono esperienze basate esclusivamente su DTMF, configurare l'input DTMF per ogni nodo di input, incluse le selezioni di menu e gli input a più cifre, come numeri di account o PIN. Assicurarsi che tutti i possibili percorsi di input dei clienti abbiano corrispondenti mappe DTMF in modo che gli utenti possano navigare e completare la conversazione usando solo l'input da tastiera.
Rilevamento del silenzio
Il rilevamento del silenzio consente agli agenti in tempo reale di riconoscere quando un chiamante non fornisce input per un periodo specificato. Configura il rilevamento del silenzio come impostazione vocale globale per l'agente andando su Impostazioni>Voce>Comportamento della conversazione>Rilevamento del silenzio.
Important
- Il rilevamento del silenzio non è attivato per impostazione predefinita. Se l'utente non parla, l'agente attende un tempo illimitato senza chiedere conferma. Attivare in modo esplicito il rilevamento del silenzio e configurare un messaggio di ripetizione per gestire i chiamanti silenziosi.
- Il timeout di rilevamento del silenzio predefinito è 7.000 ms (7 secondi). Convalidare questo valore in base al caso d'uso specifico e all'ambiente chiamante prima della distribuzione nell'ambiente di produzione. Sette secondi potrebbero sembrare troppo lunghi per alcuni chiamanti o troppo brevi per altri a seconda della natura dell'interazione, ad esempio domande complesse o ambienti rumorosi. Testare con i dati delle chiamate reali per determinare la soglia appropriata per lo scenario.
- Prima di abilitare il rilevamento del silenzio, assicurarsi che il comportamento configurato nell'argomento di rilevamento silenzio (ad esempio, Escalation, Hang Up, Reprompt) sia intenzionale e appropriato per il caso d'uso. Il comportamento di fallback configurato in modo errato, come impostare per errore il fallback su Escalare quando l'intenzione è di terminare la chiamata, o viceversa, può portare a risultati imprevisti delle chiamate.
Messaggi di latenza
Aggiungere messaggi di latenza o musica all'agente quando le operazioni in background richiedono più tempo del previsto. Per configurare la messaggistica di latenza, passare a Impostazioni>Voce>Comportamento conversazione>Messaggi di latenza.
Important
Poiché la soluzione agente in tempo reale Text LLM utilizza più passaggi sequenziali (ASR, LLM, TTS), i chiamanti sperimentano alcuni secondi di silenzio tra il parlare e sentire una risposta. Stabilisci aspettative appropriate con gli utenti, ad esempio, usando una frase come "Un momento per favore, sto cercando questo per te...".
Valutazione in tempo reale degli agenti
Gli agenti in tempo reale supportano l'invio di testo durante la valutazione, tuttavia l'elaborazione audio non è supportata.