Configura agenti in tempo reale

Note

Questo articolo descrive le caratteristiche utilizzate negli agenti o nei flussi di agenti alimentati dall'imbracatura standard.

Per distribuire un agente in tempo reale, abilita il modello in tempo reale, configura le impostazioni core dell'agente e poi imposta le funzionalità specifiche per canale necessarie. Puoi schierare lo stesso agente sul canale vocale, sui canali di messaggistica digitale, o entrambi.

Note

Real-time agents è in anteprima per i canali di messaggistica digitale. Le funzionalità di anteprima non sono destinate ad essere utilizzate per la produzione e sono soggette a restrizioni. Queste funzionalità sono soggette a condizioni supplementari per l'utilizzo. Microsoft li fornisce prima di una release ufficiale affinché i clienti possano accedere anticipatamente e fornire feedback.

Configurare e abilitare agenti in tempo reale

  1. Creare un nuovo agente e configurarne i dettagli di base, ad esempio un nome descrittivo e lo scopo dell'agente nella descrizione.

  2. Vai nelle impostazioni Voce dell'agente e attiva Abilita la voce. Nel tipo Voce, seleziona Tempo reale.

    Important

    Questa impostazione è una selezione una tantum. Dopo aver selezionato Real-time, non puoi tornare a un tipo base di agente. Per usare un agente base, crea un nuovo agente. Questa impostazione è richiesta anche se usi l'agente su un canale di messaggistica digitale.

  3. Seleziona il modello che vuoi usare: GPT-Realtime, GPT-Realtime-Mini o GPT-5-Chat (Anteprima). GPT-5-Chat (Anteprima) è un modello vocale testuale LLM che genera risposte vocali tramite Microsoft Neural Text-to-Speech (TTS).
    Scopri di più su come funzionano questi modelli in base alle loro regioni supportate e alle considerazioni di implementazione. La tabella seguente descrive gli scenari in cui puoi utilizzare modelli diversi.

    Scenario GPT-Realtime GPT-5-Chat (Anteprima)
    Stile conversazione Interazioni native da voce a voce Il parlato viene convertito in testo per ragionamento e poi sintetizzato nuovamente in parlato
    Latenza Latenza più bassa per conversazioni naturali Latenza più alta di GPT-Realtime
    Personalizzazione vocale Supporta le opzioni vocali in tempo reale integrate disponibili per gli operatori vocali in tempo reale Supporta Microsoft Neural Text-to-Speech (TTS), inclusi un catalogo vocale più ampio e modelli vocali personalizzati
    Esperienze vocali di marca Opzioni di personalizzazione limitate Consigliato quando hai bisogno di un'esperienza vocale personalizzata o con un marchio
    Flessibilità nel dispiegamento regionale Limitato alle regioni di modello in tempo reale supportate Maggiore flessibilità attraverso il riconoscimento vocale e i servizi TTS
    Ideale per Conversazioni vocali naturali e a bassa latenza e interazioni aperte Scenari che richiedono personalizzazione avanzata della voce, voci personalizzate, requisiti di conformità o flessibilità regionale nel deployment

    Tip

    • Usa GPT-Realtime quando la qualità naturale della conversazione e la bassa latenza sono i requisiti principali.
    • Usa GPT-Realtime-Mini (Anteprima) per scenari che richiedono interazioni vocali rapide con minore latenza e uso delle risorse.
    • Usa GPT-5-Chat (Anteprima) quando la personalizzazione vocale, i modelli vocali personalizzati o la flessibilità di distribuzione sono più importanti della latenza di risposta.
  4. Passare alle impostazioni di sicurezza dell'agente e selezionare Nessuna autenticazione.

Conoscenza e strumenti

È possibile configurare l'agente per l'uso di informazioni e strumenti. Per altre informazioni, vedere Riepilogo delle origini delle informazioni, Aggiungere strumenti a agenti personalizzati e strumenti, conoscenza, MCP e API.

Agenti annidati (anteprima)

Gli agenti in tempo reale supportano solo gli agenti bambini.

Important

Assicurarsi che le descrizioni degli agenti figli non si sovrappongano alle descrizioni degli argomenti. Definire in modo esplicito l'ordine di chiamata nelle istruzioni dell'agente.

Argomenti

Gli agenti in tempo reale supportano tutti gli argomenti configurati in Copilot Studio. Usa argomenti per definire comportamenti deterministici come saluti, regole di business e escalation, mentre il modello selezionato gestisce le risposte conversazionali in tempo reale. Per altre informazioni, vedere Scegliere come controllare la conversazione.

Procedure consigliate

  • Usare gli argomenti solo quando è necessario un comportamento deterministico.

  • Usare il testo statico nei messaggi di saluto per la prima risposta più veloce. I messaggi dinamici con variabili ed espressioni aumentano la latenza iniziale.

  • Disabilita l'argomento Inizio conversazione se vuoi che il modello dell'agente in tempo reale gestisca il saluto. In caso contrario, il messaggio di saluto configurato nell'argomento Avvio conversazione viene riprodotto anziché il messaggio di saluto del modello vocale.

  • Lascia che il modello dell'agente in tempo reale gestisca la conversazione generale e le domande di follow-up.

  • Includi un'azione esplicita nella sezione On Error, ad esempio il trasferimento o la terminazione della chiamata. La gestione degli errori basata solo su messaggi non è sufficiente. Senza un passo successivo deterministico, i clienti potrebbero sperimentare silenzio per gli operatori vocali o chiamate bloccate nei canali di messaggistica, causando confusione e una cattiva esperienza del cliente.

  • Usare descrizioni esplicite di argomenti e strumenti per dichiarare la proprietà della raccolta dati. Per altre informazioni, vedere Scrivere descrizioni di strumenti e argomenti efficaci.

Supporto per i nodi tematici

Il seguente elenco descrive il supporto tematico negli agenti in tempo reale:

Nodo di condizione

Feature Support
Diramazione if/Else Supportato
Espressioni Power Fx Supportato
Rielaborazione del riempimento degli slot Supportato

Nodo messaggio

Feature Support
Messaggio di base Supportato
Varianti dei messaggi Sostenuto
Inserimento di variabili Sostenuto
SSML Solo canale vocale
Rich Media/Schede adattive  Supportato solo per canali di messaggistica digitale. Questa funzionalità è in versione di anteprima. 
Risposte rapide Supportato solo per canali di messaggistica digitale. Questa funzionalità è in versione di anteprima. 

Nodo di domanda

Feature Support
Testo del prompt Sostenuto
Blocco automatico Non supportato
Riempimento degli slot Sostenuto
Ignorare il comportamento/riempimento dello slot Greedy Sostenuto
Esegui prompt nuovamente/Riprova Sostenuto
Gestione delle risposte non valida Sostenuto
Interruzione dell'argomento Sostenuto
Intrusione Supportato solo per il canale vocale.
Messaggio di ripetizione personalizzato Sostenuto
Input DTMF Supportato solo per il canale vocale.
Rilevamento del silenzio Supportato solo per il canale vocale.

Nodo HTTP

Feature Support
Metodi HTTP: GET, POST, PUT, PATCH, DELETE Supportato
Endpoint URL Supportato
Intestazioni e payload Supportato
Analisi e schema delle risposte Supportato
Mapping delle variabili Supportato
Gestione degli errori Supportato

Nodo dello strumento

Feature Support
Flusso di Power Automate Sostenuto
Chiamata allo strumento Sostenuto
Mappatura di input/output Sostenuto
Nuovo prompt Sostenuto

Imposta il valore della variabile nodo

Feature Support
Assegnazione letterale Supportato
Assegnazione di espressione Supportato
Variabile a variabile Supportato

Nodo di gestione degli argomenti

Feature Support
Terminare l'argomento corrente Supportato
Terminare tutti gli argomenti Supportato
Terminare la conversazione Supportato
Vai alla fase Supportato
Input dell'utente per riconoscere la finalità Supportato
Passare a un altro argomento Supportato

Trasferire il nodo della conversazione

Feature Support
Trasferisci ad agente Supportato
Trasferimento di numeri di telefono esterni Supportato solo per il canale vocale. 

Advanced

Feature Support
Creare risposte generative Supportato

Supporto del trigger di sistema

Trigger Support dettagli
All'inizio della conversazione Sostenuto Viene generato quando inizia una nuova conversazione
Parla con un rappresentante Sostenuto Trasferimento a un agente umano
Argomento sconosciuto/Su finalità sconosciuta Non supportato Fallback quando nessun argomento corrisponde
OnSelectIntent (più argomenti corrispondenti) Non supportato Disambiguazione tra argomenti simili
Reimposta conversazione (OnSystemRedirect) Sostenuto Cancella le variabili e riavvia il flusso
On Sign in (Accedi) Non supportato
Tasto DTMF sconosciuto Sostenuto Immissione dal tastierino non assegnata. Applicabile solo al canale vocale.
L'agente sceglie/L'utente dice una frase Sostenuto Agent seleziona l'argomento in base alla finalità
Viene ricevuto un messaggio Non supportato Aumenta la latenza
Si verifica un evento client personalizzato Non supportato Solo all'avvio della sessione
Aggiornamento della conversazione Non supportato Membri aggiunti o rimossi, modifiche alla sessione
Viene richiamato Non supportato Richiede l'interfaccia utente sincrona
Viene reindirizzato Sostenuto
L'utente è inattivo per un periodo specificato. Sostenuto Timeout di inattività dell'utente. Applicabile solo ai canali di messaggistica digitale.
Rilevamento del silenzio Sostenuto Applicabile solo al canale vocale.
Viene completato il piano Non supportato
Risposta di intelligenza artificiale generata Non supportato
In caso di errore Sostenuto Gestisce gli errori di orchestrazione

Trasferire variabili tra argomenti e il modello linguistico

Quando si usano argomenti in un flusso di conversazione ibrida, comprendere come passare variabili tra argomenti e il modello linguistico in tempo reale è fondamentale per la creazione di interazioni affidabili e con stato. Questo processo si applica a tutti i canali.

Questa funzionalità funziona tramite il processo seguente:

  • Le variabili di input definite in un argomento vengono passate all'argomento in fase di chiamata, in modo che il modello linguistico possa fornire dati strutturati al flusso deterministico.

  • Le variabili di output definite in un argomento vengono restituite al modello linguistico alla fine dell'esecuzione dell'argomento come coppie chiave-valore strutturate.

  • Gli output delle chiamate agli strumenti seguono lo stesso schema.

  • Il modello linguistico viene popolato con il contesto conversazionale, comprese le coppie chiave-valore di output delle chiamate dello strumento. Tuttavia, si restituiscono solo variabili di output definite in modo esplicito come dati strutturati.

  • La descrizione della variabile aiuta il modello a capire come usarla durante una conversazione. Fornisci definizioni chiare e descrittive.

Per altre informazioni, vedere Gestire gli input e gli output degli argomenti.

Supporto multilingue

Aggiungere tutte le lingue secondarie desiderate. Le stringhe di localizzazione non sono necessarie per i flussi in tempo reale. Tuttavia, per i messaggi degli argomenti deterministici, è necessario fornire i messaggi tradotti. Per altre informazioni, vedere Configurare e creare agenti multilingue.

Il modello in tempo reale può comprendere e rispondere in molte lingue. Tuttavia, Microsoft non convalida formalmente tutte le lingue per la disponibilità generale.

A giugno 2026, le seguenti lingue sono formalmente validate:

  • Olandese (Paesi Bassi) (nl-NL)
  • Inglese (Australia) (en-AU)
  • inglese (stati uniti) (en-us)
  • Inglese (Regno Unito) (en-GB)
  • Francese (Canada) (fr-CA)
  • Francese (Francia) (fr-FR)
  • Tedesco (Germania) (de-DE)
  • Italiano (Italia) (it-IT)
  • Portoghese (Brasile) (pt-BR)
  • Spagnolo (Spagna) (es-ES)
  • Spagnolo (Stati Uniti) (es-US)

Microsoft continua a convalidare altre lingue e aggiungerle dopo il completamento della certificazione. È possibile aggiungere qualsiasi lingua supportata da Copilot Studio. Tuttavia, le lingue non completamente certificate per la qualità a livello di GA devono essere testate accuratamente prima della distribuzione in produzione.

Important

La funzionalità del linguaggio tecnico non è uguale a un linguaggio supportato o certificato. Se si prevede di distribuire agenti in lingue diverse dall'inglese, è consigliabile eseguire test estesi con chiamanti e flussi di chiamata reali prima di andare in tempo reale.

Variabili del contesto

Un agente in tempo reale supporta variabili di contesto che gli permettono di comportarsi in modo più intelligente trasportando informazioni sulla conversazione e sul cliente. Le variabili di contesto disponibili dipendono dal canale. Questo set include:

Variabile di contesto Descrizione
ID canale Identifica il canale di comunicazione usato per l'interazione. Applicabile solo al canale vocale.
Numero di telefono chiamante (ANI) Numero di telefono di origine del chiamante. Applicabile solo al canale vocale.
Numero del chiamato (DNIS) Numero di telefono di destinazione composto dal chiamante. Applicabile solo al canale vocale.
ID conversazione Identificatore univoco per la sessione di chiamata attiva.
Intestazioni SIP Supportano le coppie chiave-valore di intestazione SIP associate alla chiamata. Applicabile solo al canale vocale.
Data corrente (UTC) Data corrente nell'ora UTC (Coordinated Universal Time), fornita in fase di esecuzione per consentire risposte con riconoscimento della data.
Ora corrente (UTC) Ora corrente nel tempo universale coordinato (UTC), fornita al tempo di esecuzione per consentire risposte consapevoli del tempo.

Scopri di più su tutte le altre variabili di contesto, inclusi i messaggi digitali e le variabili di contesto personalizzate, in Configura le variabili di contesto per agenti.

Impostazioni specifiche del canale

Voce agente

Selezionare la voce usata dall'agente selezionando l'agente e passare a Impostazioni>Voce>Seleziona voce. Gli agenti in tempo reale supportano le seguenti voci:

  • Lega
  • Cenere
  • Ballata
  • Corallo
  • Echo
  • Sage
  • Shimmer
  • Verso
  • Marin
  • Cedar

Note

  • La voce dell'agente è per il tuo agente in tempo reale e non è quella configurata nel centro di amministrazione del servizio Copilot.
  • Per abbinare le voci dei messaggi del sistema Dynamics con il tuo agente in tempo reale, usa solo le seguenti voci supportate: Alloy, Echo, Shimmer o Ash.
  • Gli agenti che utilizzano Text LLM, GPT-5-Chat (Anteprima) generano risposte vocali tramite Microsoft Neural Text-to-Speech (TTS). Questo modello supporta un catalogo vocale più ampio e modelli vocali personalizzati, rendendolo adatto a organizzazioni che richiedono esperienze vocali brandizzate o personalizzazione avanzata della voce.

Sensibilità vocale

Il rilevamento delle attività vocali con sensibilità vocale (VAD) determina quando l'agente deve rispondere dopo che il chiamante ha terminato di parlare.

Comprendere i tipi di VAD

Gli agenti in tempo reale supportano due approcci di VAD:

Screenshot della finestra di dialogo Sensibilità del discorso.

VAD basato su server - Basato sul suono (silenzio)

  • Rileva la fine del parlato in base ai segnali audio (durata del silenzio, volume)

  • Risponde rapidamente una volta rilevato il silenzio

  • Ideale per interazioni strutturate, risposte brevi, ambienti rumorosi

VAD semantico - Basato sul contesto della frase

  • Determina il completamento dei turni in base al significato di ciò che è stato detto

  • Si adatta alle pause naturali, alle parole riempitrici, al parlato finale

  • Ideale per: interazioni conversazionali, domande complesse, discussioni aperte

Seleziona il VAD giusto

Usare VAD basato su server quando tutte le condizioni seguenti sono vere:

  • Le interazioni sono strutturate (spostamento tramite menu in stile IVR).
  • Le risposte sono brevi e prevedibili.
  • Il rumore di fondo è un problema (il VAD semantico potrebbe aspettare troppo a lungo).
  • Vuoi un turno veloce e dinamico.

Usare VAD semantico quando tutte le condizioni seguenti sono vere:

  • Le conversazioni sono aperte.
  • I chiamanti potrebbero esitare o usare parole riempitive ("um", "lasciami pensare...").
  • Le domande sono complesse (i chiamanti spiegano le situazioni).
  • Il flusso di conversazione naturale è prioritario.

Configura il VAD basato su server

Passare a Impostazioni>Voce>Configurazione telefono>Input vocale>Sensibilità>Basata sul suono (silenzio).

Screenshot della finestra di dialogo Sensibilità vocale quando è impostata su In base al suono (silenzio).

Parametro Descrizione Predefinito Intervallo consigliato
Soglia Sensibilità alla voce e rumore (scala 0-1) 0,6 0.5-0.7
Riempimento del prefisso (ms) Audio acquisito prima dell'avvio del riconoscimento vocale 300 ms 200-500 ms
Durata silenzio (ms) Silenzio necessario per terminare il turno 750 millisecondi 750-1000 ms

Threshold

  • Inferiore (0,3-0,4): più sensibile; raccoglie il parlato silenzioso, potrebbe attivare il rumore di fondo.
  • Superiore (0,7-0,9): meno sensibile; richiede un parlato più forte, riduce le falsi attivazioni.
  • Consigliato: Inizia con 0,5; Aumenta se il rumore di fondo causa falsi trigger.

Riempitura del prefisso

  • Acquisisce l'audio prima del rilevamento vocale (impedisce di tagliare la prima parola).
  • Inferiore (200 ms): risposta più veloce; potrebbe perdere la prima sillaba.
  • Superiore (500 ms): acquisizione più sicura; lieve ritardo.
  • Consigliato: 300 ms (buon equilibrio).

Durata del silenzio

  • Per quanto tempo il chiamante deve essere invisibile all'utente prima che l'agente risponda.
  • Inferiore (500 ms): rapido cambio di turno; potrebbe interrompere se il chiamante fa una pausa a metà pensiero.
  • Superiore (1000 ms): più paziente; potrebbe sentirsi lento.
  • Consigliato: iniziare con 750 ms.

Configura il VAD semantico

Passare a Impostazioni>Voce>Configurazione telefono>Input vocale>Sensibilità>In base al contesto della frase.

Screenshot della finestra di dialogo Sensibilità vocale quando è impostata su In base al contesto della frase.

Parametro: Zelo (la velocità con cui l'agente risponde dopo il completamento semantico)

Impostazione Behavior Ideale per
Low Attende più a lungo, molto paziente Chiamanti che pensano ad alta voce, pause frequenti
Intermedio Bilanciato (impostazione predefinita) Conversazioni generali
Alto Risponde rapidamente Interazioni veloci, domande semplici

Configurazione DTMF

Dual-Tone Multi-Frequency (DTMF) permette ai chiamanti di inserire informazioni utilizzando la tastiera del telefono.

È possibile attivare DTMF per l'agente sia a livello di argomento che a livello globale. Per impostarlo a livello globale, selezionare l'agente e passare a Impostazioni>Comportamento> conversazionevocale>DTMF.

Important

Quando si costruiscono esperienze basate esclusivamente su DTMF, configurare l'input DTMF per ogni nodo di input, incluse le selezioni di menu e gli input a più cifre, come numeri di account o PIN. Assicurarsi che tutti i possibili percorsi di input dei clienti abbiano corrispondenti mappe DTMF in modo che gli utenti possano navigare e completare la conversazione usando solo l'input da tastiera.

Rilevamento del silenzio

Il rilevamento del silenzio consente agli agenti in tempo reale di riconoscere quando un chiamante non fornisce input per un periodo specificato. Configura il rilevamento del silenzio come impostazione vocale globale per l'agente andando su Impostazioni>Voce>Comportamento della conversazione>Rilevamento del silenzio.

Important

  • Il rilevamento del silenzio non è attivato per impostazione predefinita. Se l'utente non parla, l'agente attende un tempo illimitato senza chiedere conferma. Attivare in modo esplicito il rilevamento del silenzio e configurare un messaggio di ripetizione per gestire i chiamanti silenziosi.
  • Il timeout di rilevamento del silenzio predefinito è 7.000 ms (7 secondi). Convalidare questo valore in base al caso d'uso specifico e all'ambiente chiamante prima della distribuzione nell'ambiente di produzione. Sette secondi potrebbero sembrare troppo lunghi per alcuni chiamanti o troppo brevi per altri a seconda della natura dell'interazione, ad esempio domande complesse o ambienti rumorosi. Testare con i dati delle chiamate reali per determinare la soglia appropriata per lo scenario.
  • Prima di abilitare il rilevamento del silenzio, assicurarsi che il comportamento configurato nell'argomento di rilevamento silenzio (ad esempio, Escalation, Hang Up, Reprompt) sia intenzionale e appropriato per il caso d'uso. Il comportamento di fallback configurato in modo errato, come impostare per errore il fallback su Escalare quando l'intenzione è di terminare la chiamata, o viceversa, può portare a risultati imprevisti delle chiamate.

Messaggi di latenza

Aggiungere messaggi di latenza o musica all'agente quando le operazioni in background richiedono più tempo del previsto. Per configurare la messaggistica di latenza, passare a Impostazioni>Voce>Comportamento conversazione>Messaggi di latenza.

Important

Poiché la soluzione agente in tempo reale Text LLM utilizza più passaggi sequenziali (ASR, LLM, TTS), i chiamanti sperimentano alcuni secondi di silenzio tra il parlare e sentire una risposta. Stabilisci aspettative appropriate con gli utenti, ad esempio, usando una frase come "Un momento per favore, sto cercando questo per te...".

Screenshot della finestra di dialogo di messaggistica sulla latenza.

Valutazione in tempo reale degli agenti

Gli agenti in tempo reale supportano l'invio di testo durante la valutazione, tuttavia l'elaborazione audio non è supportata.