Configurer les agents en temps réel

Note

Cet article décrit les caractéristiques utilisées dans les agents ou flux d’agents alimentés par le faisceau standard.

Pour déployer un agent en temps réel, activez le modèle en temps réel, configurez les paramètres principaux de l’agent, puis configurez les fonctionnalités spécifiques à chaque canal requises. Vous pouvez déployer le même agent sur le canal vocal, les canaux de messagerie numérique, ou les deux.

Note

Les agents en temps réel sont en aperçu pour les canaux de messagerie numérique. Les fonctionnalités en version préliminaire ne sont pas destinées à une utilisation en production et peuvent être restreintes. Ces fonctionnalités sont soumises à des conditions d’utilisation supplémentaires. Microsoft les fournit avant une sortie officielle afin que les clients puissent accéder en anticipation et donner leur avis.

Configurez et activez des agents en temps réel

  1. Créez un agent et configurez ses détails de base, tels qu’un nom descriptif et l’objectif de l’agent dans la description.

  2. Accédez aux paramètres Voix de l’agent et activez Activer la voix. Dans Type Voix, sélectionnez Temps réel.

    Important

    Ce paramètre est une sélection ponctuelle. Après avoir sélectionné le mode Temps réel, vous ne pouvez plus revenir à un type d’agent de base. Pour utiliser un agent basique, créez-en un nouvel agent. Ce réglage est nécessaire même si vous utilisez l’agent sur un canal de messagerie numérique.

  3. Sélectionnez le modèle que vous souhaitez utiliser, GPT-Realtime, GPT-Realtime-Mini ou GPT-5-Chat (Aperçu). GPT-5-Chat (Aperçu) est un modèle vocal textuel LLM qui génère des réponses vocales via le système de synthèse vocale neuronale Microsoft (TTS).
    Découvrez comment ces modèles fonctionnent en fonction de leurs régions prises en charge et de leurs considérations de déploiement. Le tableau suivant décrit les scénarios dans lesquels vous pouvez utiliser différents modèles.

    Scenario GPT-Realtime GPT-5-Chat (Aperçu)
    Style de conversation Interactions parole-à-parole natives La parole est convertie en texte pour le raisonnement, puis synthétisée à nouveau en parole
    Latency Latence la plus faible pour les conversations naturelles Latence plus élevée que GPT-Realtime
    Personnalisation vocale Prend en compte les options vocales en temps réel intégrées pour les agents vocaux en temps réel Prend en charge le système de synthèse vocale Microsoft Neural Speech (TTS), incluant un catalogue vocal plus large et des modèles de voix personnalisés
    Expériences vocales de marque Options de personnalisation limitées Recommandé lorsque vous avez besoin d’une expérience vocale personnalisée ou de marque
    Flexibilité du déploiement régional Limité aux régions de modèles en temps réel pris en charge Une plus grande flexibilité grâce aux services de reconnaissance vocale et TTS
    Idéal pour Conversations vocales naturelles à faible latence et interactions ouvertes Scénarios nécessitant une personnalisation vocale avancée, des voix personnalisées, des exigences de conformité ou une flexibilité régionale de déploiement

    Tip

    • Utilisez GPT-Realtime lorsque la qualité naturelle de la conversation et la faible latence sont les exigences principales.
    • Utilisez GPT-Realtime-Mini (Aperçu) pour les scénarios nécessitant des interactions vocales rapides avec une latence et une utilisation de ressources plus faibles.
    • Utilisez GPT-5-Chat (Aperçu) lorsque la personnalisation vocale, les modèles de voix personnalisés ou la flexibilité de déploiement sont plus importants que la latence de réponse.
  4. Accédez aux paramètres de sécurité de l’agent et sélectionnez Aucune authentification.

Connaissances et outils

Vous pouvez configurer votre agent pour utiliser les connaissances et les outils. Pour en savoir plus sur le résumé des sources de connaissances, ajoutez des outils aux agents personnalisés et outils, connaissances, MCP et API.

Agents imbriqués (version préliminaire)

Les agents en temps réel ne prennent en charge que les agents enfants.

Important

Vérifiez que les descriptions de l’agent enfant ne chevauchent pas les descriptions des rubriques. Définissez explicitement l’ordre d’appel dans les instructions de l’agent.

Rubriques

Les agents temps réel prennent en charge tous les sujets configurés dans Copilot Studio. Utilisez des sujets pour définir des comportements déterministes tels que les salutations, les règles métier et l’escalade, tandis que le modèle que vous avez choisi gère les réponses conversationnelles à l’exécution. Apprenez-en davantage dans Choisir comment contrôler la conversation.

Bonnes pratiques

  • Utilisez des rubriques uniquement lorsque le comportement déterministe est requis.

  • Utilisez du texte statique dans les messages d’accueil pour la première réponse la plus rapide. Les messages dynamiques avec des variables et des expressions augmentent la latence initiale.

  • Désactivez le sujet Début de conversation si vous voulez que le modèle d’agent en temps réel gère la salutation. Sinon, le message d’accueil configuré dans la rubrique Conversation Start est diffusé à la place du message d’accueil du modèle vocal.

  • Laissez le modèle d’agent en temps réel gérer la conversation générale et les questions de suivi.

  • Incluez une action explicite dans la rubrique On Error, comme le transfert ou la fin de l’appel. La gestion des erreurs de message uniquement n’est pas suffisante. Sans étape suivante déterministe, les clients peuvent rencontrer un silence pour les agents vocaux ou des appels bloqués pour les canaux de messagerie, ce qui entraîne de la confusion et une mauvaise expérience client.

  • Utilisez des descriptions explicites de rubriques et d’outils pour déclarer la propriété de la collecte de données. Apprenez-en davantage dans Écrire des descriptions efficaces de rubriques et d’outils.

Support du nœud de la rubrique

La liste suivante décrit le support thématique chez les agents temps réel :

Nœud Condition

Fonctionnalité Support
Branchement If/Else Pris en charge
Expressions Power Fx Pris en charge
Retraitement de remplissage des variables Pris en charge

Nœud de message

Fonctionnalité Support
Message de base Pris en charge
Variantes de message Soutenu
Insertion de variable Soutenu
SSML Canal vocal uniquement
Rich Media/Cartes adaptatives  Pris en charge uniquement pour les canaux de messagerie numérique. Cette fonctionnalité est en version préliminaire. 
Réponses rapides Pris en charge uniquement pour les canaux de messagerie numérique. Cette fonctionnalité est en version préliminaire. 

Nœud de question

Fonctionnalité Support
Texte d’invite Soutenu
Mise en attente automatique Non pris en charge
Remplissage de slots Soutenu
Comportement de saut / Remplissage glouton des variables Soutenu
Redemander / Réessayer Soutenu
Gestion des réponses non valide Soutenu
Interruption de sujet Soutenu
Interruption Pris en charge uniquement pour le canal vocal.
Message de reprompt personnalisé Soutenu
Saisie DTMF Pris en charge uniquement pour le canal vocal.
Détection du silence Pris en charge uniquement pour le canal vocal.

Nœud HTTP

Fonctionnalité Support
Méthodes HTTP : GET, POST, PUT, PATCH, DELETE Pris en charge
Points de terminaison d’URL Pris en charge
En-têtes et charges utiles Pris en charge
Analyse et schéma de réponse Pris en charge
Mappage des variables Pris en charge
Gestion des erreurs Pris en charge

Nœud d'outil

Fonctionnalité Support
Flux Power Automate Soutenu
Appel d’outil Soutenu
Mappage d’entrée/sortie Soutenu
Nouvelle invite Soutenu

Nœud Définir la valeur de la variable

Fonctionnalité Support
Affectation littérale Pris en charge
Affectation d’expression Pris en charge
D'une variable à une autre Pris en charge

Nœud de gestion des rubriques

Fonctionnalité Support
Fin de la rubrique actuelle Pris en charge
Terminer toutes les rubriques Pris en charge
Terminer la conversation Pris en charge
Passer à l’étape Pris en charge
Entrée utilisateur pour la reconnaissance d'intention Pris en charge
Accéder à une autre rubrique Pris en charge

Transférer le nœud de conversation

Fonctionnalité Support
Transférer à l’agent Pris en charge
Transfert de numéros de téléphone externes Pris en charge uniquement pour le canal vocal. 

Avancé

Fonctionnalité Support
Créer des réponses génératives Pris en charge

Support du déclencheur système

Trigger Support Détails
Au démarrage de la conversation Soutenu Se déclenche lorsqu’une nouvelle conversation commence
Service de discussion avec un représentant Soutenu Transferts vers l’agent humain
Sujet inconnu/Sur intention inconnue Non pris en charge Option par défaut quand aucune rubrique ne correspond
OnSelectIntent (plusieurs rubriques mises en correspondance) Non pris en charge Ambiguïté entre les sujets similaires
Réinitialiser la conversation (OnSystemRedirect) Soutenu Efface les variables et redémarre le flux
Lors de la connexion Non pris en charge
Appui sur une touche DTMF inconnue Soutenu Entrée non mappée par clavier. Applicable uniquement au canal vocal.
L’agent choisit / L’utilisateur indique une expression Soutenu L’agent sélectionne la rubrique en fonction de l’intention
Un message est reçu Non pris en charge Augmente la latence
Un événement client personnalisé se produit Non pris en charge Uniquement au démarrage de la session
Mise à jour de la conversation Non pris en charge Membres ajoutés ou supprimés, modifications de session
Il est invoqué Non pris en charge Nécessite une interface utilisateur synchrone
Il est redirigé Soutenu
L’utilisateur est inactif pendant une période spécifiée. Soutenu Délai d’inactivité de l’utilisateur. Applicable uniquement aux canaux de messagerie numérique.
Détection du silence Soutenu Applicable uniquement au canal vocal.
Un plan est achevé Non pris en charge
Réponse IA générée Non pris en charge
En cas d’erreur Soutenu Gère les erreurs d’orchestration

Passer des variables entre les rubriques et le modèle de langage

Lorsque vous utilisez des rubriques dans un flux conversationnel hybride, comprendre comment passer des variables entre les rubriques et le modèle de langage en temps réel est essentiel pour créer des interactions fiables avec gestion d'état. Ce processus s’applique à tous les canaux.

Cette fonctionnalité fonctionne dans le processus suivant :

  • Vous transmettez des variables d’entrée définies sur une rubrique dans la rubrique au moment de l’appel, afin que le modèle de langage puisse fournir des données structurées au flux déterministe.

  • Vous retournez des variables de sortie définies sur une rubrique au modèle de langage à la fin de l’exécution de la rubrique en tant que paires clé-valeur structurées.

  • Les sorties des appels d’outils suivent le même schéma.

  • Le modèle de langage est alimenté par le contexte conversationnel, y compris les paires clé-valeur du résultat d’appel d’outil. Toutefois, vous retournez uniquement des variables de sortie explicitement définies en tant que données structurées.

  • La description de la variable aide le modèle à comprendre comment utiliser la variable lors d’une conversation. Fournir des définitions claires et descriptives.

Pour plus d’informations, consultez Gérer les entrées et sorties de rubrique.

Prise en charge multilingue

Ajoutez toutes les langues secondaires souhaitées. Les chaînes de localisation ne sont pas requises pour les flux en temps réel. Toutefois, pour les messages de rubrique déterministes, vous devez fournir les messages traduits. Pour en savoir plus, consultez Configurer et créer des agents multilingues.

Le modèle en temps réel peut comprendre et répondre dans de nombreuses langues. Toutefois, Microsoft ne valide pas formellement toutes les langues pour la disponibilité générale.

En juin 2026, les langages suivants sont officiellement validés :

  • Néerlandais (Pays-Bas) (nl-NL)
  • Anglais (Australie) (en-AU)
  • Anglais (États-Unis) (en-US)
  • Anglais (Royaume-Uni) (en-GB)
  • Français (Canada) (fr-CA)
  • Français (France) (fr-FR)
  • Allemand (Allemagne) (de-DE)
  • Italien (Italie) (it-IT)
  • Portugais (Brésil) (pt-BR)
  • Espagnol (Espagne) (es-ES)
  • Espagnol (États-Unis) (es-US)

Microsoft continue de valider d’autres langues et les ajoute après la fin de la certification. Vous pouvez ajouter n’importe quelle langue prise en charge par Copilot Studio. Toutefois, les langues qui ne sont pas entièrement certifiées pour la qualité au niveau GA doivent être soigneusement testées avant la mise en production.

Important

La fonctionnalité de langage technique n’est pas égale à une langue prise en charge ou certifiée. Si vous envisagez de déployer des agents dans des langues autres que l’anglais, vous devez effectuer des tests approfondis avec des appelants et des flux d’appels réels avant d’aller en direct.

Variables de contexte

Un agent en temps réel prend en charge des variables de contexte qui lui permettent de se comporter de manière plus intelligente en transportant des informations sur la conversation et le client. Les variables de contexte disponibles dépendent du canal. Cet ensemble comprend les éléments suivants :

Variable contextuelle Description
ID de canal Identifie le canal de communication utilisé pour l’interaction. Applicable uniquement au canal vocal.
Numéro de téléphone de l’appelant (ANI) Numéro de téléphone d’origine de l’appelant. Applicable uniquement au canal vocal.
Numéro d’appelé (DNIS) Numéro de téléphone de destination que l’appelant a composé. Applicable uniquement au canal vocal.
ID de conversation Identificateur unique de la session d’appel active.
En-têtes SIP Prise en charge des paires clé et valeur en-tête SIP associées à l’appel. Applicable uniquement au canal vocal.
Date actuelle (UTC) La date actuelle en temps universel coordonné (UTC) est fournie au moment de l'exécution pour permettre des réponses sensibles aux dates.
Heure actuelle (UTC) L'heure actuelle en temps universel coordonné (UTC), fournie au moment de l’exécution pour autoriser les réponses tenant compte du temps.

En savoir plus sur toutes les autres variables de contexte, y compris la messagerie numérique et les variables de contexte personnalisées, dans Configurer les variables de contexte pour les agents.

Paramètres spécifiques aux canaux

Voix de l’agent

Sélectionnez la voix utilisée par votre agent en sélectionnant votre agent et accédez à Paramètres>vocaux>Sélectionner la voix. Les agents temps réel prennent en charge les voix suivantes :

  • Alliage
  • Cendres
  • Ballade
  • Corail
  • Écho
  • Sage
  • Miroitement
  • Verse
  • Marin
  • Cèdre

Note

  • La voix de l'agent est pour votre agent en temps réel et n'est pas celle configurée dans le centre d'administration du service Copilot.
  • Pour faire correspondre les voix de vos messages système Dynamics avec celles de votre agent en temps réel, utilisez uniquement les voix supportées suivantes : Alloy, Echo, Shimmer ou Ash.
  • Les agents qui utilisent un LLM textuel, GPT-5-Chat (Aperçu), génèrent des réponses vocales à l’aide de Microsoft Neural Text-to-Speech (TTS). Ce modèle prend en charge un catalogue vocal plus large et des modèles de voix personnalisés, ce qui le rend adapté aux organisations qui recherchent des expériences vocales de marque ou une personnalisation vocale avancée.

Sensibilité vocale

La détection d'activité vocale sensible (VAD) détermine quand l'agent doit répondre après que l'appelant a fini de parler.

Comprendre les types de DAV

Les agents en temps réel prennent en charge deux approches VAD :

Capture d’écran de la boîte de dialogue Sensibilité Vocale.

VAD basé sur le serveur - Basé sur le son (silence)

  • Détecte la fin de la parole en fonction des signaux audio (durée du silence, volume)

  • Répond rapidement une fois que le silence est détecté

  • Idéal pour les interactions structurées, les réponses courtes, les environnements bruyants

VAD sémantique - Basé sur le contexte de phrase

  • Détermine l’achèvement du tour en fonction de la signification de ce qui a été dit

  • S’adapte aux pauses naturelles, aux mots de remplissage, aux paroles de fin

  • Idéal pour : interactions conversationnelles, questions complexes, discussions ouvertes

Sélectionnez le bon VAD

Utilisez la fonction VAD basée sur le serveur lorsque toutes les conditions suivantes sont remplies :

  • Les interactions sont structurées (navigation dans le menu de style IVR).
  • Les réponses sont courtes et prévisibles.
  • Le bruit d’arrière-plan est un problème (le VAD sémantique peut attendre trop longtemps).
  • Vous voulez une interaction rapide et fluide.

Utilisez la fonction VAD sémantique lorsque toutes les conditions suivantes sont remplies :

  • Les conversations sont libres et sans limite définie.
  • Les appelants peuvent hésiter ou utiliser des mots de remplissage (« um », « laissez-moi penser... »).
  • Les questions sont complexes (les appelants expliquent les situations).
  • La fluidité naturelle des conversations est priorisée.

Configurer le VAD basé sur serveur

Accédez à Paramètres>Voix>Configuration Téléphone>Entrée vocale>Sensibilité>Basé sur le son (silence).

Capture d’écran de la boîte de dialogue de sensibilité vocale lorsque la valeur est basée sur le silence (son).

Paramètre Description Default Plage recommandée
Seuil Sensibilité à la voix et au bruit (échelle 0-1) 0,6 0.5-0.7
Remplissage de préfixes (ms) Audio capturé avant le début de la parole 300 ms 200-500 ms
Durée du silence (ms) Silence requis pour terminer le tour 750 ms 750-1000 ms

Threshold

  • Inférieur (0,3-0,4) : plus sensible ; récupère la parole silencieuse, peut déclencher le bruit d’arrière-plan.
  • Plus élevé (0,7-0,9) : moins sensible ; nécessite une voix plus forte, réduit les faux déclencheurs.
  • Recommandé : Commencez avec 0,5 ; Augmentez si le bruit de fond provoque de faux déclencheurs.

Remplissage de préfixe

  • Capture l’audio avant la détection vocale (empêche la suppression du premier mot).
  • Inférieur (200 ms) : réponse plus rapide ; peut manquer la première syllabe.
  • Plus élevé (500 ms) : capture plus sûre ; léger retard.
  • Recommandé : 300 ms (bon équilibre).

Durée du silence

  • Durée pendant laquelle l’appelant doit être silencieux avant que l’agent ne réponde.
  • Faible (500 ms) : prise de parole rapide ; peut interrompre si l'appelant s'interrompt.
  • Plus élevé (1000 ms) : plus patient ; peut sembler lent.
  • Recommandé : commencez par 750 ms.

Configurer le VAD sémantique

Accédez à Paramètres>Voix>Configuration du téléphone>Entrée vocale>Sensibilité>En fonction du contexte de la phrase.

Capture d’écran de la boîte de dialogue Sensibilité vocale lorsque la valeur est réglée en fonction du contexte de la phrase.

Paramètre : promptitude (vitesse à laquelle l’agent répond après la complétion sémantique)

Setting Comportement Idéal pour
Faible Attend plus longtemps, très patient Appelants qui pensent à haute voix, des pauses fréquentes
Moyenne Équilibré (par défaut) Conversations générales
Élevé Répond rapidement Interactions rapides, questions simples

Configuration DTMF

Dual-Tone Multi-Fréquence (DTMF) permet aux appelants de saisir des informations à l’aide du clavier de leur téléphone.

Vous pouvez activer DTMF pour votre agent à la fois au niveau du sujet et au niveau global. Pour le définir au niveau global, sélectionnez votre agent et accédez à Paramètres>Vocale>Comportement de conversation>DTMF.

Important

Lors de la création d’expériences DTMF uniquement, configurez les entrées DTMF pour chaque nœud d’entrée, y compris les sélections de menus et les entrées à plusieurs chiffres comme les numéros de compte ou les codes PIN. Assurez-vous que tous les chemins d’entrée clients possibles disposent d’un mappage DTMF correspondant afin que les utilisateurs puissent naviguer et mener la conversation uniquement en utilisant l’entrée du clavier.

Détection du silence

La détection de silence permet aux agents en temps réel de reconnaître lorsqu’un appelant ne fournit aucune entrée pendant une période spécifiée. Configurez la détection de silence comme paramètre vocal global pour l’agent en accédant à Paramètres>Voix>Comportement de conversation>Détection de silence.

Important

  • La détection du silence n’est pas activée par défaut. Si l’utilisateur ne parle pas, l’agent attend indéfiniment sans donner de consigne. Activez explicitement la détection du silence et configurez un message de repromptage pour gérer les appelants silencieux.
  • Le délai d’expiration de détection du silence par défaut est de 7 000 ms (7 secondes). Validez cette valeur par rapport à votre cas d’usage spécifique et à votre environnement d’appelant avant le déploiement en production. Sept secondes peuvent être trop longues pour certains appelants ou trop court pour d’autres en fonction de la nature de l’interaction, par exemple, des questions complexes ou des environnements bruyants. Testez avec des données d’appel réelles pour déterminer le seuil approprié pour votre scénario.
  • Avant d’activer la détection du silence, assurez-vous que le comportement que vous configurez dans votre rubrique de détection de silence (par exemple, Escalader, Raccrocher, Reprompt) est intentionnel et approprié pour votre cas d’usage. Un comportement de repli mal configuré, comme définir par inadvertance le repli sur Escalader alors que l’intention est de raccrocher, ou inversement, peut entraîner des résultats d’appel inattendus.

Messagerie de latence

Ajoutez un message de latence ou de la musique à votre agent lorsque les opérations en arrière-plan prennent plus de temps que prévu. Pour configurer la messagerie de latence, accédez à Paramètres>Voix>Comportement de la conversation>Messagerie de latence.

Important

Parce que la solution d’agent en temps réel Text LLM utilise plusieurs étapes séquentielles (ASR, LLM, TTS), les appelants subissent quelques secondes de silence entre la parole et l’écoute d’une réponse. Fixez des attentes appropriées avec les utilisateurs, par exemple, en utilisant une phrase comme « Un instant s’il vous plaît, je cherche ça pour vous... ».

Capture d’écran de la boîte de dialogue Messagerie de latence.

Évaluation en temps réel de l’agent

Les agents en temps réel prennent en charge l’envoi de texte pendant l’évaluation, cependant, le traitement audio n’est pas pris en charge.