Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Note
Cet article décrit les caractéristiques utilisées dans les agents ou flux d’agents alimentés par le faisceau standard.
Pour déployer un agent en temps réel, activez le modèle en temps réel, configurez les paramètres principaux de l’agent, puis configurez les fonctionnalités spécifiques à chaque canal requises. Vous pouvez déployer le même agent sur le canal vocal, les canaux de messagerie numérique, ou les deux.
Note
Les agents en temps réel sont en aperçu pour les canaux de messagerie numérique. Les fonctionnalités en version préliminaire ne sont pas destinées à une utilisation en production et peuvent être restreintes. Ces fonctionnalités sont soumises à des conditions d’utilisation supplémentaires. Microsoft les fournit avant une sortie officielle afin que les clients puissent accéder en anticipation et donner leur avis.
Configurez et activez des agents en temps réel
Créez un agent et configurez ses détails de base, tels qu’un nom descriptif et l’objectif de l’agent dans la description.
Accédez aux paramètres Voix de l’agent et activez Activer la voix. Dans Type Voix, sélectionnez Temps réel.
Important
Ce paramètre est une sélection ponctuelle. Après avoir sélectionné le mode Temps réel, vous ne pouvez plus revenir à un type d’agent de base. Pour utiliser un agent basique, créez-en un nouvel agent. Ce réglage est nécessaire même si vous utilisez l’agent sur un canal de messagerie numérique.
Sélectionnez le modèle que vous souhaitez utiliser, GPT-Realtime, GPT-Realtime-Mini ou GPT-5-Chat (Aperçu). GPT-5-Chat (Aperçu) est un modèle vocal textuel LLM qui génère des réponses vocales via le système de synthèse vocale neuronale Microsoft (TTS).
Découvrez comment ces modèles fonctionnent en fonction de leurs régions prises en charge et de leurs considérations de déploiement. Le tableau suivant décrit les scénarios dans lesquels vous pouvez utiliser différents modèles.Scenario GPT-Realtime GPT-5-Chat (Aperçu) Style de conversation Interactions parole-à-parole natives La parole est convertie en texte pour le raisonnement, puis synthétisée à nouveau en parole Latency Latence la plus faible pour les conversations naturelles Latence plus élevée que GPT-Realtime Personnalisation vocale Prend en compte les options vocales en temps réel intégrées pour les agents vocaux en temps réel Prend en charge le système de synthèse vocale Microsoft Neural Speech (TTS), incluant un catalogue vocal plus large et des modèles de voix personnalisés Expériences vocales de marque Options de personnalisation limitées Recommandé lorsque vous avez besoin d’une expérience vocale personnalisée ou de marque Flexibilité du déploiement régional Limité aux régions de modèles en temps réel pris en charge Une plus grande flexibilité grâce aux services de reconnaissance vocale et TTS Idéal pour Conversations vocales naturelles à faible latence et interactions ouvertes Scénarios nécessitant une personnalisation vocale avancée, des voix personnalisées, des exigences de conformité ou une flexibilité régionale de déploiement Tip
- Utilisez GPT-Realtime lorsque la qualité naturelle de la conversation et la faible latence sont les exigences principales.
- Utilisez GPT-Realtime-Mini (Aperçu) pour les scénarios nécessitant des interactions vocales rapides avec une latence et une utilisation de ressources plus faibles.
- Utilisez GPT-5-Chat (Aperçu) lorsque la personnalisation vocale, les modèles de voix personnalisés ou la flexibilité de déploiement sont plus importants que la latence de réponse.
Accédez aux paramètres de sécurité de l’agent et sélectionnez Aucune authentification.
Connaissances et outils
Vous pouvez configurer votre agent pour utiliser les connaissances et les outils. Pour en savoir plus sur le résumé des sources de connaissances, ajoutez des outils aux agents personnalisés et outils, connaissances, MCP et API.
Agents imbriqués (version préliminaire)
Les agents en temps réel ne prennent en charge que les agents enfants.
Important
Vérifiez que les descriptions de l’agent enfant ne chevauchent pas les descriptions des rubriques. Définissez explicitement l’ordre d’appel dans les instructions de l’agent.
Rubriques
Les agents temps réel prennent en charge tous les sujets configurés dans Copilot Studio. Utilisez des sujets pour définir des comportements déterministes tels que les salutations, les règles métier et l’escalade, tandis que le modèle que vous avez choisi gère les réponses conversationnelles à l’exécution. Apprenez-en davantage dans Choisir comment contrôler la conversation.
Bonnes pratiques
Utilisez des rubriques uniquement lorsque le comportement déterministe est requis.
Utilisez du texte statique dans les messages d’accueil pour la première réponse la plus rapide. Les messages dynamiques avec des variables et des expressions augmentent la latence initiale.
Désactivez le sujet Début de conversation si vous voulez que le modèle d’agent en temps réel gère la salutation. Sinon, le message d’accueil configuré dans la rubrique Conversation Start est diffusé à la place du message d’accueil du modèle vocal.
Laissez le modèle d’agent en temps réel gérer la conversation générale et les questions de suivi.
Incluez une action explicite dans la rubrique On Error, comme le transfert ou la fin de l’appel. La gestion des erreurs de message uniquement n’est pas suffisante. Sans étape suivante déterministe, les clients peuvent rencontrer un silence pour les agents vocaux ou des appels bloqués pour les canaux de messagerie, ce qui entraîne de la confusion et une mauvaise expérience client.
Utilisez des descriptions explicites de rubriques et d’outils pour déclarer la propriété de la collecte de données. Apprenez-en davantage dans Écrire des descriptions efficaces de rubriques et d’outils.
Support du nœud de la rubrique
La liste suivante décrit le support thématique chez les agents temps réel :
Nœud Condition
| Fonctionnalité | Support |
|---|---|
| Branchement If/Else | Pris en charge |
| Expressions Power Fx | Pris en charge |
| Retraitement de remplissage des variables | Pris en charge |
Nœud de message
| Fonctionnalité | Support |
|---|---|
| Message de base | Pris en charge |
| Variantes de message | Soutenu |
| Insertion de variable | Soutenu |
| SSML | Canal vocal uniquement |
| Rich Media/Cartes adaptatives | Pris en charge uniquement pour les canaux de messagerie numérique. Cette fonctionnalité est en version préliminaire. |
| Réponses rapides | Pris en charge uniquement pour les canaux de messagerie numérique. Cette fonctionnalité est en version préliminaire. |
Nœud de question
| Fonctionnalité | Support |
|---|---|
| Texte d’invite | Soutenu |
| Mise en attente automatique | Non pris en charge |
| Remplissage de slots | Soutenu |
| Comportement de saut / Remplissage glouton des variables | Soutenu |
| Redemander / Réessayer | Soutenu |
| Gestion des réponses non valide | Soutenu |
| Interruption de sujet | Soutenu |
| Interruption | Pris en charge uniquement pour le canal vocal. |
| Message de reprompt personnalisé | Soutenu |
| Saisie DTMF | Pris en charge uniquement pour le canal vocal. |
| Détection du silence | Pris en charge uniquement pour le canal vocal. |
Nœud HTTP
| Fonctionnalité | Support |
|---|---|
| Méthodes HTTP : GET, POST, PUT, PATCH, DELETE | Pris en charge |
| Points de terminaison d’URL | Pris en charge |
| En-têtes et charges utiles | Pris en charge |
| Analyse et schéma de réponse | Pris en charge |
| Mappage des variables | Pris en charge |
| Gestion des erreurs | Pris en charge |
Nœud d'outil
| Fonctionnalité | Support |
|---|---|
| Flux Power Automate | Soutenu |
| Appel d’outil | Soutenu |
| Mappage d’entrée/sortie | Soutenu |
| Nouvelle invite | Soutenu |
Nœud Définir la valeur de la variable
| Fonctionnalité | Support |
|---|---|
| Affectation littérale | Pris en charge |
| Affectation d’expression | Pris en charge |
| D'une variable à une autre | Pris en charge |
Nœud de gestion des rubriques
| Fonctionnalité | Support |
|---|---|
| Fin de la rubrique actuelle | Pris en charge |
| Terminer toutes les rubriques | Pris en charge |
| Terminer la conversation | Pris en charge |
| Passer à l’étape | Pris en charge |
| Entrée utilisateur pour la reconnaissance d'intention | Pris en charge |
| Accéder à une autre rubrique | Pris en charge |
Transférer le nœud de conversation
| Fonctionnalité | Support |
|---|---|
| Transférer à l’agent | Pris en charge |
| Transfert de numéros de téléphone externes | Pris en charge uniquement pour le canal vocal. |
Avancé
| Fonctionnalité | Support |
|---|---|
| Créer des réponses génératives | Pris en charge |
Support du déclencheur système
| Trigger | Support | Détails |
|---|---|---|
| Au démarrage de la conversation | Soutenu | Se déclenche lorsqu’une nouvelle conversation commence |
| Service de discussion avec un représentant | Soutenu | Transferts vers l’agent humain |
| Sujet inconnu/Sur intention inconnue | Non pris en charge | Option par défaut quand aucune rubrique ne correspond |
| OnSelectIntent (plusieurs rubriques mises en correspondance) | Non pris en charge | Ambiguïté entre les sujets similaires |
| Réinitialiser la conversation (OnSystemRedirect) | Soutenu | Efface les variables et redémarre le flux |
| Lors de la connexion | Non pris en charge | |
| Appui sur une touche DTMF inconnue | Soutenu | Entrée non mappée par clavier. Applicable uniquement au canal vocal. |
| L’agent choisit / L’utilisateur indique une expression | Soutenu | L’agent sélectionne la rubrique en fonction de l’intention |
| Un message est reçu | Non pris en charge | Augmente la latence |
| Un événement client personnalisé se produit | Non pris en charge | Uniquement au démarrage de la session |
| Mise à jour de la conversation | Non pris en charge | Membres ajoutés ou supprimés, modifications de session |
| Il est invoqué | Non pris en charge | Nécessite une interface utilisateur synchrone |
| Il est redirigé | Soutenu | |
| L’utilisateur est inactif pendant une période spécifiée. | Soutenu | Délai d’inactivité de l’utilisateur. Applicable uniquement aux canaux de messagerie numérique. |
| Détection du silence | Soutenu | Applicable uniquement au canal vocal. |
| Un plan est achevé | Non pris en charge | |
| Réponse IA générée | Non pris en charge | |
| En cas d’erreur | Soutenu | Gère les erreurs d’orchestration |
Passer des variables entre les rubriques et le modèle de langage
Lorsque vous utilisez des rubriques dans un flux conversationnel hybride, comprendre comment passer des variables entre les rubriques et le modèle de langage en temps réel est essentiel pour créer des interactions fiables avec gestion d'état. Ce processus s’applique à tous les canaux.
Cette fonctionnalité fonctionne dans le processus suivant :
Vous transmettez des variables d’entrée définies sur une rubrique dans la rubrique au moment de l’appel, afin que le modèle de langage puisse fournir des données structurées au flux déterministe.
Vous retournez des variables de sortie définies sur une rubrique au modèle de langage à la fin de l’exécution de la rubrique en tant que paires clé-valeur structurées.
Les sorties des appels d’outils suivent le même schéma.
Le modèle de langage est alimenté par le contexte conversationnel, y compris les paires clé-valeur du résultat d’appel d’outil. Toutefois, vous retournez uniquement des variables de sortie explicitement définies en tant que données structurées.
La description de la variable aide le modèle à comprendre comment utiliser la variable lors d’une conversation. Fournir des définitions claires et descriptives.
Pour plus d’informations, consultez Gérer les entrées et sorties de rubrique.
Prise en charge multilingue
Ajoutez toutes les langues secondaires souhaitées. Les chaînes de localisation ne sont pas requises pour les flux en temps réel. Toutefois, pour les messages de rubrique déterministes, vous devez fournir les messages traduits. Pour en savoir plus, consultez Configurer et créer des agents multilingues.
Le modèle en temps réel peut comprendre et répondre dans de nombreuses langues. Toutefois, Microsoft ne valide pas formellement toutes les langues pour la disponibilité générale.
En juin 2026, les langages suivants sont officiellement validés :
- Néerlandais (Pays-Bas) (nl-NL)
- Anglais (Australie) (en-AU)
- Anglais (États-Unis) (en-US)
- Anglais (Royaume-Uni) (en-GB)
- Français (Canada) (fr-CA)
- Français (France) (fr-FR)
- Allemand (Allemagne) (de-DE)
- Italien (Italie) (it-IT)
- Portugais (Brésil) (pt-BR)
- Espagnol (Espagne) (es-ES)
- Espagnol (États-Unis) (es-US)
Microsoft continue de valider d’autres langues et les ajoute après la fin de la certification. Vous pouvez ajouter n’importe quelle langue prise en charge par Copilot Studio. Toutefois, les langues qui ne sont pas entièrement certifiées pour la qualité au niveau GA doivent être soigneusement testées avant la mise en production.
Important
La fonctionnalité de langage technique n’est pas égale à une langue prise en charge ou certifiée. Si vous envisagez de déployer des agents dans des langues autres que l’anglais, vous devez effectuer des tests approfondis avec des appelants et des flux d’appels réels avant d’aller en direct.
Variables de contexte
Un agent en temps réel prend en charge des variables de contexte qui lui permettent de se comporter de manière plus intelligente en transportant des informations sur la conversation et le client. Les variables de contexte disponibles dépendent du canal. Cet ensemble comprend les éléments suivants :
| Variable contextuelle | Description |
|---|---|
| ID de canal | Identifie le canal de communication utilisé pour l’interaction. Applicable uniquement au canal vocal. |
| Numéro de téléphone de l’appelant (ANI) | Numéro de téléphone d’origine de l’appelant. Applicable uniquement au canal vocal. |
| Numéro d’appelé (DNIS) | Numéro de téléphone de destination que l’appelant a composé. Applicable uniquement au canal vocal. |
| ID de conversation | Identificateur unique de la session d’appel active. |
| En-têtes SIP | Prise en charge des paires clé et valeur en-tête SIP associées à l’appel. Applicable uniquement au canal vocal. |
| Date actuelle (UTC) | La date actuelle en temps universel coordonné (UTC) est fournie au moment de l'exécution pour permettre des réponses sensibles aux dates. |
| Heure actuelle (UTC) | L'heure actuelle en temps universel coordonné (UTC), fournie au moment de l’exécution pour autoriser les réponses tenant compte du temps. |
En savoir plus sur toutes les autres variables de contexte, y compris la messagerie numérique et les variables de contexte personnalisées, dans Configurer les variables de contexte pour les agents.
Paramètres spécifiques aux canaux
Voix de l’agent
Sélectionnez la voix utilisée par votre agent en sélectionnant votre agent et accédez à Paramètres>vocaux>Sélectionner la voix. Les agents temps réel prennent en charge les voix suivantes :
- Alliage
- Cendres
- Ballade
- Corail
- Écho
- Sage
- Miroitement
- Verse
- Marin
- Cèdre
Note
- La voix de l'agent est pour votre agent en temps réel et n'est pas celle configurée dans le centre d'administration du service Copilot.
- Pour faire correspondre les voix de vos messages système Dynamics avec celles de votre agent en temps réel, utilisez uniquement les voix supportées suivantes : Alloy, Echo, Shimmer ou Ash.
- Les agents qui utilisent un LLM textuel, GPT-5-Chat (Aperçu), génèrent des réponses vocales à l’aide de Microsoft Neural Text-to-Speech (TTS). Ce modèle prend en charge un catalogue vocal plus large et des modèles de voix personnalisés, ce qui le rend adapté aux organisations qui recherchent des expériences vocales de marque ou une personnalisation vocale avancée.
Sensibilité vocale
La détection d'activité vocale sensible (VAD) détermine quand l'agent doit répondre après que l'appelant a fini de parler.
Comprendre les types de DAV
Les agents en temps réel prennent en charge deux approches VAD :
VAD basé sur le serveur - Basé sur le son (silence)
Détecte la fin de la parole en fonction des signaux audio (durée du silence, volume)
Répond rapidement une fois que le silence est détecté
Idéal pour les interactions structurées, les réponses courtes, les environnements bruyants
VAD sémantique - Basé sur le contexte de phrase
Détermine l’achèvement du tour en fonction de la signification de ce qui a été dit
S’adapte aux pauses naturelles, aux mots de remplissage, aux paroles de fin
Idéal pour : interactions conversationnelles, questions complexes, discussions ouvertes
Sélectionnez le bon VAD
Utilisez la fonction VAD basée sur le serveur lorsque toutes les conditions suivantes sont remplies :
- Les interactions sont structurées (navigation dans le menu de style IVR).
- Les réponses sont courtes et prévisibles.
- Le bruit d’arrière-plan est un problème (le VAD sémantique peut attendre trop longtemps).
- Vous voulez une interaction rapide et fluide.
Utilisez la fonction VAD sémantique lorsque toutes les conditions suivantes sont remplies :
- Les conversations sont libres et sans limite définie.
- Les appelants peuvent hésiter ou utiliser des mots de remplissage (« um », « laissez-moi penser... »).
- Les questions sont complexes (les appelants expliquent les situations).
- La fluidité naturelle des conversations est priorisée.
Configurer le VAD basé sur serveur
Accédez à Paramètres>Voix>Configuration Téléphone>Entrée vocale>Sensibilité>Basé sur le son (silence).
| Paramètre | Description | Default | Plage recommandée |
|---|---|---|---|
| Seuil | Sensibilité à la voix et au bruit (échelle 0-1) | 0,6 | 0.5-0.7 |
| Remplissage de préfixes (ms) | Audio capturé avant le début de la parole | 300 ms | 200-500 ms |
| Durée du silence (ms) | Silence requis pour terminer le tour | 750 ms | 750-1000 ms |
Threshold
- Inférieur (0,3-0,4) : plus sensible ; récupère la parole silencieuse, peut déclencher le bruit d’arrière-plan.
- Plus élevé (0,7-0,9) : moins sensible ; nécessite une voix plus forte, réduit les faux déclencheurs.
- Recommandé : Commencez avec 0,5 ; Augmentez si le bruit de fond provoque de faux déclencheurs.
Remplissage de préfixe
- Capture l’audio avant la détection vocale (empêche la suppression du premier mot).
- Inférieur (200 ms) : réponse plus rapide ; peut manquer la première syllabe.
- Plus élevé (500 ms) : capture plus sûre ; léger retard.
- Recommandé : 300 ms (bon équilibre).
Durée du silence
- Durée pendant laquelle l’appelant doit être silencieux avant que l’agent ne réponde.
- Faible (500 ms) : prise de parole rapide ; peut interrompre si l'appelant s'interrompt.
- Plus élevé (1000 ms) : plus patient ; peut sembler lent.
- Recommandé : commencez par 750 ms.
Configurer le VAD sémantique
Accédez à Paramètres>Voix>Configuration du téléphone>Entrée vocale>Sensibilité>En fonction du contexte de la phrase.
Paramètre : promptitude (vitesse à laquelle l’agent répond après la complétion sémantique)
| Setting | Comportement | Idéal pour |
|---|---|---|
| Faible | Attend plus longtemps, très patient | Appelants qui pensent à haute voix, des pauses fréquentes |
| Moyenne | Équilibré (par défaut) | Conversations générales |
| Élevé | Répond rapidement | Interactions rapides, questions simples |
Configuration DTMF
Dual-Tone Multi-Fréquence (DTMF) permet aux appelants de saisir des informations à l’aide du clavier de leur téléphone.
Vous pouvez activer DTMF pour votre agent à la fois au niveau du sujet et au niveau global. Pour le définir au niveau global, sélectionnez votre agent et accédez à Paramètres>Vocale>Comportement de conversation>DTMF.
Important
Lors de la création d’expériences DTMF uniquement, configurez les entrées DTMF pour chaque nœud d’entrée, y compris les sélections de menus et les entrées à plusieurs chiffres comme les numéros de compte ou les codes PIN. Assurez-vous que tous les chemins d’entrée clients possibles disposent d’un mappage DTMF correspondant afin que les utilisateurs puissent naviguer et mener la conversation uniquement en utilisant l’entrée du clavier.
Détection du silence
La détection de silence permet aux agents en temps réel de reconnaître lorsqu’un appelant ne fournit aucune entrée pendant une période spécifiée. Configurez la détection de silence comme paramètre vocal global pour l’agent en accédant à Paramètres>Voix>Comportement de conversation>Détection de silence.
Important
- La détection du silence n’est pas activée par défaut. Si l’utilisateur ne parle pas, l’agent attend indéfiniment sans donner de consigne. Activez explicitement la détection du silence et configurez un message de repromptage pour gérer les appelants silencieux.
- Le délai d’expiration de détection du silence par défaut est de 7 000 ms (7 secondes). Validez cette valeur par rapport à votre cas d’usage spécifique et à votre environnement d’appelant avant le déploiement en production. Sept secondes peuvent être trop longues pour certains appelants ou trop court pour d’autres en fonction de la nature de l’interaction, par exemple, des questions complexes ou des environnements bruyants. Testez avec des données d’appel réelles pour déterminer le seuil approprié pour votre scénario.
- Avant d’activer la détection du silence, assurez-vous que le comportement que vous configurez dans votre rubrique de détection de silence (par exemple, Escalader, Raccrocher, Reprompt) est intentionnel et approprié pour votre cas d’usage. Un comportement de repli mal configuré, comme définir par inadvertance le repli sur Escalader alors que l’intention est de raccrocher, ou inversement, peut entraîner des résultats d’appel inattendus.
Messagerie de latence
Ajoutez un message de latence ou de la musique à votre agent lorsque les opérations en arrière-plan prennent plus de temps que prévu. Pour configurer la messagerie de latence, accédez à Paramètres>Voix>Comportement de la conversation>Messagerie de latence.
Important
Parce que la solution d’agent en temps réel Text LLM utilise plusieurs étapes séquentielles (ASR, LLM, TTS), les appelants subissent quelques secondes de silence entre la parole et l’écoute d’une réponse. Fixez des attentes appropriées avec les utilisateurs, par exemple, en utilisant une phrase comme « Un instant s’il vous plaît, je cherche ça pour vous... ».
Évaluation en temps réel de l’agent
Les agents en temps réel prennent en charge l’envoi de texte pendant l’évaluation, cependant, le traitement audio n’est pas pris en charge.