Aperçu des agents en temps réel

Note

Cet article décrit les caractéristiques utilisées dans les agents ou flux d’agents alimentés par le faisceau standard.

Les agents en temps réel permettent des conversations naturelles et contextuelles à travers les canaux vocaux et de messagerie numérique. Les clients peuvent interagir directement avec un agent alimenté par l’IA et recevoir des réponses immédiates et pertinentes sans dépendre des menus traditionnels de réponse vocale interactive (IVR) ou des expériences scriptées. Pour les canaux vocaux, les agents en temps réel prennent en charge des interactions entièrement vocales via RTC et SIP, incluant l’entrée multifréquence à double tonalité (DTMF), l’entrée par barge-in, la détection d’activité vocale (VAD) et d’autres capacités téléphoniques.

Vous pouvez utiliser la même configuration d’agent en temps réel sur les canaux vocaux et de messagerie numérique, offrant une expérience cohérente quel que soit le choix des clients.

Note

Le tableau suivant décrit les capacités fournies par les agents en temps réel :

Capacité Description
Compréhension du langage naturel Comprend les intentions des clients sans nécessiter de phrases spécifiques ou d’options de menu.
Déploiement multicanal Déployez le même agent en voix, messagerie numérique (aperçu), ou les deux.
Conception axée nativement sur la voix Conçu spécialement pour l’interaction orale avec un flux naturel de conversation. Applicable uniquement au canal vocal.
Réactivité en temps réel Latence minimale avec prise de tour instantanée et pauses naturelles.
Prise en charge du contexte Maintient l’état de la conversation et fait référence aux interactions précédentes.
Prise en charge multilingue Comprend et répond dans plusieurs langues.
Intégration flexible Se connecte aux CRM, bases de connaissances, API et flux Power Automate.
Contrôle déterministe Combine la conversation IA avec des flux thématiques structurés pour la conformité et la cohérence.
Modèle vocal de LLM textuel Utilise une architecture vocale basée sur le texte qui convertit la parole en texte, utilise le modèle GPT-5-Chat (Aperçu) pour comprendre l’intention et générer des réponses, puis synthétise la réponse en parole. Ce modèle prend en compte la personnalisation avancée de la voix via le Microsoft Neural Syn-To-Speech (TTS), incluant des modèles de voix personnalisés et une flexibilité de déploiement plus large.

Prerequisites

Avant de commencer, vérifiez que vous disposez des conditions préalables de licence, de rôle et d’autorisation suivantes :

  • Dynamics 365 Contact Center avec les canaux suivants configurés selon vos besoins. Pour en savoir plus, consultez les canaux de provisionnement dans Dynamics 365 Contact Center.
    • Canal vocal et routage des appels
    • Canaux de messagerie numérique
  • Rôle d’administrateur omnicanal avec des autorisations pour configurer les canaux de voix ou de messagerie et le flux de travail requis.
  • Copilot Studio pour la création et la configuration des agents.
  • Rôle Créateur dans Copilot Studio avec les autorisations nécessaires pour créer et configurer des agents.

Note

Conditions préalables régionales

Cette fonctionnalité utilise GPT-Realtime, GPT-Realtime-Mini (Aperçu) ou GPT-5-Chat (Aperçu).

  • GPT-Realtime est hébergé en Amérique du Nord et pourrait traiter des données en dehors de la géographie Azure de la ressource IA lorsque vous utilisez un déploiement Global Standard.
  • GPT-Realtime-Mini (Aperçu) est hébergé en Australie et peut traiter des données hors de la géographie Azure de la ressource IA lorsque vous utilisez un déploiement Global Standard.
  • GPT-5-Chat (Aperçu) prend en charge le traitement des données en région dans le États-Unis, l’Union européenne, le Royaume-Uni et l’Australie lorsqu’il est déployé dans une région prise en charge.

Le stockage des données reste dans la géographie Azure de la ressource IA.

Apprenez-en davantage dans Compréhension des types de déploiement dans les modèles Microsoft Foundry et Données, confidentialité et sécurité pour les modèles Azure Direct dans Microsoft Foundry.

Note

Depuis juillet 2026, les limitations régionales suivantes s’appliquent :

  • Les clients nord-américains peuvent utiliser GPT-Realtime et GPT-5-Chat (Aperçu) sans configuration régionale supplémentaire.
  • Les clients australiens peuvent utiliser GPT-Realtime-Mini (Aperçu) et GPT-5-Chat (Aperçu) sans configuration régionale supplémentaire.
  • Les clients de Data Boundary de l’UE peuvent utiliser GPT-5-Chat (Aperçu) avec le traitement des données en région, mais ne peuvent pas utiliser GPT-Realtime ou GPT-Realtime-Mini (Aperçu) car ces modèles nécessitent un traitement inter-géométrique.
  • Les clients britanniques peuvent utiliser GPT-5-Chat (Aperçu) avec un traitement des données dans la région, mais GPT-Realtime et GPT-Realtime-Mini (Aperçu) nécessitent un traitement inter-région.
  • Les clients d’autres régions doivent autoriser le traitement interrégional pour GPT-Realtime et GPT-Realtime-Mini (Aperçu). La disponibilité régionale de GPT-5-Chat (Aperçu) dépend du support régional de déploiement.

IA responsable et avis de conformité

Les évaluations de sécurité et d’IA responsables de Microsoft ont détecté des limitations comportementales pertinentes en matière de sécurité qui pourraient entraîner un risque plus élevé que l’agent produit du contenu potentiellement dangereux. Les clients devraient prendre des mesures pour atténuer ces risques, comme détaillé dans la note de transparence pour les agents en temps réel.

Vous êtes uniquement responsable de l'utilisation de Dynamics 365, de cette fonctionnalité et de toute fonctionnalité ou service connexe conformément à toutes les lois applicables. Les clients sont également responsables de la conformité aux stratégies Microsoft. Ces stratégies incluent le Code de conduite microsoft Enterprise AI Services.

Limitations connues

  • Les limitations suivantes s’appliquent aux agents en temps réel pour les canaux de messagerie numérique pendant que la fonctionnalité est en aperçue :

    • Authentification : OAuth et l'authentification Microsoft ne sont pas prises en charge. Configurez l’agent sans authentification. En savoir plus sur la configuration de l’authentification utilisateur.
    • Durée de la conversation : Les conversations dépassant 60 minutes sont automatiquement escaladées vers un agent humain.
    • Analytique : Les rapports analytiques de Copilot Studio peuvent être incomplets pour les agents en temps réel. En savoir plus dans Aperçu de l’analytique.
  • La journalisation des transcriptions de conversation pour les agents vocaux Text LLM est limitée. Certains tournants de conversation et réponses des agents peuvent ne pas être capturés dans les transcriptions d’appel, ce qui peut affecter l’analyse et la surveillance.