Resumen de agentes en tiempo real

Note

Este artículo describe características utilizadas en agentes o flujos de agentes alimentados por el arnés estándar.

Los agentes en tiempo real permiten conversaciones naturales y conscientes del contexto a través de canales de voz y mensajería digital. Los clientes pueden interactuar directamente con un agente impulsado por IA y recibir respuestas inmediatas y relevantes sin depender de menús tradicionales de respuesta de voz interactiva (IVR) ni de experiencias guionizadas. Para los canales de voz, los agentes en tiempo real admiten interacciones completamente controladas por voz mediante PSTN y SIP, incluida la marcación multifrecuencia de doble tono (DTMF), la interrupción de la locución, la detección de actividad de voz (VAD) y otras capacidades de telefonía.

Puedes usar la misma configuración de agente en tiempo real tanto en canales de voz como digitales, proporcionando una experiencia coherente independientemente de cómo decidan interactuar los clientes.

Note

La siguiente tabla describe las capacidades proporcionadas por los agentes en tiempo real:

Capacidad Descripción
Reconocimiento del lenguaje natural Entiende las intenciones del cliente sin requerir frases específicas ni opciones de menú.
Despliegue multicanal Implementa el mismo agente para voz, mensajería digital (versión preliminar) o ambos.
Diseño nativo de la voz Diseñado específicamente para la interacción hablada con un flujo natural de conversación. Aplicable solo al canal de voz.
Capacidad de respuesta en tiempo real Latencia mínima con turnos instantáneos y pausas naturales.
Reconocimiento del contexto Mantiene el estado de conversación y hace referencia a interacciones previas.
Compatibilidad multilingüe Entiende y responde en varios idiomas.
Integración flexible Se conecta con CRMs, bases de conocimiento, APIs y flujos de Power Automate.
Control determinista Combina conversación con IA con flujos estructurados de temas para lograr cumplimiento y coherencia.
Modelo de voz para texto con LLM Utiliza una arquitectura de voz basada en texto que convierte el habla a texto, utiliza el modelo GPT-5-Chat (Preview) para entender la intención y generar respuestas, y luego sintetiza la respuesta de nuevo al habla. Este modelo soporta personalización avanzada de voz mediante Microsoft Neural Text-to-Speech (TTS), incluyendo modelos de voz personalizados y una flexibilidad de despliegue más amplia.

Prerrequisitos

Antes de comenzar, asegúrese de que tiene los siguientes requisitos previos de licencia, rol y permiso:

  • Dynamics 365 Contact Center con los siguientes canales configurados según tus necesidades. Para obtener más información, consulte Canales de provisión en Dynamics 365 Contact Center.
    • Canal de voz y enrutamiento de llamadas
    • Canales de mensajería digital
  • Rol de administrador omnicanal con permisos para configurar canales de voz o mensajería y el flujo de trabajo requerido.
  • Copilot Studio para la creación y configuración de agentes.
  • Rol de creador de Copilot Studio con permisos para crear y configurar agentes.

Note

  • Para obtener la información de licencias y facturación de Copilot Studio más completa y actualizada, consulte la Guía de Licencias de Microsoft Copilot Studio.
  • Para obtener la información más completa y actualizada sobre facturación y licencias de Dynamics 365 Contact Center, consulte la Guía de licencias de Microsoft Dynamics 365.

Requisitos previos regionales

Esta función utiliza GPT-Realtime, GPT-Realtime-Mini (Vista previa) o GPT-5-Chat (Vista previa).

  • GPT-Realtime está alojado en Norteamérica y podría procesar datos fuera de la geografía de Azure del recurso de IA cuando se utiliza un despliegue de Global Standard.
  • GPT-Realtime-Mini (Vista previa) está alojado en Australia y podría procesar datos fuera de la geografía Azure del recurso de IA cuando se utiliza un despliegue de Global Standard.
  • GPT-5-Chat (Vista previa) soporta el procesamiento de datos dentro de la región en Estados Unidos, Unión Europea, Reino Unido y Australia cuando se despliega en una región soportada.

El almacenamiento de datos permanece en la geografía de Azure del recurso de IA.

Obtenga más información en Descripción de los tipos de implementación en Modelos de Microsoft Foundry y en Datos, privacidad y seguridad para Azure Direct Models de Microsoft Foundry.

Note

A julio de 2026, se aplican las siguientes limitaciones regionales:

  • Los clientes de Norteamérica pueden usar GPT-Realtime y GPT-5-Chat (Preview) sin configuración regional adicional.
  • Los clientes australianos pueden usar GPT-Realtime-Mini (Vista previa) y GPT-5-Chat (Vista previa) sin configuración regional adicional.
  • Los clientes de EU Data Boundary pueden usar GPT-5-Chat (Preview) con procesamiento de datos dentro de la región, pero no pueden usar GPT-Realtime ni GPT-Realtime-Mini (Preview) porque esos modelos requieren procesamiento cruzado de geo.
  • Los clientes del Reino Unido pueden usar GPT-5-Chat (Preview) con procesamiento de datos en la región, pero GPT-Realtime y GPT-Realtime-Mini (Preview) requieren procesamiento cruzado de geo.
  • Los clientes de otras regiones deben permitir el procesamiento entre zonas geográficas para GPT-Realtime y GPT-Realtime-Mini (Vista previa). La disponibilidad regional de GPT-5-Chat (Preview) depende del soporte regional de despliegue.

Aviso de cumplimiento y inteligencia artificial responsable

Las evaluaciones de seguridad y inteligencia artificial responsable de Microsoft encontraron limitaciones de comportamiento relevantes para la seguridad que podrían dar lugar a un mayor riesgo de que el agente produzca contenido potencialmente perjudicial. Los clientes deberían tomar medidas para mitigar estos riesgos, como se detalla con detalle en la nota de transparencia para los agentes en tiempo real.

Usted es el único responsable del uso de Dynamics 365, esta característica y cualquier característica o servicio relacionado conforme a todas las leyes aplicables. Los clientes también son responsables de cumplir con las directivas de Microsoft. Estas directivas incluyen el Código de conducta de microsoft Enterprise AI Services.

Limitaciones conocidas

  • Las siguientes limitaciones se aplican a los agentes en tiempo real para canales de mensajería digital mientras la función está en vista previa:

    • Autenticación: No se soporta la autenticación OAuth ni Microsoft. Configura el agente sin autenticación. Obtenga más información en Configuración de la autenticación de usuario.
    • Duración de la conversación: Las conversaciones que superan los 60 minutos escalan automáticamente a un agente humano.
    • Análisis: Los informes de análisis de Copilot Studio pueden estar incompletos para los agentes en tiempo real. Más información en Análisis general.
  • El registro de transcripciones de conversaciones para agentes de voz de LLM de texto es limitado. Algunos giros de conversación y respuestas de los agentes pueden no reflejarse en las transcripciones de las llamadas, lo que puede afectar a la analítica y al monitoreo.