Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
Note
Este artículo describe características utilizadas en agentes o flujos de agentes alimentados por el arnés estándar.
Para desplegar un agente en tiempo real, activar el modelo en tiempo real, configurar la configuración principal del agente y luego configurar las funciones específicas de cada canal necesarias. Puedes desplegar el mismo agente en el canal de voz, en los canales de mensajería digital o en ambos.
Note
Los agentes en tiempo real están en versión preliminar para los canales de mensajería digital. Las características en versión preliminar no se han diseñado para un uso de producción y pueden tener una funcionalidad restringida. Estas características están sujetas a términos de uso complementarios. Microsoft los proporciona antes de un lanzamiento oficial para que los clientes puedan acceder anticipadamente y dar sus opiniones.
Configurar y habilitar agentes en tiempo real
Cree un nuevo agente y configure sus detalles básicos, como un nombre descriptivo y el propósito del agente en la descripción.
Ve a la configuración de voz del agente y activa Habilitar voz. En el tipo Voz, selecciona Tiempo real.
Importante
Esta configuración es una selección única. Después de seleccionar Tiempo real, no puedes volver a un tipo básico de agente. Para usar un agente básico, crea un nuevo agente. Esta configuración es necesaria incluso si usas el agente en un canal de mensajería digital.
Selecciona el modelo que quieras usar: GPT-Realtime, GPT-Realtime-Mini o GPT-5-Chat (Vista previa). GPT-5-Chat (Vista previa) es un modelo de voz LLM de texto que genera respuestas de voz mediante Microsoft Neural Text-to-Speech (TTS).
Descubre cómo funcionan estos modelos en función de sus regiones soportadas y consideraciones de despliegue. La siguiente tabla describe los escenarios en los que puedes usar diferentes modelos.Scenario GPT-Realtime GPT-5-Chat (Vista previa) Estilo de conversación Interacciones nativas de voz a voz La voz se convierte en texto para el razonamiento y luego se vuelve a sintetizar como voz Latencia Menor latencia para conversaciones naturales Latencia mayor que GPT-Realtime Personalización de voz Soporta las opciones de voz en tiempo real integradas disponibles para agentes de voz en tiempo real Soporta Microsoft Neural Text-to-Speech (TTS), incluyendo un catálogo de voz más amplio y modelos de voz personalizados Experiencias de voz de marca Opciones de personalización limitadas Recomendado cuando necesitas una experiencia de voz personalizada o de marca Flexibilidad en el despliegue regional Limitado a regiones de modelos en tiempo real compatibles Mayor flexibilidad gracias a los servicios de reconocimiento de voz y TTS Ideal para Conversaciones de voz naturales y de baja latencia e interacciones abiertas Escenarios que requieren personalización avanzada de voz, voces personalizadas, requisitos de cumplimiento o flexibilidad regional en el despliegue Tip
- Utiliza GPT-Realtime cuando la calidad natural de la conversación y la baja latencia son los requisitos principales.
- Usa GPT-Realtime-Mini (Vista previa) para escenarios que requieren interacciones rápidas de voz con menor latencia y uso de recursos.
- Utiliza GPT-5-Chat (Vista previa) cuando la personalización de voz, los modelos de voz personalizados o la flexibilidad de despliegue son más importantes que la latencia de respuesta.
Vaya a la configuración de seguridad del agente y seleccione Sin autenticación.
Conocimientos y herramientas
Puede configurar el agente para que use conocimientos y herramientas. Obtenga más información en Resumen de orígenes de conocimiento, Incorporación de herramientas a agentes personalizados y Herramientas, conocimientos, MCP y API.
Agentes anidados (versión preliminar)
Los agentes en tiempo real solo soportan agentes infantiles.
Importante
Asegúrese de que las descripciones del agente secundario no se superpongan con las descripciones de los temas. Defina explícitamente el orden de invocación en las instrucciones del agente.
Temas
Los agentes en tiempo real soportan todos los temas configurados en Copilot Studio. Utiliza temas para definir comportamientos deterministas como saludos, reglas de negocio y escalada, mientras que el modelo que seleccionaste gestiona las respuestas conversacionales en tiempo de ejecución. Obtenga más información en Elegir cómo controlar la conversación.
procedimientos recomendados
Use temas solo cuando se requiera un comportamiento determinista.
Use texto estático en mensajes de saludo para obtener la primera respuesta más rápida. Los mensajes dinámicos con variables y expresiones aumentan la latencia inicial.
Desactiva el tema Inicio de conversación si quieres que el modelo de agente en tiempo real gestione el saludo. De lo contrario, el saludo configurado en el tema Inicio de conversación se reproduce en lugar del saludo del modelo de voz.
Deja que el modelo de agente en tiempo real se encargue de la conversación general y las preguntas de seguimiento.
Incluya una acción explícita en el tema En caso de error, como transferir la llamada o finalizar la llamada. La gestión de errores basada únicamente en mensajes no es suficiente. Sin un siguiente paso determinista, los clientes podrían experimentar silencio por parte de los agentes de voz o llamadas atascadas en los canales de mensajería, lo que puede provocar confusión y una mala experiencia del cliente.
Use descripciones explícitas de temas y herramientas para declarar la propiedad de la recopilación de datos. Obtenga más información en Escritura de descripciones de herramientas y temas eficaces.
Soporte de nodos de tema
La siguiente lista describe el soporte por temas en agentes en tiempo real:
Nodo de condición
| Feature | Apoyo |
|---|---|
| Bifurcación if/Else | Soportado |
| Expresiones de Power Fx | Soportado |
| Reprocesamiento de relleno de ranuras | Soportado |
Nodo de mensaje
| Característica | Apoyo |
|---|---|
| Mensaje básico | Soportado |
| Variaciones de mensajes | Soportado |
| Inserción de variables | Soportado |
| SSML | Solo canal de voz |
| Contenido multimedia enriquecido/Tarjetas adaptables | Solo soportado para canales de mensajería digital. Esta característica se encuentra en versión preliminar. |
| Respuestas rápidas | Solo soportado para canales de mensajería digital. Esta característica se encuentra en versión preliminar. |
Nodo de Pregunta
| Feature | Apoyo |
|---|---|
| Texto del mensaje | Soportado |
| Suspensión automática | No soportado |
| Relleno de ranuras | Soportado |
| Comportamiento de omisión/Relleno voraz de huecos | Soportado |
| Volver a solicitar/Reintentar | Soportado |
| Control de respuestas no válido | Soportado |
| Interrupción del tema | Soportado |
| Interrumpir | Compatible solo con el canal de voz. |
| Mensaje de solicitud de repetición personalizado | Soportado |
| Entrada DTMF | Compatible solo con el canal de voz. |
| Detección de silencio | Compatible solo con el canal de voz. |
Nodo HTTP
| Característica | Apoyo |
|---|---|
| Métodos HTTP: GET, POST, PUT, PATCH, DELETE | Soportado |
| Puntos de conexión de la URL | Soportado |
| Encabezados y cargas | Soportado |
| Análisis y esquema de respuestas | Soportado |
| Mapeo de variables | Soportado |
| Gestión de errores | Soportado |
Nodo de la herramienta
| Feature | Apoyo |
|---|---|
| Flujo de Power Automate | Soportado |
| Invocación de herramientas | Soportado |
| Asignación de entrada/salida | Soportado |
| Mensaje nuevo | Soportado |
Nodo para establecer el valor de una variable
| Característica | Apoyo |
|---|---|
| Asignación literal | Soportado |
| Asignación de expresiones | Soportado |
| De variable a variable | Soportado |
Nodo de administración de temas
| Característica | Apoyo |
|---|---|
| Fin del tema actual | Soportado |
| Finalizar todos los temas | Soportado |
| Finalizar conversación | Soportado |
| Ir al paso | Soportado |
| Entrada del usuario para reconocer la intención | Soportado |
| Ir a otro tema | Soportado |
Transferir nodo de conversación
| Característica | Apoyo |
|---|---|
| Transferir a agente | Soportado |
| Transferencia de número de teléfono externo | Compatible solo con el canal de voz. |
Advanced
| Feature | Apoyo |
|---|---|
| Creación de respuestas generativas | Soportado |
Soporte de activadores del sistema
| Trigger | Apoyo | Detalles |
|---|---|---|
| Al iniciar la conversación | Soportado | Se desencadena cuando comienza una nueva conversación |
| Hablar con representante | Soportado | Transferencias al agente humano |
| Tema desconocido/Sobre intención desconocida | No soportado | Fallback cuando no coincida ningún asunto |
| OnSelectIntent (varios temas coincidentes) | No soportado | Desambiguación entre temas similares |
| Restablecer conversación (OnSystemRedirect) | Soportado | Borra las variables y reinicia el flujo. |
| Al iniciar sesión | No soportado | |
| Pulsación de tecla DTMF desconocida | Soportado | Entrada de teclado sin mapear. Aplicable solo al canal de voz. |
| El agente elige o el usuario dice una frase. | Soportado | El agente selecciona el tema en función de la intención. |
| Se recibe un mensaje | No soportado | Aumenta la latencia |
| Se produce un evento de cliente personalizado | No soportado | Solo en el inicio de sesión |
| Actualización de la conversación | No soportado | Miembros agregados o eliminados, cambios de sesión |
| Se invoca | No soportado | Requiere una interfaz de usuario sincrónica |
| Se redirige | Soportado | |
| El usuario está inactivo durante un periodo determinado. | Soportado | Tiempo de espera por inactividad del usuario. Aplicable solo a canales de mensajería digital. |
| Detección de silencio | Soportado | Aplicable solo al canal de voz. |
| Se completa un plan | No soportado | |
| Respuesta de IA generada | No soportado | |
| Al producirse un error | Soportado | Controla los errores de orquestación. |
Pasar variables entre temas y el modelo de lenguaje
Cuando se usan temas en un flujo de conversación híbrido, comprender cómo pasar variables entre temas y el modelo de lenguaje en tiempo real es fundamental para crear interacciones confiables y con estado. Este proceso se aplica a todos los canales.
Esta funcionalidad funciona mediante el siguiente proceso:
Se pasan variables de entrada definidas en un tema en el momento de la invocación, por lo que el modelo de lenguaje puede proporcionar datos estructurados al flujo determinista.
Se devuelven al modelo de lenguaje las variables de salida definidas en un tema, al final de la ejecución del tema, como pares clave-valor estructurados.
Las salidas de las llamadas a herramientas siguen el mismo patrón.
El modelo de lenguaje se rellena con el contexto conversacional, incluidos los pares clave-valor de la llamada a la herramienta. Sin embargo, solo se devuelven variables de salida definidas explícitamente como datos estructurados.
La descripción de la variable ayuda al modelo a entender cómo usar la variable durante una conversación. Proporciona definiciones claras y descriptivas.
Obtenga más información en Administración de entradas y salidas de temas.
Compatibilidad multilingüe
Agregue todos los idiomas secundarios que desee. Las cadenas de localización no son necesarias para los flujos en tiempo real. Sin embargo, para los mensajes de tema deterministas, debe proporcionar los mensajes traducidos. Obtenga más información en Configuración y creación de agentes multilingües.
El modelo en tiempo real puede comprender y responder en muchos lenguajes. Sin embargo, Microsoft no valida formalmente todos los idiomas para obtener disponibilidad general.
A junio de 2026, los siguientes lenguajes están validados formalmente:
- Holandés (Países Bajos) (nl-NL)
- Inglés (Australia) (en-AU)
- Inglés (Estados Unidos) (en-US)
- Inglés (Reino Unido) (en-GB)
- Francés (Canadá) (fr-CA)
- Francés (Francia) (fr-FR)
- Alemán (Alemania) (de-DE)
- Italiano (Italia) (it-IT)
- Portugués (Brasil) (pt-BR)
- Español (España) (es-ES)
- Español (Estados Unidos) (es-US)
Microsoft continúa validando otros idiomas y los agrega después de la finalización de la certificación. Puede agregar cualquier idioma compatible con Copilot Studio. Sin embargo, los idiomas que no están totalmente certificados para la calidad de disponibilidad general (GA) deben probarse exhaustivamente antes de la implementación en producción.
Importante
La funcionalidad de lenguaje técnico no es igual a un idioma compatible o certificado. Si tiene previsto implementar agentes en idiomas distintos del inglés, debe realizar pruebas exhaustivas con autores de llamadas reales y flujos de llamadas antes de empezar a funcionar.
Variables de contexto
Un agente en tiempo real soporta variables contextuales que le permiten comportarse de forma más inteligente al transportar información sobre la conversación y el cliente. Las variables de contexto disponibles dependen del canal. Este conjunto incluye:
| Variable de contexto | Descripción |
|---|---|
| Id. de canal | Identifica el canal de comunicación usado para la interacción. Aplicable solo al canal de voz. |
| Número de teléfono del autor de la llamada (ANI) | Número de teléfono de origen del autor de la llamada. Aplicable solo al canal de voz. |
| Número del llamado (DNIS) | Número de teléfono de destino que marcó el autor de la llamada. Aplicable solo al canal de voz. |
| ID de la conversación | Identificador único de la sesión de llamada activa. |
| Encabezados SIP | Soportaban pares clave-valor de cabecera SIP asociados a la llamada. Aplicable solo al canal de voz. |
| Fecha actual (UTC) | La fecha actual en hora universal coordinada (UTC), proporcionada en tiempo de ejecución para permitir respuestas conscientes de las fechas. |
| Hora actual (UTC) | La hora actual en hora universal coordinada (UTC), proporcionada en tiempo de ejecución para permitir respuestas compatibles con el tiempo. |
Aprende más sobre todas las demás variables de contexto, incluyendo mensajería digital y variables de contexto personalizadas, en Configurar variables de contexto para agentes.
Configuraciones específicas del canal
Voz del agente
Seleccione la voz que usa el agente seleccionando el agente y vaya a Configuración>Voz>Seleccionar voz. Los agentes en tiempo real apoyan las siguientes voces:
- Aleación
- Ceniza
- Balada
- Coral
- Echo
- Sage
- Shimmer
- Verse
- Marin
- Cedar
Note
- La voz del agente es para tu agente en tiempo real y no es la que está configurada en el centro de administración de servicio de Copilot.
- Para que las voces de los mensajes del sistema Dynamics coincidan con tu agente en tiempo real, utiliza solo las siguientes voces compatibles: Alloy, Echo, Shimmer o Ash.
- Los agentes que utilizan Text LLM, GPT-5-Chat (Preview), generan respuestas de voz a través de Microsoft Neural Text-to-Speech (TTS). Este modelo soporta un catálogo de voz más amplio y modelos de voz personalizados, lo que lo hace adecuado para organizaciones que requieren experiencias de voz personalizadas o personalización avanzada de voz.
Sensibilidad de voz
La detección de actividad de voz por sensibilidad de voz (VAD) determina cuándo debe responder el agente después de que el interlocutor termine de hablar.
Comprensión de los tipos de VAD
Los agentes en tiempo real soportan dos enfoques VAD:
VAD basado en servidor: basado en sonido (silencio)
Detecta el final de la voz en función de las señales de audio (duración del silencio, volumen)
Responde rápidamente una vez detectado el silencio
Ideal para interacciones estructuradas, respuestas cortas, entornos ruidosos
VAD semántico: basado en el contexto de oración
Determina la finalización de turnos en función del significado de lo que se dijo.
Se adapta a pausas naturales, palabras de relleno, locuciones inconclusas
Ideal para: Interacciones conversacionales, preguntas complejas, discusiones abiertas
Selecciona el VAD adecuado
Use VAD basado en servidor cuando se cumplen todas las condiciones siguientes:
- Las interacciones están estructuradas (navegación de menú de estilo IVR).
- Las respuestas son cortas y predecibles.
- El ruido de fondo es un problema (el VAD semántico puede esperar demasiado tiempo).
- Quieres una interacción rápida y clara.
Use VAD semántico cuando se cumplen todas las condiciones siguientes:
- Las conversaciones son abiertas y sin un final definido.
- Los autores de llamadas pueden dudar o usar palabras de relleno ("um", "déjame pensar...").
- Las preguntas son complejas (los autores de la llamada explican situaciones).
- El flujo de conversación natural tiene prioridad.
Configurar VAD basado en servidor
Vaya a Configuración>Voz>Configuración del teléfono>Entrada de voz>Sensibilidad>Basado en el sonido (silencio).
| Parámetro | Descripción | Predeterminado | Intervalo recomendado |
|---|---|---|---|
| Umbral | Sensibilidad a la voz frente al ruido (escala de 0 a 1) | 0.6 | 0.5-0.7 |
| Relleno de prefijo (ms) | Audio capturado antes de que se inicie la voz | 300 ms | 200-500 ms |
| Duración del silencio (ms) | Silencio necesario para finalizar el turno | 750 milisegundos | 750-1000 ms |
Threshold
- Menor (0.3-0.4): Más sensible; capta voces bajas, podría activarse con el ruido de fondo.
- Mayor (0,7-0,9): menos sensible; requiere voz más alta, reduce los desencadenadores falsos.
- Recomendado: Empieza con 0,5; Aumenta si el ruido de fondo provoca falsos desencadenantes.
Relleno de prefijo
- Captura el audio antes de la detección de voz (evita cortar la primera palabra).
- Inferior (200 ms): respuesta más rápida; es posible que se pierda la primera syllable.
- Mayor (500 ms): captura más segura; ligero retraso.
- Recomendado: 300 ms (buen equilibrio).
Duración del silencio
- Cuánto tiempo debe ser silencioso el autor de la llamada antes de que responda el agente.
- Bajo (500 ms): interacción rápida; puede interrumpir si el interlocutor pausa a mitad de pensamiento.
- Más alto (1000 ms): más paciente; puede sentirse lento.
- Recomendado: comience con 750 ms.
Configurar VAD semántico
Vaya a Configuración>Voz>Configuración del teléfono>Entrada de voz>Sensibilidad>Basado en el contexto de la oración.
Parámetro: Entusiasmo (la rapidez con la que responde el agente después de la finalización semántica)
| Configuración | Behavior | Más adecuado para |
|---|---|---|
| Bajo | Espera más tiempo, muy paciente | Personas que llaman que piensan en voz alta y hacen pausas frecuentes |
| Medio | Equilibrado (valor predeterminado) | Conversaciones generales |
| Alto | Responde rápidamente | Interacciones rápidas, preguntas sencillas |
Configuración de DTMF
Multifrecuencia de doble tono (DTMF) permite a las personas que llaman introducir información usando el teclado de su teléfono.
Puede activar DTMF para tu agente tanto a nivel de tema como a nivel global. Para establecerlo en el nivel global, seleccione su agente y vaya a Configuración>Voz>Comportamiento de conversación>DTMF.
Importante
Al crear experiencias basadas únicamente en DTMF, configure la entrada por DTMF para cada nodo de entrada, incluidas las selecciones de menú y las entradas de varios dígitos, como números de cuenta o PIN. Asegúrese de que todas las posibles vías de entrada del cliente tengan las correspondientes asignaciones DTMF para que los usuarios puedan navegar y completar la conversación utilizando únicamente el teclado telefónico.
Detección de silencio
La detección de silencio permite a los agentes en tiempo real reconocer cuando un llamante no proporciona ninguna entrada durante un periodo especificado. Configure la detección de silencio como una configuración global de voz para el agente. Para ello, vaya a Configuración>Voz>Comportamiento de conversación>Detección de silencio.
Importante
- La detección de silencio no está activada de forma predeterminada. Si el usuario no habla, el agente espera indefinidamente sin preguntar. Active explícitamente la detección de silencio y configure un mensaje de reinstrucción para manejar las llamadas silenciosas.
- El tiempo de espera de detección de silencio predeterminado es de 7000 ms (7 segundos). Valide este valor de acuerdo a su caso de uso específico y entorno de llamada antes de implementarlo en producción. Siete segundos pueden parecer demasiado largos para algunos autores de llamadas o demasiado cortos para otros en función de la naturaleza de la interacción, por ejemplo, preguntas complejas o entornos ruidosos. Pruebe con datos de llamadas reales para determinar el umbral adecuado para su escenario.
- Antes de habilitar la detección de silencio, asegúrese de que el comportamiento que configure en el tema de detección de silencio (por ejemplo, Escalar, Colgar, Resolicitar) sea intencionado y adecuado para su caso de uso. El comportamiento de respaldo mal configurado, como establecer involuntariamente el comportamiento de respaldo en Escalar cuando la intención es colgar, o viceversa, puede dar lugar a resultados inesperados de llamadas.
Mensajes de latencia
Agregue un mensaje de latencia o música al agente cuando las operaciones en segundo plano se demoren más de lo esperado. Para configurar la mensajería de latencia, vaya a Configuración>Voz>Comportamiento de conversación>Mensajería de latencia.
Importante
Debido a que la solución de agente en tiempo real de Text LLM utiliza múltiples pasos secuenciales (ASR, LLM, TTS), los llamantes experimentan unos segundos de silencio entre hablar y escuchar una respuesta. Por ejemplo, establece expectativas adecuadas con los usuarios, usando una frase como "Un momento, por favor, estoy buscando eso para ti...".
Evaluación en tiempo real del agente
Los agentes en tiempo real admiten el envío de texto durante la evaluación; sin embargo, no se admite el procesamiento de audio.