Creación de un agente compatible con voz
Sugerencia
Consulte la pestaña Texto e imágenes para obtener más detalles.
Los agentes de inteligencia artificial son programas de software que pueden comprender la información, tomar decisiones y tomar medidas por sí mismos para ayudar a los usuarios a lograr objetivos específicos. Un objetivo común para los agentes de inteligencia artificial es poder realizar conversaciones habladas en tiempo real como lo haría con un humano.
La voz a voz es una funcionalidad que permite a una aplicación tomar audio hablado como entrada y producir audio hablado como salida, sin necesidad de que el usuario lea o escriba texto. La experiencia del usuario se siente como una conversación de voz natural.
Voz a voz permite a los sistemas:
- Escuchar a una persona hablando
- Comprender o transformar lo que se dijo
- Responder con voz sintética
La tecnología de voz a voz combina la transcripción de voz a texto y de texto a voz en una única experiencia conversacional. La conversión de voz a voz se crea como una canalización de funcionalidades de voz y lenguaje. La canalización se completa:
- Conversión de voz a texto: convertir el audio hablado del usuario en texto.
- Procesamiento o razonamiento: análisis, traducción y resumen del texto, o que usa un agente de INTELIGENCIA ARTIFICIAL para decidir qué decir a continuación.
- Texto a voz: convertir el texto de respuesta en audio hablado.
Entre los escenarios comunes de conversión de voz a voz se incluyen:
- Asistentes de voz y agentes de IA: los usuarios hablan con un agente y escuchan respuestas habladas.
- Traducción de voz: un usuario habla en un idioma y escucha la respuesta en otro idioma.
- Aplicaciones manos libres: sistemas de navegación, quioscos o herramientas industriales en las que la escritura no es práctica.
- Accesibilidad: interacción basada en voz para los usuarios que prefieren o requieren entrada y salida de audio.
- Bots de soporte al cliente: quienes llaman hablan naturalmente y reciben respuestas orales.
Azure Speech - Voz en Vivo
Azure Speech incluye una VoiceLive Service que facilita la creación de agentes conversacionales. Voice Live API permite a las aplicaciones tener conversaciones de voz en tiempo real. Permite que un agente de voz escuche a alguien que habla y responda con audio hablado de forma rápida y natural.
En lugar de crear y conectar muchas partes independientes, como la conversión de voz a texto, el razonamiento de IA y el texto a voz, Voice Live API combina todo en un servicio. Voice Live API facilita y acelera a los desarrolladores la creación de experiencias basadas en voz.
Azure administra completamente VoiceLive, lo que significa que no es necesario configurar ni mantener los sistemas back-end usted mismo. Al enviar audio a VoiceLive, envía respuestas habladas. VoiceLive también puede devolver objetos visuales, como avatares, y desencadenar acciones cuando sea necesario. Azure controla los modelos y la infraestructura en segundo plano, por lo que puede centrarse en la creación de la experiencia de voz.
Las soluciones de habla a habla de Azure utilizan:
- Azure Speech que proporciona las funcionalidades de conversión de voz a texto y de texto a voz.
- Agentes o lógica de aplicación que toma decisiones sobre las respuestas.
- Herramientas de Foundry o servidores MCP que pueden presentar la voz como herramientas invocables para que los agentes no tengan que gestionar los SDK ni las APIs directamente.
Puede explorar Voice Live en un área de juegos en el portal de Foundry. El área de juegos de Foundry incluye algunos ejemplos de voz preconfigurados que puede probar o puede crear una nueva solución propia. Al crear una solución, es importante que tenga que elegir un modelo de IA generativo para que el agente lo use. Azure Speech Voice Live usa el modelo de IA generativa junto con sus propios modelos acústicos para tener una conversación en vivo con el usuario. Puede configurar muchas opciones en el área de juegos. Por ejemplo, puede habilitar la interacción proactiva, por lo que el agente puede iniciar conversaciones.
También puede habilitar el modo Voice para un agente de Microsoft Foundry en el entorno de pruebas, lo que integra Azure Speech Voice Live en la definición del agente. Este enfoque significa que la configuración de voz se encapsula en el propio agente, lo que reduce el código de cliente necesario para usarlo.
Uso de Voice Live en una aplicación
Para desarrollar una aplicación personalizada que use el agente, es necesario escribir código. Para crear una aplicación en Python, necesita el paquete azure-ai-voicelive.
El paquete se puede instalar en el Visual Studio Code terminal mediante:
pip install azure-ai-voicelive
Nota:
También debe instalar pyaudio, python-dotenvy azure-identity para ejecutar la aplicación Voice Live.
Puede encontrar código de ejemplo para una aplicación de voz a voz en el portal de Foundry. El código de ejemplo controla toda la lógica necesaria para iniciar la sesión, conectarse a dispositivos de audio como micrófonos y altavoces, procesar las secuencias entrantes y salientes de audio, controlar interrupciones, etc. El código de ejemplo es un buen punto de partida para compilar su propia aplicación.
Puede tomar el código de ejemplo en su propio editor de código e instalar los paquetes adecuados. Al ejecutar la aplicación, un asistente de voz en tiempo real transmite el audio del micrófono a Azure Voice Live, recibe la respuesta de audio hablada del asistente y la reproduce a través de los altavoces.
Voice Live in Azure Speech ofrece una manera eficaz de crear agentes conversacionales compatibles con voz que interactúan de forma natural con los usuarios. A continuación, pruebe Azure Speech - Voz en Vivo en Foundry usted mismo.