Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
¿Qué es una nota de transparencia?
Los sistemas de inteligencia artificial incluyen no solo la tecnología, sino también las personas que la usarán y las que se verán afectadas por ella, así como los entornos en los que se implementan. La creación de un sistema adecuado a su finalidad requiere comprender cómo funciona la tecnología, cuáles son sus capacidades y limitaciones, y cómo conseguir el mejor rendimiento. Las notas de transparencia de Microsoft están pensadas para ayudarle a comprender cómo funciona nuestra tecnología de inteligencia artificial, las opciones que los propietarios del sistema pueden tomar para influir en el rendimiento y el comportamiento del sistema, y la importancia de pensar en todo el sistema, incluida la tecnología, las personas y el entorno. Puede usar notas de transparencia al desarrollar o implementar su propio sistema, o compartirlas con las personas que usarán o se verán afectadas por el sistema.
Las notas de transparencia de Microsoft forman parte de un esfuerzo más amplio en Microsoft para poner en práctica nuestros principios de inteligencia artificial. Obtenga más información en Principios de inteligencia artificial de Microsoft.
Conceptos básicos del reconocimiento de voz restringido
Introducción
El reconocimiento de voz es una función vital para interactuar con sistemas de inteligencia artificial habilitados para voz. Estos sistemas (conocidos con frecuencia como motores de "voz a texto") convierten las palabras habladas de un usuario en texto, lo que suele producir una puntuación de confianza indica la probabilidad de corrección de la salida. El reconocimiento de voz restringido es una modalidad específica que limita específicamente el conjunto de palabras o frases posibles que reconoce el propio motor. Esta restricción se realiza a través de una gramática. Las gramáticas son, por definición, la lista basada en reglas de palabras o frases esperadas para que el motor reconozca.
Los motores de reconocimiento de voz restringidos son especialmente útiles para:
Reconocer entradas alfanuméricas, como números de cuenta y números de seguimiento.
Grandes listas específicas de un dominio (acciones, direcciones, nombres).
Aplicaciones de ámbito pequeño diseñadas para interacciones con un pequeño conjunto de palabras y frases que se van a reconocer.
Diálogo dirigido para ayudar a navegar por una estructura jerárquica de opciones de menú, ya sea como primera interacción de un interlocutor o como base del diseño conversacional del sistema.
Términos clave
| Término | Definición |
|---|---|
| Grammar | Una gramática es una descripción de las palabras y frases que un reconocedor de voz entiende e interpreta. El reconocedor carga las gramáticas en tiempo de ejecución para convertir las respuestas habladas del usuario y los comandos en información que la aplicación de voz puede usar. |
| GrXML | Formato en el que se componen las gramáticas. |
| Especificación de gramática de reconocimiento de voz (SRGS) | El estándar W3C para definir gramáticas. |
| Pronunciación | Las palabras o frases habladas de un usuario a un sistema de inteligencia artificial de voz que interpreta el sistema de reconocimiento de voz. |
Capabilities
Comportamiento del sistema
Cada vez que el reconocedor interpreta una expresión de usuario, compila una lista de las coincidencias posibles más cercanas para volver a la aplicación de voz. Esta lista se denomina n-best l ist, ya que se compone de un número especificado previamente n de interpretaciones que mejor coincidan con lo que parece haber dicho el usuario. Cuando el usuario habla, el reconocedor busca las mejores coincidencias entre los elementos definidos en las gramáticas. El reconocedor añade cada interpretación correspondiente a los candidatos considerados para la lista n-best. Al buscar, el reconocedor usa modelos acústicos para analizar la entrada de audio, los modelos léxicos para determinar las oraciones más probables en las gramáticas y los modelos semánticos para determinar los significados más probables de lo que ha dicho el autor de la llamada. El reconocedor busca hasta que encuentre las interpretaciones más altas posibles o hasta que los elementos restantes no pudieran coincidir con lo que se oyó.
El reconocedor asigna una puntuación de confianza a cada elemento de la lista de candidatos y los clasifica de mayor confianza a menor. El reconocedor vuelve a evaluar y ajusta estas puntuaciones a medida que se encuentran nuevas interpretaciones. Si las gramáticas permiten homónimos (palabras que suenan idénticas pero tienen significados diferentes) y se pronuncia uno de ellos, el reconocedor asigna los homónimos a interpretaciones separadas con puntuaciones de confianza idénticas. El reconocedor refina la lista candidata mediante el procesamiento de las listas de restricciones o los scripts de interpretación semántica (ECMAScript) especificados en las gramáticas. El reconocedor quita las interpretaciones que no cumplen los niveles de confianza de destino configurados para el reconocimiento. El reconocedor devuelve a la aplicación los n mejores resultados finales. Esta lista n-best contiene el texto correspondiente (para todo el enunciado y para slots individuales), las puntuaciones de confianza y las claves y los valores establecidos para los enunciados.
Casos de uso
Usos previstos
El reconocimiento de voz restringido se puede usar en varios escenarios. Entre los usos previstos del sistema se incluyen:
Reconocer palabras habladas: para traducir la voz en texto restringido por la lista definitiva proporcionada al sistema a través de una "gramática". Por ejemplo, matrículas alfanuméricas y números de la seguridad social introducidos o basados en listas, directorios corporativos, símbolos bursátiles y direcciones.
Validar la entrada: para comprobar que lo dicho debe ser aceptado por el sistema. Por ejemplo, validando que un número de tarjeta de crédito es correcto (matemáticamente).
Eliminar candidatos de resultados: elimine palabras o frases del reconocimiento en intentos sucesivos de reconocimiento.
Consideraciones al elegir otros casos de uso
Animamos a los clientes a usar el reconocimiento de voz restringido en sus innovadoras soluciones o aplicaciones. Sin embargo, estas son algunas consideraciones a tener en cuenta para elegir un caso de uso:
Aviso: Al igual que con cualquier creación de agentes de IA, informe siempre a la persona que llama de que el sistema con el que está interactuando funciona con IA.
Usos no admitidos:
Transcripción en lote: Transcribir por completo las palabras pronunciadas por una persona en una transcripción completa de texto.
Interpretación de intenciones: correspondencia entre las palabras pronunciadas por la persona y una intención inferida, en lugar de una transcripción.
Consideraciones legales y normativas: las organizaciones deben evaluar posibles obligaciones legales y normativas específicas al usar cualquier servicio y soluciones de inteligencia artificial, lo que podría no ser adecuado para su uso en todos los sectores o escenarios. Las restricciones pueden variar en función de los requisitos normativos regionales o locales. Además, los servicios o soluciones de inteligencia artificial no están diseñados para y podrían no usarse de maneras prohibidas en términos de servicio aplicables y códigos de conducta pertinentes.
Limitaciones
Como se indicó anteriormente, el reconocimiento de voz restringido funciona excepcionalmente bien con casos de uso específicos, como tareas de reconocimiento alfanuméricas y basadas en listas en las que la información es explícita, precisa y limitada del usuario. Por el contrario, los sistemas tradicionales de voz a texto que utilizan modelos basados en la semántica o de comprensión del lenguaje natural son los más adecuados para reconocer una amplia variedad de temas en el habla e interpretar contenidos dentro del ámbito del modelo o en torno a él. Dicho explícitamente, cualquier entrada de voz que quede fuera de la definición de la gramática no produce ningún reconocimiento. Por lo tanto, se recomienda a los desarrolladores que crean aplicaciones basadas en voz que consideren en qué casos es adecuado usar voz restringida frente a métodos alternativos.
Limitaciones técnicas, factores operativos e intervalos
Para que el reconocimiento de voz restringido funcione con precisión, una gramática bien diseñada debe ser capaz de aceptar muchas respuestas de usuario diferentes e interpretarlas de forma rápida, precisa y eficaz. Esto significa que un desarrollador debe poder predecir las respuestas que generará cada solicitud de aplicación y codificarlas en una gramática lo más eficaz posible. Esto a su vez significa que las gramáticas deben diseñarse en paralelo con la aplicación de voz.
Una buena gramática equilibra estos objetivos:
Cobertura exhaustiva: la gramática acepta e interpreta cualquier respuesta razonable de los usuarios a la solicitud de la aplicación anterior.
Precisión: la gramática reconoce correctamente las respuestas para que los usuarios no se pidan que se repitan, y las gramáticas no pasan valores incorrectos a la aplicación principal.
Velocidad: la gramática reconoce rápidamente las respuestas sin retrasos que frustran a los usuarios.
Uso de recursos: la gramática procesa eficazmente.
La escritura gramatical es un proceso iterativo. Usted crea una gramática inicial basándose en lo que espera que digan quienes llaman, recopila datos reales, refina la gramática, recopila algunos datos más, vuelve a refinar la gramática, y así sucesivamente. A medida que refina la gramática añadiendo y eliminando frases, esta se aproxima cada vez más a la forma en que las personas que llaman se dirigen a la aplicación. En la práctica, ninguna gramática puede incluir todas las respuestas que pueden producirse en la aplicación, ya que no puede controlar cómo hablan las personas.
El proceso de desarrollo de un conjunto de gramáticas generalmente implica los pasos siguientes:
Identifique los elementos de información y defina las ranuras: ¿Qué información debe proporcionar el usuario a la aplicación y existe un orden determinado en el que se debe proporcionar?
Diseñar el cuadro de diálogo: determine el flujo de diálogo más eficaz entre el usuario y la aplicación.
Diseña los prompts: crea prompts que obtengan la información necesaria.
Anticipe las respuestas del interlocutor a los mensajes: tenga en cuenta las palabras que la gramática tendrá que reconocer.
Identifique las partes esenciales y de relleno de sus gramáticas: Identifique las palabras clave que deben buscarse en las respuestas.
Planear la estrategia gramatical: determine la mejor manera de cumplir los requisitos de cada gramática y elija un enfoque adecuado o una combinación de enfoques para abordarlos.
Ajustar y refinar las gramáticas: resuelva los problemas y optimice el rendimiento de la gramática,
Rendimiento del sistema
El motor de reconocimiento de voz restringido funciona mejor en comparación con las modalidades alternativas del reconocimiento de voz, usando memoria limitada al procesar solicitudes. Los factores dentro del control de los desarrolladores tienen más impacto en el rendimiento que el propio sistema. El objetivo más importante para el desarrollo de gramática es diseñar para lograr una precisión de reconocimiento óptima. El siguiente objetivo es escribir para mayor claridad, facilidad de mantenimiento y extensibilidad. El tercer objetivo es crear contextos de reconocimiento eficaces.
Prácticas recomendadas para mejorar el rendimiento del sistema
A continuación se muestran las características gramaticales que afectan al uso de recursos:
Cobertura: la gramática cubre (incluye) las frases que se espera que use quien llama. Una cobertura insuficiente provoca un aumento de los enunciados no incluidos en el vocabulario, las confirmaciones y los reintentos, lo que incrementa el uso de la CPU y la duración de las llamadas, y reduce la satisfacción del llamante.
Sobregeneración: es importante que la gramática no sobregenere al permitir frases sin sentido, ya que esto reduce la precisión. Por ejemplo, una gramática que reconoce una ciudad y un estado debe restringir las expresiones a combinaciones válidas de ciudades y estados.
Varios análisis: Idealmente, cada frase posible en la gramática tiene un análisis único. En ocasiones, una gramática puede permitir varios análisis de una sola oración. Normalmente, múltiples análisis sintácticos indican un descuido en el diseño de la gramática que debe corregirse.
Claves pasadas a la aplicación: debe asegurarse de que los pares clave-valor estén establecidos correctamente.
Cuando un autor de la llamada dice una palabra o frase que no se puede analizar mediante la gramática, se dice que la palabra o frase es fuera de gramática. Por regla general, se considera aceptable una tasa del 5 % de casos fuera de la gramática. En ocasiones, no son infrecuentes tasas de entre el 10 % y el 20 % de emisiones fuera de la gramática en determinados tipos de tareas de reconocimiento. Considere la posibilidad de usar formas alternativas de reconocimiento de voz a esta última velocidad.
La latencia se define como el tiempo transcurrido después de que el autor de la llamada deje de hablar (incluido el tiempo de espera de fin de voz configurado) hasta que se devuelva un resultado de reconocimiento a la aplicación. Cuando la latencia es demasiado alta, la experiencia del usuario se degrada; el sistema aparece lento, lo que puede ser frustrante para el usuario y conduce a complicaciones adicionales de la interfaz de usuario.
En circunstancias extremas, el exceso de latencia provoca transacciones de aplicación incorrectas si el usuario deja de hablar sin lograr el objetivo de su conversación. Los tiempos de respuesta de reconocimiento deficiente pueden tener muchos factores de contribución:
Uso de gramáticas muy grandes que contienen cientos de miles de elementos.
Duración media de los enunciados extremadamente larga.
Una gran cantidad de procesamiento de ECMAScript en la gramática.
Retrasos en la red al obtener gramáticas.
Asegúrese de probar correctamente las gramáticas antes de desplegarlas en un sistema en producción, por ejemplo ejecutando escenarios de prueba con varias frases que deban pronunciarse.
Evaluación del reconocimiento de voz restringido
Métodos de evaluación
Algunas métricas usadas habitualmente para evaluar el reconocimiento de voz restringido incluyen:
Tasa de errores de palabras (WER): mide el porcentaje de palabras que se reconocen incorrectamente. Se calcula como la suma de sustituciones, eliminaciones e inserciones divididas por el número total de palabras de la referencia.
Precisión de la lista de las N mejores hipótesis: evalúa la precisión de las N mejores hipótesis generadas por el reconocedor. Resulta útil comprender la frecuencia con la que la interpretación correcta se encuentra entre las principales sugerencias.
Cobertura: esta métrica evalúa si la gramática incluye todas las frases y variaciones necesarias que los usuarios podrían decir. Una gramática con una buena cobertura garantiza que el sistema pueda controlar una amplia gama de entradas.
Latencia: mide el tiempo necesario para que el sistema procese la entrada hablada y genere un resultado de reconocimiento. La menor latencia es fundamental para las aplicaciones en tiempo real.
Tasa de aceptación/rechazo falsa: esto mide falsos positivos y negativos que experimenta el sistema. Esto afecta directamente a la contención de llamadas y a las tasas de éxito de la aplicación en escenarios de centros de contacto.
Consideraciones sobre equidad
En Microsoft, nos esforzamos por capacitar a cada persona del planeta para hacer más. Una parte esencial de este objetivo es trabajar para crear tecnologías y productos justos e inclusivos. La equidad es un tema multidimensional, socio-técnico y afecta a muchos aspectos diferentes de nuestro desarrollo de productos. Puede obtener más información sobre el enfoque de Microsoft para la equidad.
Una dimensión importante que se debe tener en cuenta al usar sistemas de inteligencia artificial, incluido el reconocimiento de voz restringido, es el rendimiento del sistema para diferentes grupos de personas. La investigación ha demostrado que sin esfuerzo consciente centrado en mejorar el rendimiento de todos los grupos, los sistemas de inteligencia artificial pueden mostrar distintos niveles de rendimiento en diferentes factores demográficos, como la raza, la etnicidad, el género y la edad.
En algunos casos, puede haber diferencias de rendimiento restantes. Es importante tener en cuenta que estas disparidades pueden superar el objetivo, y estamos trabajando activamente para abordar y minimizar los posibles sesgos o brechas de rendimiento, considerar cuidadosamente la elección del grupo demográfico del actor y buscar diversas perspectivas desde una variedad de antecedentes.
En cuanto a los daños representacionales, como la estereotipación, el desmezamiento o la eliminación de salidas, reconocemos los riesgos asociados a estos problemas. Aunque nuestro proceso de evaluación tiene como objetivo mitigar estos riesgos, animamos a los usuarios a considerar cuidadosamente sus casos de uso específicos e implementar mitigaciones adicionales según corresponda. Tener un humano en el bucle puede proporcionar una capa adicional de supervisión para abordar posibles sesgos o consecuencias no deseadas.
Nos comprometemos a mejorar continuamente nuestras evaluaciones de equidad para comprender mejor el rendimiento del sistema en varios grupos demográficos y posibles preocupaciones de equidad. El proceso de evaluación está en curso y estamos trabajando activamente para mejorar la equidad y la inclusividad, y mitigar las disparidades identificadas. Entendemos la importancia de abordar las consideraciones de equidad y nos esforzamos por garantizar que el reconocimiento de voz restringido ofrezca salidas de reconocimiento de voz confiables y equitativas.
Nota:
Esta información representa lo que sabemos hasta ahora sobre las evaluaciones de equidad, y seguimos dedicados a refinar nuestras metodologías de evaluación y abordar cualquier problema de equidad que pueda surgir.
Obtener más información sobre la IA responsable
Principios de inteligencia artificial de Microsoft
Recursos de IA responsable de Microsoft
Cursos de Microsoft Azure Learning sobre IA responsable