Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
Importante
Las traducciones no en inglés solo se proporcionan para mayor comodidad. Consulte la EN-US versión de este documento para obtener la versión definitiva.
¿Qué es una nota de transparencia?
Un sistema de inteligencia artificial incluye no solo la tecnología, sino también las personas que lo usarán, las personas que se verán afectadas por ella y el entorno en el que se implementa. La creación de un sistema que se ajuste a su finalidad prevista requiere una comprensión de cómo funciona la tecnología, cuáles son sus funcionalidades y limitaciones, y cómo lograr el mejor rendimiento. las notas de transparencia de Microsoft están pensadas para ayudarle a comprender cómo funciona nuestra tecnología de inteligencia artificial, las opciones que los propietarios del sistema pueden tomar para influir en el rendimiento y el comportamiento del sistema, y la importancia de pensar en todo el sistema, incluida la tecnología, las personas y el entorno. Puede usar notas de transparencia al desarrollar o implementar su propio sistema o compartirlos con las personas que usarán o se verán afectadas por el sistema.
las notas de transparencia de Microsoft forman parte de un esfuerzo más amplio en Microsoft poner en práctica nuestros principios de inteligencia artificial. Para obtener más información, consulte los Principios de IA de Microsoft.
Conceptos básicos de Búsqueda de Azure AI
Introducción
Búsqueda de Azure AI proporciona a los desarrolladores herramientas, API y SDK para crear una experiencia de búsqueda enriquecida sobre contenido privado y heterogéneo en aplicaciones web, móviles y empresariales. La búsqueda es fundamental para cualquier aplicación que muestre datos a los usuarios. Entre los escenarios comunes se incluyen la búsqueda de catálogos o documentos, tiendas minoristas en línea o exploración de datos sobre contenido propietario.
Los datos que se pueden buscar pueden estar en forma de texto o vectores y ser ingeridos tal cual desde un origen de datos o enriquecidos mediante el uso de inteligencia artificial para mejorar la experiencia de búsqueda general. Los desarrolladores pueden convertir los datos int en representaciones numéricas (denominadas vectores), eligiendo llamar a modelos de aprendizaje automático externos (conocidos como modelos de inserción). Opcionalmente, los indexadores pueden incluir conjuntos de habilidades que admiten una potente suite de enriquecimiento de datos a través de varias funcionalidades de Azure Language in Foundry Tools, como detección de entidades con nombre (NER) y detección de información de identificación personal (PII), y capacidades de Azure Vision in Foundry Tools, incluyendo reconocimiento óptico de caracteres (OCR) y análisis de imágenes.
Consulte las pestañas siguientes para obtener más información sobre cómo Búsqueda de Azure AI mejora la experiencia de búsqueda mediante Foundry Tools u otros sistemas de inteligencia artificial para comprender mejor la intención, la semántica y la estructura implícita del contenido de un cliente.
- Enriquecimiento con IA
- Búsqueda de vectores
- Clasificador semántico
- Reescritura de consultas
- Habilidad de indicación de GenAI
- Recuperación de agentes
El enriquecimiento con IA es la aplicación de modelos de aprendizaje automático de Foundry Tools a través del contenido que no se puede buscar fácilmente en su forma sin procesar. A través del enriquecimiento, el análisis y la inferencia se usan para crear contenido y estructura que se pueden buscar donde no existía ninguna anteriormente.
El enriquecimiento con IA es una extensión opcional de la canalización del indizador de Búsqueda de Azure AI que se conecta a Foundry Tools en la misma región que el servicio de búsqueda de un cliente. Una canalización de enriquecimiento tiene los mismos componentes principales que un indexador típico (indexador, origen de datos, índice), además de un conjunto de aptitudes que especifica los pasos de enriquecimiento atómicos. Un conjunto de aptitudes se puede ensamblar mediante aptitudes integradas basadas en las API de Foundry Tools, como Vision y Language, o aptitudes personalizadas que ejecutan código externo que proporcione.
La búsqueda vectorial es un método de recuperación de información donde los documentos y las consultas se representan en un índice como vectores en lugar de texto sin formato. En la búsqueda por vectores, los modelos de aprendizaje automático, hospedados externamente desde Búsqueda de Azure AI, generan las representaciones vectoriales de las entradas de origen, que pueden ser texto, imágenes, audio o contenido de vídeo. Esta representación matemática y normalizada del contenido, denominada incrustaciones vectoriales, proporciona una base común para escenarios de búsqueda.
Cuando todo es un vector, una consulta puede encontrar una coincidencia en el espacio vectorial, incluso si el contenido original asociado está en un tipo de medio diferente, como imágenes frente a texto o idioma que la consulta. El motor de búsqueda examina el índice que busca contenido vectorial más similar, es decir, el más cercano al vector de la consulta. La coincidencia en una representación vectorial matemática en lugar de palabras clave hace que sea mucho más probable encontrar coincidencias que comparten significado semántico, pero son textualmente distintas, como "coche" y "auto", por ejemplo. Esto proporciona una introducción más detallada a las incrustaciones de vectores y cómo funciona el algoritmo de similitud.
Términos clave
| Término | Definición |
|---|---|
| Incrustaciones de vectores | Una manera altamente optimizada de representar datos que reflejen el significado y la comprensión extraídos por un modelo de aprendizaje automático de imágenes, audio, vídeo o texto. El contenido se convierte en incrustaciones vectoriales tanto en la indexación como en el tiempo de consulta. La búsqueda vectorial equivale a tomar incrustaciones proporcionadas en una consulta y buscar las incrustaciones más similares en el índice. Los resultados normalmente se ordenan según el grado de similitud. |
| Espacio de incrustación | Todos los vectores del corpus de un solo campo ocupan el mismo espacio de inserción donde los elementos similares se encuentran cerca entre sí y los elementos diferentes están más alejados. Una mayor dimensionalidad del espacio de inserción puede incluir más información en un solo vector y mejorar considerablemente la experiencia de búsqueda, pero a un costo significativo del tamaño de almacenamiento de índices y una mayor latencia de consulta. |
El clasificador semántico usa el contexto o el significado semántico de una consulta para calcular una nueva puntuación de relevancia que promueve los resultados más cercanos semánticamente a la intención de la consulta original a la parte superior. El conjunto de resultados inicial puede provenir de una búsqueda de palabras clave con la clasificación BM25 , la búsqueda vectorial o una búsqueda híbrida que incluya ambas. También crea y devuelve "subtítulos" mediante la extracción del contenido textual que se encuentra en el resultado y "resaltados" para llamar la atención al contenido importante dentro del resultado. También puede devolver una "respuesta" si la consulta tiene las características de una pregunta ("cuál es el punto de congelación del agua") y el resultado contiene texto que tiene las características de una respuesta ("agua se inmoviliza a 0°C o 32°F").
Términos clave
| Término | Definición |
|---|---|
| Clasificador semántico | Usa el contexto y el significado semántico de una consulta para mejorar la relevancia de la búsqueda mediante language understanding para volver a clasificar los resultados de búsqueda. |
| Subtítulos y resaltados semánticos | Extrae oraciones y frases de un documento que resuman mejor el contenido, con resaltados sobre pasajes clave para facilitar la lectura. Los títulos que resumen un resultado son útiles cuando los campos de contenido individuales son demasiado densos para la página de resultados. El texto resaltado eleva los términos y frases más relevantes para que los usuarios puedan determinar rápidamente por qué se consideró relevante una coincidencia. |
| Respuestas semánticas | Proporciona una subestructura opcional y adicional devuelta desde una consulta semántica. Proporciona una respuesta directa a una consulta que tiene un aspecto similar a una pregunta. Requiere que un documento tenga texto con las características de una respuesta. |
La reescritura de consultas crea consultas sintéticas, que son consultas creadas artificialmente o generadas a partir de la entrada real del cliente para mejorar la recuperación (la fracción de documentos pertinentes recuperados del número total de documentos disponibles) de la clasificación BM25, la búsqueda vectorial o una búsqueda híbrida. La consulta original se combina con las consultas sintéticas para proporcionar una recuperación óptima del motor de búsqueda.
La habilidad de GenAI Prompt forma parte del catálogo de habilidades de Búsqueda de Azure AI, lo que permite a los clientes mejorar sus índices de búsqueda con contenido generado por IA en función de sus datos. Mediante el uso de los propios datos y preferencias de la organización del cliente, esta aptitud ayuda a generar resúmenes, respuestas o conclusiones adaptados que se alinean con sus necesidades específicas.
Esto significa que cuando el usuario final busca el contenido de los clientes a través de AI Search, el contenido generado por IA puede proporcionar resultados más informativos y contextuales, lo que facilita a los usuarios encontrar la información que buscan.
Términos clave
| Término | Definición |
|---|---|
| Habilidades | Una habilidad de Búsqueda de Azure AI es un componente de procesamiento modular dentro de la canalización de enriquecimiento de Búsqueda de Azure AI. Estas habilidades aplican transformaciones impulsadas por IA al contenido sin procesar, como texto, imágenes o documentos, durante la indexación, lo que permite la extracción de información estructurada y buscable a partir de datos no estructurados. |
| Prompt | El texto que envía al servicio en la llamada API. A continuación, este texto se introduce en el modelo. Por ejemplo, se podría introducir la siguiente indicación: Convierta las preguntas en un comando: P: Pregunte a Constanza si necesitamos algo de pan A: send-msg find constance ¿Necesitamos algo de pan? P: Envíe un mensaje a Greg para averiguar si las cosas están listas para el miércoles. R: Send-msg find greg ¿todo listo para el miércoles? |
| Índices de búsqueda | En Búsqueda de Azure AI, un índice es la estructura de datos que contiene el contenido que se puede buscar, define cómo se almacena y controla cómo lo interpretará el servicio al ejecutar una consulta. |
La recuperación agente es una arquitectura de procesamiento de consultas paralela que usa un modelo de lenguaje grande (LLM) conversacional como "planificador de consultas". LLM convierte el historial de conversaciones de un usuario en una o varias subconsultas centradas, según sea necesario. Estas subconsultas se ejecutan simultáneamente en el índice de Búsqueda de Azure AI y el servicio combina los resultados principales y devuelve:
- Cadena de contenido única que contiene los pasajes más relevantes (datos de base).
- Matriz de referencias (opcional) que expone los documentos o fragmentos de origen completos.
- Matriz de actividad que enumera todas las operaciones, el recuento de tokens y la latencia para ayudar al seguimiento y la depuración de costos.
Términos clave
| Término | Definición |
|---|---|
| Recuperación de agente | Esto hace referencia a un agente de IA que planifica y ejecuta una secuencia de pasos para recuperar información de fuentes de referencia. Esto implica actividades como consultar y refinar búsquedas para obtener la información más relevante de la consulta. |
| Datos de referencia | Conjunto de documentos o información devueltos por recuperación de agentes. Actúa como base fáctica que un LLM externo puede citar o transformar en una respuesta en lenguaje natural, lo que garantiza la rastreabilidad y reduce el riesgo de alucinación. |
| Planificador de consultas | Divide el historial de conversación en subconsultas para encontrar los datos de base más relevantes para la consulta de búsqueda subyacente. |
| Subconsulta | Una sola consulta generada por un LLM. Las subconsultas se basan en preguntas de usuario, historial de chat y parámetros en la solicitud. Las subconsultas tienen como destino los documentos indexados (texto sin formato y vectores) en Búsqueda de Azure AI. |
Capacidades
- Enriquecimiento con IA
- Búsqueda de vectores
- Clasificador semántico
- Reescritura de consultas
- Habilidad de indicación de GenAI
- Recuperación de agentes
Comportamiento del sistema
Varias habilidades integradas para el enriquecimiento con IA en Búsqueda de Azure AI aprovechan las herramientas de Foundry. Consulte las notas de transparencia de cada aptitud integrada vinculada a continuación para conocer las consideraciones al elegir usar una aptitud:
- Aptitud de extracción de frases clave: Lenguaje - Extracción de frases clave
- Capacidad de detección de idioma: Language - Detección de idioma
- Habilidad de vinculación de entidades: Lenguaje - Vinculación de entidades
- Aptitud de reconocimiento de entidades: Lenguaje - Reconocimiento de Entidades Nombradas (NER)
- Aptitud para la detección de PII: Idioma - Detección de PII
- Aptitud de Sentimiento: Idioma - Análisis de Sentimiento
- Aptitud de análisis de imágenes: Visión - Análisis de imágenes
- Habilidad OCR: Vision - OCR
- Aptitud diseño de documento: Inteligencia de documentos
Consulte la documentación de cada aptitud para obtener más información sobre sus respectivas funcionalidades, limitaciones, rendimiento, evaluaciones y métodos para la integración y el uso responsable. Tenga en cuenta que el uso de estas habilidades en combinación puede provocar efectos compuestos (por ejemplo, los errores introducidos al usar OCR se transmitirán al usar la extracción de palabras clave).
Casos de uso
Ejemplos de casos de uso
Dado que Búsqueda de Azure AI es una solución de búsqueda de texto completo, el propósito del enriquecimiento con IA es mejorar la utilidad de búsqueda de contenido no estructurado. Estos son algunos ejemplos de escenarios de enriquecimiento de contenido admitidos por las habilidades integradas:
- La traducción y la detección de idioma permiten la búsqueda multilingüe.
- El reconocimiento de entidades extrae personas , lugares y otras entidades de grandes fragmentos de texto.
- La extracción de frases clave identifica y, a continuación, genera términos importantes.
- OCR reconoce texto impreso y manuscrito en archivos binarios.
- El análisis de imágenes describe el contenido de la imagen y genera las descripciones como campos de texto que se pueden buscar.
- Vectorización integrada es una característica en versión preliminar que llama al modelo de incrustaciones de OpenAI Azure para vectorizar datos y almacenar incrustaciones en Búsqueda de Azure AI para la búsqueda de similitud.
Comportamiento del sistema
En la búsqueda de vectores, el motor de búsqueda busca vectores dentro del espacio de inserción en el índice para buscar los cercanos al vector de consulta. Esta técnica se denomina búsqueda de vecino más cercana. Esto también ayuda a cuantificar el grado de similitud, o distancia, entre los elementos. Un alto grado de similitud vectorial indica que los datos originales también eran similares. Los dos algoritmos de búsqueda vectorial admitidos por Búsqueda de Azure AI tienen enfoques diferentes para este problema, negociando características diferentes, como la latencia, el rendimiento, la recuperación y la memoria.
La búsqueda del verdadero conjunto de vecinos más cercanos "k" requiere comparar el vector de entrada exhaustivamente con todos los vectores del conjunto de datos. Aunque cada cálculo de similitud de vectores es relativamente rápido, realizar estas comparaciones exhaustivas en conjuntos de datos grandes es computacionalmente costosa y lenta debido al número máximo de comparaciones necesarias. Además, cuanto mayor sea la dimensionalidad de cada vector, más complejos y más lentos serán los cálculos de cada vector.
Para abordar este desafío, se utilizan métodos de búsqueda de vecinos más cercanos aproximados (ANN) para sacrificar recuperación por velocidad. Estos métodos pueden encontrar eficazmente un pequeño conjunto de vectores candidatos que probablemente sean similares al vector de consulta, lo que reduce el número total de comparaciones de vectores. Búsqueda de Azure AI usa el algoritmo Jerárquico de pequeños mundos navegables (HNSW) para organizar puntos de datos multidimensionales en una estructura jerárquica de grafos probabilística que permite una búsqueda de similitud rápida, lo que permite un equilibrio ajustable entre la precisión de la búsqueda y el costo computacional.
Búsqueda de Azure AI también admite varias métricas de similitud para determinar el vecino más cercano y la puntuación de cada resultado vectorial: incluyen coseno, "Euclideano" (también conocido como "norma l2") y "producto escalar". Coseno calcula el ángulo entre dos vectores. Euclideano calcula la distancia euclidiana entre dos vectores, que es la norma l2 de la diferencia de los dos vectores. El producto de puntos se ve afectado por las magnitudes de los vectores y el ángulo entre ellos. En el caso de los espacios de inserción normalizados, el producto escalar es equivalente a la similitud coseno, pero es más eficiente.
Casos de uso
Ejemplos de casos de uso
Hay muchos escenarios en los que la búsqueda de vectores es útil y solo están limitados por las funcionalidades del modelo que se usan para generar incrustaciones de vectores. Estos son algunos casos de uso generales en los que se puede usar la búsqueda de vectores:
- Búsqueda semántica: extrae la descripción semántica del texto utilizando un modelo, como modelos de inserciones de Azure OpenAI Service.
- Buscar en diferentes tipos de datos (horizontal): codificar contenido procedente de imágenes, texto, audio y vídeo, o una combinación, y realizar una sola búsqueda en todas ellas.
- Búsqueda multilingüe: use un modelo de incrustaciones multilingües para representar el documento en varios idiomas para buscar resultados en idiomas admitidos.
- Búsqueda híbrida: la búsqueda vectorial se implementa en el nivel de campo, lo que significa que puede crear consultas que incluyan campos vectoriales y campos de texto que se pueden buscar. Las consultas se ejecutan en paralelo y los resultados se combinan en una única respuesta. Se han mostrado resultados de búsqueda híbrida con clasificación semántica para proporcionar los mejores resultados cualitativos.
- Búsqueda de vectores filtrados: una consulta puede incluir una consulta vectorial y una expresión de filtro. Los filtros aplicados a otros tipos de datos son útiles para incluir o excluir documentos en función de otros criterios.
- Base de datos vectorial: este almacén de vectores puro es para la memoria a largo plazo o una base de conocimiento externa para modelos de lenguaje grande (LLM). Por ejemplo, utilice Búsqueda de Azure AI como índice vectorial en el flujo de indicación de Azure Machine Learning para aplicaciones de recuperación aumentada de generación (RAG).
Consideraciones al elegir un caso de uso
Puede haber consideraciones y preocupaciones asociadas al modelo específico que elija para generar incrustaciones de vectores. Cada modelo podría tener sus propios problemas con el sesgo y la equidad, y debe evaluarse antes de usarse en la aplicación. Búsqueda de Azure AI no proporciona ningún modelo para vectorizar contenido como parte del servicio. Consulte la nota de transparencia Azure OpenAI Service para obtener ejemplos de estas consideraciones. Otros modelos de terceros o OSS tienen consideraciones propias para revisar.
Comportamiento del sistema
La clasificación de los resultados del primer paso de recuperación de capas es un proceso muy intensivo de recursos. Para completar el procesamiento del clasificador dentro de la latencia esperada de una operación de consulta, solo los 50 resultados principales del motor de recuperación se envían al clasificador semántico como entradas. Si es demasiado largo, los 50 resultados se envían primero a un paso de resumen que extrae el contenido más relevante de cada resultado antes de ejecutar el clasificador semántico.
En el paso de resumen, el documento recuperado se somete primero a un proceso de preparación que concatena las distintas entradas del documento en una cadena larga y única. Si la cadena es demasiado larga, se realiza un ejercicio de recorte, con especial énfasis en la conservación del contenido contenido dentro de los campos agregados a la configuración semántica. Una vez preparadas las cadenas, se pasan a través de modelos de comprensión de lectura automática y representación de lenguaje para determinar qué oraciones y frases proporcionan el mejor resumen, en relación con la consulta. Esta fase extrae el contenido de la cadena que se pasará a la fase de clasificación semántica y, opcionalmente, genera un título semántico o una respuesta semántica.
El paso final, clasificación semántica, determina la relevancia del contenido extraído en el paso anterior a la consulta del usuario y genera una puntuación de clasificación semántica que va de 4 (altamente relevante) a 0 (irrelevante). Este paso se basa en el texto de consulta y en el texto resumido e implica cálculos más complejos que los de la capa de recuperación.
Casos de uso
Ejemplos de casos de uso
El clasificador semántico se puede usar en varios escenarios. Los casos de uso previstos del sistema incluyen:
- Retrieval Augmented Generation (RAG): el clasificador semántico permite que las aplicaciones de IA generativas basen sus respuestas en los resultados de búsqueda pertinentes que cumplan con el umbral de puntuación de relevancia que defina. Por ejemplo, el servicio Azure OpenAI en tus datos utiliza Búsqueda de Azure AI para mejorar los modelos de Azure OpenAI con tus datos. Puede usar el clasificador semántico dentro de este servicio para mejorar la relevancia de la información alimentada al modelo de OpenAI de Azure.
- Búsqueda de contenido: el clasificador semántico permite buscar contenido relevante dentro de los datos mediante el análisis de texto y metadatos. Por ejemplo, la búsqueda en el sitio web learn.microsoft.com utiliza un sistema de clasificación semántica para mejorar la relevancia de búsqueda para los desarrolladores de software que buscan documentación técnica de Microsoft.
- Búsqueda de comercio electrónico: el clasificador semántico permite a las empresas de comercio electrónico mejorar su experiencia de búsqueda proporcionando resultados relevantes del producto en función de la relevancia semántica. Por ejemplo, los minoristas en línea usan clasificador semántico para optimizar su experiencia de comercio electrónico proporcionando resultados de búsqueda relevantes para sus compradores en línea.
- QnA: Búsqueda de Azure AI permite a las organizaciones proporcionar una experiencia conversacional a sus usuarios respondiendo preguntas basadas en la información disponible en sus bases de datos. Por ejemplo, un fabricante puede usar el clasificador semántico para aumentar la información disponible para un bot de chat. Los ingenieros pueden usar este bot de chat para formular preguntas y recuperar documentos internos altamente relevantes relacionados con su consulta y respuestas instantáneas dentro de los documentos recuperados.
Consideraciones al elegir un caso de uso
Animamos a los clientes a usar el clasificador semántico en sus innovadoras soluciones o aplicaciones. Sin embargo, estas son algunas consideraciones al elegir un caso de uso:
- Información confidencial: los modelos de aprendizaje automático que permiten el clasificador semántico procesan los datos recuperados en una consulta de búsqueda, incluida la información confidencial, como los detalles personales y la información financiera. Tenga en cuenta las implicaciones de privacidad y seguridad antes de implementar el clasificador semántico para estos casos de uso.
- Sesgo y equidad : El clasificador semántico se basa en modelos de aprendizaje profundo. Estos modelos de aprendizaje profundo se entrenaron mediante el uso de contenido público. Los datos del cliente se puntúan mediante los modelos de clasificador semántico. Evalúe la salida del clasificador semántico cuando seleccione casos de uso, especialmente para los casos de uso que tienen implicaciones para la equidad y la justicia, como la contratación y el reclutamiento.
- Cumplimiento de la normativa: algunos sectores, como la atención sanitaria y las finanzas, están altamente regulados y pueden tener restricciones en el uso de la inteligencia artificial y el aprendizaje automático. Antes de usar el clasificador semántico en tales sectores, asegúrese de que la solución cumple con las normativas y directrices pertinentes.
Comportamiento del sistema
La consulta original se envía a un Modelo de Lenguaje Pequeño (SLM) finamente ajustado alojado en Búsqueda de Azure AI. Este modelo se entrenó mediante el contenido público. SLM transforma la consulta original en un conjunto de consultas sintéticas. Estas consultas sintéticas están semánticamente cercanas a la intención de la consulta original, pero incluyen un conjunto diferente de términos para mejorar la recuperación del motor de búsqueda.
A continuación, las consultas sintéticas se combinan con la consulta original y se envían al motor de búsqueda. Cuando realiza la clasificación bm25, los términos clave de las consultas sintéticas se combinan con la consulta original. Cuando realiza la búsqueda de vectores, la consulta original se concatena con las consultas sintéticas antes del paso de inserción de vectores .
Casos de uso
Ejemplos de casos de uso
La reescritura de consultas se puede usar en varios escenarios. La reescritura de consultas requiere el uso del clasificador semántico.
- Interacción de chat con tus datos: La reescritura de consultas permite que las respuestas de las aplicaciones de IA generativa se basen en los resultados de búsqueda relevantes que cumplen con el umbral de puntuación de relevancia que establezcas. Por ejemplo, el servicio Azure OpenAI con tus datos utiliza Búsqueda de Azure AI para mejorar los modelos de Azure OpenAI con tus datos. Puede usar la reescritura de consultas dentro de este servicio para mejorar la relevancia de los resultados de la información alimentada al modelo de OpenAI de Azure.
- Conversational Questions and Answers (QnA): Búsqueda de Azure AI permite a las organizaciones proporcionar una experiencia conversacional a sus usuarios respondiendo preguntas basadas en la información disponible en sus bases de datos. Por ejemplo, un fabricante puede usar el clasificador semántico para aumentar la información disponible para un bot de chat. Los ingenieros pueden usar este bot de chat para formular preguntas y recuperar documentos internos altamente relevantes relacionados con su consulta y respuestas instantáneas dentro de los documentos recuperados.
Consideraciones al elegir un caso de uso
Animamos a los clientes a usar la reescritura de consultas en sus innovadoras soluciones o aplicaciones. Sin embargo, estas son algunas consideraciones al elegir un caso de uso:
- Información confidencial y PII: el SLM ajustado, que permite la reescritura de consultas, procesa la consulta de búsqueda, que puede contener información confidencial. Tenga en cuenta las implicaciones de privacidad y seguridad antes de implementar la reescritura de consultas para estos casos de uso.
- Redacte información personal para reducir el sesgo inconsciente. Por ejemplo, durante el proceso de revisión de currículum vitae de una empresa, es posible que quieran bloquear el nombre, la dirección o el número de teléfono de un candidato para ayudar a reducir el sesgo inconsciente de género u otros sesgos durante la búsqueda.
- Consideraciones legales y normativas. Las organizaciones deben evaluar posibles obligaciones legales y normativas específicas al usar cualquier búsqueda de IA, que puede no ser adecuada para su uso en todos los sectores o escenarios. Las restricciones pueden variar en función de los requisitos normativos regionales o locales. Además, la búsqueda de IA no está diseñada para y puede no usarse de maneras prohibidas en términos de servicio aplicables y códigos de conducta pertinentes.
La habilidad de solicitud de GenAI permite a los clientes pasar su contenido de documentos, existente en sus orígenes de datos, y solicitudes personalizadas a un modelo de lenguaje de su propiedad, hospedado en Microsoft Foundry. El modelo de lenguaje procesa la entrada y devuelve contenido enriquecido, que luego se ingiere en el índice de búsqueda junto con el contenido del documento original. Este proceso permite aumentar los índices de búsqueda con resúmenes generados por IA, subtítulos de imagen y extracción de entidades, entre otros, en función de los criterios definidos por el cliente.
En los ejemplos siguientes se muestra cómo funciona la habilidad de preguntas de GenAI.
Resumen de vales sin tomas
Objetivo: permitir que los agentes de soporte revisen hilos de correo electrónico largos en segundos.
Cómo funciona:
- Durante la indexación, cada conversación larga de ticket se divide en segmentos lógicos (solicitud inicial, preguntas de seguimiento, registros de diagnóstico, etc.).
- Para cada segmento, se indica al modelo de lenguaje que "resuma esta sección en tres oraciones nítidas".
- Los resúmenes resultantes reemplazan el texto sin formato durante la recuperación, por lo que los agentes y las canalizaciones de RAG posteriores solo ven la esencia destilada.
Por qué ayuda: los resúmenes de nivel de segmento conciso reducen el tamaño de la solicitud, aceleran la generación de respuestas y ayudan a los agentes a centrarse en el problema principal del cliente.
Extracción de entidades con pocas tomas
Objetivo: Apoyar consultas como "Muéstrame todos los vales donde el Producto X se haya bloqueado con el error 500".
Cómo funciona
- El texto completo del ticket se envía a la habilidad junto con un ejemplo trabajado que muestra el formato de salida que se desea (una lista de entidades clave, como el nombre del producto, el código de error, el sistema operativo y la severidad).
- El modelo extrae todas las apariciones de 〈producto, error_code, plataforma, gravedad.
- Esta lista estructurada se almacena con el documento, lo que hace posible aplicar filtros instantáneos que muestren, por ejemplo, todos los bloqueos de gravedad alta en iOS.
Por qué ayuda: las entidades precomputadas convierten los mensajes de los clientes de forma libre en datos filtrables, permitiendo a los responsables de soporte identificar patrones y priorizar correcciones sin análisis manual.
Clasificación de enrutamiento de vales de una sola toma
Objetivo: Enrutar automáticamente cada ticket a la cola adecuada.
Cómo funciona:
- Cada vale se analiza con un mensaje que muestra cinco categorías de soporte técnico( Facturación, Problema técnico, Acceso a cuentas, Solicitud de características y Comentarios generales), además de un ejemplo de referencia ("Ejemplo de vale → facturación").
- El modelo asigna exactamente una etiqueta, en función de las cinco categorías de soporte anteriores, a cada ticket que entre en el sistema AI Search como entrada.
- El sistema de atención al cliente usa la etiqueta para enviar consultas de facturación a especialistas financieros, fallos técnicos a ingenieros, etc.
Por qué ayuda: El etiquetado rápido y coherente reduce las incidencias mal enrutadas, acorta el tiempo de resolución y mejora la satisfacción del cliente.
Sugerencia de resolución de razonamiento secuencial
Objetivo: proporcione a los agentes de soporte técnico el mejor paso siguiente para resolver el problema.
Cómo funciona
- El vale completo (o su mensaje más reciente del cliente) se pasa al modelo de lenguaje.
- El mensaje de usuario indica al modelo después del comando del sistema: "Piense paso a paso internamente, pero solo que produzca la próxima acción recomendada".
- La guía devuelta podría ser: "Pida al cliente que borre la memoria caché y vuelva a instalar la versión 3.2.1".
- Los agentes pueden copiar la sugerencia directamente o refinarla antes de responder.
Por qué ayuda: los agentes reciben una recomendación procesable sin la cadena de razonamiento privado del modelo, lo que ahorra tiempo y mantiene los pasos de solución de problemas concisos y relevantes. En algunos casos, el agente de soporte técnico no se inunda con información innecesaria.
Casos de uso
Ejemplos de casos de uso
La habilidad de indicación de GenAI mejora el enriquecimiento de datos en Búsqueda de Azure AI, lo que ayuda a que la relevancia de respuesta se alinee con la intención y las expectativas del usuario. Al integrar contenido generado por IA en índices de búsqueda, esta aptitud permite resultados de búsqueda más precisos y adecuados contextualmente. Entre las aplicaciones clave se incluyen:
- Generar resúmenes concisos de documentos largos para facilitar la recuperación más rápida de la información: una firma legal procesa contratos extensos y usa la aptitud De solicitud genAI para crear resúmenes breves que resaltan cláusulas clave, lo que facilita a los abogados revisar información esencial sin leer documentos completos.
- Crear descripciones textuales para imágenes para mejorar la accesibilidad y la capacidad de búsqueda: una empresa multimedia administra una amplia biblioteca de imágenes. Al aplicar la habilidad de sugerencia de GenAI, generan subtítulos descriptivos para cada imagen, lo que permite una búsqueda y organización eficaces dentro de su sistema de gestión de activos digitales.
- Identificación y extracción de entidades o hechos específicos de documentos basados en criterios personalizados: una institución de investigación analiza documentos científicos para extraer menciones de compuestos químicos y sus propiedades. La aptitud Preguntar de GenAI automatiza esta extracción, rellenando una base de datos estructurada para que los investigadores accedan rápidamente a los datos pertinentes.
- Clasificación de documentos en categorías definidas para una mejor organización y recuperación: una compañía de seguros recibe numerosos tipos de documentos diariamente. Con la habilidad de Prompt de GenAI, clasifican automáticamente estos documentos en categorías como Reclamaciones, Actualizaciones de políticas y Comentarios de los clientes. Esto simplifica su proceso de administración de documentos y facilita la localización de documentos específicos cuando sea necesario.
Aunque estas son aplicaciones comunes, la aptitud es flexible, lo que permite a los clientes definir avisos adaptados a sus requisitos únicos.
Consideraciones al elegir un caso de uso
Es importante tener en cuenta que el contenido, las indicaciones y las implementaciones del modelo de lenguaje son recursos totalmente administrados por el cliente. Foundry admite filtros de seguridad de contenido para implementaciones de modelos y los clientes son responsables de configurar estos filtros según sea necesario. Más allá de las configuraciones disponibles en Foundry, Búsqueda de Azure AI no aplica filtros de seguridad de contenido adicionales dentro de la habilidad de solicitud de GenAI.
Al implementar la habilidad de GenAI Prompt, tenga en cuenta lo siguiente:
- Implemente procesos para la revisión humana del contenido generado por la inteligencia artificial, especialmente al aplicar transformaciones rápidas que podrían afectar a la confiabilidad de la información. Use la herramienta debug sessions de Búsqueda de Azure AI para probar las solicitudes en documentos de ejemplo antes de la implementación a escala completa.
- Evite escenarios en los que el uso o el mal uso del sistema podrían dar lugar a lesiones físicas o psicológicas significativas para un individuo. Por ejemplo, los escenarios que diagnostican pacientes o recetan medicamentos tienen la posibilidad de causar daños significativos. La incorporación de una revisión y supervisión humana significativas en el escenario puede ayudar a reducir el riesgo de resultados perjudiciales.
- Considere detenidamente todos los casos de uso generativos. Los escenarios de generación de contenido pueden ser más probables para generar salidas no deseadas y estos escenarios requieren una cuidadosa consideración y mitigaciones.
- Consideraciones legales y normativas. Las organizaciones deben evaluar posibles obligaciones legales y normativas específicas al usar cualquier búsqueda de IA, que puede no ser adecuada para su uso en todos los sectores o escenarios. Las restricciones pueden variar en función de los requisitos normativos regionales o locales. Además, la búsqueda de IA no está diseñada para y puede no usarse de maneras prohibidas en términos de servicio aplicables y códigos de conducta pertinentes.
Comportamiento del sistema
La consulta de búsqueda o conversación original se envía al modelo de OpenAI Azure de propiedad de un cliente para ejecutar los pasos de planeamiento de consultas. El planeamiento de consultas divide la conversación en una serie de subconsultas optimizadas que reflejan la intención subyacente del usuario con ortografía corregida y sinónimos expandidos. Búsqueda de Azure AI luego procesa todas las subconsultas a la vez en el sistema de recuperación de búsqueda completo. Las subconsultas se procesan primero mediante una combinación híbrida de búsqueda de palabras clave y búsqueda vectorial. La búsqueda de palabras clave busca los documentos en el índice de búsqueda con palabras clave similares a las subconsultas. La búsqueda vectorial busca documentos en el índice de búsqueda que pueden tener palabras clave diferentes, pero un significado subyacente similar a las subconsultas. Los resultados de esta búsqueda híbrida se vuelven a clasificar por clasificador semántico para buscar los documentos con la mejor coincidencia con la intención de la subconsulta. A continuación, el servicio combina y quita duplicados de los resultados clasificados, aplicando límites de respuesta como la longitud máxima de salida antes de devolver la respuesta final.
Casos de uso
Ejemplos de casos de uso
- Datos de base para chatbots personalizados. Vincule el bot de chat a las directivas oficiales de RR. HH. y al manual de empleados para que cuando alguien le pregunte, "¿Cuántos días de vacaciones obtengo?" el bot de chat extrae la respuesta directamente de esos documentos en lugar de adivinar.
- Equipe a los asistentes de conocimientos empresariales para respetar el contexto del usuario, los filtros y el historial de chat. Por ejemplo, cuando un empleado pregunta sobre los objetivos de un período específico, el asistente usa su rol, los filtros actuales (por ejemplo, región: EE. UU.) y la conversación en curso (por ejemplo, el último tema era "canalización de Q2") para generar una respuesta personalizada.
- Abordar tareas complejas de búsqueda de información en las que una sola consulta de palabra clave tiene poca recuperación. Estas tareas pueden incluir guías de solución de problemas, investigaciones de literatura médica o comparaciones de productos. Por ejemplo, si un técnico simplemente busca "error de dispositivo" y recibe resultados genéricos, un recuperador agente puede tener en cuenta todo el historial de conversaciones que puede incluir el modelo de dispositivo, la versión de software, el historial de mantenimiento y el estado de red para mostrar artículos precisos y relevantes.
- Garantizar una transparencia completa en lo que se recuperó, por qué y a qué costo. Por ejemplo, al resumir documentos normativos y resultados de auditoría anteriores, es fundamental conocer los orígenes exactos (por ejemplo, "presentación de SEC de Q2 2023"), la lógica de selección (por ejemplo, "palabras clave coincidentes: divulgación de riesgos, derivados") y los costos asociados (por ejemplo, el uso de tokens).
Consideraciones al elegir un caso de uso
- Latencia: agregar una segunda llamada LLM para el planeamiento de consultas inevitablemente amplía el tiempo de ida y vuelta de la solicitud. Incluso con modelos rápidos, debe realizar pruebas comparativas del retraso adicional en el tráfico máximo y comprobar que la experiencia general sigue siendo aceptable para los usuarios. Cuando la latencia es crítica, considere la posibilidad de almacenar en caché consultas frecuentes o usar modelos de planeamiento más pequeños y más rápidos.
- Costo: Los cargos se acumulan en dos dimensiones: tokens de modelos de OpenAI y tokens de clasificación de búsqueda. Azure OpenAI factura la llamada al planificador de consultas por los tokens de entrada y salida, mientras que factura cada subconsulta por los tokens que debe clasificar. Los tokens de clasificación son gratuitos en la fase inicial de la versión preliminar pública. Estime con antelación los números de tokens del modelo y del ranking para la carga de trabajo.
- Entradas confidenciales: todo el historial de conversaciones se reenvía al modelo de planificación, lo que significa que cualquier dato personal identificable o confidencial para la empresa sale de su perímetro de confianza inmediato. Eliminar, enmascarar o censurar estos datos antes de invocar el LLM y documentar esa mitigación en la estrategia de protección de datos.
- Límites de región y versión preliminar: la recuperación agencial solo está disponible en las regiones donde el clasificador semántico está habilitado. Un agente individual puede apuntar a un solo índice de búsqueda. Confirme que la región que hospeda los datos y el modelo admite la recuperación agente y planee agentes independientes si necesita abarcar varios índices o zonas geográficas.
- Cumplimiento: confirme que el uso de un planificador de consultas controlado por LLM cumple con los requisitos específicos del sector o regionales (por ejemplo, residencia de datos, privacidad o reglas automatizadas de decisión en el sector sanitario o las finanzas). Garantizar la supervisión y el control humanos adecuados. Considere la posibilidad de incluir controles para ayudar a los desarrolladores a comprobar, revisar o aprobar acciones de forma oportuna, lo que puede incluir la revisión de tareas planeadas o llamadas a orígenes de datos externos.
- Consideraciones legales y normativas: los usuarios deben evaluar posibles obligaciones legales y normativas específicas al usar las herramientas y soluciones de Foundry, que pueden no ser adecuadas para su uso en todos los sectores o escenarios. Además, las herramientas o soluciones de Foundry no están diseñadas para y pueden no usarse de maneras prohibidas en términos de servicio aplicables y códigos de conducta pertinentes.
Limitaciones
- Enriquecimiento con IA
- Búsqueda de vectores
- Clasificador semántico
- Reescritura de consultas
- Habilidad de indicación de GenAI
- Recuperación de agentes
El enriquecimiento con IA en Búsqueda de Azure AI usa las características del indexador y del origen de datos del servicio para llamar a Foundry Tools para realizar el enriquecimiento de contenido. Se aplicarán las limitaciones de los indexadores y orígenes de datos usados en este proceso. Revise la documentación del indexador y del origen de datos para obtener más información sobre estas limitaciones relacionadas. También se aplicarán las limitaciones de cada Foundry Tool utilizada por la canalización de enriquecimiento de IA en Búsqueda de Azure AI. Consulte las notas de transparencia de cada servicio para obtener más información sobre estas limitaciones.
Limitaciones técnicas, factores operativos y intervalos
Todos los vectores cargados en Búsqueda de Azure AI deben generarse externamente desde el servicio mediante un modelo de su elección. Es responsabilidad suya tener en cuenta las limitaciones técnicas y los factores operativos de cada modelo, y si las incrustaciones que crea están optimizadas o incluso adecuadas para su caso de uso. Esto incluye las inferencias de significado extraídos del contenido y la dimensionalidad del espacio de inserción del vector.
El modelo de vectorización crea un espacio de incrustaciones que define la experiencia de búsqueda del usuario final resultante de una aplicación. Podría haber inconvenientes en un modelo que afecta negativamente tanto a la funcionalidad como al rendimiento si un modelo no se alinea bien con un caso de uso deseado o las incrustaciones generadas están mal optimizadas.
Aunque muchas limitaciones de la búsqueda de vectores se derivan del modelo que se usa para generar incrustaciones, hay algunas opciones adicionales que debe tener en cuenta en el momento de la consulta. Puede elegir entre dos algoritmos para determinar la relevancia de los resultados de del vector de búsqueda: k vecinos más cercanos (KNN) exhaustivos o mundo pequeño navegable jerárquico. Los k vecinos más cercanos (KNN) exhaustivos realizan una búsqueda por fuerza bruta en todo el espacio vectorial para encontrar las coincidencias más similares a la consulta calculando las distancias entre todos los pares de puntos de datos y determinando los k vecinos más cercanos exactos de un punto de consulta. Aunque es más preciso, este algoritmo puede ser lento. Si la latencia baja es el objetivo principal, considere la posibilidad de usar el algoritmo Jerárquico de pequeños mundos navegables (HNSW). HNSW realiza una búsqueda eficiente aproximada de vecinos más cercanos (ANN) en espacios de inserción dimensionales altos. Consulte la documentación de búsqueda de vectores para obtener más información sobre estas opciones.
Procedimientos recomendados para mejorar el rendimiento del sistema
- Dedique tiempo a realizar pruebas A/B en su aplicación con los diferentes tipos de contenido y consultas que espera que esta admita. Descubra qué experiencia de consulta es la mejor para sus necesidades.
- Dedique tiempo a probar los modelos con una amplia gama de contenido de entrada para comprender cómo se comporta en muchas situaciones. Este contenido podría incluir una entrada potencialmente confidencial para comprender si hay algún sesgo inherente al modelo. La información general Azure OpenAI Responsible AI proporciona instrucciones sobre cómo usar la inteligencia artificial responsable.
- Considere la posibilidad de agregar Seguridad del contenido de Azure AI a la arquitectura de la aplicación. Incluye una API para detectar textos o imágenes perjudiciales generados por el usuario o por IA en aplicaciones y servicios.
Evaluación e integración de la búsqueda de vectores para su uso
Para garantizar un rendimiento óptimo, realice sus propias evaluaciones de las soluciones que planea implementar mediante la búsqueda vectorial. Siga un proceso de evaluación que: (1) usa algunas partes interesadas internas para evaluar los resultados, (2) usa la experimentación A/B para implementar la búsqueda de vectores a los usuarios, (3) incorpora indicadores clave de rendimiento (KPI) y la supervisión de métricas cuando el servicio se implementa en experiencias por primera vez, y (4) prueba y ajusta la configuración del clasificador semántico o la definición del índice, incluyendo las experiencias circundantes, como la selección de ubicación de la interfaz de usuario o los procesos empresariales.
Microsoft ha evaluado rigurosamente la búsqueda de vectores en términos de latencia y recuperación y relevancia mediante el uso de diversos conjuntos de datos para medir la velocidad, escalabilidad y precisión de los resultados devueltos. El enfoque principal de los esfuerzos de evaluación debe ser seleccionar el modelo adecuado para su caso de uso específico, comprender las limitaciones y sesgos del modelo y probar rigurosamente la experiencia de búsqueda de vectores de un extremo a otro.
Limitaciones técnicas, factores operativos y intervalos
Puede haber casos en los que los resultados semánticos, los subtítulos y las respuestas no parezcan correctos. Los modelos usados por el clasificador semántico se entrenan en varios orígenes de datos (incluidos los código abierto y las selecciones del corpus de Microsoft Bing). El clasificador semántico admite una amplia gama de idiomas e intenta hacer coincidir las consultas de usuario con el contenido de los resultados de la búsqueda. El clasificador semántico también es una característica premium a un costo adicional que se debe tener en cuenta al proyectar el costo general de la solución de un extremo a otro.
Es más probable que el clasificador semántico mejore la relevancia sobre el contenido enriquecido semánticamente, como artículos y descripciones. Busca contexto y relación entre términos, elevando coincidencias que tengan más sentido dada la consulta. Reconocimiento del lenguaje "encuentra" resúmenes o subtítulos y respuestas dentro del contenido, pero, a diferencia de los modelos generativos como los modelos de Azure OpenAI Service GPT-3.5 o GPT-4, no los crea. Solo se incluye texto textual de los documentos de origen en la respuesta, que luego se puede representar en una página de resultados de búsqueda para obtener una experiencia de búsqueda más productiva.
Modelos preentrenados de última generación se utilizan para resumir y ordenar. Para mantener el rendimiento rápido que los usuarios esperan de la búsqueda, el resumen semántico y la clasificación se aplican solo a los 50 primeros resultados, como se puntúa con el algoritmo de puntuación predeterminado. Las entradas se derivan del contenido en el resultado de la búsqueda. No puede volver al índice de búsqueda para tener acceso a otros campos del documento de búsqueda que no se devolvieron en la respuesta de la consulta. Las entradas están sujetas a una longitud de token de 8 960. Estos límites son necesarios para mantener tiempos de respuesta de milisegundos.
El algoritmo de puntuación predeterminado es de Bing y Microsoft Research e integrado en la infraestructura de Búsqueda de Azure AI como una característica de complemento. Los modelos se usan internamente, no se exponen al desarrollador y no son configurables. Para obtener más información sobre las inversiones en investigación e inteligencia artificial que respaldan el clasificador semántico, consulte Cómo la inteligencia artificial de Bing está impulsando Búsqueda de Azure AI (blog de Microsoft Research).
El clasificador semántico también ofrece respuestas, subtítulos y resaltado dentro de la respuesta. Por ejemplo, si el modelo clasifica una consulta como una pregunta y es 70% confía en la respuesta, el modelo devuelve una respuesta semántica. Además, los subtítulos semánticos proporcionan el contenido más relevante dentro de los resultados y proporcionan un breve fragmento de código que resalta las palabras o frases más relevantes dentro de ese fragmento de código.
Los resultados del clasificador semántico se basan en los datos del índice de búsqueda subyacente y los modelos proporcionan clasificación de relevancia, respuestas y subtítulos en función de la información recuperada del índice. Antes de usar el clasificador semántico en un entorno de producción, es importante realizar más pruebas y asegurarse de que el conjunto de datos sea preciso y adecuado para el caso de uso previsto. Para obtener más información y ejemplos de cómo evaluar el clasificador semántico, consulte el contenido y el apéndice aquí.
Rendimiento del sistema
En muchos sistemas de inteligencia artificial, el rendimiento suele definirse en relación con la precisión, es decir, la frecuencia con la que el sistema de inteligencia artificial ofrece una predicción o salida correctas. Con los modelos de lenguaje natural a gran escala, dos usuarios diferentes pueden examinar la misma salida y tener opiniones diferentes sobre lo útil o relevante que es, lo que significa que el rendimiento de estos sistemas debe definirse de forma más flexible. Aquí, consideramos en términos generales el rendimiento como que la aplicación funciona como usted y sus usuarios esperan, incluyendo no generar resultados perjudiciales.
El clasificador semántico se entrenó en el contenido público. Como resultado, la relevancia semántica varía en función de los documentos del índice y de las consultas emitidas en él. Es importante usar su propio juicio e investigación al usar este contenido para la toma de decisiones.
Procedimientos recomendados para mejorar el rendimiento del sistema
- Dedique tiempo a probar la aplicación mediante pruebas A/B con distintos tipos de consulta, como palabra clave frente a híbrido más clasificador semántico. Descubra qué experiencia de consulta es la mejor para sus necesidades.
- Realice un esfuerzo razonable para configurar la configuración semántica de acuerdo con la documentación de características.
- No confíe en las respuestas semánticas si no tiene confianza en la precisión de la información dentro del índice de búsqueda.
- No confíe siempre en los títulos semánticos porque se extraen del contenido del cliente a través de una serie de modelos que predicen las respuestas más relevantes en un breve fragmento de código.
Evaluación del clasificador semántico
Métodos de evaluación
El clasificador semántico se evaluó a través de pruebas internas, incluidos el criterio automatizado y humano en varios conjuntos de datos, así como los comentarios de los clientes internos. Las pruebas incluyen la clasificación de documentos puntuándolos como relevantes o no relevantes, y ordenándolos en una secuencia de prioridad según su relevancia. Del mismo modo, los títulos y la funcionalidad de respuestas también se clasificaron a través de pruebas internas.
Resultados de la evaluación
Nos esforzamos por enviar todas las actualizaciones del modelo sin regresión (es decir, el modelo actualizado solo debe mejorar el modelo de producción actual). Cada candidato se compara directamente con el modelo de producción actual mediante métricas adecuadas para la característica que se va a evaluar (por ejemplo, Ganancia acumulativa con descuento normalizado para clasificación y precisión o recuperación para respuestas). Los modelos de clasificador semántico se entrenan, optimizan y evalúan mediante una amplia gama de datos de entrenamiento que son representativos de documentos que tienen propiedades diferentes (lenguaje, longitud, formato, estilos y tonos) para admitir la gama más amplia de escenarios de búsqueda. Nuestros datos de entrenamiento y prueba se extraen de:
Fuentes de documentos:
- Referencias comparativas académicas e industriales
- Datos del cliente (solo pruebas, realizadas con permiso de cliente)
- Datos sintéticos
Orígenes de consultas:
- Conjuntos de consultas comparativas
- Conjuntos de consultas proporcionados por el cliente (solo pruebas, realizadas con permiso de cliente)
- Conjuntos de consultas sintéticas
- Conjuntos de consultas generados por el usuario
Orígenes de etiquetas para el puntaje de pares de consultas y documentos.
- Etiquetas de referencia académicas e industriales
- Etiquetas de cliente (solo pruebas, realizadas con permiso de cliente)
- Etiquetas de datos sintéticas
- Etiquetas puntuadas por humanos
Evaluación e integración del clasificador semántico para su uso
El rendimiento del clasificador semántico varía en función de los usos del mundo real y las condiciones en las que las personas la usan. La calidad de la relevancia proporcionada a través de los modelos de aprendizaje profundo que potencian las funcionalidades del clasificador semántico se correlaciona directamente con la calidad de los datos del índice de búsqueda. Por ejemplo, los modelos actualmente tienen limitaciones de token que solo tienen en cuenta los 8 960 tokens principales para las respuestas semánticas. Por lo tanto, si la respuesta semántica a una consulta de búsqueda se encuentra hacia el final de un documento largo (más allá del límite de 8960 tokens), no se proporcionará la respuesta. La misma regla se aplica a los títulos. Además, la configuración semántica enumera los campos de búsqueda pertinentes en orden de prioridad. Puede reordenar los campos de esta lista para ayudar a adaptar la relevancia para satisfacer mejor sus necesidades.
Para garantizar un rendimiento óptimo en sus escenarios, los clientes deben realizar sus propias evaluaciones de las soluciones que implementan mediante el clasificador semántico. Por lo general, los clientes deben seguir un proceso de evaluación que: (1) usa algunas partes interesadas internas para evaluar los resultados, (2) usa experimentación A/B para implementar el clasificador semántico para los usuarios, (3) incorpora KPI y supervisión de métricas cuando el servicio se implementa en experiencias por primera vez, y (4) prueba y ajusta la configuración del clasificador semántico o la definición del índice, incluyendo las experiencias circundantes, como la selección de ubicación de la interfaz de usuario o los procesos empresariales.
Si está desarrollando una aplicación en un dominio o sector de alto riesgo, como la atención sanitaria, los recursos humanos, la educación o el campo legal, evalúe el funcionamiento de la aplicación en su escenario, implemente una fuerte supervisión humana, evalúe la calidad de los usuarios para comprender las limitaciones de la aplicación y cumpla con todas las leyes pertinentes. Considere otras mitigaciones en función de su escenario.
Limitaciones técnicas, factores operativos y intervalos
Puede haber casos en los que las consultas sintéticas son incorrectas, vienen con demasiadas restricciones o son demasiado costosas. La reescritura de consultas admite una amplia gama de lenguajes e intenta volver a escribir consultas de usuario para maximizar la recuperación, es necesario especificar el lenguaje de consulta como entrada. La reescritura de consultas forma parte del clasificador semántico (Búsqueda de Azure AI característica para mejorar la relevancia de búsqueda), que es una característica premium con un costo adicional. Esto debe tenerse en cuenta al proyectar los gastos generales de la solución de un extremo a otro. La reescritura de consultas solo se puede usar si tiene habilitado el clasificador semántico.
Antes de usar la reescritura de consultas en un entorno de producción (versión activa de la aplicación), es importante realizar más pruebas y asegurarse de que las consultas sintéticas son adecuadas para el caso de uso previsto. Para obtener más información y ejemplos de cómo evaluar la reescritura de consultas, consulte el contenido y el apéndice aquí.
Rendimiento del sistema
Con los modelos de lenguaje natural a gran escala, dos usuarios diferentes pueden examinar la misma salida y tener opiniones diferentes sobre lo útil o relevante que es, lo que significa que el rendimiento de estos sistemas debe definirse de forma más flexible. Aquí, consideramos en términos generales el rendimiento como que la aplicación funciona como usted y sus usuarios esperan, incluyendo no generar resultados perjudiciales.
El rendimiento de la reescritura de consultas varía en función de los usos y condiciones reales en los que los usuarios lo usen. La calidad de las consultas sintéticas proporcionadas por el modelo de reescritura de consultas se correlaciona directamente con la consulta de búsqueda original.
Para garantizar un rendimiento óptimo en sus escenarios, los clientes deben realizar sus propias evaluaciones de las soluciones que implementan mediante la reescritura de consultas. Por lo general, los clientes deben seguir un proceso de evaluación que:
- usa algunas partes interesadas internas para evaluar los resultados,
- utiliza la experimentación A/B para desplegar la reescritura de consultas a los usuarios y
- incorpora KPI y supervisión de métricas cuando el servicio se implementa en experiencias por primera vez
Procedimientos recomendados para mejorar el rendimiento del sistema
- Complete las pruebas A/B para la aplicación con diferentes tipos de consulta (texto completo, vector, híbrido u otro tipo de consultas). Descubra qué experiencia de consulta es la mejor para sus necesidades.
- No siempre suponga que todas las consultas sintéticas generadas por la reescritura de consultas reflejarán la intención exacta de la consulta original. Las consultas sintéticas se generan mediante un SLM ajustado, que genera consultas semánticamente similares a la intención de la consulta original, pero puede que no coincidan con la intención exacta.
Evaluación de la reescritura de consultas
Métodos de evaluación
La reescritura de consultas se evaluó a través de pruebas internas, incluidos el criterio automatizado y humano en varios conjuntos de datos, así como los comentarios de los clientes internos. Las pruebas incluían evaluar la relevancia de los resultados de la clasificación semántica combinada con la reescritura de consultas en comparación con la relevancia de los resultados solo con clasificación semántica.
Resultados de la evaluación
Cada modelo candidato se compara directamente con el modelo implementado actualmente mediante métricas adecuadas para la característica que se está evaluando. Los modelos de reescritura de consultas se optimizan y evalúan mediante una amplia gama de datos públicos que son representativos de las consultas que tienen diferentes propiedades (lenguaje, longitud, formato, estilos y tonos) para admitir la amplia gama de escenarios de búsqueda. Nuestros datos de entrenamiento y prueba se extraen de:
Fuentes de documentos:
- Referencias comparativas académicas e industriales
- Datos del cliente (solo pruebas, realizadas con permiso de cliente)
Orígenes de consultas:
- Conjuntos de consultas comparativas
- Conjuntos de consultas proporcionados por el cliente (solo pruebas, realizadas con permiso de cliente)
- Conjuntos de consultas sintéticas
- Conjuntos de consultas generados por el usuario
Orígenes de etiquetas para el puntaje de pares de consultas y documentos.
- Etiquetas de referencia académicas e industriales
- Etiquetas de cliente (solo pruebas, realizadas con permiso de cliente)
- Etiquetas de datos sintéticas
- Etiquetas puntuadas por humanos
Evaluar e integrar la reescritura de consultas para su uso
Dado que la reescritura de consultas se ha entrenado con contenido público, las consultas sintéticas variarán en función de las consultas emitidas a esta. Por lo tanto, es importante usar su propio juicio e investigación cuando use este contenido para la toma de decisiones.
Limitaciones técnicas, factores operativos y intervalos
Aunque la aptitud Prompt de GenAI ofrece funcionalidades eficaces, es esencial reconocer ciertas limitaciones:
- La aptitud se basa en filtros de contenido configurados por el cliente en Foundry. Búsqueda de Azure AI no proporciona mecanismos de seguridad de contenido adicionales para esta aptitud.
- La calidad del contenido generado por ia depende de la eficacia de las indicaciones y del modelo de lenguaje subyacente. Es necesario realizar pruebas exhaustivas para asegurarse de que la salida cumple los estándares deseados.
- El procesamiento de grandes volúmenes de datos con avisos complejos puede requerir recursos computacionales significativos y puede provocar latencia. Planee y asigne recursos sabiamente para no solo mantener el rendimiento y la rentabilidad, sino también para evitar posibles retrasos en el procesamiento de datos.
Rendimiento del sistema
Procedimientos recomendados para mejorar el rendimiento del sistema
Para optimizar el rendimiento de la habilidad de indicación de GenAI:
- Utiliza la herramienta de depuración de sesiones de Búsqueda de Azure AI para probar las solicitudes en documentos de ejemplo, para garantizar que el contenido generado por IA se alinee con las expectativas antes de la implementación completa.
- Cree indicaciones claras y detalladas para guiar el modelo de lenguaje de forma eficaz, lo que reduce la probabilidad de salidas irrelevantes o inexactas.
- Supervise el rendimiento del sistema y escale los recursos según sea necesario para controlar las demandas computacionales del procesamiento de inteligencia artificial.
- Fomentar la supervisión humana de las salidas antes de la publicación o difusión. Con la inteligencia artificial generativa, existe la posibilidad de generar contenido que podría ser ofensivo o irrelevante para la tarea en cuestión.
Evaluación de la habilidad de indicación de GenAI
Evaluar e integrar la habilidad de indicación de GenAI para su uso
Para maximizar las ventajas de la habilidad de indicación de GenAI en un contexto específico, siga estos pasos:
- Determine los objetivos de enriquecimiento específicos, como generar resúmenes concisos, extraer entidades clave o crear metadatos descriptivos, para alinear la aplicación de la aptitud con sus necesidades empresariales.
- Comience con un subconjunto de los datos para evaluar el rendimiento de la aptitud y realizar los ajustes necesarios. Este enfoque permite la experimentación controlada y el refinamiento antes de la implementación a escala completa.
- Establecer mecanismos para supervisar la calidad y el impacto del contenido generado por la inteligencia artificial. Solicite comentarios de los usuarios finales para identificar áreas de mejora y asegurarse de que los datos enriquecidos satisfacen las expectativas del usuario.
Limitaciones técnicas, factores operativos y intervalos
Puede haber casos en los que las subconsultas generadas por LLM sean irrelevantes, excesivamente restrictivas o aumenten los costos de tokens. La recuperación agente admite todos los lenguajes administrados por la familia GPT-4o, pero la calidad del plan de consulta generado sigue dependiendo de la claridad de la entrada del usuario. Dado que la recuperación de agentes se basa en un clasificador semántico para cada consulta secundaria, debe tener habilitado el clasificador semántico en el índice. El clasificador semántico es una característica premium basada en tokens; aunque los cargos de clasificación se eximen durante la fase inicial de la versión preliminar pública, se aplicarán más adelante y se deben tener en cuenta en el costo total de la propiedad.
Antes de mover la recuperación agente a un entorno de producción, realice pruebas adicionales para confirmar que las subconsultas y los pasajes devueltos son adecuadas para el caso de uso previsto, que la latencia y el costo cumplen los objetivos de nivel de servicio y que los datos de base no exponen contenido confidencial o no compatible.
Rendimiento del sistema
Al igual que con cualquier sistema de modelo de lenguaje a gran escala, diferentes usuarios pueden llegar a diferentes juicios sobre la utilidad o relevancia de los pasajes devueltos, por lo que el rendimiento debe definirse de forma flexible. Para la recuperación mediante agentes, consideramos que un buen rendimiento significa que la aplicación de extremo a extremo entrega el contenido que sus usuarios esperan, sin latencia inaceptable, costos elevados, ni resultados perjudiciales.
La eficacia de la recuperación de agentes depende de muchos factores reales:
- Longitud del historial de mensajes o chat
- Número de subconsultas generadas por LLM
- Tamaño y esquema del índice (palabra clave, vector, híbrido)
- Elección del modelo de planeación (GPT-4o frente a GPT-4o-mini)
- Umbrales de puntuación y configuración de búsqueda semántica
Procedimientos recomendados para mejorar el rendimiento del sistema
- Resumir o recortar los turnos de chat más antiguos para mantener el uso de tokens bajo.
- Ajuste el umbral del clasificador para que solo se devuelvan pasajes altamente relevantes.
- Uso de filtros siempre que sea posible
Evaluación de la recuperación de agentes
La recuperación de agentes se ha evaluado a través de pruebas internas, incluida la evaluación automatizada y humana en varios conjuntos de datos. Las pruebas incluían la evaluación de la relevancia de los resultados de la recuperación de agentes en comparación con solo los resultados con clasificación semántica.
Métodos de evaluación
Cada configuración de recuperación de agente candidata, definida por su solicitud del planificador, variante del modelo, recuento de subconsultas y umbrales de clasificación, se evalúa directamente con respecto a la línea base de producción. Aplicamos un conjunto de métricas de relevancia, seguridad, latencia y costo elegidas específicamente para escenarios de recuperación de varias consultas. Para garantizar la confiabilidad en los casos de uso del mundo real, el ajuste y las pruebas se realizan en una amplia combinación de conjuntos de datos públicos y aprobados por el cliente que varían en lenguaje, longitud de consulta, formato, estilo y tono conversacional. El material de prueba procede de:
Fuentes de documentos:
- Referencias comparativas académicas e industriales
- Datos del cliente (solo pruebas, realizadas con permiso de cliente)
- Orígenes de consultas:
- Conjuntos de consultas comparativas
- Conjuntos de consultas proporcionados por el cliente (solo pruebas, realizadas con permiso de cliente)
- Conjuntos de consultas sintéticas
- Conjuntos de consultas generados por el usuario
Orígenes de etiquetas para el puntaje de pares de consultas y documentos.
- Etiquetas de referencia académicas e industriales
- Etiquetas de cliente (solo pruebas, realizadas con permiso de cliente)
- Etiquetas de datos sintéticas
- Etiquetas puntuadas por humanos
Evaluar e integrar la recuperación de agentes para su uso
Dado que el planificador de recuperación agente se entrena en gran medida en datos públicos, la calidad y la relevancia de sus subconsultas generadas variarán con el dominio y las solicitudes de usuario específicas. Para maximizar las ventajas de la recuperación de agentes en su contexto específico, tenga en cuenta los pasos siguientes:
- Valide la salida antes de usarla para impulsar decisiones críticas para la empresa: inspeccione manualmente una muestra de subconsultas generadas y documentos devueltos para confirmar que se alinean con la terminología del dominio, la precisión y los requisitos de cumplimiento.
- Proporcione información específica del dominio al planificador. Proporcione mapas de sinónimos y historial de conversaciones completo para que LLM pueda parafrasar y descomponer consultas en lenguaje que coincidan con el contenido, lo que mejora la recuperación y la precisión.
- Lógica de reserva o de límite de protección: si el planificador genera subconsultas de baja confianza o fuera del ámbito, traslade la solicitud a un vector de búsqueda o de palabras clave más sencillas, o muestre una solicitud de aclaración al usuario, impidiendo que las respuestas no fiables se propaguen en etapas posteriores.
Más información sobre la inteligencia artificial responsable
- Microsoft principios de inteligencia artificial
- Recursos responsables de inteligencia artificial de Microsoft
- Microsoft Azure cursos de aprendizaje sobre inteligencia artificial responsable
Más información sobre Búsqueda de Azure AI
Comentarios
¿Le ha resultado útil esta página?
No
¿Necesita ayuda con este tema?
¿Desea intentar usar Ask Learn para aclarar o guiarle a través de este tema?
Recursos adicionales
-
Last updated on
2026-04-30