Indexación semántica para Microsoft Copilot

Microsoft Copilot asigna los datos de la organización a un índice léxico y semántico avanzado para impulsar la relevancia y precisión de la búsqueda. Copilot puede acceder al contexto y las relaciones dentro de los datos mediante Microsoft Graph, lo que permite una recuperación de información más precisa y contextual. El índice mejora las interacciones con los datos, ofreciendo a los usuarios una experiencia más rica y fluida. Creado con un enfoque integral de seguridad, cumplimiento y privacidad, Copilot garantiza que se respeten todos los límites organizativos dentro de su espacio empresarial. Con Microsoft Copilot, los usuarios pueden confiar en que sus búsquedas son relevantes, precisas y seguras.

¿Qué es un índice?

Microsoft Copilot mejora la búsqueda con un conocimiento léxico y semántico avanzado de los datos de su organización.

El concepto de indexación de datos está bien establecido en Microsoft 365. La indexación es una de las formas importantes en que los servicios de Microsoft 365 acceden a la enorme cantidad de datos de Microsoft Graph, donde reside su inquilino de Microsoft 365. Con la indexación, los usuarios ven los resultados de búsqueda de Microsoft Graph, incluido el contenido y las señales de la mayoría de las aplicaciones de Microsoft 365 de su espacio empresarial. Esto garantiza que los resultados de búsqueda se personalicen y eleven en función de las conexiones entre el contenido y las personas de su red.

El índice semántico se genera a partir del contenido de Microsoft Graph. Se usa para ayudar en la producción de respuestas contextualmente relevantes a las consultas de los usuarios. Permite a las organizaciones buscar a través de miles de millones de vectores (representaciones matemáticas de características o atributos) y devolver resultados relacionados. El índice semántico, que se combina con mejoras de Microsoft Graph, le conecta con información relevante de su organización. Se basa en el enfoque integral de Microsoft para la seguridad, el cumplimiento y la privacidad, y respeta todos los límites organizativos dentro de su espacio empresarial.

Las interacciones con los datos de Microsoft Graph se basan en la coincidencia de palabras clave, la personalización y la coincidencia social. Consultas de búsqueda de palabras clave en un índice de Microsoft Graph, que se asigna a ubicaciones en documentos o a un conjunto de documentos. Microsoft 365 usa Microsoft Graph para clasificar los contenidos más relevantes en función de su conocimiento de las señales adicionales para los usuarios y su red cercana. Esto se conoce como personalización y coincidencia social en Microsoft 365, que impulsa la relevancia de las consultas en el contenido de su organización. El acceso a los datos del inquilino en Microsoft Graph se controla mediante el control de acceso basado en roles. Las organizaciones siempre tienen el control de las funcionalidades de Búsqueda de Microsoft a través del portal Búsqueda e inteligencia del Centro de administración de Microsoft 365.

Cómo la indexación semántica ayuda a administrar los datos

El índice semántico mejora la experiencia de Microsoft Copilot tanto en Microsoft 365 Chat como en las aplicaciones de Microsoft 365. Permite una base de contenido mejorada y una comprensión conceptual de los datos en línea que Microsoft habilita automáticamente. Lo hace mediante la creación de índices vectorizados. Un vector es una representación numérica de una palabra, un píxel de imagen u otro punto de datos. El vector se organiza o mapea con números cercanos colocados cerca uno del otro para representar la similitud. Los vectores se almacenan en espacios multidimensionales donde puntos de datos semánticamente similares se agrupan en el espacio vectorial, lo que permite a Microsoft 365 controlar un conjunto más amplio de consultas de búsqueda más allá de la "coincidencia exacta".

En términos prácticos, esto significa que los servicios de Microsoft 365, como Microsoft Copilot, pueden:

  • Comprender las relaciones entre diferentes formas de palabras (por ejemplo, tecnología, tecnología, tecnologías; EE. UU., EE. UU., Estados Unidos, Estados Unidos de América; perro, gato, mascota).
  • Captura sinónimos para expandir la cantidad de información que se puede buscar, incluida la intención de oraciones, fragmentos, documentos y reuniones.
  • Identifique los activos relacionados con la consulta o el contenido de muestra.

En el gráfico siguiente se usa texto (en lugar de números usados por los índices vectorizados) para mostrar un ejemplo de similitud entre puntos de datos:

Gráfico que muestra un ejemplo de cómo se agrupan los puntos de datos del índice semántico.

La indexación semántica proporciona una búsqueda y recuperación de similitudes rápida y precisa de datos en función de su distancia o similitud vectorial. Esto significa que, además de utilizar métodos léxicos tradicionales para realizar consultas basadas en coincidencias exactas o criterios predefinidos, la indexación semántica puede encontrar los datos más similares o relevantes en función del significado semántico o contextual.

Características

Las siguientes características de indexación semántica hacen más que mejorar los resultados de búsqueda; Trabajan juntos para ayudarle a comprender los datos, encontrar información más rápidamente y mejorar la productividad. Los usuarios pueden interactuar con el índice semántico inicialmente a través de la integración de Microsoft Copilot. Generamos un índice semántico para los usuarios con una licencia de pago de Microsoft Copilot. Estos son los detalles de cómo funciona cada característica.

Microsoft Copilot con Microsoft Graph

La indexación semántica proporciona los datos de base para la recuperación de conocimiento a través de Microsoft Copilot al comprender la intención de la consulta y anexar información adicional al símbolo del sistema de Microsoft Copilot.

La información relevante se obtiene en Microsoft Graph y el índice semántico para proporcionar al modelo de lenguaje grande (LLM) más información sobre la que razonar. Por ejemplo, supongamos que desea que Microsoft Copilot encuentre un correo electrónico en el que un compañero elogió el trabajo de diseño de un proveedor. La indexación semántica incluye palabras cercanas (por ejemplo, eufórico, emocionado, asombrado) en la búsqueda para ampliar el área de búsqueda y obtener el mejor resultado. Todo este trabajo se lleva a cabo entre bastidores para agregar relevancia a los resultados que busca con Microsoft Copilot, sin agregar complejidad.

Cuando un usuario adjunta una biblioteca o carpeta de documentos de SharePoint o proporciona su dirección URL en una consulta de Copilot, el paso de conexión a tierra incluye ese ámbito y usa los metadatos de columna de la biblioteca junto con el contenido del archivo para restringir y clasificar los resultados.

Consultas enfocadas con bibliotecas y carpetas de SharePoint

Cuando un usuario adjunta una biblioteca o carpeta de documentos de SharePoint (o proporciona su dirección URL) en Copilot, Copilot puede usar los metadatos de columna de la biblioteca como señales adicionales para refinar la conexión a tierra, mejorar la relevancia contextual y aumentar la precisión de la respuesta. Esta comprensión de metadatos se aplica a las consultas con ámbito a una biblioteca o carpeta específicas y está disponible en la experiencia web.

Cómo funciona la indexación semántica

La indexación semántica potencia los resultados de búsqueda de Microsoft Copilot al habilitar una comprensión conceptual de los datos en línea para complementar la comprensión léxica que también tenemos. Microsoft habilita automáticamente la indexación.

En la actualidad, se crea un índice semántico para cada suscripción en el nivel de inquilino y usuario. Es un índice de toda la organización generado a partir de archivos de SharePoint Online basados en texto. Sin embargo, solo muestra los resultados a un usuario si este ya tiene acceso al contenido controlado por el control de acceso basado en roles. Además, el sitio de SharePoint Online debe seguir pudiendo buscarse. Para los elementos de SharePoint, los metadatos de columna asociados se pueden incorporar como señales durante la recuperación cuando una consulta se limita a una biblioteca o carpeta específica. Con el tiempo, también generaremos contenido de índice a nivel de usuario. Esto agrega un índice personalizado de un conjunto de datos de trabajo que es accesible para los usuarios que realizan tareas cotidianas. Esto incluye cualquier contenido basado en texto que cree o con el que interactúe, como correos electrónicos, documentos que lo mencionen, o que comente o comparta.

En la sección siguiente se explica cómo habilitar cada índice, cómo el flujo de datos en Microsoft Copilot usa la indexación semántica, qué tipos de archivo puede controlar cada índice y cómo cada índice trata las actualizaciones.

Activación

Cada cliente de Microsoft Copilot tiene ahora un índice de nivel de inquilino. El proceso de indexación no requiere ninguna participación administrativa.

Flujos de datos

Microsoft Copilot aumenta la precisión de la búsqueda mediante el uso de información léxica y semántica avanzada de los datos de Microsoft Graph. En el diagrama siguiente se muestra cómo funciona el flujo de datos para una solicitud mediante Microsoft Copilot.

Captura de pantalla que muestra la relación entre Microsoft Copilot, las Aplicaciones Microsoft 365, Microsoft Graph y el modelo de lenguaje grande.

Las indicaciones de usuario de las aplicaciones de Microsoft 365 se envían a Copilot (1) y Copilot accede a Microsoft Graph y al índice semántico para su procesamiento (2). Copilot envía la indicación modificada al modelo de lenguaje grande (3), recibe la respuesta de LLM (4) y, a continuación, accede a Microsoft Graph y al índice semántico para el procesamiento posterior (5). A continuación, Copilot envía el comando de respuesta y aplicación a las aplicaciones de Microsoft 365. Todas las solicitudes se cifran mediante HTTPS y los datos de los clientes permanecen cifrados en reposo.

Tipos de contenido compatibles

Las respuestas fundamentadas de Microsoft Graph pueden utilizar la comprensión semántica del buzón de usuario y los tipos de archivo enumerados en la tabla siguiente, con más tipos de archivo admitidos con el tiempo. Además del contenido de los tipos de archivo admitidos, los metadatos de elementos de SharePoint se pueden usar como señales de relevancia cuando los usuarios limitan las consultas de Copilot a una biblioteca o carpeta de documentos específica. En la tabla se incluye una lista de los tipos de archivo admitidos para el índice de nivel de usuario y el índice de inquilino.

Contenido/tipo de archivo Nivel de usuario Nivel de inquilino
Buzón de usuario Compatible No aplicable
Buzón delegado No se admite No aplicable
Buzón compartido No se admite No aplicable
Datos archivados del buzón No compatible No aplicable
Datos archivados de SharePoint No compatible No compatible
Documentos de Word (doc/docx) Compatible Compatible
PowerPoint (pptx) Compatible Compatible
archivos PDF Compatible Compatible
Páginas web (aspx) Compatible Compatible
Archivos de OneNote (uno) Compatible Compatible
Datos del conector de Copilot No aplicable Compatible

Nota:

Files de hasta 512 MB ahora son compatibles con las extensiones PDF, PPTX y DOCX. Esta mejora permite a los usuarios de Copilot analizar, resumir y generar información de forma eficaz a partir de estos archivos de gran tamaño.

Actualizaciones de índice

Cuando los datos de Microsoft Graph se indexan para un cliente por primera vez, los documentos creados por los usuarios se indexan casi en tiempo real en el buzón del usuario. Los nuevos documentos que se agregan a los sitios de SharePoint Online a los que dos o más usuarios pueden acceder se indexan diariamente. Cuando se actualiza un documento indexado a nivel de usuario e inquilino, los cambios se indexan inmediatamente.

Administración

Proporcionamos a los administradores actividades opcionales para preparar y administrar la indexación semántica a través del Centro de administración de Microsoft 365. No se requiere ninguna implicación administrativa para habilitar la indexación semántica, ya que Microsoft habilita automáticamente el servicio. La indexación semántica es una mejora de la búsqueda de Microsoft 365 y no se puede deshabilitar.

Los administradores pueden elegir preparar y administrar la indexación semántica revisando las consideraciones para planear e implementar un archivo, colaborar en SharePoint y compartir permisos en la experiencia moderna de SharePoint. Los administradores pueden optar por excluir archivos de la indexación semántica revisando las consideraciones para excluir datos con la Prevención de pérdida de datos de Microsoft Purview (DLP). Si no hay una solución DLP, los administradores pueden excluir los sitios de SharePoint Online del índice de nivel de inquilino.
Para beneficiarse de las consultas con ámbito que tienen en cuenta los metadatos, asegúrese de que el sitio o la biblioteca de SharePoint pertinente siga siendo capaz de buscar (la búsqueda y la disponibilidad sin conexión están configuradas para permitir la búsqueda) de modo que tanto el contenido como los metadatos de columna estén disponibles para Copilot cuando los usuarios adjunten esa biblioteca o carpeta.

Excluir sitios de SharePoint Online

Hay ocasiones en las que las organizaciones sin la Prevención de pérdida de datos de Microsoft Purview pueden querer excluir un sitio de SharePoint Online de que sus datos sean indexados por la Búsqueda de Microsoft. Estos pasos solo se deben tener en cuenta para datos confidenciales, como nóminas, RR. HH. o información financiera. Para excluir un sitio de SharePoint Online, siga estos pasos:

  1. Vaya al sitio con los permisos de administrador adecuados.

  2. Seleccione Configuración y luego Información del sitio en el menú desplegable.

  3. Seleccione Ver toda la configuración del sitio para abrir la página Configuración del sitio.

  4. Selecciona Búsqueda y disponibilidad sin conexión en la categoría Búsqueda y selecciona No para permitir que este sitio aparezca en los resultados de búsqueda para excluirlo tanto de la búsqueda de Microsoft como de la búsqueda de índice semántico. Esto también se puede realizar con PowerShell para varios sitios.

    Captura de pantalla que muestra la configuración para excluir sitios de SharePoint Online.

La Búsqueda de Microsoft y la indexación semántica solo admiten la exclusión del contenido de SharePoint Online del índice de nivel de inquilino. No hay ninguna opción para excluir los resultados solo de la Búsqueda de Microsoft o solo de la indexación semántica; Las acciones se aplican a ambos al mismo tiempo.

Configuración de información sobre elementos

En la página Búsqueda e inteligencia del Centro de administración de Microsoft 365, la información del elemento está habilitada de forma predeterminada. Desactivar la información de personas o elementos reduce la experiencia de Búsqueda de Microsoft y el índice semántico, ya que los resultados no incluirán personas relevantes que se habrían derivado de grupos de distribución o del organigrama.

  • People insights proporciona una lista de personas relevantes a un usuario en función de su trabajo colaborativo público en Microsoft 365. La colaboración pública incluye a los miembros de un grupo de distribución pública y a las personas conectadas en el organigrama.

  • Las perspectivas de elementos permiten recomendaciones para las personas de su organización en función de su trabajo colaborativo en Microsoft 365. Estas recomendaciones pueden incluir, entre otras, documentos u otros tipos de contenido y mostrarse en tarjetas de personas (contactos), Delve, la aplicación Microsoft 365, resultados de Microsoft Copilot y otras ubicaciones.

Tanto Item insights como People insights no cubren las características de personalización basadas en los propios datos de un usuario.

Incorporación de información de terceros

Con los conectores de Copilot, las organizaciones pueden incorporar datos o contenido de la organización de orígenes externos a Microsoft Graph. Una vez en Microsoft Graph, ese contenido se indexa para que Copilot pueda acceder a él, a la vez que mantiene los controles de acceso para el contenido. Esto expande los tipos de orígenes de contenido que se pueden buscar en las aplicaciones de productividad de Microsoft 365 y en el ecosistema más amplio de Microsoft. Tenga en cuenta que este proceso funciona mejor cuando el contenido del conector es rico en texto. Los datos de terceros se pueden hospedar localmente o en una nube pública o privada. Obtenga más información sobre los requisitos de licencia del conector de Copilot para Microsoft 365 Enterprise y Microsoft Copilot en Requisitos y precios de licencia.

Privacidad, cumplimiento y seguridad

El modelo de permisos dentro del inquilino de Microsoft 365 puede ayudar a garantizar que los datos no se filtren involuntariamente entre usuarios, grupos e inquilinos. Microsoft Copilot presenta solo datos a los que cada individuo puede acceder usando los mismos controles subyacentes para el acceso a datos utilizados en otros servicios de Microsoft 365. Cuando los datos se indexan, seguimos respetando el límite de acceso basado en la identidad del usuario para que el proceso de fundamentación solo acceda al contenido al que el usuario actual está autorizado a acceder. Para obtener más información, consulta la documentación del servicio y la directiva de privacidad de Microsoft.

Microsoft Copilot cumple nuestros compromisos existentes de privacidad, seguridad y cumplimiento con los clientes comerciales de Microsoft 365, incluido el Reglamento general de protección de datos (RGPD) y el límite de datos de la Unión Europea (UE). Las consultas, respuestas y datos a los que se accede a través de la indexación semántica no se usan para entrenar LLM básicos, incluidos los que usa Microsoft Copilot. Para obtener más información, consulte Datos, privacidad y seguridad para Microsoft Copilot.

Almacenamiento y procesamiento

Los datos generados por la indexación permanecen dentro del inquilino de su empresa y cumplen con sus políticas y procesos de seguridad, cumplimiento, identidad y privacidad. La indexación semántica solo funciona con contenido para el que los usuarios ya tienen permiso y no afecta a las cuotas de almacenamiento.

La información de índice de nivel de usuario se almacena donde se encuentra el buzón del usuario. Por otro lado, la información de índice de nivel de inquilino se almacena en un contenedor de inquilino de cliente aislado y protegido. Este contenedor se encuentra en la región donde se encuentra el sitio de SharePoint, que puede ser la región de inicio u otra región especificada por el administrador de inquilinos. Para los clientes dentro del límite de datos de la Unión Europea (EUDB), el índice se almacena en un centro de datos basado en la UE o la AELC. El procesamiento de otros clientes puede tener lugar en una región de inquilino o en Estados Unidos. Para las organizaciones multigeográficas, se respetan todos los límites geográficos. Los datos de la región se almacenan y procesan en cada región.

Soporte técnico de la clave de cliente de Microsoft Purview (BYOK)

Microsoft proporciona soporte para Bring your own key (BYOK) a las empresas que han habilitado BYOK en su entorno. Microsoft habilita automáticamente la indexación semántica para los clientes habilitados para BYOK sin ninguna implicación administrativa.

Protección de la información

En el contexto de la búsqueda, no hay otras maneras de excluir los datos de la indexación semántica mediante las funcionalidades de protección de la información. La indexación semántica hereda la configuración de seguridad y privacidad de la Búsqueda de Microsoft, y los datos traídos de conectores de terceros reciben el mismo almacenamiento y protecciones que otros datos de Microsoft 365. Para las organizaciones que están investigando opciones adicionales de protección de la información, Microsoft 365 proporciona funcionalidades integradas en aplicaciones de Microsoft 365. También hay disponibles productos complementarios para ayudar a los administradores a proteger los datos de la organización mediante la minimización de datos y la reducción del uso compartido excesivo. En las secciones siguientes se describen las opciones disponibles para las organizaciones solo como referencia.

Minimización de datos

La minimización de datos reduce la cantidad de datos disponibles a los que podría tener acceso su organización. Conservar y eliminar contenido suele ser necesario para cumplir los requisitos normativos y de cumplimiento, pero eliminar contenido que ya no tiene valor empresarial también le ayuda a administrar el riesgo y la responsabilidad. La Administración del ciclo de vida de Microsoft Purview, que tiene una licencia por separado, se puede usar para eliminar contenido que ya no se necesita con directivas de retención para la administración a escala y etiquetas de retención para excepciones y control granular.

Reducir el uso compartido excesivo

Las organizaciones han podido tomar medidas durante mucho tiempo para reducir el uso compartido excesivo en Microsoft 365 mediante los controles existentes en el Centro de administración de Microsoft 365 y SharePoint Online. Es importante tener en cuenta que indexar los datos no cambia los permisos de acceso al contenido y no cambia los principios de cómo los usuarios deben compartir información con sus compañeros. Por ejemplo, compartir contenido con un vínculo que funcione con todos los usuarios de mi organización no convierte la información en parte del índice de nivel de inquilino. Solo los usuarios que seleccionen un vínculo al que tengan acceso tendrán la información agregada a su índice de usuarios. Se recomienda que las organizaciones consideren lo siguiente al explorar las opciones de protección de la información:

  • Planear la colaboración segura de archivos – Revisar Planee e implemente una colaboración de archivos para comprender mejor los procedimientos recomendados para operar un entorno de colaboración de archivos seguro y productivo para los usuarios.

  • Ajustar el tamaño del acceso del usuario a los datos para reducir la lista : reduzca el uso compartido excesivo heredando listas de exclusiones para los sitios de SharePoint Online y realizando comprobaciones de control de acceso en tiempo real. Las organizaciones pueden considerar el uso del complemento Syntex Administración Avanzada de SharePoint para administrar y gobernar estos permisos.

  • Use etiquetas de confidencialidad: otra manera de reducir el uso compartido excesivo de contenido es usar Microsoft Purview Information Protection para aplicar etiquetas de confidencialidad, que permiten clasificar los datos en función de su confidencialidad, y aplicar protecciones como el cifrado y el marketing de contenido. Las etiquetas de confidencialidad también se incluyen en el recorte de búsqueda (es decir, son compatibles con el filtrado y las reglas del lado de la aplicación usadas para el marcado visual y las restricciones de acceso).

  • Limitar el acceso: la Prevención de pérdida de datos de Microsoft Purview está disponible en Microsoft 365 E5 y podría usarse para limitar de forma retroactiva y temporal el acceso a documentos que se han notificado como compartidos en exceso. Las organizaciones que no tengan licencias de Microsoft 365 E5 pueden usar la prueba de 90 días de las soluciones de Microsoft Purview para explorar cómo las funcionalidades adicionales de Purview pueden ayudar a administrar sus necesidades de seguridad y cumplimiento de datos.

Si los clientes interesados en explorar cómo implementar soluciones avanzadas de protección de la información, consulte el siguiente artículo que explica cómo implementar una solución de protección de la información con Microsoft Purview. Para obtener más información sobre cómo Microsoft Purview puede ayudarle a reforzar los requisitos de seguridad de datos y cumplimiento normativo de Microsoft Copilot, consulte Proteger y administrar las interacciones de Microsoft Copilot con Microsoft Purview.

Recursos adicionales

Para obtener más información sobre Microsoft Copilot, consulte estos recursos: