Indexation sémantique pour Microsoft Copilot

Microsoft Copilot mappe les données de votre organisation dans un index lexical et sémantique avancé pour améliorer la pertinence et la précision de la recherche. Copilot peut accéder au contexte et aux relations au sein de vos données à l’aide de Microsoft Graph, ce qui permet une récupération d’informations contextuellement plus précise. L’index améliore les interactions avec vos données, offrant aux utilisateurs une expérience plus riche et plus transparente. Conçu avec une approche complète de la sécurité, de la conformité et de la confidentialité, Copilot garantit que toutes les limites organisationnelles au sein de votre client sont respectées. Avec Microsoft Copilot, les utilisateurs peuvent être sûrs que leurs recherches sont pertinentes, précises et sécurisées.

Qu’est-ce qu’un index ?

Microsoft Copilot améliore la recherche grâce à une compréhension lexicale et sémantique avancée des données de votre organisation.

Le concept d’indexation des données est bien établi dans Microsoft 365. L’indexation est l’un des principaux moyens par lesquels les services Microsoft 365 accèdent à l’énorme quantité de données de Microsoft Graph, où réside votre client Microsoft 365. Avec l’indexation, les utilisateurs voient les résultats de la recherche à partir de Microsoft Graph, y compris le contenu et les signaux de la plupart des applications Microsoft 365 de votre client. Cela garantit que les résultats de la recherche sont personnalisés et élevés en fonction de vos connexions entre le contenu et les personnes de votre réseau.

L’index sémantique est généré à partir du contenu de Microsoft Graph. Il est utilisé pour faciliter la production de réponses contextuellement pertinentes aux requêtes des utilisateurs. Il permet aux organisations de rechercher des milliards de vecteurs (représentations mathématiques de caractéristiques ou d’attributs) et de renvoyer des résultats connexes. Combiné aux améliorations apportées à Microsoft Graph, l’index sémantique vous connecte aux informations pertinentes dans votre organisation. Il s’appuie sur l’approche globale de Microsoft en matière de sécurité, de conformité et de confidentialité, et respecte toutes les limites organisationnelles au sein de votre client.

Les interactions avec les données dans Microsoft Graph sont basées sur la correspondance de mots clés, la personnalisation et la correspondance sociale. Requêtes de recherche par mot clé par rapport à un index dans Microsoft Graph, qui correspond à des emplacements dans des documents ou un ensemble de documents. Microsoft 365 utilise Microsoft Graph pour classer le contenu le plus pertinent en fonction de sa connaissance des signaux supplémentaires pour les utilisateurs et leur réseau proche. C’est ce que l’on appelle la personnalisation et la correspondance sociale dans Microsoft 365, ce qui rend les requêtes pertinentes par rapport au contenu de votre organisation. L’accès aux données des locataires dans Microsoft Graph est contrôlé par un contrôle d’accès basé sur un rôle. Les organisations ont toujours le contrôle des fonctionnalités de Recherche Microsoft via le portail Recherche et intelligence du Centre d’administration Microsoft 365.

Comment l’indexation sémantique aide à gérer vos données

L’index sémantique améliore l’expérience Microsoft Copilot dans Microsoft 365 Chat et dans les applications Microsoft 365. Il prend en charge un contenu amélioré, l’ancrage et la compréhension conceptuelle de vos données en ligne, qui sont automatiquement activés par Microsoft. Pour ce faire, il crée des index vectorisés. Un vecteur est une représentation numérique d’un mot, d’un pixel d’image ou d’un autre point de données. Le vecteur est arrangé ou cartographié avec des nombres proches placés à proximité les uns des autres pour représenter la similarité. Les vecteurs sont stockés dans des espaces multidimensionnels où des points de données sémantiquement similaires sont regroupés dans l’espace vectoriel, ce qui permet à Microsoft 365 de gérer un ensemble plus large de requêtes de recherche au-delà de la « correspondance exacte ».

Concrètement, cela signifie que les services Microsoft 365 tels que Microsoft Copilot peuvent :

  • Comprendre les relations entre les différentes formes de mots (par exemple, technologie, technologie, technologies ; USA, U.S.A, États-Unis, États-Unis d’Amérique ; chien, chat, animal de compagnie).
  • Capture synonymes pour augmenter la quantité d’informations pouvant faire l’objet d’une recherche, y compris l’intention de phrases, d’extraits, de documents et de réunions.
  • Identifiez les ressources associées à votre requête ou à votre exemple de contenu.

Le graphique suivant utilise du texte (au lieu des nombres utilisés par les index vectorisés) pour illustrer un exemple de similitude entre des points de données :

Graphique montrant un exemple de la façon dont les points de données de l’index sémantique sont regroupés.

L’indexation sémantique permet une recherche et une récupération rapides et précises de la similarité des données en fonction de leur distance vectorielle ou de leur similarité. Cela signifie qu’en plus d’utiliser les méthodes lexicales traditionnelles pour interroger sur la base de correspondances exactes ou de critères prédéfinis, l’indexation sémantique peut trouver les données les plus similaires ou les plus pertinentes en fonction de la signification sémantique ou contextuelle.

Fonctionnalités

Les fonctionnalités d’indexation sémantique suivantes font plus qu’améliorer les résultats de recherche ; Ils travaillent ensemble pour vous aider à comprendre vos données, à trouver des informations plus rapidement et à améliorer votre productivité. Les utilisateurs peuvent interagir avec l’index sémantique initialement via l’intégration de Microsoft Copilot. Nous générons un index sémantique pour les utilisateurs disposant d’une licence Microsoft Copilot payante. Vous trouverez ci-dessous les détails du fonctionnement de chaque fonctionnalité.

Microsoft Copilot avec Microsoft Graph

L’indexation sémantique fournit les données de base pour la récupération des connaissances via Microsoft Copilot en comprenant l’intention de votre requête et en ajoutant des informations supplémentaires à votre invite Microsoft Copilot.

Les informations pertinentes sont obtenues dans le graphique Microsoft et l’index sémantique pour fournir au grand modèle de langage (LLM) plus d’informations sur lesquelles réfléchir. Par exemple, supposons que vous souhaitiez que Microsoft Copilot trouve un e-mail dans lequel un collègue fait l’éloge du travail de conception d’un fournisseur. L’indexation sémantique inclut les mots proches (par exemple, ravi, excité, étonné) dans la recherche pour élargir la zone de recherche et donner le meilleur résultat. Tout ce travail se déroule en arrière-plan pour ajouter de la pertinence aux résultats que vous recherchez avec Microsoft Copilot, sans ajouter de complexité.

Lorsqu’un utilisateur joint une bibliothèque de documents ou un dossier SharePoint, ou fournit son URL dans une requête Copilot, l’étape d’ancrage inclut cette étendue et utilise les métadonnées de colonne de la bibliothèque avec le contenu du fichier pour limiter et classer les résultats.

Requêtes étendues avec des bibliothèques et des dossiers SharePoint

Lorsqu’un utilisateur joint une bibliothèque de documents ou un dossier SharePoint (ou fournit son URL) dans Copilot, Copilot peut utiliser les métadonnées de colonne de la bibliothèque comme signaux supplémentaires pour affiner l’ancrage, améliorer la pertinence contextuelle et augmenter la précision des réponses. Cette compréhension des métadonnées s’applique aux requêtes limitées à une bibliothèque ou à un dossier spécifique et est disponible dans l’expérience web.

Fonctionnement de l’indexation sémantique

L’indexation sémantique alimente les résultats de recherche de Microsoft Copilot en permettant une compréhension conceptuelle de vos données en ligne pour compléter la compréhension lexicale dont nous disposons également. L’indexation est automatiquement activée par Microsoft.

Aujourd’hui, un index sémantique est créé pour chaque abonnement au niveau du locataire et de l’utilisateur. Il s’agit d’un index à l’échelle de l’organisation généré à partir de fichiers texte SharePoint Online. Toutefois, les résultats ne sont affichés à un utilisateur que si celui-ci a déjà accès au contenu contrôlé par le contrôle d’accès en fonction du rôle. En outre, le site SharePoint Online doit rester consultable. Pour les éléments SharePoint, les métadonnées de colonne associées peuvent être incorporées en tant que signaux lors de la récupération lorsqu’une requête est étendue à une bibliothèque ou un dossier spécifique. Avec le temps, nous générerons également du contenu d’index au niveau de l’utilisateur. Cela ajoute un index personnalisé d’un jeu de données de travail accessible aux utilisateurs effectuant des tâches quotidiennes. Cela inclut tout contenu texte que vous créez ou avec lequel vous interagissez, tel que les e-mails, les documents qui vous mention, que vous commentez ou partagez.

La section suivante explique comment activer chaque index, comment le flux de données dans Microsoft Copilot utilise l’indexation sémantique, quels types de fichiers chaque index peut gérer et comment chaque index traite les mises à jour.

Activation

Chaque client Microsoft Copilot dispose désormais d’un index au niveau du locataire. Le processus d’indexation ne nécessite aucune intervention administrative.

Flux de données

Microsoft Copilot améliore la précision de la recherche en utilisant des insights lexicaux et sémantiques avancés à partir des données Microsoft Graph. Le diagramme suivant montre comment fonctionne le flux de données pour une demande à l’aide de Microsoft Copilot.

Capture d’écran montrant la relation entre Microsoft Copilot, Microsoft 365 Apps, Microsoft Graph et Large Language Model.

Les invites utilisateur des applications Microsoft 365 sont envoyées à Copilot (1), et Copilot accède au graphique Microsoft et à l’index sémantique pour le traitement (2). Copilot envoie l’invite modifiée au grand modèle de langage (3), reçoit la réponse LLM (4), puis accède au graphique Microsoft et à l’index sémantique pour le post-traitement (5). Copilot renvoie ensuite la réponse et la commande d’application aux applications Microsoft 365. Toutes les demandes sont chiffrées par HTTPS et les données client restent chiffrées au repos.

Types de contenu pris en charge

Les réponses ancrée Microsoft Graph peuvent utiliser la compréhension sémantique des types de fichiers et de boîtes aux lettres utilisateur répertoriés dans le tableau suivant, avec davantage de types de fichiers pris en charge au fil du temps. Outre le contenu des types de fichiers pris en charge, les métadonnées d’élément SharePoint peuvent être utilisées comme signaux de pertinence lorsque les utilisateurs étendent des requêtes Copilot à une bibliothèque de documents ou à un dossier spécifique. Une liste des types de fichiers pris en charge pour l’index de niveau utilisateur et l’index de niveau locataire est incluse dans le tableau.

Type de contenu/fichier Niveau de l’utilisateur Niveau du locataire
Boîte aux lettres de l’utilisateur Pris en charge Non applicable
Boîte aux lettres déléguée Non pris en charge Non applicable
Boîte aux lettres partagée Non pris en charge Non applicable
Données de boîte aux lettres archivées Non pris en charge Non applicable
Données SharePoint archivées Non pris en charge Non pris en charge
Documents Word (doc/docx) Pris en charge Pris en charge
PowerPoint (pptx) Pris en charge Pris en charge
Fichiers .pdf Pris en charge Pris en charge
Pages Web (ASPX) Pris en charge Pris en charge
Fichiers OneNote (un) Pris en charge Pris en charge
Données du connecteur Copilot Non applicable Pris en charge

Remarque

Les Files jusqu’à 512 Mo sont désormais pris en charge pour les extensions PDF, PPTX et DOCX. Cette amélioration permet aux utilisateurs de Copilot d’analyser, de résumer et de générer efficacement des insights à partir de ces fichiers volumineux.

Mises à jour de l’index

Lorsque les données Microsoft Graph sont indexées pour un client pour la première fois, les documents créés par les utilisateurs sont indexés quasiment en temps réel dans la boîte aux lettres de l’utilisateur. Les nouveaux documents ajoutés aux sites SharePoint Online qui sont accessibles, via l’héritage du site, par deux utilisateurs ou plus sont indexés quotidiennement. Lorsqu’un document indexé au niveau de l’utilisateur et du locataire est mis à jour, les modifications sont immédiatement indexées.

Administration

Nous fournissons aux administrateurs des activités facultatives pour préparer et gérer l’indexation sémantique via le Centre d’administration Microsoft 365. Aucune intervention administrative n’est requise pour activer l’indexation sémantique, car le service est automatiquement activé par Microsoft. L’indexation sémantique est une amélioration de la recherche Microsoft 365 et ne peut pas être désactivée.

Les administrateurs peuvent choisir de préparer et de gérer l’indexation sémantique en examinant les considérations relatives à la planification et au déploiement d’un fichier, à la collaboration dans SharePoint et aupartage des autorisations dans l’expérience moderne de SharePoint. Les administrateurs peuvent choisir d’exclure des fichiers de l’indexation sémantique en examinant les considérations relatives à l’exclusion de données avec la fonctionnalité de protection contre la perte de données Microsoft Purview (DLP). En l’absence de solution DLP, les administrateurs peuvent exclure les sites SharePoint Online de l’index de niveau locataire.
Pour tirer parti des requêtes étendues prenant en charge les métadonnées, assurez-vous que le site ou la bibliothèque SharePoint concerné reste consultable (la recherche et la disponibilité hors connexion sont définies pour autoriser la recherche) afin que les métadonnées de contenu et de colonne soient disponibles pour Copilot lorsque les utilisateurs attachent cette bibliothèque ou ce dossier.

Exclusion des sites SharePoint Online

Il arrive que des organisations sans Protection contre la perte de données Microsoft Purview souhaitent exclure un site SharePoint Online de l’indexation de ses données par Recherche Microsoft. Ces étapes ne doivent être envisagées que pour les données sensibles, telles que la paie, les RH ou les informations financières. Pour exclure un site SharePoint Online, procédez comme suit :

  1. Naviguez sur le site avec les autorisations d’administrateur appropriées.

  2. Sélectionnez Paramètres , puis Informations sur le site dans le menu déroulant.

  3. Sélectionnez Afficher tous les paramètres du site pour afficher la page Paramètres du site.

  4. Sélectionnez Recherche et disponibilité hors connexion sous la catégorie de recherche , puis sélectionnez Non pour Autoriser ce site à apparaître dans les résultats de recherche afin de l’exclure de la recherche Microsoft et de la recherche d’index sémantique. Cette opération peut également être effectuée avec PowerShell pour plusieurs sites.

    Capture d’écran montrant les paramètres d’exclusion de sites SharePoint Online.

La recherche Microsoft et l’indexation sémantique prennent en charge l’exclusion du contenu SharePoint Online de l’index au niveau du locataire uniquement. Il n’existe aucune option permettant d’exclure les résultats de Recherche Microsoft uniquement ou d’indexation sémantique uniquement ; Les actions s’appliquent aux deux en même temps.

Configuration d’Insights d’élément

Dans la page Recherche et intelligence du Centre d’administration Microsoft 365, les informations sur les éléments sont activées par défaut. La désactivation d’informations sur les personnes ou les éléments réduit l’expérience de recherche Microsoft et d’index sémantique, car les résultats n’incluront pas les personnes pertinentes qui auraient été dérivées des groupes de distribution ou de l’organigramme.

  • Informations sur les People fournit à un utilisateur une liste de personnes pertinentes en fonction de son travail collaboratif public dans Microsoft 365. La collaboration publique inclut les membres d’un groupe de distribution public et les individus connectés dans l’organigramme.

  • Les insights d’élément permettent de recommander des recommandations aux membres de votre organisation en fonction de leur travail collaboratif dans Microsoft 365. Ces recommandations peuvent inclure, sans s’y limiter, des documents ou d’autres types de contenu, et s’afficher dans des cartes de contacts (contacts), Delve, l’application Microsoft 365, les résultats de Microsoft Copilot et d’autres emplacements.

Les informations sur les éléments et les informations sur les People ne couvrent pas les fonctionnalités de personnalisation basées sur les propres données d’un utilisateur.

Incorporation d’informations tierces

À l’aide des connecteurs Copilot, les organisations peuvent importer des données organisationnelles ou du contenu provenant de sources externes dans Microsoft Graph. Une fois dans Microsoft Graph, ce contenu est indexé afin que Copilot puisse y accéder, tout en conservant les contrôles d’accès pour le contenu. Les types de sources de contenu disponibles dans vos applications de productivité Microsoft 365 et l’écosystème Microsoft au sens large sont ainsi élargis. Notez que ce processus fonctionne mieux lorsque le contenu du connecteur est riche en texte. Les données tierces peuvent être hébergées sur site ou dans un cloud public ou privé. Pour en savoir plus sur les exigences de licence du connecteur Copilot pour Microsoft 365 Entreprise et Microsoft Copilot, consultez Exigences et tarification des licences.

Confidentialité, conformité et sécurité

Le modèle d’autorisations relatif à votre locataire Microsoft 365 peut vous aider à garantir que les données ne fuient pas involontairement entre les utilisateurs, les groupes et les locataires. Microsoft Copilot présente uniquement les données auxquelles chaque individu peut accéder à l’aide des mêmes contrôles sous-jacents pour l’accès aux données utilisé dans d’autres services Microsoft 365. Lorsque des données sont indexées, nous continuons à respecter la limite d’accès basée sur l’identité de l’utilisateur afin que le processus d’ancrage accède uniquement au contenu auquel l’utilisateur actuel est autorisé à accéder. Pour plus d’informations, consultez la politique de confidentialité et la documentation du service Microsoft.

Microsoft Copilot respecte nos engagements existants en matière de confidentialité, de sécurité et de conformité envers les clients commerciaux de Microsoft 365, notamment le Règlement général sur la protection des données (RGPD) et la limite des données de l’Union européenne (UE). Les requêtes, les réponses et les données accessibles via l’indexation sémantique ne sont pas utilisées pour entraîner les LLM de base, y compris celles utilisées par Microsoft Copilot. Pour plus d’informations, consultez Données, confidentialité et sécurité pour Microsoft Copilot.

Stockage et traitement

Les données générées par l’indexation restent dans le locataire de votre entreprise et sont conformes à vos politiques et processus de sécurité, de conformité, d’identité et de confidentialité. L’indexation sémantique fonctionne uniquement avec le contenu pour lequel vos utilisateurs disposent déjà d’une autorisation et n’affecte pas les quotas de stockage.

L’emplacement de la boîte aux lettres de l’utilisateur stocke les informations d’index au niveau de l’utilisateur. En revanche, les informations d’index au niveau du client sont stockées dans le conteneur client isolé et protégé. Ce conteneur se trouve dans la région où se trouve le site SharePoint, qui peut être la région d’origine ou une autre région spécifiée par l’administrateur client. Pour les clients compris dans la limite de données de l’Union européenne (EUDB), l’index est stocké dans un centre de données basé sur l’UE/AELE. Le traitement des autres clients peut avoir lieu dans une région locataire ou aux États-Unis. Pour les organisations multigéographiques, toutes les limites géographiques sont respectées. Les données d’une région sont stockées et traitées dans chaque région.

Prise en charge de la clé client Microsoft Purview (BYOK)

Microsoft fournit un support BYOK (Apportez votre propre clé) aux entreprises qui ont activé BYOK dans leur environnement. Microsoft active automatiquement l’indexation sémantique pour les clients compatibles BYOK sans aucune implication administrative.

Protection des informations

Dans le contexte de la recherche, il n’existe pas d’autres moyens d’exclure des données de l’indexation sémantique à l’aide des fonctionnalités de protection des informations. L’indexation sémantique hérite des paramètres de sécurité et de confidentialité de Recherche Microsoft, et les données importées à partir de connecteurs tiers bénéficient du même stockage et des mêmes protections que les autres données Microsoft 365. Pour les organisations qui recherchent des options supplémentaires de protection des informations, Microsoft 365 fournit des fonctionnalités intégrées dans les applications Microsoft 365. Des produits complémentaires sont également disponibles pour aider les administrateurs à protéger les données de l’organisation en minimisant les données et en réduisant les partages excessifs. Les sections suivantes décrivent les options disponibles pour les organisations à titre de référence uniquement.

Minimisation des données

La minimisation des données réduit la quantité de données disponibles auxquelles votre organisation peut accéder. La conservation et la suppression de contenu sont souvent nécessaires pour des raisons de conformité et de réglementation, mais la suppression de contenu qui n’a plus de valeur commerciale vous aide également à gérer les risques et la responsabilité. La gestion du cycle de vie des données Microsoft Purview, qui est sous licence séparée, peut être utilisée pour supprimer du contenu qui n’est plus nécessaire avec des stratégies de rétention pour la gestion à grande échelle, des étiquettes de rétention pour les exceptions et un contrôle granulaire.

Réduisez les partages excessifs

Les organisations ont depuis longtemps la possibilité de prendre des mesures pour réduire le partage excessif dans Microsoft 365 à l’aide des contrôles existants dans le Centre d’administration Microsoft 365 et SharePoint Online. Il est important de noter que l’indexation des données ne modifie pas les autorisations d’accès au contenu et ne modifie pas les principes sur la façon dont les utilisateurs doivent partager des informations avec leurs collègues. Par exemple, le partage de contenu avec un lien qui fonctionne avec tous les membres de mon organisation n’inclut pas les informations dans l’index de niveau locataire. Seules les personnes qui sélectionnent un lien auquel elles ont accès verront les informations ajoutées à leur index utilisateur. Il est recommandé aux organisations de prendre en compte les points suivants lorsqu’elles explorent les options de protection des informations :

  • Planifier la collaboration de fichiers sécurisés – Vérifier Planifiez et déployez une collaboration de fichiers pour mieux comprendre les pratiques recommandées afin d’exploiter un environnement de collaboration de fichiers sécurisé et productif pour vos utilisateurs.

  • Ajuster la taille de l’accès utilisateur aux données pour réduire la liste : réduisez le partage excessif en héritant des listes d’exclusion pour les sites SharePoint Online et en effectuant des contrôles d’accès en temps réel. Les organisations peuvent envisager d’utiliser le module complémentaire Syntex Gestion avancée de SharePoint pour gérer et régir ces autorisations.

  • Utiliser des étiquettes de confidentialité : Une autre façon de réduire le partage excessif de contenu consiste à utiliser la Protection des données Microsoft Purview pour appliquer des étiquettes de confidentialité, ce qui vous permet de classer les données en fonction de leur niveau de sensibilité, et d’appliquer des protections telles que le chiffrement et le marketing de contenu. Les étiquettes de confidentialité sont également incluses dans le découpage de la recherche (c’est-à-dire, prises en charge pour le filtrage et les règles côté application utilisées pour le marquage visuel et les restrictions d’accès).

  • Limiter l’accès : la protection contre la perte de données Microsoft Purview est disponible dans Microsoft 365 E5 et peut être utilisée pour limiter rétroactivement et temporairement l’accès aux documents qui ont été signalés comme étant partagés en trop. Les organisations pour lesquelles vous ne disposez pas de licences Microsoft 365 E5 peuvent utiliser la version d’essai de 90 jours des solutions Microsoft Purview pour explorer comment des fonctionnalités Purview supplémentaires peuvent vous aider à gérer vos besoins en matière de sécurité et de conformité des données.

Pour les clients qui souhaitent découvrir comment déployer des solutions avancées de protection des informations, consultez l’article suivant qui explique comment déployer une solution de protection des informations avec Microsoft Purview. Pour plus d’informations sur la façon dont Microsoft Purview peut vous aider à renforcer vos exigences de sécurité et de conformité des données pour Microsoft Copilot, consultez Protéger et gérer les interactions de Microsoft Copilot avec Microsoft Purview.

Ressources supplémentaires

Pour en savoir plus sur Microsoft Copilot, consultez les ressources suivantes à la case activée :