Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Cet article répond aux questions fréquemment posées sur les capacités d’IA utilisées dans les fonctionnalités analytiques dans l’onglet Copilot Studio Monitor.
Comment l’IA générative est-elle utilisée pour l’analyse ?
Copilot Studio utilise l’IA pour évaluer la qualité des réponses génératives et identifier les modèles dans les requêtes utilisateur via le clustering. Ces clusters fournissent des insights sur les performances de l’agent.
Les réponses génératives utilisent des sources de connaissances que vous choisissez, pour générer une réponse. La fonctionnalité collecte également tous les commentaires que vous fournissez. L’analytique utilise des modèles de langage volumineux (LLMs) pour classifier les messages de conversation entre les utilisateurs et les agents en niveaux qui indiquent la qualité des réponses de réponse génératives. Ces classifications sont agrégées pour fournir un résumé des performances de l’agent.
Le clustering utilise des machines virtuelles LLM pour trier les messages des utilisateurs en groupes en fonction des sujets partagés et fournir à chaque groupe un nom descriptif. Copilot Studio utilise les noms de ces clusters pour fournir différents types d’insights que vous pouvez utiliser pour améliorer votre agent.
Qualité des réponses pour les réponses génératives
Quelle est l’utilisation prévue de la qualité de la réponse ?
Utilisez la qualité de l’analytique des réponses pour comprendre les performances de l’agent et identifier les améliorations. Actuellement, vous pouvez utiliser l’analytique pour comprendre si la qualité des réponses génératives d’un agent répond à vos attentes.
En plus de la qualité globale, la qualité de l’analytique des réponses identifie les zones où un agent effectue mal ou ne parvient pas à atteindre vos objectifs prévus. Identifiez où les réponses génératives fonctionnent mal et prennent des mesures pour améliorer leur qualité.
Lors de l’identification de performances médiocres, suivez les meilleures pratiques qui peuvent aider à améliorer la qualité. Par exemple, après avoir identifié des sources de connaissances avec des performances médiocres, vous pouvez modifier la source de connaissances ou fractionner la source de connaissances en plusieurs sources plus ciblées pour améliorer la qualité.
Quelles données sont utilisées pour créer des analyses pour la qualité de la réponse ?
La qualité de l’analytique des réponses est basée sur un exemple d’interactions de réponses génératives . Elle nécessite la requête de l’utilisateur, la réponse de l’agent et les sources de connaissances pertinentes que le modèle générateur utilise pour la réponse générative. La qualité de l’analytique des réponses utilise ces informations pour évaluer si la qualité de la réponse générative est bonne, et si ce n’est pas le cas, pourquoi la qualité est médiocre. Par exemple, la qualité de la réponse peut identifier les réponses incomplètes, non pertinentes ou non entièrement ancrées.
Quelles sont les limitations de la qualité de l’analytique des réponses et comment les utilisateurs peuvent-ils réduire les effets de ces limitations ?
La qualité de l'analyse des réponses n'utilise pas toutes les réponses générées. Au lieu de cela, l’analytique mesure un exemple de sessions d’agent utilisateur. Les agents qui ont moins que le nombre minimal de réponses génératives réussies ne peuvent pas recevoir un résumé analytique de la qualité des réponses.
Dans certains cas, l’analyse n’évalue pas précisément une réponse individuelle. Au niveau agrégé, il doit être précis pour la plupart des cas.
L’analyse de la qualité des réponses ne fournit pas de ventilation des requêtes spécifiques ayant conduit à une performance de faible qualité. Ils ne fournissent pas non plus de répartition des sources de connaissances courantes ou des sujets utilisés lorsque des réponses de faible qualité se produisent.
Les analyses ne sont pas calculées pour les réponses qui utilisent des connaissances génératives.
La complétude des réponses est l’un des indicateurs utilisés pour évaluer la qualité des réponses. Cette mesure mesure à quel point la réponse traite pleinement le contenu du document récupéré.
Si le système ne récupère pas un document pertinent contenant des informations supplémentaires pour la question, il n’évalue pas la métrique de complétude de ce document.
Quelles sont les protections en place pour la qualité de l’analytique des réponses dans Copilot Studio pour l’IA responsable ?
Les utilisateurs d’agents ne voient pas les résultats d’analyse. Les résultats sont disponibles uniquement pour les créateurs d’agents et les administrateurs.
Les décideurs et les administrateurs peuvent uniquement utiliser la qualité de l’analyse des réponses pour voir le pourcentage de réponses de bonne qualité et toutes les raisons prédéfinies de performances médiocres. Les résultats sont agrégés et présentés sous forme de pourcentages et de catégories prédéfinies.
Nous avons testé l’analyse pour la qualité des réponses minutieusement pendant le développement afin de garantir de bonnes performances. Cependant, dans de rares cas, la qualité des évaluations de la réponse peut être inexacte.
Analyse du sentiment pour les sessions de conversation
Quel est l’usage prévu de l’analyse de sentiment ?
Utilisez l’analyse des sentiments pour comprendre le niveau de satisfaction des utilisateurs dans les sessions de conversation en fonction d’une analyse IA des messages utilisateur à l’agent. Vous pouvez comprendre le sentiment global de la session (positif, négatif ou neutre), examiner les raisons et prendre des mesures pour y remédier.
Quelles données sont utilisées pour l’analyse des sentiments ?
L’analyse des sentiments utilise des messages utilisateur à l’agent pour un exemple de sessions conversationnelles.
L’analyse du sentiment utilise ces informations pour évaluer si la satisfaction de l’utilisateur pendant la session est positive, négative ou neutre. Par exemple, un utilisateur peut utiliser des mots et un ton de voix indiquant une frustration ou un insatisfaction en fonction de l’interaction avec l’agent. Dans cet incident, la session est classée comme un sentiment négatif.
Quelles sont les limites de l’analyse de sentiment, et comment les utilisateurs peuvent-ils compenser ces limitations ?
Les analyses de sentiment ne sont pas calculées en utilisant toutes les séances de conversation. Au lieu de cela, l’analytique mesure un exemple de sessions d’agent utilisateur. Les agents en dessous d’un nombre minimum de réponses génératives réussies quotidiennes ne peuvent pas recevoir de score de sentiment.
L’analyse de sentiment dépend actuellement des réponses génératives et nécessite un nombre minimum de réponses réussies quotidiennement pour calculer le score de sentiment de l’agent.
Pour calculer le sentiment d’une session, il doit y avoir au moins deux messages utilisateurs. De plus, en raison des contraintes techniques actuelles, l’analyse de sentiment n’est pas réalisée sur des sessions dépassant un total de 26 messages (y compris les messages utilisateurs et agents)
L’analyse du sentiment ne fournit pas de détail des messages spécifiques des utilisateurs ayant conduit au score de sentiment.
Quelles sont les protections en place pour l’analyse des sentiments dans Copilot Studio pour l’IA responsable ?
Les utilisateurs d’agents ne voient pas les résultats d’analyse. Les résultats sont disponibles uniquement pour les créateurs d’agents et les administrateurs.
Vous pouvez uniquement utiliser l’analyse des sentiments pour voir la répartition des sentiments entre toutes les sessions.
Nous avons testé l’analyse de sentiment de manière approfondie pendant le développement pour garantir de bonnes performances. Cependant, dans de rares cas, les évaluations de sentiment peuvent être inexactes.
Thèmes des questions des utilisateurs
Quelle est l’utilisation prévue des thèmes ?
Le clustering par thèmes et analyse au niveau du thème vous aide à comprendre rapidement ce que les utilisateurs demandent à grande échelle. Cette fonctionnalité analyse de grands volumes de requêtes utilisateur et expose des rubriques de haut niveau (« thèmes ») qui représentent les principaux sujets auxquels les utilisateurs s’intéressent. Cette analyse vous aide à passer de l’inspection des conversations individuelles à l’identification de modèles plus larges, de besoins émergents et de domaines d’intérêt.
En fournissant une vue d’ensemble structurée et pilotée par les données de l’activité utilisateur, l’analyse au niveau du thème vous aide à :
Identifiez les rubriques les plus courantes avec qui les utilisateurs interagissent.
Détecter les lacunes dans la couverture ou les expériences peu claires.
Surveillez la façon dont les intérêts des utilisateurs évoluent au fil du temps.
Hiérarchiser les améliorations en fonction de la demande réelle des utilisateurs.
Comment l’analyse des thèmes fonctionne-t-elle à un niveau élevé ?
Cette fonctionnalité fonctionne en tant que processus en plusieurs étapes qui organise en permanence les requêtes utilisateur en groupes significatifs. À un niveau élevé, ce processus comprend deux phases clés :
Génération de thèmes candidats
Le système analyse un ensemble récent de requêtes utilisateur et identifie les thèmes candidats qui représentent des rubriques générales distinctes. Le système détecte des modèles, des similitudes et des sujets récurrents entre les requêtes pour dériver ces candidats.
Attribution des requêtes aux thèmes
Une fois que le système génère des thèmes candidats, il associe des requêtes individuelles au thème le plus pertinent. Chaque thème représente une collection de questions utilisateur associées et évolue à mesure que le système traite de nouvelles requêtes. Le système affine ces thèmes au fil du temps en utilisant des signaux tels que la similarité sémantique et les commentaires des utilisateurs. Ce processus d’affinement permet à la représentation de s’adapter à mesure que le comportement de l’utilisateur change.
Quelles données sont utilisées pour créer des thèmes ?
Les utilisateurs génèrent des thèmes à partir de requêtes qui entraînent des réponses génératives. Le processus se concentre sur une fenêtre récente d’activité pour s’assurer que les thèmes reflètent les intérêts actuels des utilisateurs et les tendances en évolution. À mesure que de nouvelles données sont disponibles, le système actualise les thèmes pour les maintenir pertinents.
Étant donné que les thèmes s’appuient sur des modèles dans les requêtes utilisateur, la fonctionnalité dépend d’une quantité significative d’activité à analyser. Dans les situations où il existe des données limitées ou des requêtes hautement fragmentées, le système peut ne pas générer de thèmes ou fournir des insights limités.
Quelles sont les limitations de l’analyse de thème et comment puis-je les atténuer ?
L’analyse du thème est un système de clustering piloté par les données, et son efficacité dépend de la nature et du volume des requêtes utilisateur. Voici quelques limitations potentielles :
Des données insuffisantes ou hautement diversifiées peuvent entraîner des thèmes trop larges ou étroits.
Des sujets étroitement liés peuvent parfois être divisés en thèmes distincts.
Des requêtes non liées peuvent parfois être regroupées.
Les modifications apportées au langage utilisateur au fil du temps peuvent affecter la cohérence des thèmes.
Pour obtenir la valeur la plus élevée des thèmes :
Passez régulièrement en revue les thèmes générés.
Fournissez des commentaires (par exemple : pouces vers le haut ou vers le bas) pour améliorer la qualité.
Interpréter les thèmes comme des insights directionnels plutôt que des catégorisations exactes.
Quelles sont les mesures de protection en place pour une IA responsable ?
Le clustering et l’analyse de thèmes sont conçus avec des principes d’IA responsables à l’esprit.
Les créateurs et les administrateurs autorisés sont les seuls à pouvoir voir les thèmes.
Seuls ceux autorisés à voir les requêtes utilisateur peuvent voir leur répartition en thèmes.
Les thèmes reflètent le contenu des requêtes utilisateur, de sorte qu’ils fournissent un résumé honnête pour les décideurs et les administrateurs à voir.
Ces protections contribuent à garantir que Themes fournit des informations utiles tout en maintenant une expérience sûre et contrôlée.
Analytique des métriques personnalisées
Quelle est l’utilisation prévue des métriques personnalisées ?
Utilisez l’analyse de métriques personnalisées pour comprendre dans quelle mesure vos agents conversationnels influencent les résultats de l’entreprise. Ces métriques complètent l’analytique des économies. Parmi les exemples de métriques personnalisées, citons le taux de résolution, la classification des intentions client et d’autres résultats spécifiques au domaine.
Les métriques personnalisées peuvent montrer où les agents manquent les objectifs prévus. Définissez ce qu’il faut mesurer, tester les métriques par rapport aux données de session réelles et affiner les définitions en fonction des résultats.
Quelles données sont utilisées pour calculer des métriques personnalisées ?
Calculez des métriques personnalisées à l’aide d’un exemple de sessions d’agent passées. Le calcul utilise les messages conversationnels échangés pendant une session.
Le modèle IA classifie les données de session en fonction de votre définition de métrique. L’agent agrège les résultats à partir de l'échantillon pour afficher la performance globale des métriques pour la période sélectionnée.
Quelles sont les limitations des métriques personnalisées et comment les utilisateurs peuvent-ils réduire les effets des limitations ?
Les métriques personnalisées n’utilisent pas toutes les sessions d’agent. Au lieu de cela, ils mesurent un échantillon de sessions à partir de la période sélectionnée. Étant donné que les résultats sont basés sur un échantillon, traitez-les comme des indicateurs directionnels plutôt que des chiffres exacts.
Considérez que le calcul des métriques est basé sur la transcription des messages lors de l’interprétation des métriques. Évitez de tirer des conclusions sur les comportements qui se produisent principalement en dehors des messages, tels que des rubriques et des outils.
Le modèle IA peut mal classer les sessions. Les résultats agrégés sont généralement précis. Les sessions qui ne correspondent pas à une catégorie définie sont placées dans la catégorie de secours (Autre). Si les résultats des tests ne correspondent pas aux résultats attendus, vous pouvez mettre à jour la description des métriques et les définitions de catégorie.
Si vous modifiez considérablement les instructions ou la configuration d’un agent après avoir défini une métrique, la métrique peut ne plus refléter avec précision le comportement mis à jour de l’agent. Passez en revue leurs métriques personnalisées après avoir apporté des modifications importantes à l’agent.
Quelles sont les protections en place pour les métriques personnalisées dans Copilot Studio pour l’IA responsable ?
Les créateurs d’agents et les administrateurs sont les seuls qui peuvent accéder aux résultats des métriques personnalisées. Les utilisateurs de l’agent n’ont pas accès aux résultats d’analyse.
Vous passez en revue et approuvez toutes les métriques personnalisées avant d’enregistrer. Pendant la définition de métrique, vous testez les métriques par rapport aux exemples de données de session et examinez les résultats individuels et le raisonnement du modèle. Si les résultats ne répondent pas aux attentes, vous pouvez mettre à jour ou ignorer la métrique. Les métriques ne sont pas appliquées sans votre confirmation explicite.
L’invite générée par l’IA utilisée pour classifier les sessions est visible pour vous dans l’interface utilisateur. Vous pouvez donc comprendre comment le modèle interprète votre définition de métrique. Vous pouvez modifier ou supprimer des métriques personnalisées à tout moment.
Dans de rares cas, les classifications de session individuelles peuvent être inexactes. Les résultats doivent être interprétés dans l’agrégat plutôt qu’au niveau de la session individuelle.