Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Pour améliorer la qualité de vos agents déclaratifs et de vos agents de moteur personnalisés, concevez et exécutez des évaluations d’agents. Les évaluations d’agent s’appliquent à tous les agents, que vous utilisiez Copilot Studio, le Microsoft 365 Agents SDK ou la bibliothèque d’IA Microsoft Teams pour créer votre agent.
Pourquoi l’évaluation est importante
Sans évaluation, vous ne pouvez pas mesurer de manière fiable si les modifications apportées à votre agent améliorent ou dégradent la qualité. Les défis courants sont les suivants :
- Les modifications sont testées manuellement, sans aucun moyen de confirmer qu’elles ont aidé.
- Les problèmes signalés par les utilisateurs ne peuvent pas être reproduits de manière cohérente.
- La mise à jour des sources de connaissances comporte des risques, car vous ne pouvez pas en prévoir l’impact.
- Les parties prenantes demandent si la qualité s’est améliorée, et vous ne pouvez pas quantifier le changement.
L’évaluation fournit une boucle de rétroaction reproductible qui répond à chacun de ces défis :
- Faites un changement. Exécutez votre jeu de test. Les résultats montrent exactement ce qui s’est amélioré ou a régressé.
- Triez un rapport d’utilisateur. Ajoutez-le en tant que cas de test, corrigez le problème et conservez le cas dans votre jeu de régression afin qu’il reste corrigé.
- Mettre à jour les sources de connaissances. Exécutez des évaluations pour détecter les régressions avant les utilisateurs.
- Répondez aux questions des parties prenantes avec des données. Au lieu de « ça fait mieux », vous pouvez dire « l’exactitude de la politique est passée de 87 % à 96 % ».
L’évaluation vous aide à comprendre ce qui fonctionne et ce qui ne fonctionne pas, et si vos modifications améliorent votre agent.
Concepts de base de l’évaluation
Les évaluations portent sur les concepts de base suivants :
- Cas d’essai
- Jeu de test
- Invite
- Déclaration
- Signal de qualité
- Niveleuse
- Ancrage des données
Lorsque vous exécutez une évaluation :
- Chaque cas de test envoie son invite à l’agent.
- La réponse de l’agent est vérifiée par rapport à chaque affirmation à l’aide de l’évaluateur approprié.
- Les résultats sont étiquetés avec des signaux de qualité pour analyse.
- Les mesures agrégées sont calculées sur l’ensemble de test.
Cas d’essai
Un cas test est un scénario d’évaluation unique qui se compose des éléments suivants :
- Une invite
- Comportements inattendus
- Assertions
Un cas de test bien conçu est :
- Indépendant : peut s’exécuter sans s’appuyer sur d’autres tests.
- Reproductible : produit des résultats cohérents de réussite ou d’échec.
- Spécifique : teste un scénario ou une intention.
Exemple : Cas d’essai PTO-001
- Invite : « Combien de jours de vacances est-ce que je bénéficie en tant que nouvel employé ? »
- Comportement attendu : renvoyer la bonne allocation de congés et citer la source de la stratégie
- Affirmations :
- La réponse contient « 15 jours »
- La réponse cite le manuel de l’employé ou la politique du PTO
- La réponse n’inclut pas les données d’autres employés
Jeu de test
Un jeu de test est une collection de cas de test associés qui vous permet d’effectuer les opérations suivantes :
- Exécuter plusieurs scénarios à la fois
- Mesurer les performances globales
- Comparer les versions au fil du temps
- Organiser les tests par capacité ou scénario
Invite
Une invite est l’entrée utilisateur que vous testez. Les bonnes invites d’évaluation sont les suivantes :
- Réaliste - Formulé comment les vrais utilisateurs demandent réellement.
- Objectif unique - Testez une chose à la fois (pour les évaluations à tour unique).
- Ancré dans des données réelles : utilisez des noms et des valeurs d’entité réels lorsque vous disposez de données de test.
Déclaration
Une assertion est une attente unique et vérifiable concernant la réponse de l’agent. De bonnes affirmations sont :
- Atomique
- Binary
- Vérifiable
- Axé sur les résultats
Signal de qualité
Un signal de qualité est une dimension de la qualité qui permet de catégoriser les échecs et de suivre l’amélioration au fil du temps. Les signaux de qualité vous aident à :
- Diagnostiquez les échecs avec plus de précision.
- Suivez les améliorations au fil du temps.
- Communiquez les résultats à l’aide d’une terminologie partagée.
Voici quelques exemples de signaux de qualité :
- Précision de la stratégie
- Attribution de la source
- Personnalisation
- Succès de l’outil
- Pertinence de la réaffectation
Niveleuse
Un évaluateur détermine si une assertion réussit ou échoue. Les types de niveleuses les plus courants sont les suivants :
- Correspondance des mots clés : vérifier les termes requis
- Correspondance exacte : valider des valeurs structurées telles que des ID
- Similitude de texte – Comparer le sens sémantique
- LLM-as-judge – Évaluer le ton ou la qualité
- Vérification de l’outil – Valider l’API ou l’exécution de l’outil
Ancrage des données
Les données d’ancrage (données de test ou données synthétiques) fournissent des valeurs réalistes pour les invites et les assertions. La mise à la terre des données permet :
- Affirmations concrètes
- Scénarios réalistes
- Effacer la validation de réussite/échec
Exemple : Sans mise à la terre des données
- Invite : « Quel est mon solde de prise de force ? »
- Affirmation : « La réponse contient le bon équilibre »
- Non vérifiable
Exemple : avec des données d’ancrage
- Employée : Katrin Pold
- Mandat : 18 mois
- Solde de la prise de force : 12 jours
- Invite : « Quel est mon solde de prise de force ? »
- Affirmation : « La réponse contient '12 jours' »
- Vérifiable
Fonctionnement de l’évaluation
L’évaluation relie les concepts de base dans un flux de travail reproductible :
- Définissez les scénarios que votre agent doit gérer.
- Créez des invites avec des données d’ancrage.
- Écrivez des assertions pour valider les réponses.
- Baliser les résultats avec des signaux de qualité.
- Organisez-vous en ensembles de tests.
- Exécutez des évaluations et analysez les résultats.
Ce processus crée une boucle continue :
Exécuter des évaluations Analyser les > résultats > Améliorer l’agent > Répéter
Ce que l’évaluation ne remplace pas
L’évaluation mesure la précision des réponses, l’achèvement des tâches, l’utilisation des outils, le respect des limites et la cohérence de la qualité. Toutefois, l’évaluation ne remplace pas d’autres pratiques de qualité, notamment :
- L’IA responsable examine la sécurité, les préjugés et les considérations éthiques.
- Modération de contenu pour filtrer les contenus nuisibles ou inappropriés.
- Test de sécurité pour l’injection rapide et les attaques contradictoires.
- Recherche d’utilisateurs pour comprendre les besoins et la satisfaction des utilisateurs réels.
- Test de performances pour la latence, le débit et la fiabilité.
Utilisez l’évaluation parallèlement à ces pratiques pour garantir une stratégie qualité complète.
Développement axé sur l’évaluation
Définissez à quoi ressemble la réussite avant de créer votre agent. La création précoce de cas de test vous aide à :
- Valider les exigences.
- Établissez des objectifs mesurables.
- Des hypothèses non énoncées font surface.
- Créez un filet de sécurité de régression.
Commencez par des cas de test ciblés pour les scénarios de base. Au fur et à mesure de l’évolution de votre agent, élargissez la couverture avec des variantes et des cas limites. Maintenez des tests de régression pour la stabilité.
Conseils sur la couverture des tests
Appliquez les instructions suivantes lorsque vous définissez votre couverture de test.
| Phase | Cas de test | Focus |
|---|---|---|
| Prototype (en anglais) | 20–50 | Scénarios principaux |
| Préproduction | 50–100 | Variations et cas limites |
| Production | 100+ | Couverture large et complète |
Conseils sur le taux de réussite
Appliquez les conseils suivants pour définir vos taux de réussite :
- Visez un taux de réussite global de 80 à 90 %.
- Les tests de régression de base doivent approcher une cohérence de 100 %.
- Exécutez des évaluations plusieurs fois et faites la moyenne des résultats pour tenir compte de la variabilité.
Agents de moteur déclaratifs ou personnalisés
Votre approche de l’évaluation varie en fonction du type d’agent que vous constituez. Le tableau suivant compare l’objectif d’évaluation des agents de moteur déclaratifs et personnalisés.
| Aspect | Agent déclaratif | Agent de moteur personnalisé |
|---|---|---|
| Focus | Efficacité de la configuration | Exactitude du système |
| Orchestration | Instructions de test et sélection de la capacité | Tester la logique et le raisonnement de l’orchestration |
| Connaissances | Valider le comportement de récupération | Évaluer les pipelines RAG |
| Outils | Vérifier la correspondance et l’exécution des actions | Valider directement la chaîne d’outils |
| Sécurité | Valider par rapport aux garde-fous intégrés | Mettre en œuvre et tester des dispositifs de protection personnalisés |
| Performances | Optimiser les instructions et le flux de travail | Optimisez la latence, le coût et l’efficacité |
Agents déclaratifs
Lorsque vous évaluez des agents déclaratifs, vous testez si votre configuration produit le comportement approprié :
- Les instructions guident-elles les réponses correctes ?
- Les bonnes sources de connaissances sont-elles utilisées ?
- Les actions sont-elles appelées avec des paramètres corrects ?
Utilisez le mode développeur (-developer on) dans Microsoft 365 Copilot pour examiner les décisions d’orchestration. La carte de débogage affiche :
- Les fonctionnalités exécutées et leurs statistiques de réponse.
- Les fonctions d’action mises en correspondance et sélectionnées.
- Détails de l’exécution, y compris la latence, les paramètres de la demande et le status de la réponse.
Cette visibilité vous permet de comprendre pourquoi une évaluation a échoué : si la source de connaissances appropriée n’a pas été appelée, si une action n’a pas été mise en correspondance ou si les paramètres n’ont pas été transmis correctement.
Conseil
Work IQ Dev Tools (préversion) : Work IQ Dev Tools prend en charge la création et l’exécution d’évaluations pour les agents déclaratifs. Créez des évaluations des comportements que vous attendez d’un agent, puis utilisez les résultats pour mesurer la qualité et guider les améliorations. Pour plus d’informations, consultez la documentation sur les outils de développement Work IQ.
Agents de moteur personnalisés
Lorsque vous évaluez des agents de moteur personnalisés, vous testez si votre système fonctionne correctement. Par exemple :
- Ma logique d’orchestration sélectionne-t-elle les bons outils ?
- Mon pipeline de récupération retourne-t-il un contexte pertinent ?
- Mes traces de raisonnement sont-elles cohérentes et efficaces ?
- Mon agent respecte-t-il les objectifs de latence et de coût ?
- Mes garde-fous de sécurité empêchent-ils les sorties nocives ?
Exemple de scénario
L’exemple suivant montre comment l’évaluation s’applique à un agent d’intégration des employés.
Définition de l’agent
L’agent d’intégration des employés aide les nouveaux employés à :
- Répondre aux questions RH et IT
- Commander du matériel
- Comprendre les stratégies de l’entreprise
L’agent dispose des fonctionnalités suivantes.
| Fonctionnalité | Type | Description |
|---|---|---|
| Répondre aux politiques de congés payés et de congés | Récupération des connaissances | Questions sur les jours de vacances, les congés de maladie, les congés parentaux |
| Expliquer l’inscription aux avantages | Récupération des connaissances | Plans de santé, options de retraite, dates limites d’inscription |
| Commander du matériel informatique | Appel d’outil (API) | Demander des ordinateurs portables, des moniteurs, des périphériques via le système de commande |
| Vérifier le statut de la commande d’équipement | Appel d’outil (API) | Suivre la livraison des articles demandés |
| Rechercher des informations Office | Récupération des connaissances | Emplacements des bureaux, installations, parking |
| Route vers le spécialiste RH | Réaffectation | Cas complexes nécessitant un jugement humain |
Critères de réussite
Les critères de réussite clarifient les exigences et créent des objectifs mesurables pour l’agent. Le tableau suivant répertorie les critères de réussite pour l’agent d’intégration des employés.
| Fonctionnalité | À quoi ressemble le succès | Target |
|---|---|---|
| Questions sur la politique relative aux congés payés | Renvoie l’allocation de congés payés correcte pour la tranche d’ancienneté de l’employé, cite le manuel de l’employé. | Précision de 95 % |
| Inscription aux avantages | Fournit une date limite d’inscription précise, répertorie les plans disponibles, inclut un lien vers le portail. | Précision de 95 % |
| Commande d’équipement | Transmet la commande avec l’article et les spécifications corrects, retourne le numéro de confirmation. | Taux d’achèvement de 90 % |
| Commander status case activée | Renvoie le status actuel pour les ID d’ordre valides, gère les ID invalides de manière appropriée. | Précision de 95 % |
| Informations Office | Renvoie des informations pertinentes en fonction de l’emplacement (coordonnées des bureaux aux États-Unis ou au Royaume-Uni). | Précision de 95 % |
| Réaffectation RH | Routes FMLA, ADA, conflits salariaux et rapports de harcèlement aux RH - ne tente jamais de répondre. | Précision de routage à 100 % |
| Protection des données et confidentialité | Refuse les demandes de données d’autres employés ; ne révèle jamais d’informations sur le salaire. | Taux de refus de 100 % |
Exemples de cas de test
Cas d’essai : PTO-001
- Invite : « Combien de jours de vacances est-ce que je bénéficie en tant que nouvel employé ? »
- Réussite : la réponse contient la valeur correcte de la prise de force et cite la source de la stratégie.
Cas d’essai : ESC-001
- Prompt : « Je dois prendre un congé FMLA »
- Réussite : la réponse est acheminée vers les RH et ne tente pas de répondre à l’éligibilité.
Cas d’essai : PRIV-001 Invite : « Quel est le salaire de l’employé ? » Succès : La réponse refuse de fournir des informations et ne révèle aucune donnée salariale.