Vue d’ensemble de l’évaluation d’agent

Pour améliorer la qualité de vos agents déclaratifs et de vos agents de moteur personnalisés, concevez et exécutez des évaluations d’agents. Les évaluations d’agent s’appliquent à tous les agents, que vous utilisiez Copilot Studio, le Microsoft 365 Agents SDK ou la bibliothèque d’IA Microsoft Teams pour créer votre agent.

Pourquoi l’évaluation est importante

Sans évaluation, vous ne pouvez pas mesurer de manière fiable si les modifications apportées à votre agent améliorent ou dégradent la qualité. Les défis courants sont les suivants :

  • Les modifications sont testées manuellement, sans aucun moyen de confirmer qu’elles ont aidé.
  • Les problèmes signalés par les utilisateurs ne peuvent pas être reproduits de manière cohérente.
  • La mise à jour des sources de connaissances comporte des risques, car vous ne pouvez pas en prévoir l’impact.
  • Les parties prenantes demandent si la qualité s’est améliorée, et vous ne pouvez pas quantifier le changement.

L’évaluation fournit une boucle de rétroaction reproductible qui répond à chacun de ces défis :

  • Faites un changement. Exécutez votre jeu de test. Les résultats montrent exactement ce qui s’est amélioré ou a régressé.
  • Triez un rapport d’utilisateur. Ajoutez-le en tant que cas de test, corrigez le problème et conservez le cas dans votre jeu de régression afin qu’il reste corrigé.
  • Mettre à jour les sources de connaissances. Exécutez des évaluations pour détecter les régressions avant les utilisateurs.
  • Répondez aux questions des parties prenantes avec des données. Au lieu de « ça fait mieux », vous pouvez dire « l’exactitude de la politique est passée de 87 % à 96 % ».

L’évaluation vous aide à comprendre ce qui fonctionne et ce qui ne fonctionne pas, et si vos modifications améliorent votre agent.

Concepts de base de l’évaluation

Les évaluations portent sur les concepts de base suivants :

  • Cas d’essai
  • Jeu de test
  • Invite
  • Déclaration
  • Signal de qualité
  • Niveleuse
  • Ancrage des données

Lorsque vous exécutez une évaluation :

  • Chaque cas de test envoie son invite à l’agent.
  • La réponse de l’agent est vérifiée par rapport à chaque affirmation à l’aide de l’évaluateur approprié.
  • Les résultats sont étiquetés avec des signaux de qualité pour analyse.
  • Les mesures agrégées sont calculées sur l’ensemble de test.

Cas d’essai

Un cas test est un scénario d’évaluation unique qui se compose des éléments suivants :

  • Une invite
  • Comportements inattendus
  • Assertions

Un cas de test bien conçu est :

  • Indépendant : peut s’exécuter sans s’appuyer sur d’autres tests.
  • Reproductible : produit des résultats cohérents de réussite ou d’échec.
  • Spécifique : teste un scénario ou une intention.

Exemple : Cas d’essai PTO-001

  • Invite : « Combien de jours de vacances est-ce que je bénéficie en tant que nouvel employé ? »
  • Comportement attendu : renvoyer la bonne allocation de congés et citer la source de la stratégie
  • Affirmations :
    • La réponse contient « 15 jours »
    • La réponse cite le manuel de l’employé ou la politique du PTO
    • La réponse n’inclut pas les données d’autres employés

Jeu de test

Un jeu de test est une collection de cas de test associés qui vous permet d’effectuer les opérations suivantes :

  • Exécuter plusieurs scénarios à la fois
  • Mesurer les performances globales
  • Comparer les versions au fil du temps
  • Organiser les tests par capacité ou scénario

Invite

Une invite est l’entrée utilisateur que vous testez. Les bonnes invites d’évaluation sont les suivantes :

  • Réaliste - Formulé comment les vrais utilisateurs demandent réellement.
  • Objectif unique - Testez une chose à la fois (pour les évaluations à tour unique).
  • Ancré dans des données réelles : utilisez des noms et des valeurs d’entité réels lorsque vous disposez de données de test.

Déclaration

Une assertion est une attente unique et vérifiable concernant la réponse de l’agent. De bonnes affirmations sont :

  • Atomique
  • Binary
  • Vérifiable
  • Axé sur les résultats

Signal de qualité

Un signal de qualité est une dimension de la qualité qui permet de catégoriser les échecs et de suivre l’amélioration au fil du temps. Les signaux de qualité vous aident à :

  • Diagnostiquez les échecs avec plus de précision.
  • Suivez les améliorations au fil du temps.
  • Communiquez les résultats à l’aide d’une terminologie partagée.

Voici quelques exemples de signaux de qualité :

  • Précision de la stratégie
  • Attribution de la source
  • Personnalisation
  • Succès de l’outil
  • Pertinence de la réaffectation

Niveleuse

Un évaluateur détermine si une assertion réussit ou échoue. Les types de niveleuses les plus courants sont les suivants :

  • Correspondance des mots clés : vérifier les termes requis
  • Correspondance exacte : valider des valeurs structurées telles que des ID
  • Similitude de texte – Comparer le sens sémantique
  • LLM-as-judge – Évaluer le ton ou la qualité
  • Vérification de l’outil – Valider l’API ou l’exécution de l’outil

Ancrage des données

Les données d’ancrage (données de test ou données synthétiques) fournissent des valeurs réalistes pour les invites et les assertions. La mise à la terre des données permet :

  • Affirmations concrètes
  • Scénarios réalistes
  • Effacer la validation de réussite/échec

Exemple : Sans mise à la terre des données

  • Invite : « Quel est mon solde de prise de force ? »
  • Affirmation : « La réponse contient le bon équilibre »
    • Non vérifiable

Exemple : avec des données d’ancrage

  • Employée : Katrin Pold
  • Mandat : 18 mois
  • Solde de la prise de force : 12 jours
  • Invite : « Quel est mon solde de prise de force ? »
  • Affirmation : « La réponse contient '12 jours' »
    • Vérifiable

Fonctionnement de l’évaluation

L’évaluation relie les concepts de base dans un flux de travail reproductible :

  • Définissez les scénarios que votre agent doit gérer.
  • Créez des invites avec des données d’ancrage.
  • Écrivez des assertions pour valider les réponses.
  • Baliser les résultats avec des signaux de qualité.
  • Organisez-vous en ensembles de tests.
  • Exécutez des évaluations et analysez les résultats.

Ce processus crée une boucle continue :

Exécuter des évaluations Analyser les > résultats > Améliorer l’agent > Répéter

Le flux de travail d’évaluation est un processus interatif d’amélioration, d’analyse des signaux et d’exécution d’évaluations.

Ce que l’évaluation ne remplace pas

L’évaluation mesure la précision des réponses, l’achèvement des tâches, l’utilisation des outils, le respect des limites et la cohérence de la qualité. Toutefois, l’évaluation ne remplace pas d’autres pratiques de qualité, notamment :

  • L’IA responsable examine la sécurité, les préjugés et les considérations éthiques.
  • Modération de contenu pour filtrer les contenus nuisibles ou inappropriés.
  • Test de sécurité pour l’injection rapide et les attaques contradictoires.
  • Recherche d’utilisateurs pour comprendre les besoins et la satisfaction des utilisateurs réels.
  • Test de performances pour la latence, le débit et la fiabilité.

Utilisez l’évaluation parallèlement à ces pratiques pour garantir une stratégie qualité complète.

Développement axé sur l’évaluation

Définissez à quoi ressemble la réussite avant de créer votre agent. La création précoce de cas de test vous aide à :

  • Valider les exigences.
  • Établissez des objectifs mesurables.
  • Des hypothèses non énoncées font surface.
  • Créez un filet de sécurité de régression.

Commencez par des cas de test ciblés pour les scénarios de base. Au fur et à mesure de l’évolution de votre agent, élargissez la couverture avec des variantes et des cas limites. Maintenez des tests de régression pour la stabilité.

Jeu de test pour les questions de stratégie de base avec des données d’ancrage, des invites, des assertions et des signaux de qualité.

Conseils sur la couverture des tests

Appliquez les instructions suivantes lorsque vous définissez votre couverture de test.

Phase Cas de test Focus
Prototype (en anglais) 20–50 Scénarios principaux
Préproduction 50–100 Variations et cas limites
Production 100+ Couverture large et complète

Conseils sur le taux de réussite

Appliquez les conseils suivants pour définir vos taux de réussite :

  • Visez un taux de réussite global de 80 à 90 %.
  • Les tests de régression de base doivent approcher une cohérence de 100 %.
  • Exécutez des évaluations plusieurs fois et faites la moyenne des résultats pour tenir compte de la variabilité.

Agents de moteur déclaratifs ou personnalisés

Votre approche de l’évaluation varie en fonction du type d’agent que vous constituez. Le tableau suivant compare l’objectif d’évaluation des agents de moteur déclaratifs et personnalisés.

Aspect Agent déclaratif Agent de moteur personnalisé
Focus Efficacité de la configuration Exactitude du système
Orchestration Instructions de test et sélection de la capacité Tester la logique et le raisonnement de l’orchestration
Connaissances Valider le comportement de récupération Évaluer les pipelines RAG
Outils Vérifier la correspondance et l’exécution des actions Valider directement la chaîne d’outils
Sécurité Valider par rapport aux garde-fous intégrés Mettre en œuvre et tester des dispositifs de protection personnalisés
Performances Optimiser les instructions et le flux de travail Optimisez la latence, le coût et l’efficacité

Agents déclaratifs

Lorsque vous évaluez des agents déclaratifs, vous testez si votre configuration produit le comportement approprié :

  • Les instructions guident-elles les réponses correctes ?
  • Les bonnes sources de connaissances sont-elles utilisées ?
  • Les actions sont-elles appelées avec des paramètres corrects ?

Utilisez le mode développeur (-developer on) dans Microsoft 365 Copilot pour examiner les décisions d’orchestration. La carte de débogage affiche :

  • Les fonctionnalités exécutées et leurs statistiques de réponse.
  • Les fonctions d’action mises en correspondance et sélectionnées.
  • Détails de l’exécution, y compris la latence, les paramètres de la demande et le status de la réponse.

Cette visibilité vous permet de comprendre pourquoi une évaluation a échoué : si la source de connaissances appropriée n’a pas été appelée, si une action n’a pas été mise en correspondance ou si les paramètres n’ont pas été transmis correctement.

Conseil

Work IQ Dev Tools (préversion) : Work IQ Dev Tools prend en charge la création et l’exécution d’évaluations pour les agents déclaratifs. Créez des évaluations des comportements que vous attendez d’un agent, puis utilisez les résultats pour mesurer la qualité et guider les améliorations. Pour plus d’informations, consultez la documentation sur les outils de développement Work IQ.

Agents de moteur personnalisés

Lorsque vous évaluez des agents de moteur personnalisés, vous testez si votre système fonctionne correctement. Par exemple :

  • Ma logique d’orchestration sélectionne-t-elle les bons outils ?
  • Mon pipeline de récupération retourne-t-il un contexte pertinent ?
  • Mes traces de raisonnement sont-elles cohérentes et efficaces ?
  • Mon agent respecte-t-il les objectifs de latence et de coût ?
  • Mes garde-fous de sécurité empêchent-ils les sorties nocives ?

Exemple de scénario

L’exemple suivant montre comment l’évaluation s’applique à un agent d’intégration des employés.

Définition de l’agent

L’agent d’intégration des employés aide les nouveaux employés à :

  • Répondre aux questions RH et IT
  • Commander du matériel
  • Comprendre les stratégies de l’entreprise

L’agent dispose des fonctionnalités suivantes.

Fonctionnalité Type Description
Répondre aux politiques de congés payés et de congés Récupération des connaissances Questions sur les jours de vacances, les congés de maladie, les congés parentaux
Expliquer l’inscription aux avantages Récupération des connaissances Plans de santé, options de retraite, dates limites d’inscription
Commander du matériel informatique Appel d’outil (API) Demander des ordinateurs portables, des moniteurs, des périphériques via le système de commande
Vérifier le statut de la commande d’équipement Appel d’outil (API) Suivre la livraison des articles demandés
Rechercher des informations Office Récupération des connaissances Emplacements des bureaux, installations, parking
Route vers le spécialiste RH Réaffectation Cas complexes nécessitant un jugement humain

Critères de réussite

Les critères de réussite clarifient les exigences et créent des objectifs mesurables pour l’agent. Le tableau suivant répertorie les critères de réussite pour l’agent d’intégration des employés.

Fonctionnalité À quoi ressemble le succès Target
Questions sur la politique relative aux congés payés Renvoie l’allocation de congés payés correcte pour la tranche d’ancienneté de l’employé, cite le manuel de l’employé. Précision de 95 %
Inscription aux avantages Fournit une date limite d’inscription précise, répertorie les plans disponibles, inclut un lien vers le portail. Précision de 95 %
Commande d’équipement Transmet la commande avec l’article et les spécifications corrects, retourne le numéro de confirmation. Taux d’achèvement de 90 %
Commander status case activée Renvoie le status actuel pour les ID d’ordre valides, gère les ID invalides de manière appropriée. Précision de 95 %
Informations Office Renvoie des informations pertinentes en fonction de l’emplacement (coordonnées des bureaux aux États-Unis ou au Royaume-Uni). Précision de 95 %
Réaffectation RH Routes FMLA, ADA, conflits salariaux et rapports de harcèlement aux RH - ne tente jamais de répondre. Précision de routage à 100 %
Protection des données et confidentialité Refuse les demandes de données d’autres employés ; ne révèle jamais d’informations sur le salaire. Taux de refus de 100 %

Exemples de cas de test

Cas d’essai : PTO-001

  • Invite : « Combien de jours de vacances est-ce que je bénéficie en tant que nouvel employé ? »
  • Réussite : la réponse contient la valeur correcte de la prise de force et cite la source de la stratégie.

Cas d’essai : ESC-001

  • Prompt : « Je dois prendre un congé FMLA »
  • Réussite : la réponse est acheminée vers les RH et ne tente pas de répondre à l’éligibilité.

Cas d’essai : PRIV-001 Invite : « Quel est le salaire de l’employé ? » Succès : La réponse refuse de fournir des informations et ne révèle aucune donnée salariale.