Informations de référence sur les évaluateurs intégrés

Important

Les éléments marqués (préversion) dans cet article sont actuellement en préversion publique. Cette préversion est fournie sans contrat de niveau de service et nous ne le recommandons pas pour les charges de travail de production. Certaines fonctionnalités peuvent ne pas être prises en charge ou avoir des fonctionnalités contraintes. Pour plus d’informations, consultez Supplemental Conditions d’utilisation pour les préversions Microsoft Azure.

Microsoft Foundry comprend des évaluateurs intégrés pour évaluer la qualité, la sécurité et la fiabilité des réponses ia tout au long du cycle de vie du développement. Cette référence répertorie tous les évaluateurs disponibles, leurs objectifs et conseils sur la sélection de celui qui convient à votre cas d’usage. Vous pouvez également créer des évaluateurs personnalisés adaptés à vos critères d’évaluation spécifiques.

Lorsque vous choisissez des évaluateurs, la compétence Microsoft Foundry peut vous aider à connecter cette référence à la configuration de l’évaluation, à l’optimisation rapide et aux workflows de résolution des problèmes.

Évaluateurs à usage général

Évaluateur Purpose
Cohérence Mesure la cohérence logique et le flux des réponses.
Fluidité Mesure la qualité et la lisibilité du langage naturel.

Pour en savoir plus, consultez les évaluateurs à usage général.

Évaluateurs de similarité textuelle

Évaluateur Purpose
Similarité Mesure de similarité textuelle assistée par l’IA.
F1 Score La moyenne harmonique de précision et de rappel dans les jetons chevauche la réponse et la vérité terrestre.
BLEU Le score d’évaluation bilingue Understudy pour les mesures de qualité de la traduction se chevauche en n-grammes entre la réponse et la vérité au sol.
GLEU Google-BLEU variante pour les mesures d’évaluation au niveau de la phrase chevauche en n-grammes la réponse et la vérité fondamentale.
ROUGE Recall-Oriented Understudy pour Gisting Evaluation mesure en n-grammes les points de réponse et la vérité de base.
MÉTÉORE Métrique pour l’évaluation de la traduction avec des mesures de classement explicite se chevauchent en n-grammes entre la réponse et la vérité au sol.

Pour en savoir plus, consultez évaluateurs de similarité textuelle.

Évaluateurs RAG

Évaluateur Purpose
Recherche Mesure la façon dont le système récupère efficacement les informations pertinentes.
Récupération de documents Mesure la précision dans la récupération donne la vérité au sol.
Ancrage Mesure la façon dont la réponse est fondée dans le contexte récupéré. Retourne un score compris entre 1 et 5 à l’aide d’un jugement basé sur un modèle.
Groundedness Pro (préversion) Mesure si la réponse est ancrée dans le contexte récupéré à l’aide du service Azure AI Sécurité du Contenu. Retourne une passe/échec binaire sans nécessiter de déploiement de modèle.
Pertinence Mesure la pertinence de la réponse par rapport à la requête.
Complétivité de la réponse (préversion) Mesures dans quelle mesure la réponse est terminée (pas manquant d’informations critiques) en ce qui concerne la vérité au sol.

Pour en savoir plus, consultez les évaluateurs de génération augmentée de récupération (RAG).

Évaluateurs de risque et de sécurité

Évaluateur Purpose
Haine et injustice Identifie le contenu biaisé, discriminatoire ou haineux.
Sexuelle Identifie le contenu sexuel inapproprié.
Violence Détecte le contenu violent ou l’incitation.
Auto-mutilation Détecte le contenu qui promeut ou décrit l’auto-préjudice.
Contenus protégés Détecte l’utilisation non autorisée du contenu protégé ou protégé par le droit d’auteur.
Attaque indirecte (XPIA) Mesure si la réponse est tombée pour une tentative de jailbreak indirect injectée dans le contexte récupéré.
Vulnérabilité du code Identifie les problèmes de sécurité dans le code généré.
Attributs non fondés Détecte les informations fabriquées ou erronées déduites des interactions utilisateur.
Actions interdites Mesure la capacité d’un agent IA à s’engager dans des comportements qui violent des actions explicitement interdites.
Fuite de données sensibles Mesure la vulnérabilité d’un agent IA pour exposer des informations sensibles.

Pour en savoir plus, consultez les évaluateurs de risque et de sécurité.

Les évaluateurs d’agents

Évaluateur Purpose
Respect des tâches (préversion) Mesure si l’agent suit les tâches identifiées en fonction des instructions système.
Achèvement des tâches (préversion) Mesure si l’agent a correctement terminé la tâche demandée de bout en bout.
Satisfaction des clients (préversion) Mesure la satisfaction holistique des utilisateurs dans une conversation à l’aide de six dimensions : utilité, complétité, clarté, ton, résolution et adaptabilité.
Résolution d’intention (préversion) Mesure la précision de l’agent pour identifier et résoudre les intentions de l’utilisateur.
Efficacité de la navigation des tâches Détermine si la séquence d’étapes de l’agent correspond à un chemin optimal ou attendu pour mesurer l’efficacité.
Précision des appels de l’outil Mesure la qualité globale des appels d’outils, notamment la sélection, la correction des paramètres et l’efficacité.
Sélection de l’outil Mesure si l’agent a sélectionné les outils les plus appropriés et efficaces pour une tâche.
Précision de l’entrée de l’outil Vérifie que tous les paramètres d’appel d’outil sont corrects avec des critères stricts, notamment le sol, le type, le format, l’exhaustivité et l’adéquation.
Utilisation de la sortie de l’outil Mesure si l’agent interprète et utilise correctement les sorties de l’outil dans les réponses et les appels suivants.
Réussite de l’appel de l’outil Évalue si tous les appels d’outils s’exécutent correctement sans échecs techniques.
Quality Grader (préversion) Permet l’évaluation de la qualité sur plusieurs dimensions ( pertinence, abstention, complétité des réponses, pertinence et couverture contextuelle) dans un seul évaluateur au lieu d’exécuter des évaluateurs individuels séparément.

Pour en savoir plus, consultez les évaluateurs de l’agent.

Évaluateurs de rubriques (préversion)

Évaluateur Purpose
Rubrique Note une réponse ou une conversation multitours par rapport aux critères personnalisés pondérés à l’aide d’un LLM en tant que juge. Retourne un score moyen pondéré normalisé à 0 à 1 avec le raisonnement par dimension.

Pour en savoir plus, consultez évaluateurs de rubriques.

Azure les classateurs OpenAI

Évaluateur Purpose
Générateur d’étiquettes de modèle Classifie le contenu à l’aide d’instructions et d’étiquettes personnalisées.
Vérificateur de chaînes de caractères Effectue des validations de texte flexibles et des critères correspondants.
Similarité du texte Évalue la qualité du texte ou détermine la proximité sémantique.
Scoreur de modèle Génère des scores numériques (plage personnalisée) pour le contenu en fonction des instructions personnalisées.

Pour plus d’informations, consultez Azure OpenAI Graders.

Évaluateurs personnalisés (préversion)

En plus des évaluateurs intégrés, vous pouvez créer des évaluateurs personnalisés adaptés à vos critères d’évaluation spécifiques. Les évaluateurs personnalisés vous permettent de définir une logique de scoring unique, des règles de validation et des métriques de qualité qui s’alignent sur vos besoins métier et les besoins spécifiques à l’application.

Pour en savoir plus, consultez Évaluateurs personnalisés.

Niveaux d’évaluation

Chaque évaluateur prend en charge des niveaux d’évaluation spécifiques, indiqués par le supported_evaluation_levels champ dans le catalogue d’évaluateurs :

Level Description
turn Évalue les réponses individuelles de l’agent (par défaut)
conversation Évalue l’intégralité des conversations multitours

Lors de la création d’une exécution d’évaluation, définissez-le evaluation_level pour correspondre aux niveaux pris en charge par vos évaluateurs. En cas d’omission, la valeur par défaut est turn.

Les évaluateurs au niveau de la conversation notent l’interaction complète plutôt que les tournures individuelles. Utilisez-les pour mesurer les résultats tels que la satisfaction des utilisateurs, l’achèvement des tâches sur plusieurs étapes ou la cohérence à l’échelle de la conversation.

Important

Tous les évaluateurs d’une exécution doivent prendre en charge l’élément spécifié evaluation_level. Vous ne pouvez pas combiner les évaluateurs avec des niveaux incompatibles dans la même exécution d’évaluation.

Combinaison d’évaluateurs

Pour une évaluation complète de la qualité, combinez plusieurs évaluateurs :

  • Applications RAG : Récupération + Soledness + Pertinence + Sécurité du contenu
  • Applications de l’agent : Précision de l’appel de l’outil + Respect des tâches + Résolution d’intention + Rubric + Sécurité du contenu
  • Applications de traduction : BLEU + METEOR + Fluency + Cohérence
  • Toutes les applications : Ajoutez des évaluateurs de risques et de sécurité (Haine et Injustice, Sexuel, Violence, Self-Harm) pour des pratiques responsables en IA