Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Important
Les éléments marqués (préversion) dans cet article sont actuellement en préversion publique. Cette préversion est fournie sans contrat de niveau de service. Nous vous déconseillons donc de l’utiliser dans des charges de travail de production. Certaines fonctionnalités peuvent ne pas être prises en charge ou avoir des fonctionnalités contraintes. Pour plus d’informations, consultez Conditions supplémentaires d'utilisation pour les versions préliminaires de Microsoft Azure.
Testez vos modèles et agents d’IA génératives en exécutant des évaluations qui mesurent les performances, la qualité et la sécurité. Utilisez des évaluations avant le déploiement pour valider le comportement ou après le déploiement pour surveiller la qualité de production. Les évaluations exécutent votre modèle ou agent sur des données de test et notent les sorties à l’aide d’évaluateurs intégrés ou personnalisés.
Cet article vous montre comment créer et exécuter des évaluations dans le portail Foundry.
Conditions préalables
Un abonnement Azure. Créez-en un gratuitement.
Un projet Microsoft Foundry. Créez un projet si vous n’en avez pas.
L’une des options suivantes, en fonction de votre cible d’évaluation :
- Évaluation de l’agent : agent dans votre projet.
- Évaluation du modèle : modèle déployé ou modèle disponible avec un accès instantané.
- Évaluation du jeu de données : jeu de données de test au format CSV ou JSONL contenant des sorties de modèle ou d’agent préexistantes.
Connexion OpenAI Azure avec un modèle GPT déployé (par exemple,
gpt-4.1-mini). Requis pour les évaluations de qualité assistées par l’IA.Rôle d’utilisateur Foundry sur le projet Foundry. Pour plus d’informations, consultez le contrôle d’accès basé sur les rôles pour Microsoft Foundry.
Important
Les rôles Foundry RBAC ont été récemment renommés. Foundry User, Foundry Owner, Propriétaire du compteFoundry et Foundry Project Manager ont été précédemment nommés Azure utilisateur IA, Azure propriétaire d’IA, propriétaire Azure compte IA et Azure gestionnaire Project IA. Il se peut que vous voyiez encore les anciens noms à certains endroits pendant le déploiement de ce changement de nom. Les ID de rôle et les autorisations de base ne sont pas modifiés par ce changement de nom.
Choisir une approche d’évaluation
Sélectionnez une approche d’évaluation en fonction de ce que vous souhaitez tester :
| Cible | Scope | Source de données | Idéal pour |
|---|---|---|---|
| Agent | Conversations complètes | Données simulées | Test du comportement de l’agent de bout en bout avec des scénarios synthétiques avant le déploiement. |
| Agent | Conversations complètes | Conversations existantes | Évaluation des interactions réelles des utilisateurs pour surveiller la qualité de la production. |
| Agent | Tours de parole individuels | Jeu de données existant | Débogage de réponses spécifiques de l’agent, test de l’utilisation des outils, analyse fine. |
| Agent | Tours de parole individuels | Données synthétiques | Tests de scénarios Q&R à tour unique ou de RAG à l’aide de requêtes générées. |
| Agent | Tours de parole individuels | Traces existantes | Évaluation des traces historiques d’agent issues de votre projet. |
| Modèle | Tours de parole individuels | Données synthétiques | Test des achèvements de modèle avec des requêtes générées. |
| Modèle | Tours de parole individuels | Jeu de données existant | Évaluation des performances du modèle par rapport à un jeu de tests organisé. |
| Dataset | Tours de parole individuels | (Le jeu de données est la cible) | Évaluation des sorties préexistantes sans réexécuter le modèle ou l’agent. |
Tip
Commencez par Agent > Conversations complètes > Données simulées pour tester le comportement de votre agent dans des scénarios contrôlés. Utilisez Conversations existantes lorsque votre agent est en production pour surveiller les performances en conditions réelles.
Créer une évaluation
Vous pouvez démarrer une évaluation à partir de plusieurs emplacements dans le portail Foundry :
- Page d’évaluation : dans le volet gauche, sélectionnez Création d’évaluation>.
- Page Modèles : Accédez à votre modèle, sélectionnez l’onglet Évaluation , puis sélectionnez Créer.
- Page Agents : Accédez à votre agent, sélectionnez l’onglet Évaluation , puis sélectionnez Créer.
- Terrain de jeu de l’agent : accédez à votre agent, sélectionnez l’onglet Terrain de jeu, puis sélectionnez Métriques, >.
Étape 1 : Sélectionner la cible d’évaluation
Lorsque vous créez une évaluation, choisissez d’abord la cible d’évaluation. La cible détermine sur quoi l’évaluation porte.
| Cible | Description |
|---|---|
| Agent | Évalue la sortie générée par votre agent sélectionné et l’entrée définie par l’utilisateur. Fonctionne pour les agents à la demande et les agents hébergés. |
| Modèle | Évalue la sortie générée par votre modèle sélectionné et l’invite définie par l’utilisateur. |
| Dataset | Évalue les sorties préexistantes d’un modèle ou d’un agent à partir d’un jeu de données de test. |
| Traces | Évalue les interactions de l’agent déjà capturées dans Application Insights. Sélectionnez l’agent et l’intervalle de temps, et le portail récupère les traces correspondantes pour l’évaluation. Pour l'équivalent du SDK, consultez Évaluation de trace. |
Tip
Accès instantané : l’accès instantané est des modèles sans déploiement que vous pouvez utiliser immédiatement sans créer de déploiement. Lors de la création d’une évaluation, vous pouvez sélectionner un modèle instantané comme cible d’évaluation ou le modèle de juge directement à partir du sélecteur de modèles.
Étape 2 : Sélectionner l’étendue d’évaluation
Note
Cette étape s’affiche uniquement pour les cibles de l’agent et du jeu de données . Les évaluations Modèle utilisent toujours des tours individuels.
Choisissez la façon dont vous souhaitez évaluer les performances de votre agent :
| Scope | Description | Idéal pour |
|---|---|---|
| Conversations complètes (préversion) | Évalue des conversations multitours complètes du début à la fin. Mesure la qualité globale des conversations, l’achèvement des tâches et la satisfaction des utilisateurs. | Test des expériences de l’agent de bout en bout, de la satisfaction des clients et du flux de conversation. |
| Tours de parole individuels | Évalue les réponses individuelles de l’agent dans les conversations. Mesure les métriques par tour, telles que la précision de la sélection des outils et la qualité de la réponse. | Débogage de comportements d’agent spécifiques, test de l’utilisation de l’outil et analyse affinée. |
Étape 3 : Sélectionner la source de données
Les options de source de données dépendent de votre cible d’évaluation et de votre étendue.
Pour les évaluations des conversations (agent > conversations complètes) (préversion)
Choisissez l’emplacement de vos données de conversation :
Données simulées
Générez des conversations synthétiques en exécutant votre agent sur des descriptions de scénarios issues d’un jeu de données. Utilisez cette option pour tester le comportement de votre agent dans des scénarios contrôlés avant le déploiement.
Sélectionnez Données simulées.
Sélectionnez Générer pour ouvrir la boîte de dialogue de configuration de simulation.
Sélectionnez votre fichier : choisissez un jeu de données contenant des descriptions de scénarios. Chaque ligne de votre jeu de données décrit un scénario que vous utilisez pour générer une conversation simulée.
Sélectionnez un modèle : choisissez le modèle qui simule l’utilisateur dans la conversation :
-
gpt-4.1(recommandé pour les scénarios complexes) gpt-4ogpt-4o-minigpt-4.1-mini
-
Configurer les paramètres de simulation :
- Nombre de conversations simulées par scénario : nombre de conversations à générer pour chaque ligne de votre jeu de données (1 à 5). Plusieurs conversations par scénario permettent d’identifier la variance dans le comportement de l’agent.
- Nombre de tours par conversation : nombre maximal de tours autorisés par conversation (1 à 50). La conversation se termine lorsque la tâche est terminée ou que cette limite est atteinte.
Sélectionnez Confirmer pour enregistrer votre configuration de simulation.
Conversations existantes
Évaluez les conversations réelles que votre agent avait déjà avec les utilisateurs.
- Sélectionnez Conversations existantes.
- Configurer les options de filtrage :
- Nombre de conversations : nombre maximal de conversations à échantillonner à partir de la plage de dates (1 à 100).
- Intervalle de temps : filtrer les conversations par période. Utilisez des filtres rapides (Dernier jour, 7D, 1M, 3M) ou sélectionnez une plage de dates personnalisée.
- Parcourez et sélectionnez des conversations spécifiques à inclure dans l’évaluation.
Pour les évaluations de tours individuels
Choisissez l’emplacement de vos données d’évaluation :
Données synthétiques
Générez des requêtes de test à l’aide de l’IA. Sélectionnez Synthétique et configurez le nombre de lignes et une invite qui décrit les données à générer. Vous pouvez également charger des fichiers pour améliorer la pertinence.
Note
La génération de données synthétiques nécessite un modèle avec la fonctionnalité API Réponses. Pour plus d’informations sur la disponibilité, consultez la disponibilité de la région de l’API Réponses.
Jeu de données existant
Utilisez un jeu de données préparé au format CSV ou JSONL. Sélectionnez un jeu de données existant et choisissez un fichier dans les ressources de données de votre projet. Seuls les formats de fichiers CSV et JSONL sont pris en charge.
Traces existantes (agent uniquement)
Évaluez les traces d’agent historiques de votre projet. Sélectionnez les traces existantes et filtrez par plage de dates pour sélectionner les traces.
Contenu multimodal (aperçu)
Toutes les cibles d’évaluation prennent en charge le contenu audio et image. Chaque type de contenu utilise un schéma JSONL spécifique :
Contenu de l’image :
-
image_url: Image en tant qu’URI de données (par exemple)data:image/png;base64,...ou URL accessible publiquement. -
caption: description textuelle du contenu de l’image.
{"image_url": "data:image/png;base64,iVBOR...", "caption": "A red to blue color gradient"}
Contenu audio :
-
audio_data: l’audio en tant qu’URI de données avec des données WAV encodées en base64 (par exemple).data:audio/wav;base64,... -
expected: description textuelle du contenu audio attendu.
Note
Seul le format audio WAV est actuellement pris en charge.
{"audio_data": "data:audio/wav;base64,UklGR...", "expected": "A short beep tone at 440 Hz"}
Les jeux de données peuvent également utiliser le format de messages de chat, où les données audio et image sont incorporées dans une seule colonne de message de chat sous forme d'URI de données ou d'URL publiques accessibles.
L’exemple suivant montre une colonne de jeu de données de conversation avec du contenu image et audio incorporé :
[
{
"role": "system",
"content": "..."
},
{
"role": "user",
"content": [
{
"type": "text",
"text": "What are in these images?"
},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/path/image.png"
}
},
{
"type": "image_url",
"image_url": {
"url": "data:image/png;base64,iVBORw0KGgo..."
}
}
]
},
{
"role": "assistant",
"content": "..."
},
{
"role": "user",
"content": [
{
"type": "text",
"text": "Tell me the tones for the voices?"
},
{
"type": "input_audio",
"input_audio": {
"data": "https://example.com/path/voice.wav",
"format": "wav"
}
},
{
"type": "input_audio",
"input_audio": {
"data": "data:audio/wav;base64,UklGRigAAA...",
"format": "wav"
}
}
]
}
]
Vous pouvez afficher un aperçu des images et lire des clips audio directement dans le flux de création d’évaluation et dans la vue des résultats de l’évaluation.
Étape 4 : Configurer des agents
Note
Cette étape s’affiche uniquement pour les évaluations de l’agent .
Personnalisez le comportement de votre agent pendant l’évaluation :
- Passez en revue la liste des agents impliqués dans votre évaluation.
- Pour chaque agent, sélectionnez Configurer pour personnaliser son comportement :
- Prompt système : Modifier les instructions de l’agent pour l’évaluation.
- Invite de l’utilisateur : spécifiez la façon dont chaque élément de jeu de données est envoyé à votre agent pendant l’évaluation.
- La session d’évaluation préserve les configurations de l’agent.
Configuration de la requête utilisateur
L’invite utilisateur définit la façon dont les entrées de test sont passées à votre agent. Par défaut, le portail utilise {{item.query}} pour passer la requête de jeu de données directement à votre agent.
Dans la plupart des cas, vous pouvez utiliser la valeur par défaut. Modifiez cette valeur uniquement si votre agent attend un autre format d’entrée. Par exemple, si votre agent utilise un protocole d’agent hébergé ou nécessite une entrée structurée avec des champs supplémentaires.
Modèles courants :
| Format | Quand utiliser |
|---|---|
{{item.query}} |
Default. Transmet directement le champ de requête de votre jeu de données. |
{{item.messages}} |
Pour les agents qui attendent l’historique des conversations comme entrée. |
| JSON personnalisé | Pour les agents hébergés ou les API qui nécessitent des corps de requête structurés. |
Tip
Utilisez des invites personnalisées pour tester des cas de périphérie ou des scénarios spécifiques qui peuvent ne pas se produire naturellement dans votre jeu de données.
Étape 5 : Configurer le mappage de champs
Note
Cette étape s’affiche lorsque vous utilisez des données existantes (conversations existantes, jeu de données existant ou traces existantes).
Mappez vos champs de données aux champs attendus par chaque évaluateur. Les champs obligatoires dépendent de votre étendue d’évaluation.
Pour les évaluations de conversations (multitours)
| Champ | Description | Obligatoire |
|---|---|---|
| messages | Les messages de conversation au format de chat. | Oui |
| tool_definitions | Définitions d’outil ou de fonction disponibles pour l’agent. | Oui |
Pour les évaluations de tours individuels (à tour unique)
| Champ | Description | Obligatoire |
|---|---|---|
| query | La requête ou l’instruction de l’utilisateur. | Oui |
| response | Modèle ou réponse de l’agent. | Oui |
| context | Contexte récupéré pour les scénarios RAG. | Non |
| ground_truth | Réponse correcte attendue pour la comparaison. | Non |
| tool_calls | Appels d’outils effectués par l’agent. | Non |
| tool_definitions | Définitions d’outils disponibles. | Non |
Le portail tente automatiquement de mapper vos champs de jeu de données. Si un champ s’affiche comme non attribué, sélectionnez la liste déroulante pour affecter manuellement une colonne à partir de votre jeu de données.
Note
Les champs obligatoires sont marqués d’un astérisque (*). Les évaluateurs échouent si les champs requis sont laissés non attribués.
Étape 6 : Sélectionner des critères de test
Sélectionnez les évaluateurs à utiliser pour votre évaluation. Microsoft Foundry fournit trois catégories d’évaluateurs intégrés. Les évaluateurs disponibles dépendent de votre étendue d’évaluation.
Les évaluateurs d’agents
Évaluez la façon dont les agents gèrent efficacement les tâches, les outils et l’intention de l’utilisateur. Disponible uniquement pour le périmètre Tours individuels.
| Évaluateur | Description |
|---|---|
| Résolution des intentions | Mesure si l’agent a correctement identifié et traité l’intention de l’utilisateur. |
| Conformité aux tâches | Mesure la façon dont l’agent a suivi les instructions et les contraintes. |
| Appel d’outil réussi | Évalue si les appels d’outil sont exécutés avec succès. |
| Sélection de l’outil | Mesure si l’agent a sélectionné les outils appropriés pour la tâche. |
| Utilisation de la sortie de l’outil | Évalue dans quelle mesure l’agent a utilisé efficacement les résultats produits par les outils dans ses réponses. |
| Précision d’entrée de l’outil | Mesure si l’agent a fourni des entrées correctes aux outils. |
| Précision des appels d’outil | Précision globale de l’utilisation des outils. |
Évaluateurs de qualité
Mesurez la qualité globale des réponses générées. La plupart des évaluateurs de qualité sont disponibles pour toutes les étendues d’évaluation. Les évaluateurs marqués d’une étoile ★ prennent en charge à la fois l’analyse au niveau de la conversation et l’analyse au niveau des tours.
| Évaluateur | Description | Prise en charge des conversations |
|---|---|---|
| Satisfaction des clients | Prédit la satisfaction des utilisateurs avec l’interaction de l’agent. | ★ |
| Achèvement de la tâche | Évalue si l’agent a correctement terminé la tâche demandée. | ★ |
| Cohérence | Mesure le flux logique et la cohérence des réponses. | ★ |
| Groundedness | Mesure si les réponses sont ancrées dans le contexte fourni. | ★ |
| Complétivité de la réponse | Évalue si les réponses répondent entièrement aux requêtes utilisateur. | — |
| Fluency | Évalue la qualité du langage naturel. | — |
| Relevance | Évalue la pertinence des réponses par rapport à la requête. | — |
Évaluateurs de sécurité
Identifiez les risques potentiels liés au contenu et à la sécurité. Disponible uniquement pour le périmètre Tours individuels.
| Évaluateur | Description |
|---|---|
| Violence | Détecte le contenu violent dans les réponses. |
| Sexuel | Détecte le contenu sexuel. |
| Auto-préjudice | Détecte le contenu lié à l’auto-préjudice. |
| Haine/injustice | Détecte le contenu haineux ou biaisé. |
Le portail préélectionne les évaluateurs recommandés en fonction de votre cible d’évaluation et de votre étendue :
- Conversations complètes : Satisfaction des clients, Achèvement des tâches, Cohérence, Fondement
- Tours individuels (données existantes) : tous les évaluateurs d’agent ainsi que les évaluateurs de qualité et de sécurité
- Tours individuels (synthétiques/traces) : pertinence, ancrage, fluidité, cohérence
Tip
Vous pouvez ajouter ou supprimer des évaluateurs en fonction des besoins. Sélectionnez évaluateurs personnalisés pour utiliser les évaluateurs que vous avez définis dans votre projet.
Étape 7 : Vérifier et envoyer
- Entrez un nom pour votre évaluation.
- Passez en revue votre configuration :
- Cible et étendue d’évaluation
- Source de données et jeu de données
- Évaluateurs sélectionnés
- Mappages de champs (le cas échéant)
- Sélectionnez Envoyer pour démarrer l’évaluation.
Une fois que vous avez envoyé votre formulaire, le processus d'évaluation démarre. Les évaluations se terminent généralement en quelques minutes, en fonction de la taille du jeu de données et du nombre de conversations simulées.
Pour vérifier que votre évaluation a démarré correctement :
- Dans le volet gauche, sélectionnez Évaluation.
- Recherchez votre évaluation dans la liste. La colonne État affiche l’état actuel :
- En cours : l’évaluation est en cours d’exécution.
- Terminé : l’évaluation s’est terminée avec succès.
- Partiel : certains évaluateurs ont terminé mais d’autres ont échoué.
- Échec : l’évaluation a rencontré une erreur.
Pour afficher les résultats détaillés, sélectionnez le nom de l’évaluation ou consultez Afficher les résultats de l’évaluation.
Tip
Pour les flux de travail d’évaluation par programmation, utilisez le sdk d’évaluation IA Azure. Découvrez comment exécuter l’évaluation par lots avec le Kit de développement logiciel (SDK).
Résolution des problèmes
L’évaluation dépasse le délai imparti ou s’exécute lentement
- Réduisez le nombre de conversations ou de lignes de jeu de données.
- Pour les simulations, diminuez les tours maximum par conversation.
- Vérifiez que votre modèle de juge dispose d’un quota suffisant.
Erreurs de mappage de champs
- Vérifiez que votre jeu de données contient les colonnes requises pour votre étendue d’évaluation.
- Pour les évaluations de conversation, vérifiez que la colonne des messages contient des messages de conversation correctement mis en forme.
- Vérifiez que les noms de colonnes dans votre jeu de données correspondent aux noms de champs attendus.
Quota de modèle dépassé
- Le modèle de juge utilisé pour les évaluations assistées par l’IA est comptabilisé dans votre quota Azure OpenAI.
- Utilisez un jeu de données plus petit ou attendez l’actualisation du quota.
- Envisagez d’utiliser
gpt-4.1-miniplutôt quegpt-4.1pour des évaluations économiques.
Bonnes pratiques
Pour les évaluations basées sur la simulation
- Commencez petit : Commencez par 1 conversation par scénario et 5 à 10 tours pour valider votre configuration avant de monter en puissance.
- Scénarios variés : incluez une variété de descriptions de scénarios pour tester différentes fonctionnalités d’agent.
- Itérer sur les invites : si les agents se comportent de manière inattendue, utilisez l’étape Configurer les agents pour ajuster les invites.
Pour les évaluations de conversations existantes
- Exemple représentatif : sélectionnez des conversations qui représentent des interactions utilisateur classiques.
- Inclure des cas de périphérie : n’évaluez pas simplement les conversations réussies, notamment les scénarios difficiles.
- Évaluation régulière : Planifiez des évaluations périodiques pour suivre les performances de l’agent au fil du temps.
Pour les évaluations du modèle
- Jeux de données de test : utilisez des jeux de données standardisés pour comparer les performances des modèles entre les versions.
- Testez à la fois l’accès déployé et instantané : comparez vos déploiements affinés aux modèles de base.
Pour les évaluations de jeux de données
- Sorties de pré-calcul : générez des sorties hors connexion et évaluez en bloc pour optimiser les coûts.
- Versionnez vos jeux de données : suivez quelle version du jeu de données a produit quels résultats d’évaluation.
Conseils généraux
- Comparez les évaluateurs : exécutez les mêmes données via plusieurs évaluateurs pour obtenir une vue complète.
- Suivre les tendances : utilisez l’historique d’évaluation pour identifier les améliorations de performances ou les régressions.
- Exploitez les résultats : utilisez les enseignements tirés de l’évaluation pour affiner les prompts de l’agent, les définitions d’outils et les configurations.
Contenu connexe
En savoir plus sur l’évaluation de vos modèles et agents d’IA génératives :
- Afficher les résultats de l’évaluation
- Informations de référence sur les évaluateurs intégrés
- Évaluateurs d’agents
- Évaluateurs de qualité
- Évaluateurs de sécurité
- Évaluateurs personnalisés
- Comment exécuter l’évaluation par lots avec le Kit de développement logiciel (SDK)
- Note de transparence pour les évaluations de sécurité de la fonderie