Exécuter des évaluations à partir du portail Microsoft Foundry

Important

Les éléments marqués (préversion) dans cet article sont actuellement en préversion publique. Cette préversion est fournie sans contrat de niveau de service. Nous vous déconseillons donc de l’utiliser dans des charges de travail de production. Certaines fonctionnalités peuvent ne pas être prises en charge ou avoir des fonctionnalités contraintes. Pour plus d’informations, consultez Conditions supplémentaires d'utilisation pour les versions préliminaires de Microsoft Azure.

Testez vos modèles et agents d’IA génératives en exécutant des évaluations qui mesurent les performances, la qualité et la sécurité. Utilisez des évaluations avant le déploiement pour valider le comportement ou après le déploiement pour surveiller la qualité de production. Les évaluations exécutent votre modèle ou agent sur des données de test et notent les sorties à l’aide d’évaluateurs intégrés ou personnalisés.

Cet article vous montre comment créer et exécuter des évaluations dans le portail Foundry.

Conditions préalables

  • Un abonnement Azure. Créez-en un gratuitement.

  • Un projet Microsoft Foundry. Créez un projet si vous n’en avez pas.

  • L’une des options suivantes, en fonction de votre cible d’évaluation :

    • Évaluation de l’agent : agent dans votre projet.
    • Évaluation du modèle : modèle déployé ou modèle disponible avec un accès instantané.
    • Évaluation du jeu de données : jeu de données de test au format CSV ou JSONL contenant des sorties de modèle ou d’agent préexistantes.
  • Connexion OpenAI Azure avec un modèle GPT déployé (par exemple, gpt-4.1-mini). Requis pour les évaluations de qualité assistées par l’IA.

  • Rôle d’utilisateur Foundry sur le projet Foundry. Pour plus d’informations, consultez le contrôle d’accès basé sur les rôles pour Microsoft Foundry.

    Important

    Les rôles Foundry RBAC ont été récemment renommés. Foundry User, Foundry Owner, Propriétaire du compteFoundry et Foundry Project Manager ont été précédemment nommés Azure utilisateur IA, Azure propriétaire d’IA, propriétaire Azure compte IA et Azure gestionnaire Project IA. Il se peut que vous voyiez encore les anciens noms à certains endroits pendant le déploiement de ce changement de nom. Les ID de rôle et les autorisations de base ne sont pas modifiés par ce changement de nom.

Choisir une approche d’évaluation

Sélectionnez une approche d’évaluation en fonction de ce que vous souhaitez tester :

Cible Scope Source de données Idéal pour
Agent Conversations complètes Données simulées Test du comportement de l’agent de bout en bout avec des scénarios synthétiques avant le déploiement.
Agent Conversations complètes Conversations existantes Évaluation des interactions réelles des utilisateurs pour surveiller la qualité de la production.
Agent Tours de parole individuels Jeu de données existant Débogage de réponses spécifiques de l’agent, test de l’utilisation des outils, analyse fine.
Agent Tours de parole individuels Données synthétiques Tests de scénarios Q&R à tour unique ou de RAG à l’aide de requêtes générées.
Agent Tours de parole individuels Traces existantes Évaluation des traces historiques d’agent issues de votre projet.
Modèle Tours de parole individuels Données synthétiques Test des achèvements de modèle avec des requêtes générées.
Modèle Tours de parole individuels Jeu de données existant Évaluation des performances du modèle par rapport à un jeu de tests organisé.
Dataset Tours de parole individuels (Le jeu de données est la cible) Évaluation des sorties préexistantes sans réexécuter le modèle ou l’agent.

Tip

Commencez par Agent > Conversations complètes > Données simulées pour tester le comportement de votre agent dans des scénarios contrôlés. Utilisez Conversations existantes lorsque votre agent est en production pour surveiller les performances en conditions réelles.

Créer une évaluation

Vous pouvez démarrer une évaluation à partir de plusieurs emplacements dans le portail Foundry :

  • Page d’évaluation : dans le volet gauche, sélectionnez Création d’évaluation>.
  • Page Modèles : Accédez à votre modèle, sélectionnez l’onglet Évaluation , puis sélectionnez Créer.
  • Page Agents : Accédez à votre agent, sélectionnez l’onglet Évaluation , puis sélectionnez Créer.
  • Terrain de jeu de l’agent : accédez à votre agent, sélectionnez l’onglet Terrain de jeu, puis sélectionnez Métriques, >.

Étape 1 : Sélectionner la cible d’évaluation

Lorsque vous créez une évaluation, choisissez d’abord la cible d’évaluation. La cible détermine sur quoi l’évaluation porte.

Cible Description
Agent Évalue la sortie générée par votre agent sélectionné et l’entrée définie par l’utilisateur. Fonctionne pour les agents à la demande et les agents hébergés.
Modèle Évalue la sortie générée par votre modèle sélectionné et l’invite définie par l’utilisateur.
Dataset Évalue les sorties préexistantes d’un modèle ou d’un agent à partir d’un jeu de données de test.
Traces Évalue les interactions de l’agent déjà capturées dans Application Insights. Sélectionnez l’agent et l’intervalle de temps, et le portail récupère les traces correspondantes pour l’évaluation. Pour l'équivalent du SDK, consultez Évaluation de trace.

Tip

Accès instantané : l’accès instantané est des modèles sans déploiement que vous pouvez utiliser immédiatement sans créer de déploiement. Lors de la création d’une évaluation, vous pouvez sélectionner un modèle instantané comme cible d’évaluation ou le modèle de juge directement à partir du sélecteur de modèles.

Étape 2 : Sélectionner l’étendue d’évaluation

Note

Cette étape s’affiche uniquement pour les cibles de l’agent et du jeu de données . Les évaluations Modèle utilisent toujours des tours individuels.

Choisissez la façon dont vous souhaitez évaluer les performances de votre agent :

Scope Description Idéal pour
Conversations complètes (préversion) Évalue des conversations multitours complètes du début à la fin. Mesure la qualité globale des conversations, l’achèvement des tâches et la satisfaction des utilisateurs. Test des expériences de l’agent de bout en bout, de la satisfaction des clients et du flux de conversation.
Tours de parole individuels Évalue les réponses individuelles de l’agent dans les conversations. Mesure les métriques par tour, telles que la précision de la sélection des outils et la qualité de la réponse. Débogage de comportements d’agent spécifiques, test de l’utilisation de l’outil et analyse affinée.

Étape 3 : Sélectionner la source de données

Les options de source de données dépendent de votre cible d’évaluation et de votre étendue.

Pour les évaluations des conversations (agent > conversations complètes) (préversion)

Choisissez l’emplacement de vos données de conversation :

Données simulées

Générez des conversations synthétiques en exécutant votre agent sur des descriptions de scénarios issues d’un jeu de données. Utilisez cette option pour tester le comportement de votre agent dans des scénarios contrôlés avant le déploiement.

  1. Sélectionnez Données simulées.

  2. Sélectionnez Générer pour ouvrir la boîte de dialogue de configuration de simulation.

  3. Sélectionnez votre fichier : choisissez un jeu de données contenant des descriptions de scénarios. Chaque ligne de votre jeu de données décrit un scénario que vous utilisez pour générer une conversation simulée.

    Capture d’écran montrant l’aperçu du jeu de données dans la boîte de dialogue de simulation.

  4. Sélectionnez un modèle : choisissez le modèle qui simule l’utilisateur dans la conversation :

    • gpt-4.1 (recommandé pour les scénarios complexes)
    • gpt-4o
    • gpt-4o-mini
    • gpt-4.1-mini
  5. Configurer les paramètres de simulation :

    • Nombre de conversations simulées par scénario : nombre de conversations à générer pour chaque ligne de votre jeu de données (1 à 5). Plusieurs conversations par scénario permettent d’identifier la variance dans le comportement de l’agent.
    • Nombre de tours par conversation : nombre maximal de tours autorisés par conversation (1 à 50). La conversation se termine lorsque la tâche est terminée ou que cette limite est atteinte.
  6. Sélectionnez Confirmer pour enregistrer votre configuration de simulation.

Conversations existantes

Évaluez les conversations réelles que votre agent avait déjà avec les utilisateurs.

  1. Sélectionnez Conversations existantes.
  2. Configurer les options de filtrage :
    • Nombre de conversations : nombre maximal de conversations à échantillonner à partir de la plage de dates (1 à 100).
    • Intervalle de temps : filtrer les conversations par période. Utilisez des filtres rapides (Dernier jour, 7D, 1M, 3M) ou sélectionnez une plage de dates personnalisée.
  3. Parcourez et sélectionnez des conversations spécifiques à inclure dans l’évaluation.

Pour les évaluations de tours individuels

Choisissez l’emplacement de vos données d’évaluation :

Données synthétiques

Générez des requêtes de test à l’aide de l’IA. Sélectionnez Synthétique et configurez le nombre de lignes et une invite qui décrit les données à générer. Vous pouvez également charger des fichiers pour améliorer la pertinence.

Note

La génération de données synthétiques nécessite un modèle avec la fonctionnalité API Réponses. Pour plus d’informations sur la disponibilité, consultez la disponibilité de la région de l’API Réponses.

Jeu de données existant

Utilisez un jeu de données préparé au format CSV ou JSONL. Sélectionnez un jeu de données existant et choisissez un fichier dans les ressources de données de votre projet. Seuls les formats de fichiers CSV et JSONL sont pris en charge.

Traces existantes (agent uniquement)

Évaluez les traces d’agent historiques de votre projet. Sélectionnez les traces existantes et filtrez par plage de dates pour sélectionner les traces.

Contenu multimodal (aperçu)

Toutes les cibles d’évaluation prennent en charge le contenu audio et image. Chaque type de contenu utilise un schéma JSONL spécifique :

Contenu de l’image :

  • image_url: Image en tant qu’URI de données (par exemple) data:image/png;base64,...ou URL accessible publiquement.
  • caption: description textuelle du contenu de l’image.
{"image_url": "data:image/png;base64,iVBOR...", "caption": "A red to blue color gradient"}

Contenu audio :

  • audio_data: l’audio en tant qu’URI de données avec des données WAV encodées en base64 (par exemple). data:audio/wav;base64,...
  • expected: description textuelle du contenu audio attendu.

Note

Seul le format audio WAV est actuellement pris en charge.

{"audio_data": "data:audio/wav;base64,UklGR...", "expected": "A short beep tone at 440 Hz"}

Les jeux de données peuvent également utiliser le format de messages de chat, où les données audio et image sont incorporées dans une seule colonne de message de chat sous forme d'URI de données ou d'URL publiques accessibles.

L’exemple suivant montre une colonne de jeu de données de conversation avec du contenu image et audio incorporé :

[
  {
    "role": "system",
    "content": "..."
  },
  {
    "role": "user",
    "content": [
      {
        "type": "text",
        "text": "What are in these images?"
      },
      {
        "type": "image_url",
        "image_url": {
          "url": "https://example.com/path/image.png"
        }
      },
      {
        "type": "image_url",
        "image_url": {
          "url": "data:image/png;base64,iVBORw0KGgo..."
        }
      }
    ]
  },
  {
    "role": "assistant",
    "content": "..."
  },
  {
    "role": "user",
    "content": [
      {
        "type": "text",
        "text": "Tell me the tones for the voices?"
      },
      {
        "type": "input_audio",
        "input_audio": {
          "data": "https://example.com/path/voice.wav",
          "format": "wav"
        }
      },
      {
        "type": "input_audio",
        "input_audio": {
          "data": "data:audio/wav;base64,UklGRigAAA...",
          "format": "wav"
        }
      }
    ]
  }
]

Vous pouvez afficher un aperçu des images et lire des clips audio directement dans le flux de création d’évaluation et dans la vue des résultats de l’évaluation.

Étape 4 : Configurer des agents

Note

Cette étape s’affiche uniquement pour les évaluations de l’agent .

Personnalisez le comportement de votre agent pendant l’évaluation :

  1. Passez en revue la liste des agents impliqués dans votre évaluation.
  2. Pour chaque agent, sélectionnez Configurer pour personnaliser son comportement :
    • Prompt système : Modifier les instructions de l’agent pour l’évaluation.
    • Invite de l’utilisateur : spécifiez la façon dont chaque élément de jeu de données est envoyé à votre agent pendant l’évaluation.
  3. La session d’évaluation préserve les configurations de l’agent.

Configuration de la requête utilisateur

L’invite utilisateur définit la façon dont les entrées de test sont passées à votre agent. Par défaut, le portail utilise {{item.query}} pour passer la requête de jeu de données directement à votre agent.

Dans la plupart des cas, vous pouvez utiliser la valeur par défaut. Modifiez cette valeur uniquement si votre agent attend un autre format d’entrée. Par exemple, si votre agent utilise un protocole d’agent hébergé ou nécessite une entrée structurée avec des champs supplémentaires.

Modèles courants :

Format Quand utiliser
{{item.query}} Default. Transmet directement le champ de requête de votre jeu de données.
{{item.messages}} Pour les agents qui attendent l’historique des conversations comme entrée.
JSON personnalisé Pour les agents hébergés ou les API qui nécessitent des corps de requête structurés.

Tip

Utilisez des invites personnalisées pour tester des cas de périphérie ou des scénarios spécifiques qui peuvent ne pas se produire naturellement dans votre jeu de données.

Étape 5 : Configurer le mappage de champs

Note

Cette étape s’affiche lorsque vous utilisez des données existantes (conversations existantes, jeu de données existant ou traces existantes).

Mappez vos champs de données aux champs attendus par chaque évaluateur. Les champs obligatoires dépendent de votre étendue d’évaluation.

Pour les évaluations de conversations (multitours)

Champ Description Obligatoire
messages Les messages de conversation au format de chat. Oui
tool_definitions Définitions d’outil ou de fonction disponibles pour l’agent. Oui

Pour les évaluations de tours individuels (à tour unique)

Champ Description Obligatoire
query La requête ou l’instruction de l’utilisateur. Oui
response Modèle ou réponse de l’agent. Oui
context Contexte récupéré pour les scénarios RAG. Non
ground_truth Réponse correcte attendue pour la comparaison. Non
tool_calls Appels d’outils effectués par l’agent. Non
tool_definitions Définitions d’outils disponibles. Non

Le portail tente automatiquement de mapper vos champs de jeu de données. Si un champ s’affiche comme non attribué, sélectionnez la liste déroulante pour affecter manuellement une colonne à partir de votre jeu de données.

Note

Les champs obligatoires sont marqués d’un astérisque (*). Les évaluateurs échouent si les champs requis sont laissés non attribués.

Étape 6 : Sélectionner des critères de test

Sélectionnez les évaluateurs à utiliser pour votre évaluation. Microsoft Foundry fournit trois catégories d’évaluateurs intégrés. Les évaluateurs disponibles dépendent de votre étendue d’évaluation.

Les évaluateurs d’agents

Évaluez la façon dont les agents gèrent efficacement les tâches, les outils et l’intention de l’utilisateur. Disponible uniquement pour le périmètre Tours individuels.

Évaluateur Description
Résolution des intentions Mesure si l’agent a correctement identifié et traité l’intention de l’utilisateur.
Conformité aux tâches Mesure la façon dont l’agent a suivi les instructions et les contraintes.
Appel d’outil réussi Évalue si les appels d’outil sont exécutés avec succès.
Sélection de l’outil Mesure si l’agent a sélectionné les outils appropriés pour la tâche.
Utilisation de la sortie de l’outil Évalue dans quelle mesure l’agent a utilisé efficacement les résultats produits par les outils dans ses réponses.
Précision d’entrée de l’outil Mesure si l’agent a fourni des entrées correctes aux outils.
Précision des appels d’outil Précision globale de l’utilisation des outils.

Évaluateurs de qualité

Mesurez la qualité globale des réponses générées. La plupart des évaluateurs de qualité sont disponibles pour toutes les étendues d’évaluation. Les évaluateurs marqués d’une étoile ★ prennent en charge à la fois l’analyse au niveau de la conversation et l’analyse au niveau des tours.

Évaluateur Description Prise en charge des conversations
Satisfaction des clients Prédit la satisfaction des utilisateurs avec l’interaction de l’agent.
Achèvement de la tâche Évalue si l’agent a correctement terminé la tâche demandée.
Cohérence Mesure le flux logique et la cohérence des réponses.
Groundedness Mesure si les réponses sont ancrées dans le contexte fourni.
Complétivité de la réponse Évalue si les réponses répondent entièrement aux requêtes utilisateur.
Fluency Évalue la qualité du langage naturel.
Relevance Évalue la pertinence des réponses par rapport à la requête.

Évaluateurs de sécurité

Identifiez les risques potentiels liés au contenu et à la sécurité. Disponible uniquement pour le périmètre Tours individuels.

Évaluateur Description
Violence Détecte le contenu violent dans les réponses.
Sexuel Détecte le contenu sexuel.
Auto-préjudice Détecte le contenu lié à l’auto-préjudice.
Haine/injustice Détecte le contenu haineux ou biaisé.

Le portail préélectionne les évaluateurs recommandés en fonction de votre cible d’évaluation et de votre étendue :

  • Conversations complètes : Satisfaction des clients, Achèvement des tâches, Cohérence, Fondement
  • Tours individuels (données existantes) : tous les évaluateurs d’agent ainsi que les évaluateurs de qualité et de sécurité
  • Tours individuels (synthétiques/traces) : pertinence, ancrage, fluidité, cohérence

Tip

Vous pouvez ajouter ou supprimer des évaluateurs en fonction des besoins. Sélectionnez évaluateurs personnalisés pour utiliser les évaluateurs que vous avez définis dans votre projet.

Étape 7 : Vérifier et envoyer

  1. Entrez un nom pour votre évaluation.
  2. Passez en revue votre configuration :
    • Cible et étendue d’évaluation
    • Source de données et jeu de données
    • Évaluateurs sélectionnés
    • Mappages de champs (le cas échéant)
  3. Sélectionnez Envoyer pour démarrer l’évaluation.

Une fois que vous avez envoyé votre formulaire, le processus d'évaluation démarre. Les évaluations se terminent généralement en quelques minutes, en fonction de la taille du jeu de données et du nombre de conversations simulées.

Pour vérifier que votre évaluation a démarré correctement :

  1. Dans le volet gauche, sélectionnez Évaluation.
  2. Recherchez votre évaluation dans la liste. La colonne État affiche l’état actuel :
    • En cours : l’évaluation est en cours d’exécution.
    • Terminé : l’évaluation s’est terminée avec succès.
    • Partiel : certains évaluateurs ont terminé mais d’autres ont échoué.
    • Échec : l’évaluation a rencontré une erreur.

Pour afficher les résultats détaillés, sélectionnez le nom de l’évaluation ou consultez Afficher les résultats de l’évaluation.

Tip

Pour les flux de travail d’évaluation par programmation, utilisez le sdk d’évaluation IA Azure. Découvrez comment exécuter l’évaluation par lots avec le Kit de développement logiciel (SDK).

Résolution des problèmes

L’évaluation dépasse le délai imparti ou s’exécute lentement

  • Réduisez le nombre de conversations ou de lignes de jeu de données.
  • Pour les simulations, diminuez les tours maximum par conversation.
  • Vérifiez que votre modèle de juge dispose d’un quota suffisant.

Erreurs de mappage de champs

  • Vérifiez que votre jeu de données contient les colonnes requises pour votre étendue d’évaluation.
  • Pour les évaluations de conversation, vérifiez que la colonne des messages contient des messages de conversation correctement mis en forme.
  • Vérifiez que les noms de colonnes dans votre jeu de données correspondent aux noms de champs attendus.

Quota de modèle dépassé

  • Le modèle de juge utilisé pour les évaluations assistées par l’IA est comptabilisé dans votre quota Azure OpenAI.
  • Utilisez un jeu de données plus petit ou attendez l’actualisation du quota.
  • Envisagez d’utiliser gpt-4.1-mini plutôt que gpt-4.1 pour des évaluations économiques.

Bonnes pratiques

Pour les évaluations basées sur la simulation

  • Commencez petit : Commencez par 1 conversation par scénario et 5 à 10 tours pour valider votre configuration avant de monter en puissance.
  • Scénarios variés : incluez une variété de descriptions de scénarios pour tester différentes fonctionnalités d’agent.
  • Itérer sur les invites : si les agents se comportent de manière inattendue, utilisez l’étape Configurer les agents pour ajuster les invites.

Pour les évaluations de conversations existantes

  • Exemple représentatif : sélectionnez des conversations qui représentent des interactions utilisateur classiques.
  • Inclure des cas de périphérie : n’évaluez pas simplement les conversations réussies, notamment les scénarios difficiles.
  • Évaluation régulière : Planifiez des évaluations périodiques pour suivre les performances de l’agent au fil du temps.

Pour les évaluations du modèle

  • Jeux de données de test : utilisez des jeux de données standardisés pour comparer les performances des modèles entre les versions.
  • Testez à la fois l’accès déployé et instantané : comparez vos déploiements affinés aux modèles de base.

Pour les évaluations de jeux de données

  • Sorties de pré-calcul : générez des sorties hors connexion et évaluez en bloc pour optimiser les coûts.
  • Versionnez vos jeux de données : suivez quelle version du jeu de données a produit quels résultats d’évaluation.

Conseils généraux

  • Comparez les évaluateurs : exécutez les mêmes données via plusieurs évaluateurs pour obtenir une vue complète.
  • Suivre les tendances : utilisez l’historique d’évaluation pour identifier les améliorations de performances ou les régressions.
  • Exploitez les résultats : utilisez les enseignements tirés de l’évaluation pour affiner les prompts de l’agent, les définitions d’outils et les configurations.

En savoir plus sur l’évaluation de vos modèles et agents d’IA génératives :