Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Un jeu de données d’évaluation est une collection réutilisable de cas de test pour mesurer la qualité du modèle ou de l’agent. Les jeux de données d’évaluation utilisent généralement JSONL, avec un objet JSON par ligne. Cet article explique quand utiliser un jeu de données réutilisable, comment les données d’évaluation sont organisées et les méthodes disponibles pour les préparer.
Avez-vous besoin d’un jeu de données d’évaluation ?
Créez un jeu de données lorsque vous souhaitez un jeu de tests stable que vous pouvez réexécuter sur différents modèles, invites ou versions de l’agent. Les jeux de données réutilisables sont bien adaptés aux tests de régression, aux jalons de qualité CI/CD et aux comparaisons d’un cycle d’évaluation à l’autre.
Vous n’avez pas toujours besoin d’un jeu de données. Si votre agent Foundry a déjà des réponses ou que votre application émet des traces vers Application Insights, vous pouvez évaluer ces données là où elles existent. Consultez Évaluer les interactions par ID de réponse et Évaluer les traces.
Utilisation des données d’évaluation par Foundry
Dans un jeu de données JSONL, le messages champ représente des interactions de modèle ou d’agent. Chaque message identifie un rôle et son contenu.
Si votre jeu de données contient des réponses terminées, Foundry évalue ces réponses directement. Si vous exécutez l’évaluation sur un modèle ou un agent, Foundry génère une nouvelle réponse pour chaque entrée et évalue cette réponse. Toute réponse déjà stockée dans le jeu de données est ignorée.
Par exemple, considérez un utilisateur qui ne peut pas se connecter. L’agent demande quelle erreur s’affiche, l’utilisateur indique que son mot de passe est rejeté et que l’agent recommande une réinitialisation de mot de passe. L’évaluation au niveau du tour évalue une réponse d’agent individuelle, telle que les instructions de réinitialisation de mot de passe, en utilisant les messages précédents comme contexte. L’évaluation à l’échelle de la conversation évalue l’ensemble de l’interaction.
Le paramètre evaluation_level de l’exécution détermine la granularité de notation.
Le jeu de données et les évaluateurs sélectionnés doivent prendre en charge ce niveau. Pour plus d’informations, consultez Choisir un niveau d’évaluation.
Pour obtenir des colonnes et des exemples standard, consultez le schéma du jeu de données d’évaluation.
Choisir comment préparer les données d’évaluation
| Situation | Approche recommandée |
|---|---|
| Vous avez organisé des données d’évaluation | Chargez-le en tant que jeu de données Foundry versionné ou fournissez un petit jeu de données inline. Consultez Préparer les données d’entrée. |
| Vous souhaitez examiner et réutiliser les cas de test générés avant d’exécuter une évaluation | Générez un jeu de données d’évaluation synthétique à partir d’une définition d’agent, d’une invite inline ou d’un fichier de référence. |
| Vous souhaitez un jeu de données réutilisable basé sur le trafic de production | Convertissez des traces en un jeu de données. |
| Vous souhaitez tester des scénarios à plusieurs tours simulés | Générez un jeu de données de départ de simulation ou créez des scénarios de cas de test en tant que JSONL, puis simulez des conversations. |
| Vous avez des identifiants de réponse Foundry | Évaluez les interactions par ID de réponse sans créer de jeu de données. |
| Vous souhaitez évaluer les traces Application Insights existantes | Évaluez les traces sans créer de jeu de données. |
| Vous souhaitez générer des requêtes, appeler une cible et évaluer ses réponses dans un flux de travail | Générez des requêtes synthétiques pendant l’exécution de l’évaluation. Foundry enregistre les requêtes générées en tant que jeu de données à réutiliser. |