Code Génie pour l’observabilité et l’évaluation de l’agent

Genie Code fournit une interface de langage naturel pour comprendre, déboguer et améliorer vos applications GenAI dans MLflow. Il dispose d’un accès en lecture à tous les éléments de votre expérience, des traces, des invites et des jeux de données aux exécutions d’évaluation, aux scorers et aux sessions d’étiquetage. Vous pouvez ainsi explorer votre observabilité et vos données d’évaluation de manière interactive, sans avoir à rédiger de requêtes ou à naviguer entre plusieurs pages de l'interface utilisateur.

Pour commencer, cliquez sur l’icône Génie Code en haut à droite de votre espace de travail lors de l’affichage d’une expérience.

Code Génie pour l’observabilité et l’évaluation de l’agent

Capacités

Genie Code peut vous aider à effectuer un large éventail de tâches d’observabilité et d’évaluation, notamment :

  • Analyse et débogage des traces : examinez les traces défaillantes, trouvez des erreurs, examinez les arborescences d’étendues, identifiez les causes profondes, analysez la latence et identifiez les goulots d’étranglement dans le flux d’exécution de votre agent. Explorez en détail toute trace pour inspecter sa hiérarchie d’étendue complète, y compris les entrées, les sorties, les métadonnées et l’utilisation des jetons à chaque étape.
  • Métriques et performances : centiles de latence de calcul (P50/P95/P99), effectuez le suivi des taux d’erreur et du débit au fil du temps, analysez les modèles et coûts d’utilisation des jetons et comparez les performances sur différentes périodes ou filtres.
  • Qualité et évaluations : passez en revue les scores d’évaluation des commentaires humains, des juges LLM et des vérifications programmatiques. Inspectez les jeux de données d’évaluation, vérifiez les scoreurs enregistrés et leurs configurations, puis obtenez de l’aide pour configurer mlflow.genai.evaluate() avec les bons scoreurs.
  • Étiquetage et révision : affichez les sessions d’étiquetage et les personnes affectées à la révision des traces et inspectez les schémas d’étiquetage pour comprendre les critères de commentaires tels que les évaluations, les commentaires et les attentes.
  • Registre d’invites : parcourez les invites dans le catalogue Unity, affichez les modèles, les versions et les alias.
  • Guide d'instrumentation : obtenez de l’aide pour ajouter de la traçabilité à votre code avec autolog(), @mlflow.trace ou des périmètres manuels, avec des extraits de code exécutables que vous pouvez coller directement dans les carnets Azure Databricks.

Exemples de questions

Voici quelques points que vous pouvez demander au code Genie :

  • « Aidez-moi à identifier les problèmes liés aux appels d’outils de mon agent dans les traces de cette expérience au cours des 3 dernières heures »
  • « Identifier les cas où les utilisateurs sont frustrés dans les conversations avec mon agent »
  • « Quelles sessions ont les scores de commentaires des utilisateurs les plus bas et ce qui s’est passé dans ces conversations ? »
  • « Quels sont les modèles d’échec les plus courants dans mes traces de la semaine dernière et quels évaluateurs dois-je ajouter pour les détecter ? »
  • « Quelles étendues consomment le plus de jetons parmi l’ensemble de mes traces ? »
  • « Trouver des traces où le moteur de recherche n’a retourné aucun résultat, mais l’agent a quand même essayé de répondre »
  • « Aidez-moi à mettre en place l’évaluation de mon agent RAG avec les évaluateurs les plus appropriés »

Exigences

Pour utiliser Genie Code pour l’observabilité et l’évaluation de l’agent, votre espace de travail a besoin des éléments suivants :

Ressources supplémentaires