Appliquer le cadre de triage d’évaluation à travers des scénarios pratiques

Ces guides pas à pas illustrent comment les couches de cadre de triage d’évaluation fonctionnent ensemble en pratique. Chaque parcours commence par un scénario d’évaluation différent et suit un parcours diagnostique distinct.

Les guides montrent comment appliquer le cadre étape par étape. Utilisez ces exemples pour comprendre comment passer des résultats d’évaluation au diagnostic, à la remédiation et à la vérification dans des scénarios réels d’évaluation d’assistants.

Astuce

Avant de travailler sur ces exemples, passez en revue les objectifs du cadre, y compris les concepts et principes fondamentaux.

Parcours Situation de départ Ce que cela démontre
Parcours 1 Première séance d’évaluation Flux de bout en bout : Interpréter → prioriser → triage → remédier → vérifier
Parcours 2 Les scores stagnent après plusieurs itérations Analyse de modèle, reclassification et contournement des limites de plateforme
Parcours 3 Les scores régressent après un changement Détection de régression, diagnostic des conflits d’instructions et résolution par compromis

Note

Ces exemples sont illustratifs et basés sur des modèles courants observés lors de plusieurs évaluations clients. Les cas de test, les scores et les détails des assistants sont des ensembles représentatifs plutôt que des données issues d’un seul engagement. Les approches diagnostiques et stratégies de remédiation présentées reflètent les pratiques utilisées dans de vraies implémentations.

Parcours 1 : Première séance d’évaluation

Vous exécutez votre suite d’évaluation pour la première fois sur un assistant du service client. Voici les résultats :

Ensemble d’évaluation Taux de réussite
Données personnelles et de sécurité 100 %
Questions et réponses métier principales 87 %
Ancrage des connaissances 71 %
Invocation d’outil 92 %
Routage des déclencheurs 88 %
Ton et qualité 83 %
Escalade 90 %
Global 85 %

Étape 1 : Interpréter les scores (Couche 1)

Utilisez le tableau d’interprétation des scores pour calibrer les seuils et identifier quels ensembles d’évaluation sont en dessous des seuils de blocage.

Ensemble d’évaluation Score Seuil Statut
Données personnelles et de sécurité 100 % Blocage à 95 % Réussite
Questions et réponses métier principales 87 % Blocage à 80 % Réussite
Ancrage des connaissances 71 % Blocage à 80 % En dessous du blocage
Invocation d’outil 92 % Blocage à 85 % Réussite
Routage des déclencheurs 88 % Blocage à 80 % Réussite
Ton et qualité 83 % Blocage à 75 % Réussite
Escalade 90 % Blocage à 85 % Réussite

Évaluation de l’aptitude : itérer. L’ancrage des connaissances est en dessous de son seuil bloquant. Concentrez les actions de remédiation sur cet aspect.

Étape 2 : Prioriser les échecs (Couche 2, Étape 0)

Situation : L’ancrage des connaissances comporte sept cas tests. Deux cas de test échouent : KG-003 et KG-005. Les deux cas de test font partie d’un ensemble d’évaluation métier central, donc ils ont la priorité 2. Étant donné qu’il n’y en a que deux, effectuez un triage des deux.

Référence : Prioriser les échecs (Couche 2, Étape 0)

Étape 3: Triage de KG-003 (Couche 2, étapes 1 à 2)

Cas de test KG-003 :

  • Exemple d’entrée : « Quelle est votre politique de retour ? »
  • Réponse attendue : « Nous proposons un délai de retour de 30 jours pour tous les achats. »
  • Réponse de l’assistant : « Notre politique de retour autorise les retours dans les 15 jours ouvrables suivant l’achat. »
  • Méthode d’évaluation : Correspondance de mots-clés
  • Résultat : échec (attendu « 30 jours », l’assistant a dit « 15 jours ouvrables »)

Vérifier la configuration de l’évaluation (étape 1 de la couche 2) :

Question Réponse Résultat
La réponse de l’assistant est-elle acceptable ? Doit vérifier le document source. Vérifier d’abord la source.
La réponse attendue est-elle toujours en vigueur ? Le document source indique « 15 jours ouvrables ». La politique a été mise à jour. max. La réponse attendue est dépassée.

Classification : Problème de configuration de l’évaluation. Réponse attendue dépassée. L’assistant est correct. L’évaluation est erronée.

Étape 4: Triage de KG-005 (Couche 2, étapes 1 à 2)

Cas de test KG-005 :

  • Exemple d’entrée : « Le plan Premium inclut-il une garantie prolongée ? »
  • Réponse attendue : « Le plan Premium inclut une garantie standard de deux ans. Des options de garantie prolongée sont disponibles à l’achat séparément. »
  • Réponse de l’assistant : « Oui, le plan Premium inclut une garantie prolongée de trois ans couvrant toutes les pièces et main-d’œuvre. »
  • Méthode d’évaluation : Comparer le sens
  • Résultat : échec (détails de garantie fabriqués par l’assistant)

Vérifier la configuration de l’évaluation (étape 1 de la couche 2) :

Question Réponse Résultat
La réponse de l’assistant est-elle acceptable ? max. La « garantie prolongée de trois ans » est fabriquée. Continuer
La réponse attendue est-elle en vigueur ? Oui. La source confirme la garantie standard de deux ans. Continuer
Le cas de test est-il réaliste ? Oui. Question fréquente des clients. Continuer
Une autre réponse pourrait-elle être correcte ? max. Les détails de la garantie sont factuels. Continuer
La méthode d’évaluation est-elle appropriée ? Oui.Comparer le sens est correct pour la précision sémantique. L’évaluation est valable.

Diagnostiquer l’assistant (étape 2 de la couche 2) :

Question Réponse
Le contenu source est-il incorrect ? max. La source indique « garantie standard de deux ans ».
L’assistant a-t-il contredit les informations de la source ? Oui. La source indique « garantie standard de deux ans », mais l’assistant a répondu « garantie prolongée de trois ans ».
L’assistant a-t-il répondu sans utiliser de source ? Probablement oui. Le détail « garantie prolongée de trois ans couvrant toutes les pièces et la main-d’œuvre » n’existe dans aucune source.

Classification : Problème de configuration d’assistant. Lacune d’ancrage des connaissances. L’assistant a fourni des détails de garantie qui ne sont pas présents dans les sources de connaissances configurées.

Étape 5 : Corriger (Couche 3)

KG-003 (Correction de la configuration de l’évaluation) :

  • Modification : Mettre à jour la valeur attendue de « délai de retour de 30 jours » à « 15 jours ouvrables »
  • Réexécution : KG-003 uniquement
  • Résultat attendu : Réussite

KG-005 (Correction de la configuration de l’assistant) :

  • Changement : ajoutez une instruction d’ancrage à la requête système : « Répondez uniquement en vous basant sur les informations présentes dans vos sources de connaissances. Si l’information n’est pas disponible, dis-le. »
  • Nouvelle exécution : ensemble complet d’évaluation de l’ancrage des connaissances (une modification de la configuration de l’assistant peut avoir des effets plus larges)
  • Résultat attendu : KG-005 réussit. Les autres cas de test ne devraient pas régresser.

Étape 6 : Vérifier

Après les deux modifications, relancez l’ensemble d’évaluation de l’ancrage des connaissances :

Avant Après
71 % (réussite de 5/7) 86 % (réussite de 6/7)

Évaluation : L’ancrage des connaissances dépasse désormais le seuil de blocage de 80 %. Une défaillance (KG-007) subsiste et ne bloque pas l’aptitude. Révisez-la dans la prochaine itération.

Étape 7 : Document (Couche 4)

Notez dans le journal des défaillances :

Cas de test Type de la cause racine Problème observé Changement appliqué Résolu
KG-003 Configuration d’évaluation Réponse attendue obsolète (politique passée de 30 jours à 15 jours ouvrables). Valeur attendue mise à jour Oui
KG-005 Configuration de l’assistant Des détails de garantie incorrects qui ne sont dans aucune source. Ajout d’une instruction d’ancrage à la requête système Oui

Note sur le modèle : Vérifier les valeurs attendues par rapport aux documents sources avant chaque exécution d’évaluation. Ajoutez cette étape à la liste de contrôle préalable à l’évaluation.

Nouvelle vérification de l’état de préparation : tous les ensembles d’évaluation sont désormais au-dessus des seuils bloquants.

Évaluation de l’aptitude : Déployer l’assistant avec des lacunes connues (KG-007 documenté, plan de suivi en place).

Référence : Couche 4 : analysez les modèles et améliorez continuellement votre assistant

Parcours 2 : stagnation des scores

Situation : Vous exécutez quatre itérations sur un assistant de support produit. La précision factuelle reste à 78 % sur les quatre exécutions. Vous faites des modifications rapides après chaque exécution mais vous ne voyez aucune amélioration.

Étape 1: Vérifier les modèles (Couche 4)

Vérifiez le journal des défaillances sur les quatre itérations :

Itération Score Changement appliqué Résultat
1 78 % (base de référence)
2 79 % Ajout de « Soyez précis sur les spécifications du produit » Aucun changement significatif
3 77 % Requête réorganisée pour mettre les instructions de précision en premier Aucun changement significatif
4 78 % Ajout d’exemples concrets de réponses produit correctes Aucun changement significatif

Tendance : Stable. La correction ne cible pas la cause racine réelle.

Référence : Couche 4 : analysez les modèles et améliorez continuellement votre assistant

Étape 2 : Analyser les cas de test en échec

Examinez les six échecs persistants sur toutes les itérations.

Cas de test Échec depuis Problème observé
FA-002 Itération 1 L’assistant cite la page FAQ au lieu du manuel produit
FA-005 Itération 1 L’assistant cite la page FAQ au lieu du manuel produit
FA-008 Itération 1 L’assistant cite la page FAQ au lieu du manuel produit
FA-011 Itération 1 L’assistant cite la page FAQ au lieu du manuel produit
FA-014 Itération 1 L’assistant cite la page FAQ au lieu du manuel produit
FA-019 Itération 2 L’assistant donne une réponse partielle de la FAQ, mais oublie un détail du manuel

Analyse de concentration : Cinq des six défaillances (83 %) concernent la même cause racine : l’assistant récupère les informations à partir de la page FAQ plutôt que du manuel produit.

Étape 3 : Nouveau triage (Couche 2)

Au départ, classez les défaillances comme Problème de configuration de l’assistant : mauvaise source récupérée.

Appliquez plusieurs modifications de configuration de l’assistant, y compris la reformulation de la requête, la réorganisation et l’ajout d’exemples. Ces changements n’entraînent pas d’amélioration mesurable. À ce stade, validez la défaillance par rapport aux indicateurs de limitation de la plateforme.

Indicateur Vérification
La défaillance persiste à travers plusieurs variations de requêtes ou de configurations Oui. Quatre itérations sans aucun changement.
La récupération renvoie systématiquement des documents incorrects malgré la bonne configuration de la source Oui. La FAQ est systématiquement consultée à la place du manuel produit.

Reclassification : Ce problème est une limitation de la plateforme liée au classement de récupération. La plateforme privilégie systématiquement la FAQ plutôt que le manuel produit pour ces requêtes, et les modifications ultérieures des consignes ou des instructions n’affectent pas le comportement de récupération.

Référence : Couche 2 : Défaillances de l’assistant de triage

Étape 4 : Corriger (Couche 3 – Limitation de la plateforme)

Lorsque vous classez une défaillance comme une limitation de la plateforme, concentrez la correction sur les solutions de contournement et la documentation plutôt que sur des modifications de configuration de l’assistant.

Référence : Réponse à la limitation de la plateforme

Stratégie de contournement : appliquez une ou plusieurs des approches d’atténuation suivantes pour réduire l’impact :

  • Restructurez le manuel produit avec des titres de section plus clairs qui correspondent au vocabulaire utilisé dans les requêtes des utilisateurs.
  • Dupliquez les spécifications produit critiques du manuel dans la FAQ pour créer des chemins de récupération redondants.
  • Refactorisez le contenu du manuel pour que chaque section réponde à une question unique et bien définie afin d’améliorer l’appariement des segments de récupération.

Ces approches visent à influencer le comportement de récupération sans s’appuyer sur les modifications de requête ou d’instruction.

Escalade et suivi : si la limitation persiste, documentez et faites remonter le problème à l’équipe de la plateforme.

  • Documentez la limitation comme suit : « Les requêtes sur les <spécifications produit> récupèrent systématiquement la page FAQ (dernière mise à jour : <date>, <n> pages) au lieu du manuel produit (dernière mise à jour : <date>, <N> pages), bien que le manuel contiennent les informations faisant autorité. »
  • Fournir des preuves à l’appui : Inclure plusieurs cas de test montrant la requête, la source attendue et la source réelle récupérée.
  • Soumettre pour enquête.
  • Partagez les limitations documentées et les preuves avec l’équipe de la plateforme pour le suivi.

Étape 5 : Vérifier

Après avoir restructuré le manuel produit et ajouté des entrées FAQ redondantes, relancez l’ensemble d’évaluation pertinent pour vérifier l’impact.

Avant Après
78 % (inchangé sur quatre itérations) 89 %

Évaluation : la solution de contournement améliore la performance globale. Une défaillance subsiste (FA-019). La requête est trop ambiguë pour récupérer de manière fiable la source correcte, même avec un contenu restructuré. Cette défaillance est enregistrée comme une limitation connue.

Étape 6 : Documenter

Mettez à jour le journal des défaillances pour refléter la classification finale et les résultats.

Cas de test Type de la cause racine Problème observé Changement appliqué Résolu
FA-002, 005, 008, 011, 014 Limitation de la plateforme Le classement de récupération privilégie la FAQ plutôt que le manuel produit Restructuration des titres manuels ; spécifications critiques dupliquées dans la FAQ Oui
FA-019 Limitation de la plateforme Une requête ambiguë ne peut pas récupérer de manière fiable la source correcte Limitation connue, répertoriée dans la documentation Non

Point clé à retenir : si les scores d’évaluation restent stables malgré plusieurs modifications de la requête ou des instructions, la cause racine est probablement indépendante de la requête. Validez le comportement de l’infrastructure et de la plateforme avant d’investir davantage dans l’ingénierie des requêtes.

Parcours 3 : Régression post-mise à jour

Situation : Vous avez mis à jour la requête système pour améliorer le ton et l’empathie. Les scores de ton ont augmenté, mais la précision factuelle est passée sous son seuil bloquant, introduisant une régression.

Avant le changement :

Ensemble d’évaluation Score
Exactitude factuelle 91 %
Ton et qualité 83 %
Tous les autres Au-dessus du seuil

Vous avez ajouté l’instruction suivante à la requête système : « Reconnais toujours la préoccupation du client et fais preuve d’empathie avant de donner ta réponse. Commence chaque réponse en validant l’expérience du client. »

Après le changement :

Ensemble d’évaluation Avant Après Delta
Exactitude factuelle 91 % 76 % -15 %
Ton et qualité 83 % 91 % +8 %

Étape 1 : Interpréter (Couche 1)

L’exactitude factuelle est désormais inférieure au seuil de blocage de 80 %. Ce changement introduit une régression et bloque l’état d’aptitude.

Référence : Couche 1 : Interpréter les scores et identifier les échecs

Étape 2: Vérifier les modèles (Couche 4)

Analyse des modèles inter-signaux : le ton s’améliore tandis que l’exactitude se dégrade.

Cause racine indiquée : conflit d’instructions.

Les nouvelles directives de ton entrent en concurrence avec les instructions de précision pour l’attention du modèle.

Référence : Couche 4 : analysez les modèles et améliorez continuellement votre assistant

Étape 3 : Trier les nouvelles défaillances (Couche 2)

Passez en revue les cas de test d’exactitude factuelle qui réussissaient avant le changement et échouent maintenant.

Cas de test FA-007 :

  • Entrée : « Quelle est la taille maximale d’envoi d’un fichier ? »
  • Attendu : « La taille maximale d’envoi de fichier est de 25 Mo pour les comptes standards et de 100 Mo pour les comptes d’entreprise. »
  • Assistant précédent : « La taille maximale d’envoi de fichier est de 25 Mo pour les comptes standard et 100 Mo pour les comptes d’entreprise. »
  • Assistant après: « Je comprends parfaitement votre préoccupation concernant la taille des fichiers à charger ; cela peut être frustrant lorsque vous essayez de télécharger des documents importants ! » Je souhaite m’assurer que vous disposez de toutes les informations nécessaires. La taille maximale de chargement est de 25 Mo pour les plans standard. »

Étape 1. Vérifier l’évaluation : La réponse attendue est correcte et l’évaluation est valable. La réponse post-mise à jour omet le détail du compte d’entreprise.

Étape 2. Diagnostiquer : La nouvelle instruction sur le ton exige un préambule d’empathie dans chaque réponse. Cette exigence consomme le budget de réponse et l’attention du modèle, et conduit à des réponses factuelles incomplètes.

Classification : Problème de configuration d’assistant. Conflit d’instructions entre les consignes de ton et d’exactitude.

Référence : Couche 2 : Défaillances de l’assistant de triage

Étape 4 : Corriger (Couche 3)

Le problème ne vient pas des directives de ton en elles-mêmes, mais des priorités concurrentes au sein de la requête système. La correction se concentre sur la séparation et la priorisation des instructions.

Ancienne instruction (unique, conflictuelle) : « Reconnaissez toujours les préoccupations du client et faites preuve d’empathie avant de fournir votre réponse. » Commence chaque réponse en validant l’expérience du client. »

Nouvelle instruction (séparée, prioritaire) : « Incluez toujours la réponse factuelle complète à la question du client. » N’omettez pas de détails par souci de concision. De plus, lorsque le client exprime de la frustration ou de l’inquiétude, reconnaissez-le brièvement. »

Principaux changements :

  • L’exactitude est explicitement priorisée.
  • L’exhaustivité des réponses factuelles est indiquée directement.
  • L’empathie est conditionnelle plutôt qu’universelle.
  • « De manière brève » limite l’empathie afin d’éviter toute troncature du contenu.

Référence : Couche 3 : Associer les modèles de défaillance aux stratégies de correction

Étape 5 : Vérifier

Relancez l’ensemble complet d’évaluations, car les modifications de la requête système peuvent avoir un impact étendu.

Ensemble d’évaluation Avant la modification Après la régression Après la modification
Exactitude factuelle 91 % 76 % 90 %
Ton et qualité 83 % 91 % 89 %
Tous les autres Au-dessus du seuil Au-dessus du seuil Au-dessus du seuil

Évaluation : Les deux signaux respectent désormais leurs seuils de blocage. Le ton ne revient pas complètement à son niveau maximal, mais il reste bien au-dessus du seuil de blocage de 75 % et s’améliore par rapport à la valeur de référence initiale.

Étape 6 : Documenter

Cas de test Type de la cause racine Problème observé Changement appliqué Résolu
FA-007, FA-012, FA-018 (et d’autres) Configuration de l’assistant La consigne sur le ton a supplanté l’exhaustivité factuelle Requête restructurée pour prioriser l’exactitude et appliquer une empathie conditionnelle Oui

Point clé : Validez toujours les modifications des requêtes système contre l’ensemble de la suite d’évaluation, pas seulement le signal cible. Les instructions rivalisent pour attirer l’attention du modèle, et des améliorations dans un domaine peuvent introduire des régressions dans d’autres.

Modèle à surveiller : Ce scénario est un exemple de problème de budget d’instruction. À mesure que les requêtes s’allongent, les conflits d’instructions deviennent plus probables. La consolidation et la simplification périodiques contribuent à maintenir la stabilité.

Modèles récurrents à travers les parcours

Chaque parcours commence à partir d’un scénario différent pour illustrer une approche diagnostique distincte. Pour voir comment un assistant unique progresse à travers l’ensemble du cycle de vie de l’évaluation (interprétation des scores, triage des échecs, remédiation et vérification), consultez le Parcours 1, qui offre le guide de bout en bout le plus complet.

Ce tableau met en évidence les modèles récurrents observés au fil des parcours et les leçons pratiques qu’ils renforcent.

Modèle Où elle apparaît À retenir
Valider l’évaluation avant l’assistant Parcours 1 Une cause fréquente d’efforts inutiles est la résolution de problèmes du comportement de l’assistant lorsque l’évaluation elle-même est incorrecte.
Des scores stables indiquent une cause racine mal classée Parcours 2 Si des corrections répétées n’améliorent pas les résultats, reclassez le problème. Vous pourriez vous attaquer à la mauvaise cause racine.
Relancez la suite d’évaluation complète après des modifications de la requête Parcours 3 Les modifications de requête peuvent affecter plusieurs signaux de qualité. Vérifiez toujours les régressions en dehors de la zone ciblée.
Documenter les résultats et les décisions Tous les parcours La tenue d’un journal des défaillances permet d’éviter de redécouvrir les mêmes causes racines lors des itérations ultérieures.
Les écarts connus peuvent être acceptables Parcours 1 (KG-007), Parcours 2 (FA-019) Il n’est pas nécessaire de résoudre toutes les défaillances avant l’expédition. Documentez les lacunes connues et surveillez-les au fil du temps.

Étapes suivantes

Après avoir examiné ces exemples, choisissez l’action suivante qui correspond le mieux à votre situation actuelle :