Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Ces guides pas à pas illustrent comment les couches de cadre de triage d’évaluation fonctionnent ensemble en pratique. Chaque parcours commence par un scénario d’évaluation différent et suit un parcours diagnostique distinct.
Les guides montrent comment appliquer le cadre étape par étape. Utilisez ces exemples pour comprendre comment passer des résultats d’évaluation au diagnostic, à la remédiation et à la vérification dans des scénarios réels d’évaluation d’assistants.
Astuce
Avant de travailler sur ces exemples, passez en revue les objectifs du cadre, y compris les concepts et principes fondamentaux.
| Parcours | Situation de départ | Ce que cela démontre |
|---|---|---|
| Parcours 1 | Première séance d’évaluation | Flux de bout en bout : Interpréter → prioriser → triage → remédier → vérifier |
| Parcours 2 | Les scores stagnent après plusieurs itérations | Analyse de modèle, reclassification et contournement des limites de plateforme |
| Parcours 3 | Les scores régressent après un changement | Détection de régression, diagnostic des conflits d’instructions et résolution par compromis |
Note
Ces exemples sont illustratifs et basés sur des modèles courants observés lors de plusieurs évaluations clients. Les cas de test, les scores et les détails des assistants sont des ensembles représentatifs plutôt que des données issues d’un seul engagement. Les approches diagnostiques et stratégies de remédiation présentées reflètent les pratiques utilisées dans de vraies implémentations.
Parcours 1 : Première séance d’évaluation
Vous exécutez votre suite d’évaluation pour la première fois sur un assistant du service client. Voici les résultats :
| Ensemble d’évaluation | Taux de réussite |
|---|---|
| Données personnelles et de sécurité | 100 % |
| Questions et réponses métier principales | 87 % |
| Ancrage des connaissances | 71 % |
| Invocation d’outil | 92 % |
| Routage des déclencheurs | 88 % |
| Ton et qualité | 83 % |
| Escalade | 90 % |
| Global | 85 % |
Étape 1 : Interpréter les scores (Couche 1)
Utilisez le tableau d’interprétation des scores pour calibrer les seuils et identifier quels ensembles d’évaluation sont en dessous des seuils de blocage.
| Ensemble d’évaluation | Score | Seuil | Statut |
|---|---|---|---|
| Données personnelles et de sécurité | 100 % | Blocage à 95 % | Réussite |
| Questions et réponses métier principales | 87 % | Blocage à 80 % | Réussite |
| Ancrage des connaissances | 71 % | Blocage à 80 % | En dessous du blocage |
| Invocation d’outil | 92 % | Blocage à 85 % | Réussite |
| Routage des déclencheurs | 88 % | Blocage à 80 % | Réussite |
| Ton et qualité | 83 % | Blocage à 75 % | Réussite |
| Escalade | 90 % | Blocage à 85 % | Réussite |
Évaluation de l’aptitude : itérer. L’ancrage des connaissances est en dessous de son seuil bloquant. Concentrez les actions de remédiation sur cet aspect.
Étape 2 : Prioriser les échecs (Couche 2, Étape 0)
Situation : L’ancrage des connaissances comporte sept cas tests. Deux cas de test échouent : KG-003 et KG-005. Les deux cas de test font partie d’un ensemble d’évaluation métier central, donc ils ont la priorité 2. Étant donné qu’il n’y en a que deux, effectuez un triage des deux.
Référence : Prioriser les échecs (Couche 2, Étape 0)
Étape 3: Triage de KG-003 (Couche 2, étapes 1 à 2)
Cas de test KG-003 :
- Exemple d’entrée : « Quelle est votre politique de retour ? »
- Réponse attendue : « Nous proposons un délai de retour de 30 jours pour tous les achats. »
- Réponse de l’assistant : « Notre politique de retour autorise les retours dans les 15 jours ouvrables suivant l’achat. »
- Méthode d’évaluation : Correspondance de mots-clés
- Résultat : échec (attendu « 30 jours », l’assistant a dit « 15 jours ouvrables »)
Vérifier la configuration de l’évaluation (étape 1 de la couche 2) :
| Question | Réponse | Résultat |
|---|---|---|
| La réponse de l’assistant est-elle acceptable ? | Doit vérifier le document source. | Vérifier d’abord la source. |
| La réponse attendue est-elle toujours en vigueur ? | Le document source indique « 15 jours ouvrables ». La politique a été mise à jour. | max. La réponse attendue est dépassée. |
Classification : Problème de configuration de l’évaluation. Réponse attendue dépassée. L’assistant est correct. L’évaluation est erronée.
Étape 4: Triage de KG-005 (Couche 2, étapes 1 à 2)
Cas de test KG-005 :
- Exemple d’entrée : « Le plan Premium inclut-il une garantie prolongée ? »
- Réponse attendue : « Le plan Premium inclut une garantie standard de deux ans. Des options de garantie prolongée sont disponibles à l’achat séparément. »
- Réponse de l’assistant : « Oui, le plan Premium inclut une garantie prolongée de trois ans couvrant toutes les pièces et main-d’œuvre. »
- Méthode d’évaluation : Comparer le sens
- Résultat : échec (détails de garantie fabriqués par l’assistant)
Vérifier la configuration de l’évaluation (étape 1 de la couche 2) :
| Question | Réponse | Résultat |
|---|---|---|
| La réponse de l’assistant est-elle acceptable ? | max. La « garantie prolongée de trois ans » est fabriquée. | Continuer |
| La réponse attendue est-elle en vigueur ? | Oui. La source confirme la garantie standard de deux ans. | Continuer |
| Le cas de test est-il réaliste ? | Oui. Question fréquente des clients. | Continuer |
| Une autre réponse pourrait-elle être correcte ? | max. Les détails de la garantie sont factuels. | Continuer |
| La méthode d’évaluation est-elle appropriée ? | Oui.Comparer le sens est correct pour la précision sémantique. | L’évaluation est valable. |
Diagnostiquer l’assistant (étape 2 de la couche 2) :
| Question | Réponse |
|---|---|
| Le contenu source est-il incorrect ? | max. La source indique « garantie standard de deux ans ». |
| L’assistant a-t-il contredit les informations de la source ? | Oui. La source indique « garantie standard de deux ans », mais l’assistant a répondu « garantie prolongée de trois ans ». |
| L’assistant a-t-il répondu sans utiliser de source ? | Probablement oui. Le détail « garantie prolongée de trois ans couvrant toutes les pièces et la main-d’œuvre » n’existe dans aucune source. |
Classification : Problème de configuration d’assistant. Lacune d’ancrage des connaissances. L’assistant a fourni des détails de garantie qui ne sont pas présents dans les sources de connaissances configurées.
Étape 5 : Corriger (Couche 3)
KG-003 (Correction de la configuration de l’évaluation) :
- Modification : Mettre à jour la valeur attendue de « délai de retour de 30 jours » à « 15 jours ouvrables »
- Réexécution : KG-003 uniquement
- Résultat attendu : Réussite
KG-005 (Correction de la configuration de l’assistant) :
- Changement : ajoutez une instruction d’ancrage à la requête système : « Répondez uniquement en vous basant sur les informations présentes dans vos sources de connaissances. Si l’information n’est pas disponible, dis-le. »
- Nouvelle exécution : ensemble complet d’évaluation de l’ancrage des connaissances (une modification de la configuration de l’assistant peut avoir des effets plus larges)
- Résultat attendu : KG-005 réussit. Les autres cas de test ne devraient pas régresser.
Étape 6 : Vérifier
Après les deux modifications, relancez l’ensemble d’évaluation de l’ancrage des connaissances :
| Avant | Après |
|---|---|
| 71 % (réussite de 5/7) | 86 % (réussite de 6/7) |
Évaluation : L’ancrage des connaissances dépasse désormais le seuil de blocage de 80 %. Une défaillance (KG-007) subsiste et ne bloque pas l’aptitude. Révisez-la dans la prochaine itération.
Étape 7 : Document (Couche 4)
Notez dans le journal des défaillances :
| Cas de test | Type de la cause racine | Problème observé | Changement appliqué | Résolu |
|---|---|---|---|---|
| KG-003 | Configuration d’évaluation | Réponse attendue obsolète (politique passée de 30 jours à 15 jours ouvrables). | Valeur attendue mise à jour | Oui |
| KG-005 | Configuration de l’assistant | Des détails de garantie incorrects qui ne sont dans aucune source. | Ajout d’une instruction d’ancrage à la requête système | Oui |
Note sur le modèle : Vérifier les valeurs attendues par rapport aux documents sources avant chaque exécution d’évaluation. Ajoutez cette étape à la liste de contrôle préalable à l’évaluation.
Nouvelle vérification de l’état de préparation : tous les ensembles d’évaluation sont désormais au-dessus des seuils bloquants.
Évaluation de l’aptitude : Déployer l’assistant avec des lacunes connues (KG-007 documenté, plan de suivi en place).
Référence : Couche 4 : analysez les modèles et améliorez continuellement votre assistant
Parcours 2 : stagnation des scores
Situation : Vous exécutez quatre itérations sur un assistant de support produit. La précision factuelle reste à 78 % sur les quatre exécutions. Vous faites des modifications rapides après chaque exécution mais vous ne voyez aucune amélioration.
Étape 1: Vérifier les modèles (Couche 4)
Vérifiez le journal des défaillances sur les quatre itérations :
| Itération | Score | Changement appliqué | Résultat |
|---|---|---|---|
| 1 | 78 % | (base de référence) | — |
| 2 | 79 % | Ajout de « Soyez précis sur les spécifications du produit » | Aucun changement significatif |
| 3 | 77 % | Requête réorganisée pour mettre les instructions de précision en premier | Aucun changement significatif |
| 4 | 78 % | Ajout d’exemples concrets de réponses produit correctes | Aucun changement significatif |
Tendance : Stable. La correction ne cible pas la cause racine réelle.
Référence : Couche 4 : analysez les modèles et améliorez continuellement votre assistant
Étape 2 : Analyser les cas de test en échec
Examinez les six échecs persistants sur toutes les itérations.
| Cas de test | Échec depuis | Problème observé |
|---|---|---|
| FA-002 | Itération 1 | L’assistant cite la page FAQ au lieu du manuel produit |
| FA-005 | Itération 1 | L’assistant cite la page FAQ au lieu du manuel produit |
| FA-008 | Itération 1 | L’assistant cite la page FAQ au lieu du manuel produit |
| FA-011 | Itération 1 | L’assistant cite la page FAQ au lieu du manuel produit |
| FA-014 | Itération 1 | L’assistant cite la page FAQ au lieu du manuel produit |
| FA-019 | Itération 2 | L’assistant donne une réponse partielle de la FAQ, mais oublie un détail du manuel |
Analyse de concentration : Cinq des six défaillances (83 %) concernent la même cause racine : l’assistant récupère les informations à partir de la page FAQ plutôt que du manuel produit.
Étape 3 : Nouveau triage (Couche 2)
Au départ, classez les défaillances comme Problème de configuration de l’assistant : mauvaise source récupérée.
Appliquez plusieurs modifications de configuration de l’assistant, y compris la reformulation de la requête, la réorganisation et l’ajout d’exemples. Ces changements n’entraînent pas d’amélioration mesurable. À ce stade, validez la défaillance par rapport aux indicateurs de limitation de la plateforme.
| Indicateur | Vérification |
|---|---|
| La défaillance persiste à travers plusieurs variations de requêtes ou de configurations | Oui. Quatre itérations sans aucun changement. |
| La récupération renvoie systématiquement des documents incorrects malgré la bonne configuration de la source | Oui. La FAQ est systématiquement consultée à la place du manuel produit. |
Reclassification : Ce problème est une limitation de la plateforme liée au classement de récupération. La plateforme privilégie systématiquement la FAQ plutôt que le manuel produit pour ces requêtes, et les modifications ultérieures des consignes ou des instructions n’affectent pas le comportement de récupération.
Référence : Couche 2 : Défaillances de l’assistant de triage
Étape 4 : Corriger (Couche 3 – Limitation de la plateforme)
Lorsque vous classez une défaillance comme une limitation de la plateforme, concentrez la correction sur les solutions de contournement et la documentation plutôt que sur des modifications de configuration de l’assistant.
Référence : Réponse à la limitation de la plateforme
Stratégie de contournement : appliquez une ou plusieurs des approches d’atténuation suivantes pour réduire l’impact :
- Restructurez le manuel produit avec des titres de section plus clairs qui correspondent au vocabulaire utilisé dans les requêtes des utilisateurs.
- Dupliquez les spécifications produit critiques du manuel dans la FAQ pour créer des chemins de récupération redondants.
- Refactorisez le contenu du manuel pour que chaque section réponde à une question unique et bien définie afin d’améliorer l’appariement des segments de récupération.
Ces approches visent à influencer le comportement de récupération sans s’appuyer sur les modifications de requête ou d’instruction.
Escalade et suivi : si la limitation persiste, documentez et faites remonter le problème à l’équipe de la plateforme.
- Documentez la limitation comme suit : « Les requêtes sur les <spécifications produit> récupèrent systématiquement la page FAQ (dernière mise à jour : <date>, <n> pages) au lieu du manuel produit (dernière mise à jour : <date>, <N> pages), bien que le manuel contiennent les informations faisant autorité. »
- Fournir des preuves à l’appui : Inclure plusieurs cas de test montrant la requête, la source attendue et la source réelle récupérée.
- Soumettre pour enquête.
- Partagez les limitations documentées et les preuves avec l’équipe de la plateforme pour le suivi.
Étape 5 : Vérifier
Après avoir restructuré le manuel produit et ajouté des entrées FAQ redondantes, relancez l’ensemble d’évaluation pertinent pour vérifier l’impact.
| Avant | Après |
|---|---|
| 78 % (inchangé sur quatre itérations) | 89 % |
Évaluation : la solution de contournement améliore la performance globale. Une défaillance subsiste (FA-019). La requête est trop ambiguë pour récupérer de manière fiable la source correcte, même avec un contenu restructuré. Cette défaillance est enregistrée comme une limitation connue.
Étape 6 : Documenter
Mettez à jour le journal des défaillances pour refléter la classification finale et les résultats.
| Cas de test | Type de la cause racine | Problème observé | Changement appliqué | Résolu |
|---|---|---|---|---|
| FA-002, 005, 008, 011, 014 | Limitation de la plateforme | Le classement de récupération privilégie la FAQ plutôt que le manuel produit | Restructuration des titres manuels ; spécifications critiques dupliquées dans la FAQ | Oui |
| FA-019 | Limitation de la plateforme | Une requête ambiguë ne peut pas récupérer de manière fiable la source correcte | Limitation connue, répertoriée dans la documentation | Non |
Point clé à retenir : si les scores d’évaluation restent stables malgré plusieurs modifications de la requête ou des instructions, la cause racine est probablement indépendante de la requête. Validez le comportement de l’infrastructure et de la plateforme avant d’investir davantage dans l’ingénierie des requêtes.
Parcours 3 : Régression post-mise à jour
Situation : Vous avez mis à jour la requête système pour améliorer le ton et l’empathie. Les scores de ton ont augmenté, mais la précision factuelle est passée sous son seuil bloquant, introduisant une régression.
Avant le changement :
| Ensemble d’évaluation | Score |
|---|---|
| Exactitude factuelle | 91 % |
| Ton et qualité | 83 % |
| Tous les autres | Au-dessus du seuil |
Vous avez ajouté l’instruction suivante à la requête système : « Reconnais toujours la préoccupation du client et fais preuve d’empathie avant de donner ta réponse. Commence chaque réponse en validant l’expérience du client. »
Après le changement :
| Ensemble d’évaluation | Avant | Après | Delta |
|---|---|---|---|
| Exactitude factuelle | 91 % | 76 % | -15 % |
| Ton et qualité | 83 % | 91 % | +8 % |
Étape 1 : Interpréter (Couche 1)
L’exactitude factuelle est désormais inférieure au seuil de blocage de 80 %. Ce changement introduit une régression et bloque l’état d’aptitude.
Référence : Couche 1 : Interpréter les scores et identifier les échecs
Étape 2: Vérifier les modèles (Couche 4)
Analyse des modèles inter-signaux : le ton s’améliore tandis que l’exactitude se dégrade.
Cause racine indiquée : conflit d’instructions.
Les nouvelles directives de ton entrent en concurrence avec les instructions de précision pour l’attention du modèle.
Référence : Couche 4 : analysez les modèles et améliorez continuellement votre assistant
Étape 3 : Trier les nouvelles défaillances (Couche 2)
Passez en revue les cas de test d’exactitude factuelle qui réussissaient avant le changement et échouent maintenant.
Cas de test FA-007 :
- Entrée : « Quelle est la taille maximale d’envoi d’un fichier ? »
- Attendu : « La taille maximale d’envoi de fichier est de 25 Mo pour les comptes standards et de 100 Mo pour les comptes d’entreprise. »
- Assistant précédent : « La taille maximale d’envoi de fichier est de 25 Mo pour les comptes standard et 100 Mo pour les comptes d’entreprise. »
- Assistant après: « Je comprends parfaitement votre préoccupation concernant la taille des fichiers à charger ; cela peut être frustrant lorsque vous essayez de télécharger des documents importants ! » Je souhaite m’assurer que vous disposez de toutes les informations nécessaires. La taille maximale de chargement est de 25 Mo pour les plans standard. »
Étape 1. Vérifier l’évaluation : La réponse attendue est correcte et l’évaluation est valable. La réponse post-mise à jour omet le détail du compte d’entreprise.
Étape 2. Diagnostiquer : La nouvelle instruction sur le ton exige un préambule d’empathie dans chaque réponse. Cette exigence consomme le budget de réponse et l’attention du modèle, et conduit à des réponses factuelles incomplètes.
Classification : Problème de configuration d’assistant. Conflit d’instructions entre les consignes de ton et d’exactitude.
Référence : Couche 2 : Défaillances de l’assistant de triage
Étape 4 : Corriger (Couche 3)
Le problème ne vient pas des directives de ton en elles-mêmes, mais des priorités concurrentes au sein de la requête système. La correction se concentre sur la séparation et la priorisation des instructions.
Ancienne instruction (unique, conflictuelle) : « Reconnaissez toujours les préoccupations du client et faites preuve d’empathie avant de fournir votre réponse. » Commence chaque réponse en validant l’expérience du client. »
Nouvelle instruction (séparée, prioritaire) : « Incluez toujours la réponse factuelle complète à la question du client. » N’omettez pas de détails par souci de concision. De plus, lorsque le client exprime de la frustration ou de l’inquiétude, reconnaissez-le brièvement. »
Principaux changements :
- L’exactitude est explicitement priorisée.
- L’exhaustivité des réponses factuelles est indiquée directement.
- L’empathie est conditionnelle plutôt qu’universelle.
- « De manière brève » limite l’empathie afin d’éviter toute troncature du contenu.
Référence : Couche 3 : Associer les modèles de défaillance aux stratégies de correction
Étape 5 : Vérifier
Relancez l’ensemble complet d’évaluations, car les modifications de la requête système peuvent avoir un impact étendu.
| Ensemble d’évaluation | Avant la modification | Après la régression | Après la modification |
|---|---|---|---|
| Exactitude factuelle | 91 % | 76 % | 90 % |
| Ton et qualité | 83 % | 91 % | 89 % |
| Tous les autres | Au-dessus du seuil | Au-dessus du seuil | Au-dessus du seuil |
Évaluation : Les deux signaux respectent désormais leurs seuils de blocage. Le ton ne revient pas complètement à son niveau maximal, mais il reste bien au-dessus du seuil de blocage de 75 % et s’améliore par rapport à la valeur de référence initiale.
Étape 6 : Documenter
| Cas de test | Type de la cause racine | Problème observé | Changement appliqué | Résolu |
|---|---|---|---|---|
| FA-007, FA-012, FA-018 (et d’autres) | Configuration de l’assistant | La consigne sur le ton a supplanté l’exhaustivité factuelle | Requête restructurée pour prioriser l’exactitude et appliquer une empathie conditionnelle | Oui |
Point clé : Validez toujours les modifications des requêtes système contre l’ensemble de la suite d’évaluation, pas seulement le signal cible. Les instructions rivalisent pour attirer l’attention du modèle, et des améliorations dans un domaine peuvent introduire des régressions dans d’autres.
Modèle à surveiller : Ce scénario est un exemple de problème de budget d’instruction. À mesure que les requêtes s’allongent, les conflits d’instructions deviennent plus probables. La consolidation et la simplification périodiques contribuent à maintenir la stabilité.
Modèles récurrents à travers les parcours
Chaque parcours commence à partir d’un scénario différent pour illustrer une approche diagnostique distincte. Pour voir comment un assistant unique progresse à travers l’ensemble du cycle de vie de l’évaluation (interprétation des scores, triage des échecs, remédiation et vérification), consultez le Parcours 1, qui offre le guide de bout en bout le plus complet.
Ce tableau met en évidence les modèles récurrents observés au fil des parcours et les leçons pratiques qu’ils renforcent.
| Modèle | Où elle apparaît | À retenir |
|---|---|---|
| Valider l’évaluation avant l’assistant | Parcours 1 | Une cause fréquente d’efforts inutiles est la résolution de problèmes du comportement de l’assistant lorsque l’évaluation elle-même est incorrecte. |
| Des scores stables indiquent une cause racine mal classée | Parcours 2 | Si des corrections répétées n’améliorent pas les résultats, reclassez le problème. Vous pourriez vous attaquer à la mauvaise cause racine. |
| Relancez la suite d’évaluation complète après des modifications de la requête | Parcours 3 | Les modifications de requête peuvent affecter plusieurs signaux de qualité. Vérifiez toujours les régressions en dehors de la zone ciblée. |
| Documenter les résultats et les décisions | Tous les parcours | La tenue d’un journal des défaillances permet d’éviter de redécouvrir les mêmes causes racines lors des itérations ultérieures. |
| Les écarts connus peuvent être acceptables | Parcours 1 (KG-007), Parcours 2 (FA-019) | Il n’est pas nécessaire de résoudre toutes les défaillances avant l’expédition. Documentez les lacunes connues et surveillez-les au fil du temps. |
Étapes suivantes
Après avoir examiné ces exemples, choisissez l’action suivante qui correspond le mieux à votre situation actuelle :
- Commencez par l’interprétation des scores si vous avez des résultats d’évaluation prêts à être analysés.
- Commencez le triage des défaillances si vous devez diagnostiquer des défaillances de cas de test spécifiques.
- Appliquez l’analyse des modèles si vous travaillez avec plusieurs défaillances et souhaitez identifier des problèmes systémiques.
- Mettez en place la journalisation des défaillances pour suivre les décisions, les résultats et les problèmes récurrents.
- Revenez aux objectifs du cadre pour revoir l’approche complète du triage de l’évaluation.