Pas het evaluatiesorteerkader toe aan de hand van praktische scenario's

In deze end-to-end-scenario's ziet u hoe de lagen van het framework voor het sorteren van evaluaties in de praktijk samenwerken. Elke beleving begint vanuit een ander evaluatiescenario en volgt een uniek diagnostisch pad.

De scenario's laten zien hoe u het framework stap voor stap toepast. Gebruik deze voorbeelden om te begrijpen hoe u van evaluatieresultaten naar diagnose, oplossing en verificatie gaat in praktijkgerichte agent-evaluatiescenario's.

Fooi

Bekijk voordat u deze voorbeelden doorloopt de doelen van het kader inclusief kernconcepten en principes.

Beleving Startsituatie Wat het demonstreert
Beleving 1 Eerste evaluatieronde Volledig proces: interpreteren → prioriteren → sorteren → oplossen → verifiëren
Beleving 2 Scores stabiliseren zich na meerdere herhalingen Patroonanalyse, herclassificatie en oplossingen voor platformbeperkingen
Beleving 3 Scores vertonen een regressie na een wijziging Detectie van regressies, diagnose van instructieconflicten en het oplossen van afwegingen

Notitie

Deze voorbeelden zijn illustratief en gebaseerd op veelvoorkomende patronen die zijn waargenomen in meerdere klantenevaluaties. Testcases, scores en gegevens over medewerkers zijn representatieve samenvattingen en geen gegevens uit één specifiek contactmoment. De getoonde diagnostische benaderingen en herstelstrategieën weerspiegelen praktijken die in echte implementaties worden toegepast.

Beleving 1: Eerste evaluatieronde

U voert uw evaluatiesuite voor het eerst uit op een klantenservice-agent. Dit zijn de resultaten:

Evaluatieset Slagingspercentage
Veiligheid en persoonlijke gegevens 100%
Vragen en antwoorden over kernactiviteiten 87%
Kennisonderbouwing 71%
Toolaanroep 92%
Routering activeren 88%
Toon en kwaliteit 83%
Escalatie 90%
Algemeen 85%

Stap 1: Scores interpreteren (laag 1)

Gebruik de score-interpretatietabel om drempels te kalibreren en na te gaan welke evaluatiesets de blokkeringsdrempel niet halen.

Evaluatieset Score Threshold Status
Veiligheid en persoonlijke gegevens 100% 95% geblokkeerd Succes
Vragen en antwoorden over kernactiviteiten 87% 80% geblokkeerd Succes
Kennisonderbouwing 71% 80% geblokkeerd Minder geblokkeerd
Toolaanroep 92% 85% geblokkeerd Succes
Routering activeren 88% 80% geblokkeerd Succes
Toon en kwaliteit 83% 75% geblokkeerd Succes
Escalatie 90% 85% geblokkeerd Succes

Gereedheidsbeoordeling: Herhalen. Kennisonderbouwing ligt onder de blokkeringsdrempel. Richt u daar op herstel.

Stap 2: Fouten prioriteren (Laag 2, Stap 0)

Situatie: kennisonderbouwing bestaat uit zeven testcases. Twee testcases mislukken: KG-003 en KG-005. Beide testcases behoren tot een kernset bedrijfsevaluaties, dus ze zijn prioriteit 2. Omdat er slechts twee zijn, beoordeelt u beide.

Referentie: Fouten prioriteren (Laag 2, Stap 0)

Stap 3: Sorteren van KG-003 (laag 2, stappen 1-2)

Testcase KG-003:

  • Voorbeeldinvoer: "Wat is uw retourbeleid?"
  • Verwacht antwoord: "We bieden een retourtermijn van 30 dagen voor alle aankopen."
  • Respons van de agent: "Ons retourbeleid staat retouren binnen 15 werkdagen na aankoop toe."
  • Evaluatiemethode: Sleutelwoordovereenkomst
  • Resultaat: Mislukt (verwacht "30 dagen", agent zei "15 werkdagen")

De evaluatie-setup verifiëren (stap 1 van laag 2):

Vraag Beantwoorden Resultaat
Is de respons van de agent acceptabel? Het brondocument moet gecontroleerd worden. Controleer eerst de bron.
Is het verwachte antwoord nog steeds actueel? Brondocument zegt "15 werkdagen." Het beleid is bijgewerkt. Nee Het verwachte antwoord is verouderd.

Classificatie: Probleem met de evaluatie-instelling. Verouderd verwacht antwoord. De agent heeft gelijk. De evaluatie is onjuist.

Stap 4: Sorteren van KG-005 (laag 2, stappen 1-2)

Testcase KG-005:

  • Voorbeeldinput: "Omvat het Premium-abonnement een verlengde garantie?"
  • Verwacht antwoord: "Het Premium-abonnement omvat een standaardgarantie van twee jaar." Uitgebreide garantieopties kunnen apart worden aangeschaft.
  • Respons van de agent: "Ja, het Premium-abonnement omvat een verlengde garantie van drie jaar die alle onderdelen en arbeid dekt."
  • Evaluatiemethode: Vergelijken van betekenis
  • Resultaat: Fout (agent heeft garantiegegevens verzonnen)

De evaluatie-setup verifiëren (stap 1 van laag 2):

Vraag Beantwoorden Resultaat
Is de respons van de agent acceptabel? Nee 'Verlengde garantie van drie jaar' is verzonnen. Ga door
Is het verwachte antwoord actueel? Ja. Bron bevestigt twee jaar standaardgarantie. Ga door
Is de testcase realistisch? Ja. Veelgestelde klantvraag. Ga door
Zou een alternatieve respons correct kunnen zijn? Nee De garantiedetails zijn feitelijk. Ga door
Is de evaluatiemethode geschikt? Ja.Betekenis vergelijken is correct voor semantische nauwkeurigheid. Evaluatie is valide.

De agent diagnosticeren (stap 2 van laag 2):

Vraag Beantwoorden
Is de inhoud van de bron onjuist? Nee Bron zegt "twee jaar standaardgarantie".
Sprak de agent de informatie in de bron tegen? Ja. De bron zegt "twee jaar standaardgarantie," maar de agent zei "drie jaar verlengde garantie".
Heeft de agent geantwoord zonder enige bron te gebruiken? Waarschijnlijk wel. De vermelding "drie jaar verlengde garantie die alle onderdelen en arbeid dekt" komt in geen enkele bron voor.

Classificatie: Probleem met de configuratie van de agent. Hiaat in kennisonderbouwing. De agent heeft garantiegegevens geproduceerd die niet aanwezig zijn in de geconfigureerde kennisbronnen.

Stap 5: Herstellen (laag 3)

KG-003 (Herstel van evaluatie-instellingen):

  • Wijziging: De verwachte waarde aanpassen van "30 dagen retourvenster" naar "15 werkdagen"
  • Opnieuw uitvoeren: alleen KG-003
  • Verwacht: Geslaagd

KG-005 (Herstel van agentconfiguratie):

  • Wijziging: Onderbouwingsinstructie toevoegen aan systeemprompt: "Alleen antwoorden op basis van informatie in uw kennisbronnen. Als de informatie niet beschikbaar is, zeg dat dan."
  • Opnieuw uitvoeren: evaluatieset volledige kennisonderbouwing (agentconfiguratiewijziging kan bredere effecten hebben)
  • Verwacht: KG-005 slaagt. Andere testcases mogen geen regressie vertonen.

Stap 6: Verifiëren

Na beide wijzigingen voert u de evaluatieset voor kennisonderbouwing opnieuw uit:

Voor Na
71% (5/7 geslaagd) 86% (6/7 geslaagd)

Beoordeling: Kennisonderbouwing is nu boven de 80% blokkeringsdrempel. Er blijft één fout (KG-007) over en deze belemmert de gereedheid niet. Bekijk het in de volgende iteratie.

Stap 7: Documenteren (laag 4)

Noteer in het foutenlogboek:

Testcase Type hoofdoorzaak Probleem vastgesteld Wijziging toegepast Opgelost
KG-003 Evaluatie-instelling Verwacht antwoord verouderd (beleid veranderd van 30 dagen in 15 werkdagen). Bijgewerkte verwachte waarde Ja
KG-005 Agentconfiguratie Onjuiste garantiegegevens die in geen enkele bron voorkomen. Onderbouwingsinstructie toegevoegd aan systeemprompt Ja

Patroonopmerking: De verwachte waarden verifiëren met de brondocumenten vóór elke evaluatieronde. Voeg deze stap toe aan de pre-evaluatiechecklist.

Gereedheidscontrole: Alle evaluatiesets overschrijden nu de blokkeringsdrempels.

Beoordeling van gereedheid: Implementeer agent met bekende hiaten (KG-007 gedocumenteerd, monitoringplan aanwezig).

Referentie: Laag 4: Patronen analyseren en uw agent voortdurend blijven verbeteren

Reis 2: Scoreplateau

Situatie: U voert vier iteraties uit op een agent voor productondersteuning. Feitelijke nauwkeurigheid blijft gedurende alle vier de uitvoeringen op 78%. U voert na elke uitvoering wijzigingen in de prompt door, maar ziet geen verbetering.

Stap 1: Patronen controleren (laag 4)

Bekijk het mislukkingslogboek over alle vier de iteraties:

Iteratie Score Wijziging toegepast Resultaat
1 78% (basislijn)
2 79% 'Wees nauwkeurig over productspecificaties' toegevoegd Geen betekenisvolle verandering
3 77% De prompt herzien zodat de nauwkeurigheidsinstructies eerst komen Geen betekenisvolle verandering
4 78% Toegevoegd: uitgewerkte voorbeelden van correcte productantwoorden Geen betekenisvolle verandering

Trend: Gelijkblijvend. Herstel richt zich niet op de onderliggende oorzaak.

Referentie: Laag 4: Patronen analyseren en uw agent voortdurend blijven verbeteren

Stap 2: Analyseer falende testgevallen

Bekijk de zes aanhoudende mislukkingen tijdens alle iteraties.

Testcase Mislukt sinds Probleem vastgesteld
FA-002 Iteratie 1 Agent verwijst naar de pagina met veelgestelde vragen in plaats van de producthandleiding
FA-005 Iteratie 1 Agent verwijst naar de pagina met veelgestelde vragen in plaats van de producthandleiding
FA-008 Iteratie 1 Agent verwijst naar de pagina met veelgestelde vragen in plaats van de producthandleiding
FA-011 Iteratie 1 Agent verwijst naar de pagina met veelgestelde vragen in plaats van de producthandleiding
FA-014 Iteratie 1 Agent verwijst naar de pagina met veelgestelde vragen in plaats van de producthandleiding
FA-019 Iteratie 2 Agent geeft een gedeeltelijk antwoord uit de veelgestelde vragen, mist details uit de handleiding

Concentratieanalyse: Vijf van de zes mislukkingen (83%) hebben dezelfde oorzaak: de agent haalt informatie uit de pagina met veelgestelde vragen in plaats van uit de producthandleiding.

Stap 3: Hersortering (laag 2)

Classificeer de fouten eerst als Agentconfiguratieprobleem: Verkeerde bron opgehaald.

Voer meerdere wijzigingen in de agentconfiguratie door, waaronder het herformuleren van prompts, het herschikken van de volgorde en het toevoegen van voorbeelden. Deze wijzigingen leiden niet tot meetbare verbetering. Controleer de fout nu aan de hand van platformbeperkingsindicatoren.

Indicator Controle
Het probleem blijft bestaan bij verschillende prompt- of configuratievariaties Ja. Vier iteraties zonder verandering.
De ophaalfunctie geeft consequent verkeerde documenten terug ondanks correcte bronconfiguratie Ja. De veelgestelde vragen worden consequent opgehaald in plaats van de producthandleiding.

Herclassificatie: Dit probleem is een platformbeperking gerelateerd aan ophaalrangschikking. Het platform geeft consequent prioriteit aan de veelgestelde vragen boven de producthandleiding voor deze zoekopdrachten, en verdere wijzigingen in prompts of instructies beïnvloeden het ophaalgedrag niet.

Referentie: Laag 2: Agentfouten sorteren

Stap 4: Oplossen (laag 3: Platformbeperking)

Wanneer u een fout als een platformbeperking classificeert, richt u de oplossing op workarounds en documentatie in plaats van het wijzigen van de agentconfiguratie.

Referentie: Reactie op platformbeperking

Workaroundstrategie: Pas een of meer van de volgende beperkingsmethoden toe om de impact te verminderen:

  • Herstructureer de producthandleiding met duidelijkere sectiekoppen die aansluiten bij de woordenschat die in gebruikerszoekopdrachten wordt gebruikt.
  • Dupliceer kritieke productspecificaties uit de handleiding naar de veelgestelde vragen om redundante ophaalpaden te creëren.
  • Herstructureer de handleiding zodat elke sectie één duidelijke, goed omschreven vraag behandelt om de overeenkomst met ophaalsegmenten te verbeteren.

Deze methoden zijn bedoeld om ophaalgedrag te beïnvloeden zonder prompt- of instructiewijzigingen.

Escalatie en tracking: Als de beperking blijft bestaan, documenteer en escaleer het probleem naar het platformteam.

  • Documenteer de beperking als volgt: "Query's naar <productspecificaties> halen consequent de pagina met veelgestelde vragen op (laatst bijgewerkt: <datum>, <n> pagina's) in plaats van de producthandleiding (laatst bijgewerkt: <datum>, <N> pagina's), ondanks dat de handleiding de gezaghebbende informatie bevat."
  • Lever ondersteunend bewijs: Voeg meerdere testgevallen toe waarin de zoekopdracht, de verwachte bron en de daadwerkelijk opgehaalde bron worden getoond.
  • Dien in voor onderzoek.
  • Deel de gedocumenteerde beperking en het bewijs met het platformteam voor monitoring en opvolging.

Stap 5: Verifiëren

Na het herstructureren van de producthandleiding en het toevoegen van redundante items uit de veelgestelde vragen, voert u de relevante evaluatieset opnieuw uit om de impact te verifiëren.

Voor Na
78% (ongewijzigd over vier iteraties) 89%

Beoordeling: De workaround verbetert de algehele prestaties. Er blijft één fout over (FA-019). De query is te ambigu om betrouwbaar de juiste bron op te halen, zelfs met geherstructureerde inhoud. Deze fout wordt geregistreerd als een bekende beperking.

Stap 6: Documenteren

Werk het mislukkingslogboek bij om de uiteindelijke classificatie en uitkomsten vast te leggen.

Testcase Type hoofdoorzaak Probleem vastgesteld Wijziging toegepast Opgelost
FA-002, 005, 008, 011, 014 Platformbeperking Ophaalrangschikking geeft prioriteit aan de veelgestelde vragen boven de producthandleiding Geherstructureerde handleidingkoppen; gedupliceerde kritieke specificaties in de veelgestelde vragen Ja
FA-019 Platformbeperking Ambigue query kan de juiste bron niet betrouwbaar ophalen Gedocumenteerd als een bekende beperking Nee

Belangrijke conclusie: Als de evaluatiescores gelijk blijven ondanks meerdere wijzigingen in prompts of instructies, is het onwaarschijnlijk dat de oorzaak bij de prompt ligt. Valideer het gedrag van infrastructuur en platforms voordat u meer investeert in prompt-engineering.

Reis 3: Regressie na update

Situatie: U hebt de systeemprompt bijgewerkt om toon en empathie te verbeteren. De toonscores stegen, maar de feitelijke nauwkeurigheid daalde onder de blokkeringsdrempel, wat leidde tot een regressie.

Vóór de wijziging:

Evaluatieset Score
Feitelijke juistheid 91%
Toon en kwaliteit 83%
Alle overige Boven drempel

U voegde de volgende instructie toe aan de systeemprompt: "Erken altijd de bezorgdheid van de klant en toon empathie voordat u uw antwoord geeft." Begin elke reactie met het valideren van de ervaring van de klant."

Na de wijziging:

Evaluatieset Voor Na Delta
Feitelijke juistheid 91% 76% -15%
Toon en kwaliteit 83% 91% +8%

Stap 1: Interpreteren (laag 1)

De feitelijke nauwkeurigheid ligt nu onder de 80% blokkeringsdrempel. Deze verandering introduceert een regressie en blokkeert gereedheid.

Referentie: Laag 1: Interpreteer scores en identificeer fouten

Stap 2: Patronen controleren (laag 4)

Patroonovereenkomst tussen signalen: De toon verbetert terwijl de nauwkeurigheid achteruitgaat.

Aangewezen hoofdoorzaak: instructieconflict.

De nieuw toegevoegde richtlijnen over toon strijden om aandacht van het model met nauwkeurigheidsinstructies.

Referentie: Laag 4: Patronen analyseren en uw agent voortdurend blijven verbeteren

Stap 3: Sorteer de nieuwe fouten (laag 2)

Bekijk testcases voor feitelijke nauwkeurigheid die vóór de wijziging slaagden en nu falen.

Testcase FA-007:

  • Invoer: "Wat is de maximale uploadgrootte van bestanden?"
  • Verwacht: "De maximale uploadgrootte is 25 MB voor standaardaccounts en 100 MB voor ondernemingsaccounts."
  • Agent voorheen: "De maximale uploadgrootte is 25 MB voor standaardaccounts en 100 MB voor ondernemingsaccounts."
  • Agent daarna: "Ik begrijp uw zorgen over de grootte van bestanden. Het kan frustrerend zijn als u belangrijke documenten probeert te uploaden! Ik wil zeker weten dat u alle informatie hebt die u nodig hebt. De maximale uploadgrootte is 25 MB voor standaardabonnementen."

Stap 1. Controleer de evaluatie: Het verwachte antwoord is correct en de evaluatie is geldig. De respons na de update laat de details van het ondernemingsaccount weg.

Stap 2. Diagnose: De nieuwe tooninstructie vereist een empathische inleiding in elke respons. Deze eis verbruikt het responsbudget en de modelaandacht en leidt tot onvolledige feitelijke antwoorden.

Classificatie: Probleem met de configuratie van de agent. Conflict tussen tooninstructies en instructies voor nauwkeurigheid.

Referentie: Laag 2: Agentfouten sorteren

Stap 4: Herstellen (laag 3)

Het probleem is niet de tooninstructie zelf, maar concurrerende prioriteiten binnen de systeemprompt. Herstel richt zich op het scheiden en prioriteren van instructies.

Oude instructie (enkel, concurrerend): "Erken altijd de bezorgdheid van de klant en toon empathie voordat u antwoord geeft." Begin elke reactie met het valideren van de ervaring van de klant."

Nieuwe instructie (gescheiden en geprioriteerd): "Neem altijd het volledige, feitelijke antwoord op de vraag van de klant op." Laat geen details weg om het kort te houden. Wanneer de klant frustratie of bezorgdheid uit, erken dat kort."

Belangrijke wijzigingen:

  • Nauwkeurigheid krijgt expliciet prioriteit.
  • De volledigheid van feitelijke antwoorden wordt expliciet vermeld.
  • Empathie is voorwaardelijk in plaats van universeel.
  • "Kort" beperkt de empathie om te voorkomen dat de inhoud wordt afgekapt.

Referentie: Laag 3: Foutenpatronen toewijzen aan herstelstrategieën

Stap 5: Verifiëren

Voer de volledige evaluatiesuite opnieuw uit, want systeempromptwijzigingen kunnen brede impact hebben.

Evaluatieset Vóór de wijziging Na regressie Na de wijziging
Feitelijke juistheid 91% 76% 90%
Toon en kwaliteit 83% 91% 89%
Alle overige Boven drempel Boven drempel Boven drempel

Beoordeling: Beide signalen voldoen nu aan hun blokkeringsdrempel. Toon keert niet volledig terug naar de piek, maar blijft ruim boven de blokkeringsdrempel van 75% en verbetert ten opzichte van de oorspronkelijke basislijn.

Stap 6: Documenteren

Testcase Type hoofdoorzaak Probleem vastgesteld Wijziging toegepast Opgelost
FA-007, FA-012, FA-018 (en andere) Agentconfiguratie Toonbegeleiding kreeg voorrang boven feitelijke volledigheid De prompt is geherstructureerd om nauwkeurigheid te prioriteren en voorwaardelijke empathie toe te passen Ja

Belangrijke conclusie: Valideer altijd wijzigingen in systeemprompts tegen de volledige evaluatiesuite, niet alleen het doelsignaal. Instructies concurreren om de aandacht van het model en verbeteringen in het ene gebied kunnen regressies in andere veroorzaken.

Patroon om op te letten: Dit scenario is een voorbeeld van het instructiebudgetprobleem. Naarmate prompts toenemen, worden instructieconflicten waarschijnlijker. Regelmatige consolidatie en vereenvoudiging dragen bij aan het behoud van stabiliteit.

Veelvoorkomende patronen over belevingen heen

Elke beleving begint vanuit een ander scenario om een uniek diagnostisch pad te illustreren. Om te zien hoe een enkele agent de volledige evaluatielevenscyclus doorloopt (score-interpretatie, sortering van mislukkingen, herstel en verificatie) bekijkt u Beleving 1, die het meest complete end-to-end scenario biedt.

Deze tabel belicht terugkerende patronen die in de verschillende belevingen zijn waargenomen en de praktische lessen die ze illustreren.

Patroon Waar u dit ziet Belangrijkste conclusie
Valideer eerst de evaluatie, daarna pas de agent Beleving 1 Een veelvoorkomende bron van verspilde moeite is gedrag van probleemoplossingsagenten wanneer de evaluatie zelf onjuist is.
Vlakke scores wijzen op een verkeerd geclassificeerde hoofdoorzaak Beleving 2 Als herhaald herstel de resultaten niet verbetert, herclassificeer dan het probleem. Misschien pakt u de verkeerde hoofdoorzaak aan.
De volledige evaluatiesuite opnieuw uitvoeren na promptwijzigingen Beleving 3 Promptwijzigingen kunnen invloed hebben op meerdere kwaliteitssignalen. Controleer altijd op regressies buiten het doelgebied.
Documenteer uitkomsten en beslissingen Alle belevingen Het bijhouden van een mislukkingslogboek voorkomt dat dezelfde hoofdoorzaken in latere iteraties opnieuw worden ontdekt.
Bekende hiaten kunnen acceptabel zijn Beleving 1 (KG-007), Beleving 2 (FA-019) Niet elke tekortkoming hoeft vóór de vrijgave opgelost te worden. Documenteer bekende hiaten en monitor deze in de loop van de tijd.

Volgende stappen

Na het bekijken van deze voorbeelden kiest u de volgende actie die het beste aansluit bij uw huidige situatie: