Tillämpa prioriteringsramverket för utvärdering genom praktiska scenarier

Dessa helhetsgenomgångar illustrerar hur lagren i utvärderingstriageramverket samverkar i praktiken. Varje fall startar från ett annat utvärderingsscenario och följer en unik diagnostisk process.

Genomgångarna visar hur man tillämpar ramverket steg för steg. Använd dessa exempel för att förstå hur man övergår från utvärderingsresultat till diagnos, åtgärder och verifiering i verkliga agentutvärderingsscenarier.

Dricks

Innan du går igenom dessa exempel, granska ramverkets mål, inklusive kärnbegrepp och principer.

Resa Utgångsläge Vad det visar
Resa 1 Första utvärderingsrundan End-to-end flow: Tolka → Prioritera → Sortera → Åtgärda → Verifiera
Resa 2 Poängen planar ut efter flera iterationer Mönsteranalys, omklassificering och arbetsrundor för plattformsbegränsningar
Resa 3 Poängen försämras efter en förändring Regressionsdetektion, diagnos av instruktionskonflikter och lösning av avvägningar

Kommentar

Dessa exempel är illustrativa och baserade på vanliga mönster som observerats över flera kundutvärderingar. Testkörningar, poäng och agentinformation är representativa sammansatta objekt snarare än poster från ett enda åtagande. De diagnostiska tillvägagångssätt och åtgärdsstrategier som visas återspeglar praxis i verkliga implementationer.

Resa 1: Första utvärderingsrundan

Du kör utvärderingspaketet för första gången i en kundsupportagent. Här är resultaten:

Utvärderingsuppsättning Andel godkända
Säkerhet och personlig information 100 %
Frågor och svar om kärnverksamheten 87 %
Kunskapsförankring 71 %
Verktygsanrop 92 %
Utlösarroutning 88 %
Ton och kvalitet 83 %
Eskalering 90 %
Totalt 85 %

Steg 1: Tolka poäng (Nivå 1):

Använd tabellen för poängtolkning för att kalibrera tröskelvärden och identifiera vilka utvärderingsuppsättningar som ligger under blockerande tröskelvärden.

Utvärderingsuppsättning Poäng Tröskelvärde Status
Säkerhet och personlig information 100 % 95 % blockering Godkänd
Frågor och svar om kärnverksamheten 87 % 80 % blockering Godkänd
Kunskapsförankring 71 % 80 % blockering Nedanstående blockering
Verktygsanrop 92 % 85 % blockering Godkänd
Utlösarroutning 88 % 80 % blockering Godkänd
Ton och kvalitet 83 % 75 % blockering Godkänd
Eskalering 90 % 85 % blockering Godkänd

Bedömning av systemets färdighet: Iterera. Kunskapsjordning ligger under sin blockeringsgräns. Fokusera sanering där.

Steg 2: Prioritera fel (Lager 2, Steg 0)

Situationen: Kunskapsförankring har sju testkörningar. Två testfall misslyckas: KG-003 och KG-005. Båda testfallen ingår i en kärnuppsättning inom affärsutvärdering, så de är prioritet 2. Eftersom det bara finns två, prioritera båda.

Referens: Prioritera fel (Lager 2, Steg 0)

Steg 3: prioritera KG-003 (lager 2, steg 1–2)

Testkörning KG-003:

  • Exempelinmatning: "Vad är din returpolicy?"
  • Förväntat svar: "Vi erbjuder en returperiod på 30 dagar för alla köp."
  • Agentens svar: "Vår returpolicy tillåter returer inom 15 arbetsdagar efter köp."
  • Utvärderingsmetod: Matchning av nyckelord
  • Resultat: Underkänt (förväntat "30 dagar", agenten sa "15 arbetsdagar")

Verifiera utvärderingsinställningen (steg 1 i lager 2):

Question Svar Resultat
Är agentens svar acceptabelt? Behöver kontrollera källdokumentet. Kontrollera källan först.
Är det förväntade svaret fortfarande aktuellt? Källdokumentet säger "15 arbetsdagar." Policyn uppdaterades. Nej. Det förväntade svaret är föråldrat.

Klassificering: Problem med utvärderingsinställning. Föråldrat förväntat svar. Agenten har rätt. Utvärderingen är felaktig.

Steg 4: prioritera KG-005 (lager 2, steg 1–2)

Testkörning KG-005:

  • Exempelinmatning: "Inkluderar Premium-planen en förlängd garanti?"
  • Förväntat svar: "Premium-planen inkluderar en tvåårig standardgaranti." Förlängda garantialternativ finns att köpa separat.
  • Agentens svar: "Ja, Premium-planen inkluderar en treårig förlängd garanti som täcker alla delar och all arbetskostnad."
  • Utvärderingsmetod: Jämför betydelse
  • Resultat: Misslyckande (agenten angav påhittade garantidetaljer)

Verifiera utvärderingsinställningen (steg 1 i lager 2):

Question Svar Resultat
Är agentens svar acceptabelt? Nej. "Tre års utökad garanti" är fabricerat. Fortsätt
Är det förväntade svaret aktuellt? Ja. Källan bekräftar två års standardgaranti. Fortsätt
Är testkörning realistiskt? Ja. Vanlig kundfråga. Fortsätt
Kan ett alternativt svar vara korrekt? Nej. Garantidetaljerna är faktiska. Fortsätt
Är utvärderingsmetoden lämplig? Ja.Jämför betydelse är korrekt för semantisk korrekthet. Utvärderingen är giltig.

Diagnostisera agenten (steg 2 i lager 2):

Question Svar
Är källinnehållet felaktigt? Nej. Källan säger "två års standardgaranti."
Motsade agenten informationen i källan? Ja. Källan säger "två års standardgaranti", men agenten sa "tre års förlängd garanti."
Svarade agenten utan att använda någon källa? Troligen ja. Detaljen om "treårig förlängd garanti som täcker alla delar och arbete" finns inte i någon källa.

Klassificering: Problem med agentkonfiguration. Brist i kunskapsförankring. Agenten har tagit fram garantiuppgifter som inte finns i de konfigurerade kunskapskällorna.

Steg 5: Åtgärda (lager 3)

KG-003 (Reparation av utvärderingskonfiguration):

  • Förändring: Uppdatera förväntat värde från "30-dagars returfönster" till "15 arbetsdagar"
  • Kör om: endast KG-003
  • Förväntat: Godkänd

KG-005 (Agentkonfigurationsåtgärd):

  • Förändring: Lägg till kunskapsanknytningsinstruktion i systemprompten: "Svara endast baserat på information som finns i dina kunskapskällor." Om informationen inte finns tillgänglig, säg det.
  • Kör om: Fullständig kunskapsgrundande utvärderingsuppsättning (ändring av agentkonfiguration kan ha bredare effekter)
  • Förväntas: KG-005 godkänns. Andra testkörningar bör inte försämras.

Steg 6: Verifiera

När båda ändringarna har gjorts kör du om utvärderingsuppsättningen för kunskapsgrundning:

Före Efter
71 % (5/7 godkända) 86 % (6/7 godkända)

Bedömning: Kunskapsgrundning är nu över den blockerande tröskeln på 80 %. Ett fel (KG-007) kvarstår och blockerar inte beredskapen. Granska det i nästa iteration.

Steg 7: Dokumentera (lager 4)

Registrera i felloggen:

Testkörning Grundorsakstyp Observerat problem Ändring genomförd Löst
KG-003 Utvärderingskonfiguration Förväntat svar är föråldrat (policyn ändrades från 30 dagar till 15 arbetsdagar). Uppdaterat förväntat värde Ja
KG-005 Handläggarkonfiguration Felaktiga garantiuppgifter som inte finns i någon källa. Lade till grundningsinstruktion i systemprompten Ja

Mönsternot: Verifiera förväntade värden mot källdokumenten före varje utvärderingskörning. Lägg till detta steg i checklistan inför utvärdering.

Ny kontroll av beredskap: Alla utvärderingsuppsättningar överskrider nu blockeringströsklar.

Beredskapsbedömning: Distribuera agenten med kända brister (dokumenterat KG-007, övervakningsplan på plats).

Referens: Lager 4: Analysera mönster och förbättra agenten kontinuerligt

Scenario 2: Poängplatå

Situation: Du kör fyra iterationer på en produktsupportagent. Den faktiska noggrannheten förblir oförändrad på 78 % under alla fyra körningar. Du justerar prompten efter varje körning men ser ingen förbättring.

Steg 1: Kontrollera mönster (lager 4)

Gå igenom felloggen över alla fyra iterationer:

Iteration Poäng Ändring genomförd Resultat
1 78 % (baslinje)
2 79 % Lagt till "Var noggrann med produktspecifikationerna" Ingen meningsfull förändring
3 77 % Prompten omorganiserades för att sätta noggrannhetsinstruktionerna först. Ingen meningsfull förändring
4 78 % Tillagda genomarbetade exempel på korrekta produktsvar Ingen meningsfull förändring

Trend: Oförändrad. Reparationen riktar sig inte mot den faktiska rotorsaken.

Referens: Lager 4: Analysera mönster och förbättra agenten kontinuerligt

Steg 2: Analysera misslyckade testfall

Gå igenom de sex ihållande felen i alla iterationer.

Testkörning Misslyckats sedan dess Observerat problem
FA-002 Iteration 1 Agenten citerar Vanliga frågor och svar-sidan istället för produktmanualen
FA-005 Iteration 1 Agenten citerar Vanliga frågor och svar-sidan istället för produktmanualen
FA-008 Iteration 1 Agenten citerar Vanliga frågor och svar-sidan istället för produktmanualen
FA-011 Iteration 1 Agenten citerar Vanliga frågor och svar-sidan istället för produktmanualen
FA-014 Iteration 1 Agenten citerar Vanliga frågor och svar-sidan istället för produktmanualen
FA-019 Iteration 2 Agenten ger ett delvis svar från Vanliga frågor och svar, missar detaljer från manualen.

Koncentrationsanalys: Fem av sex fel (83 %) beror på samma rotorsak: Agenten hämtar information från sidan med frågor och svar i stället för produkthandboken.

Steg 3: Prioritering (lager 2)

Klassificera felen initialt som Agentkonfigurationsproblem: Fel källa hämtad.

Tillämpa flera ändringar i agentkonfigurationen, inklusive omformulering av prompt, omordning och tillägg av exempel. Dessa förändringar leder inte till mätbar förbättring. Vid detta skede, validera felet mot indikatorer för plattformsbegränsningar.

Indikator Check
Felet kvarstår trots flera olika varianter av prompt eller konfiguration Ja. Fyra iterationer utan förändring.
Hämtningen returnerar konsekvent felaktiga dokument trots att källkonfigurationen är korrekt. Ja. Vanliga frågor och svar hämtas konsekvent i stället för produktmanualen.

Omklassificering: Detta problem är en plattformsbegränsning relaterad till hämtningens ranking. Plattformen prioriterar konsekventa Vanliga frågor och svar framför produktmanualen för dessa frågor, och ytterligare ändringar i prompt eller instruktioner påverkar inte hämtningsbeteendet.

Referens: Lager 2: Prioritera agentfel

Steg 4: Åtgärda (lager 3 – Plattformsbegränsning)

När du klassificerar ett fel som en plattformsbegränsning, fokusera på arbetsrundor och dokumentation istället för att göra ändringar i agentkonfigurationen.

Referens: Svar på plattformsbegränsningar

Åtgärdsstrategi: Använd en eller flera av följande åtgärder för att minska påverkan:

  • Omstrukturera produktmanualen med tydligare rubriker som matchar den terminologi som används i användarfrågor.
  • Duplicera kritiska produktspecifikationer från manualen till Vanliga frågor och svar för att skapa redundanta sökvägar.
  • Bearbeta manualens innehåll så att varje avsnitt adresserar en enda, tydligt definierad fråga för att förbättra matchningen av avsnitt vid informationshämtning.

Dessa tillvägagångssätt syftar till att påverka sökbeteendet utan att förlita sig på prompt- eller instruktionsändringar.

Eskalering och spårning: Om begränsningen kvarstår, dokumentera och eskalera begränsningen till plattformsteamet.

  • Dokumentera begränsningen enligt följande: "Förfrågningar om <produktspecifikationer> leder konsekvent till Vanliga frågor och svar-sidan (senast uppdaterad: <datum>, <n> sidor) istället för produktmanualen (senast uppdaterad: <datum>, <N> sidor), trots att manualen innehåller auktoritativ information."
  • Tillhandahåll stödjande bevis: Inkludera flera testfall som visar frågan, förväntad källa och faktisk källa som hämtats.
  • Skicka in för utredning.
  • Dela den dokumenterade begränsningen samt underlag med plattformsteamet för spårning och uppföljning.

Steg 5: Verifiera

När produkthandboken har omstrukturerats och redundanta poster med vanliga frågor har lagts till kör du om den relevanta utvärderingsuppsättningen för att verifiera effekten.

Före Efter
78 % (oförändrat över fyra iterationer) 89 %

Bedömning: Lösningen förbättrar den övergripande prestationen. Ett fel återstår (FA-019). Sökfrågan är för tvetydig för att pålitligt kunna hämta rätt källa, även med omstrukturerat innehåll. Detta fel är registrerat som en känd begränsning.

Steg 6: Dokumentera:

Uppdatera felloggen för att återspegla slutklassificeringen och resultaten.

Testkörning Grundorsakstyp Observerat problem Ändring genomförd Löst
FA-002, 005, 008, 011, 014 Plattformsbegränsning Sökrankning prioriterar FAQ:n framför produktmanualen Omstrukturerade rubriker i manualen; duplicerade kritiska specifikationer i Vanliga frågor och svar Ja
FA-019 Plattformsbegränsning En tvetydig sökfråga kan inte pålitligt hämta rätt källa Dokumenterat som en känd begränsning Nej

Viktig slutsats: Om utvärderingspoängen förblir oförändrade vid flera ändringar av prompter eller instruktioner är det osannolikt att rotorsaken är prompten. Verifiera infrastruktur- och plattformsbeteendet innan du investerar mer i promptteknik.

Resa 3: Regression efter uppdatering:

Situation: Du uppdaterade systemprompten för att förbättra ton och empati. Tonpoängen ökade, men faktakorrektheten sjönk under blockeringsgränsen, vilket introducerade en regression.

Före förändringen:

Utvärderingsuppsättning Poäng
Faktisk noggrannhet 91 %
Ton och kvalitet 83 %
Alla andra Över tröskelvärdet

Du lade till följande instruktion i systemprompten: "Bekräfta alltid kundens oro och visa empati innan du ger ditt svar. Börja varje svar med att validera kundens upplevelse."

Efter förändringen:

Utvärderingsuppsättning Före Efter Delta
Faktisk noggrannhet 91 % 76 % –15 %
Ton och kvalitet 83 % 91 % +8 %

Steg 1: Tolka (Lager 1):

Faktanoggrannheten ligger nu under den blockerande tröskeln på 80 %. Denna förändring introducerar en regression och hindrar att systemet är redo.

Referens: Lager 1: Tolka poäng och identifiera misslyckanden

Steg 2: Kontrollera mönster (lager 4)

Matchning av tvärsignalmönster: Tonen förbättras medan noggrannheten försämras.

Angiven rotorsak: Instruktionskonflikt.

Den nyligen tillagda tonvägledningen konkurrerar med instruktioner för noggrannhet för modellens uppmärksamhet.

Referens: Lager 4: Analysera mönster och förbättra agenten kontinuerligt

Steg 3: Sortera de nya felen (Lager 2)

Granska den faktiska noggrannhet i testkörningar som skickades före ändringen och som nu misslyckas.

Testkörning FA-007:

  • Indata: "Vad är den maximala filuppladdningsstorleken?"
  • Förväntat: "Den maximala filuppladdningsstorleken är 25 MB för standardkonton och 100 MB för företagskonton."
  • Agent tidigare: "Den maximala filuppladdningsstorleken är 25 MB för standardkonton och 100 MB för företagskonton."
  • Agent efter: "Jag förstår helt din oro kring filuppladdningsstorlekar – det kan vara frustrerande när du försöker ladda upp viktiga dokument! Jag vill vara säker på att du har all information du behöver. Den maximala uppladdningsstorleken är 25 MB för standardabonnemang."

Steg 1. Verifiera utvärderingen: Det förväntade svaret är korrekt och utvärderingen är giltig. Svaret efter uppdateringen utelämnar företagskontoinformationen.

Steg 2. Diagnos: Den nya toninstruktionen kräver en empatiskt inledande text i varje svar. Detta krav förbrukar svarutrymmet och modellens uppmärksamhet, vilket leder till ofullständiga faktasvar.

Klassificering: Problem med agentkonfiguration. Instruktionskonflikt mellan tonvägledning och noggrannhet.

Referens: Lager 2: Prioritera agentfel

Steg 4: Åtgärda (lager 3)

Problemet är inte tonvägledningen i sig, utan motstridiga prioriteringar inom systemprompten. Reparationen fokuserar på att separera och prioritera instruktioner.

Gammal instruktion (enkel, motstridig): "Bekräfta alltid kundens oro och visa empati innan du ger ditt svar." Börja varje svar med att validera kundens upplevelse."

Ny instruktion (separerad, prioriterad): "Ge alltid ett fullständigt och faktabaserat svar på kundens fråga." Utelämna inte detaljer för att vara kortfattad. Dessutom, när kunden uttrycker frustration eller oro, bekräfta det kortfattat.

Viktiga ändringar:

  • Korrekthet prioriteras uttryckligen.
  • Fullständigheten i faktasvaren anges uttryckligen.
  • Empati är villkorlig snarare än universell.
  • "Kortfattat" begränsar empati för att förhindra att innehållet förkortas.

Referens: Lager 3: Koppla felmönster till åtgärdsstrategier

Steg 5: Verifiera

Kör hela utvärderingssviten igen, eftersom ändringar i systemprompten kan ha bred påverkan.

Utvärderingsuppsättning Före förändringen Efter regression Efter förändringen
Faktisk noggrannhet 91 % 76 % 90 %
Ton och kvalitet 83 % 91 % 89 %
Alla andra Över tröskelvärdet Över tröskelvärdet Över tröskelvärdet

Bedömning: Båda signalerna uppfyller nu sina blockerande tröskelvärden. Tonen återgår inte helt till det högsta värdet, men den ligger fortfarande långt över tröskelvärdet på 75 % blockering och förbättras jämfört med den ursprungliga baslinjen.

Steg 6: Dokumentera:

Testkörning Grundorsakstyp Observerat problem Ändring genomförd Löst
FA-007, FA-012, FA-018 (och andra) Handläggarkonfiguration Tonvägledning som påverkar faktabaserad fullständighet Prompten omstrukturerades för att prioritera precision och tillämpa villkorlig empati Ja

Viktig slutsats: Validera alltid ändringar i systemprompten mot hela testsviten, inte enbart den avsedda signalen. Instruktioner tävlar om modelluppmärksamhet, och förbättringar inom ett område kan leda till regressioner i andra.

Viktigt mönster att uppmärksamma: Detta scenario är ett exempel på instruktionsbudget-problemet. När prompt växer blir instruktionskonflikter mer sannolika. Regelbunden konsolidering och förenkling bidrar till att behålla stabilitet.

Vanliga mönster över resor

Varje resa börjar från ett nytt scenario för att illustrera en tydlig diagnostisk väg. För att se hur en enskild agent går igenom hela utvärderingslivscykeln—tolkning av poäng, triage av fel, åtgärd och verifiering—granska Journey 1, som erbjuder den mest kompletta genomgången från början till slut.

Denna tabell belyser återkommande mönster som observerats under utvärderingsresorna och de praktiska lärdomar de förstärker.

Mönster Var det visas Viktiga punkter
Validera utvärderingen innan agenten Resa 1 En vanlig källa till onödigt arbete är fbeteendet för elsökningsagent när utvärderingen i sig är felaktig.
Jämna poäng indikerar en felaktigt klassificerad rotorsak Resa 2 Om upprepade korrigerande åtgärder inte förbättrar resultaten, omklassificera problemet. Du kanske tar itu med fel grundorsak.
Kör den fullständiga utvärderingssviten igen efter ändringar av prompten Resa 3 Promptändringar kan påverka flera kvalitetssignaler. Kontrollera alltid regressioner utanför målområdet.
Dokumentera resultat och beslut Alla resor Genom att underhålla en fellogg förhindrar man att samma rotorsaker återupptäcks i senare iterationer.
Kända luckor kan vara acceptabla Resa 1 (KG-007), Resa 2 (FA-019) Inte alla fel behöver åtgärdas före lansering. Dokumentera kända luckor och övervaka dem över tid.

Nästa steg

Efter att ha granskat dessa exempel, välj nästa åtgärd som bäst passar din nuvarande situation: