Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Dessa helhetsgenomgångar illustrerar hur lagren i utvärderingstriageramverket samverkar i praktiken. Varje fall startar från ett annat utvärderingsscenario och följer en unik diagnostisk process.
Genomgångarna visar hur man tillämpar ramverket steg för steg. Använd dessa exempel för att förstå hur man övergår från utvärderingsresultat till diagnos, åtgärder och verifiering i verkliga agentutvärderingsscenarier.
Dricks
Innan du går igenom dessa exempel, granska ramverkets mål, inklusive kärnbegrepp och principer.
| Resa | Utgångsläge | Vad det visar |
|---|---|---|
| Resa 1 | Första utvärderingsrundan | End-to-end flow: Tolka → Prioritera → Sortera → Åtgärda → Verifiera |
| Resa 2 | Poängen planar ut efter flera iterationer | Mönsteranalys, omklassificering och arbetsrundor för plattformsbegränsningar |
| Resa 3 | Poängen försämras efter en förändring | Regressionsdetektion, diagnos av instruktionskonflikter och lösning av avvägningar |
Kommentar
Dessa exempel är illustrativa och baserade på vanliga mönster som observerats över flera kundutvärderingar. Testkörningar, poäng och agentinformation är representativa sammansatta objekt snarare än poster från ett enda åtagande. De diagnostiska tillvägagångssätt och åtgärdsstrategier som visas återspeglar praxis i verkliga implementationer.
Resa 1: Första utvärderingsrundan
Du kör utvärderingspaketet för första gången i en kundsupportagent. Här är resultaten:
| Utvärderingsuppsättning | Andel godkända |
|---|---|
| Säkerhet och personlig information | 100 % |
| Frågor och svar om kärnverksamheten | 87 % |
| Kunskapsförankring | 71 % |
| Verktygsanrop | 92 % |
| Utlösarroutning | 88 % |
| Ton och kvalitet | 83 % |
| Eskalering | 90 % |
| Totalt | 85 % |
Steg 1: Tolka poäng (Nivå 1):
Använd tabellen för poängtolkning för att kalibrera tröskelvärden och identifiera vilka utvärderingsuppsättningar som ligger under blockerande tröskelvärden.
| Utvärderingsuppsättning | Poäng | Tröskelvärde | Status |
|---|---|---|---|
| Säkerhet och personlig information | 100 % | 95 % blockering | Godkänd |
| Frågor och svar om kärnverksamheten | 87 % | 80 % blockering | Godkänd |
| Kunskapsförankring | 71 % | 80 % blockering | Nedanstående blockering |
| Verktygsanrop | 92 % | 85 % blockering | Godkänd |
| Utlösarroutning | 88 % | 80 % blockering | Godkänd |
| Ton och kvalitet | 83 % | 75 % blockering | Godkänd |
| Eskalering | 90 % | 85 % blockering | Godkänd |
Bedömning av systemets färdighet: Iterera. Kunskapsjordning ligger under sin blockeringsgräns. Fokusera sanering där.
Steg 2: Prioritera fel (Lager 2, Steg 0)
Situationen: Kunskapsförankring har sju testkörningar. Två testfall misslyckas: KG-003 och KG-005. Båda testfallen ingår i en kärnuppsättning inom affärsutvärdering, så de är prioritet 2. Eftersom det bara finns två, prioritera båda.
Referens: Prioritera fel (Lager 2, Steg 0)
Steg 3: prioritera KG-003 (lager 2, steg 1–2)
Testkörning KG-003:
- Exempelinmatning: "Vad är din returpolicy?"
- Förväntat svar: "Vi erbjuder en returperiod på 30 dagar för alla köp."
- Agentens svar: "Vår returpolicy tillåter returer inom 15 arbetsdagar efter köp."
- Utvärderingsmetod: Matchning av nyckelord
- Resultat: Underkänt (förväntat "30 dagar", agenten sa "15 arbetsdagar")
Verifiera utvärderingsinställningen (steg 1 i lager 2):
| Question | Svar | Resultat |
|---|---|---|
| Är agentens svar acceptabelt? | Behöver kontrollera källdokumentet. | Kontrollera källan först. |
| Är det förväntade svaret fortfarande aktuellt? | Källdokumentet säger "15 arbetsdagar." Policyn uppdaterades. | Nej. Det förväntade svaret är föråldrat. |
Klassificering: Problem med utvärderingsinställning. Föråldrat förväntat svar. Agenten har rätt. Utvärderingen är felaktig.
Steg 4: prioritera KG-005 (lager 2, steg 1–2)
Testkörning KG-005:
- Exempelinmatning: "Inkluderar Premium-planen en förlängd garanti?"
- Förväntat svar: "Premium-planen inkluderar en tvåårig standardgaranti." Förlängda garantialternativ finns att köpa separat.
- Agentens svar: "Ja, Premium-planen inkluderar en treårig förlängd garanti som täcker alla delar och all arbetskostnad."
- Utvärderingsmetod: Jämför betydelse
- Resultat: Misslyckande (agenten angav påhittade garantidetaljer)
Verifiera utvärderingsinställningen (steg 1 i lager 2):
| Question | Svar | Resultat |
|---|---|---|
| Är agentens svar acceptabelt? | Nej. "Tre års utökad garanti" är fabricerat. | Fortsätt |
| Är det förväntade svaret aktuellt? | Ja. Källan bekräftar två års standardgaranti. | Fortsätt |
| Är testkörning realistiskt? | Ja. Vanlig kundfråga. | Fortsätt |
| Kan ett alternativt svar vara korrekt? | Nej. Garantidetaljerna är faktiska. | Fortsätt |
| Är utvärderingsmetoden lämplig? | Ja.Jämför betydelse är korrekt för semantisk korrekthet. | Utvärderingen är giltig. |
Diagnostisera agenten (steg 2 i lager 2):
| Question | Svar |
|---|---|
| Är källinnehållet felaktigt? | Nej. Källan säger "två års standardgaranti." |
| Motsade agenten informationen i källan? | Ja. Källan säger "två års standardgaranti", men agenten sa "tre års förlängd garanti." |
| Svarade agenten utan att använda någon källa? | Troligen ja. Detaljen om "treårig förlängd garanti som täcker alla delar och arbete" finns inte i någon källa. |
Klassificering: Problem med agentkonfiguration. Brist i kunskapsförankring. Agenten har tagit fram garantiuppgifter som inte finns i de konfigurerade kunskapskällorna.
Steg 5: Åtgärda (lager 3)
KG-003 (Reparation av utvärderingskonfiguration):
- Förändring: Uppdatera förväntat värde från "30-dagars returfönster" till "15 arbetsdagar"
- Kör om: endast KG-003
- Förväntat: Godkänd
KG-005 (Agentkonfigurationsåtgärd):
- Förändring: Lägg till kunskapsanknytningsinstruktion i systemprompten: "Svara endast baserat på information som finns i dina kunskapskällor." Om informationen inte finns tillgänglig, säg det.
- Kör om: Fullständig kunskapsgrundande utvärderingsuppsättning (ändring av agentkonfiguration kan ha bredare effekter)
- Förväntas: KG-005 godkänns. Andra testkörningar bör inte försämras.
Steg 6: Verifiera
När båda ändringarna har gjorts kör du om utvärderingsuppsättningen för kunskapsgrundning:
| Före | Efter |
|---|---|
| 71 % (5/7 godkända) | 86 % (6/7 godkända) |
Bedömning: Kunskapsgrundning är nu över den blockerande tröskeln på 80 %. Ett fel (KG-007) kvarstår och blockerar inte beredskapen. Granska det i nästa iteration.
Steg 7: Dokumentera (lager 4)
Registrera i felloggen:
| Testkörning | Grundorsakstyp | Observerat problem | Ändring genomförd | Löst |
|---|---|---|---|---|
| KG-003 | Utvärderingskonfiguration | Förväntat svar är föråldrat (policyn ändrades från 30 dagar till 15 arbetsdagar). | Uppdaterat förväntat värde | Ja |
| KG-005 | Handläggarkonfiguration | Felaktiga garantiuppgifter som inte finns i någon källa. | Lade till grundningsinstruktion i systemprompten | Ja |
Mönsternot: Verifiera förväntade värden mot källdokumenten före varje utvärderingskörning. Lägg till detta steg i checklistan inför utvärdering.
Ny kontroll av beredskap: Alla utvärderingsuppsättningar överskrider nu blockeringströsklar.
Beredskapsbedömning: Distribuera agenten med kända brister (dokumenterat KG-007, övervakningsplan på plats).
Referens: Lager 4: Analysera mönster och förbättra agenten kontinuerligt
Scenario 2: Poängplatå
Situation: Du kör fyra iterationer på en produktsupportagent. Den faktiska noggrannheten förblir oförändrad på 78 % under alla fyra körningar. Du justerar prompten efter varje körning men ser ingen förbättring.
Steg 1: Kontrollera mönster (lager 4)
Gå igenom felloggen över alla fyra iterationer:
| Iteration | Poäng | Ändring genomförd | Resultat |
|---|---|---|---|
| 1 | 78 % | (baslinje) | — |
| 2 | 79 % | Lagt till "Var noggrann med produktspecifikationerna" | Ingen meningsfull förändring |
| 3 | 77 % | Prompten omorganiserades för att sätta noggrannhetsinstruktionerna först. | Ingen meningsfull förändring |
| 4 | 78 % | Tillagda genomarbetade exempel på korrekta produktsvar | Ingen meningsfull förändring |
Trend: Oförändrad. Reparationen riktar sig inte mot den faktiska rotorsaken.
Referens: Lager 4: Analysera mönster och förbättra agenten kontinuerligt
Steg 2: Analysera misslyckade testfall
Gå igenom de sex ihållande felen i alla iterationer.
| Testkörning | Misslyckats sedan dess | Observerat problem |
|---|---|---|
| FA-002 | Iteration 1 | Agenten citerar Vanliga frågor och svar-sidan istället för produktmanualen |
| FA-005 | Iteration 1 | Agenten citerar Vanliga frågor och svar-sidan istället för produktmanualen |
| FA-008 | Iteration 1 | Agenten citerar Vanliga frågor och svar-sidan istället för produktmanualen |
| FA-011 | Iteration 1 | Agenten citerar Vanliga frågor och svar-sidan istället för produktmanualen |
| FA-014 | Iteration 1 | Agenten citerar Vanliga frågor och svar-sidan istället för produktmanualen |
| FA-019 | Iteration 2 | Agenten ger ett delvis svar från Vanliga frågor och svar, missar detaljer från manualen. |
Koncentrationsanalys: Fem av sex fel (83 %) beror på samma rotorsak: Agenten hämtar information från sidan med frågor och svar i stället för produkthandboken.
Steg 3: Prioritering (lager 2)
Klassificera felen initialt som Agentkonfigurationsproblem: Fel källa hämtad.
Tillämpa flera ändringar i agentkonfigurationen, inklusive omformulering av prompt, omordning och tillägg av exempel. Dessa förändringar leder inte till mätbar förbättring. Vid detta skede, validera felet mot indikatorer för plattformsbegränsningar.
| Indikator | Check |
|---|---|
| Felet kvarstår trots flera olika varianter av prompt eller konfiguration | Ja. Fyra iterationer utan förändring. |
| Hämtningen returnerar konsekvent felaktiga dokument trots att källkonfigurationen är korrekt. | Ja. Vanliga frågor och svar hämtas konsekvent i stället för produktmanualen. |
Omklassificering: Detta problem är en plattformsbegränsning relaterad till hämtningens ranking. Plattformen prioriterar konsekventa Vanliga frågor och svar framför produktmanualen för dessa frågor, och ytterligare ändringar i prompt eller instruktioner påverkar inte hämtningsbeteendet.
Referens: Lager 2: Prioritera agentfel
Steg 4: Åtgärda (lager 3 – Plattformsbegränsning)
När du klassificerar ett fel som en plattformsbegränsning, fokusera på arbetsrundor och dokumentation istället för att göra ändringar i agentkonfigurationen.
Referens: Svar på plattformsbegränsningar
Åtgärdsstrategi: Använd en eller flera av följande åtgärder för att minska påverkan:
- Omstrukturera produktmanualen med tydligare rubriker som matchar den terminologi som används i användarfrågor.
- Duplicera kritiska produktspecifikationer från manualen till Vanliga frågor och svar för att skapa redundanta sökvägar.
- Bearbeta manualens innehåll så att varje avsnitt adresserar en enda, tydligt definierad fråga för att förbättra matchningen av avsnitt vid informationshämtning.
Dessa tillvägagångssätt syftar till att påverka sökbeteendet utan att förlita sig på prompt- eller instruktionsändringar.
Eskalering och spårning: Om begränsningen kvarstår, dokumentera och eskalera begränsningen till plattformsteamet.
- Dokumentera begränsningen enligt följande: "Förfrågningar om <produktspecifikationer> leder konsekvent till Vanliga frågor och svar-sidan (senast uppdaterad: <datum>, <n> sidor) istället för produktmanualen (senast uppdaterad: <datum>, <N> sidor), trots att manualen innehåller auktoritativ information."
- Tillhandahåll stödjande bevis: Inkludera flera testfall som visar frågan, förväntad källa och faktisk källa som hämtats.
- Skicka in för utredning.
- Dela den dokumenterade begränsningen samt underlag med plattformsteamet för spårning och uppföljning.
Steg 5: Verifiera
När produkthandboken har omstrukturerats och redundanta poster med vanliga frågor har lagts till kör du om den relevanta utvärderingsuppsättningen för att verifiera effekten.
| Före | Efter |
|---|---|
| 78 % (oförändrat över fyra iterationer) | 89 % |
Bedömning: Lösningen förbättrar den övergripande prestationen. Ett fel återstår (FA-019). Sökfrågan är för tvetydig för att pålitligt kunna hämta rätt källa, även med omstrukturerat innehåll. Detta fel är registrerat som en känd begränsning.
Steg 6: Dokumentera:
Uppdatera felloggen för att återspegla slutklassificeringen och resultaten.
| Testkörning | Grundorsakstyp | Observerat problem | Ändring genomförd | Löst |
|---|---|---|---|---|
| FA-002, 005, 008, 011, 014 | Plattformsbegränsning | Sökrankning prioriterar FAQ:n framför produktmanualen | Omstrukturerade rubriker i manualen; duplicerade kritiska specifikationer i Vanliga frågor och svar | Ja |
| FA-019 | Plattformsbegränsning | En tvetydig sökfråga kan inte pålitligt hämta rätt källa | Dokumenterat som en känd begränsning | Nej |
Viktig slutsats: Om utvärderingspoängen förblir oförändrade vid flera ändringar av prompter eller instruktioner är det osannolikt att rotorsaken är prompten. Verifiera infrastruktur- och plattformsbeteendet innan du investerar mer i promptteknik.
Resa 3: Regression efter uppdatering:
Situation: Du uppdaterade systemprompten för att förbättra ton och empati. Tonpoängen ökade, men faktakorrektheten sjönk under blockeringsgränsen, vilket introducerade en regression.
Före förändringen:
| Utvärderingsuppsättning | Poäng |
|---|---|
| Faktisk noggrannhet | 91 % |
| Ton och kvalitet | 83 % |
| Alla andra | Över tröskelvärdet |
Du lade till följande instruktion i systemprompten: "Bekräfta alltid kundens oro och visa empati innan du ger ditt svar. Börja varje svar med att validera kundens upplevelse."
Efter förändringen:
| Utvärderingsuppsättning | Före | Efter | Delta |
|---|---|---|---|
| Faktisk noggrannhet | 91 % | 76 % | –15 % |
| Ton och kvalitet | 83 % | 91 % | +8 % |
Steg 1: Tolka (Lager 1):
Faktanoggrannheten ligger nu under den blockerande tröskeln på 80 %. Denna förändring introducerar en regression och hindrar att systemet är redo.
Referens: Lager 1: Tolka poäng och identifiera misslyckanden
Steg 2: Kontrollera mönster (lager 4)
Matchning av tvärsignalmönster: Tonen förbättras medan noggrannheten försämras.
Angiven rotorsak: Instruktionskonflikt.
Den nyligen tillagda tonvägledningen konkurrerar med instruktioner för noggrannhet för modellens uppmärksamhet.
Referens: Lager 4: Analysera mönster och förbättra agenten kontinuerligt
Steg 3: Sortera de nya felen (Lager 2)
Granska den faktiska noggrannhet i testkörningar som skickades före ändringen och som nu misslyckas.
Testkörning FA-007:
- Indata: "Vad är den maximala filuppladdningsstorleken?"
- Förväntat: "Den maximala filuppladdningsstorleken är 25 MB för standardkonton och 100 MB för företagskonton."
- Agent tidigare: "Den maximala filuppladdningsstorleken är 25 MB för standardkonton och 100 MB för företagskonton."
- Agent efter: "Jag förstår helt din oro kring filuppladdningsstorlekar – det kan vara frustrerande när du försöker ladda upp viktiga dokument! Jag vill vara säker på att du har all information du behöver. Den maximala uppladdningsstorleken är 25 MB för standardabonnemang."
Steg 1. Verifiera utvärderingen: Det förväntade svaret är korrekt och utvärderingen är giltig. Svaret efter uppdateringen utelämnar företagskontoinformationen.
Steg 2. Diagnos: Den nya toninstruktionen kräver en empatiskt inledande text i varje svar. Detta krav förbrukar svarutrymmet och modellens uppmärksamhet, vilket leder till ofullständiga faktasvar.
Klassificering: Problem med agentkonfiguration. Instruktionskonflikt mellan tonvägledning och noggrannhet.
Referens: Lager 2: Prioritera agentfel
Steg 4: Åtgärda (lager 3)
Problemet är inte tonvägledningen i sig, utan motstridiga prioriteringar inom systemprompten. Reparationen fokuserar på att separera och prioritera instruktioner.
Gammal instruktion (enkel, motstridig): "Bekräfta alltid kundens oro och visa empati innan du ger ditt svar." Börja varje svar med att validera kundens upplevelse."
Ny instruktion (separerad, prioriterad): "Ge alltid ett fullständigt och faktabaserat svar på kundens fråga." Utelämna inte detaljer för att vara kortfattad. Dessutom, när kunden uttrycker frustration eller oro, bekräfta det kortfattat.
Viktiga ändringar:
- Korrekthet prioriteras uttryckligen.
- Fullständigheten i faktasvaren anges uttryckligen.
- Empati är villkorlig snarare än universell.
- "Kortfattat" begränsar empati för att förhindra att innehållet förkortas.
Referens: Lager 3: Koppla felmönster till åtgärdsstrategier
Steg 5: Verifiera
Kör hela utvärderingssviten igen, eftersom ändringar i systemprompten kan ha bred påverkan.
| Utvärderingsuppsättning | Före förändringen | Efter regression | Efter förändringen |
|---|---|---|---|
| Faktisk noggrannhet | 91 % | 76 % | 90 % |
| Ton och kvalitet | 83 % | 91 % | 89 % |
| Alla andra | Över tröskelvärdet | Över tröskelvärdet | Över tröskelvärdet |
Bedömning: Båda signalerna uppfyller nu sina blockerande tröskelvärden. Tonen återgår inte helt till det högsta värdet, men den ligger fortfarande långt över tröskelvärdet på 75 % blockering och förbättras jämfört med den ursprungliga baslinjen.
Steg 6: Dokumentera:
| Testkörning | Grundorsakstyp | Observerat problem | Ändring genomförd | Löst |
|---|---|---|---|---|
| FA-007, FA-012, FA-018 (och andra) | Handläggarkonfiguration | Tonvägledning som påverkar faktabaserad fullständighet | Prompten omstrukturerades för att prioritera precision och tillämpa villkorlig empati | Ja |
Viktig slutsats: Validera alltid ändringar i systemprompten mot hela testsviten, inte enbart den avsedda signalen. Instruktioner tävlar om modelluppmärksamhet, och förbättringar inom ett område kan leda till regressioner i andra.
Viktigt mönster att uppmärksamma: Detta scenario är ett exempel på instruktionsbudget-problemet. När prompt växer blir instruktionskonflikter mer sannolika. Regelbunden konsolidering och förenkling bidrar till att behålla stabilitet.
Vanliga mönster över resor
Varje resa börjar från ett nytt scenario för att illustrera en tydlig diagnostisk väg. För att se hur en enskild agent går igenom hela utvärderingslivscykeln—tolkning av poäng, triage av fel, åtgärd och verifiering—granska Journey 1, som erbjuder den mest kompletta genomgången från början till slut.
Denna tabell belyser återkommande mönster som observerats under utvärderingsresorna och de praktiska lärdomar de förstärker.
| Mönster | Var det visas | Viktiga punkter |
|---|---|---|
| Validera utvärderingen innan agenten | Resa 1 | En vanlig källa till onödigt arbete är fbeteendet för elsökningsagent när utvärderingen i sig är felaktig. |
| Jämna poäng indikerar en felaktigt klassificerad rotorsak | Resa 2 | Om upprepade korrigerande åtgärder inte förbättrar resultaten, omklassificera problemet. Du kanske tar itu med fel grundorsak. |
| Kör den fullständiga utvärderingssviten igen efter ändringar av prompten | Resa 3 | Promptändringar kan påverka flera kvalitetssignaler. Kontrollera alltid regressioner utanför målområdet. |
| Dokumentera resultat och beslut | Alla resor | Genom att underhålla en fellogg förhindrar man att samma rotorsaker återupptäcks i senare iterationer. |
| Kända luckor kan vara acceptabla | Resa 1 (KG-007), Resa 2 (FA-019) | Inte alla fel behöver åtgärdas före lansering. Dokumentera kända luckor och övervaka dem över tid. |
Nästa steg
Efter att ha granskat dessa exempel, välj nästa åtgärd som bäst passar din nuvarande situation:
- Börja med poängtolkning om du har utvärderingsresultat redo att bedöma.
- Påbörja felprioritering om du behöver diagnostisera specifika testkörningsfel.
- Tillämpa mönsteranalys om du arbetar med flera fel och vill identifiera systemiska problem.
- Sätt upp felregistrering för att spåra beslut, utfall och återkommande problem.
- Återvänd till ramverkets mål för att granska hela utvärderingens triage-process.