Spor agentevalueringsfeil med strukturerte loggmaler

Dokumentering av evalueringsfeil bygger institusjonell kunnskap som akselererer fremtidige sorteringsøkter. Når du møter samme type feil igjen, vet du allerede hva du skal sjekke først i stedet for å gjenoppdage de samme grunnårsakene.

Bruk disse strukturerte malene til å registrere feilanalyser fra sorteringsøktene dine. Velg versjonen som best passer til teamets behov og arbeidsflyt.

Viktig!

Fullfør feilsorteringen først. Dokumenter feil etter hvert som du diagnostiserer dem.

Velg malversjonen som passer teamet ditt:

  • Lettvektsversjon for små team som gjentar på én enkelt agent
  • Detaljert versjon for større team eller når du skal bygge institusjonell kunnskap på tvers av agenter

Lett feillogg

Den lette feilloggen er ment for små team eller raske sorteringsøkter.

Kopier denne tabellen og fyll den ut under sorteringsøktene. Legg til en rad for hver feil.

Testsak Årsakstype Feil observert Endring implementert Løst
___ Evalueringsoppsett, agentkonfigurasjon eller plattformbegrensning ___ ___ Ja / Nei / Delvis
___ ___ ___ ___ ___
___ ___ ___ ___ ___

Eksempel (utfylt)

Testsak Årsakstype Feil observert Endring implementert Løst
KG-003 Evalueringsoppsett Forventet svar er utdatert (gamle returpolicy – 30 dager; nåværende policy er 15 virkedager) Oppdatert forventet verdi til 15 virkedager Ja
KG-005 Agentkonfigurasjon Agenten oppga garantidetaljer som ikke finnes i noen tilgjengelige kunnskapskilder Lagt til instruksjon om kunnskapsgrunnlag: «Svar bare fra kunnskapskilder» Ja
TI-002 Plattformbegrensning Rangeringssystemet ignorerer nøyaktig dokumenttittel; Vanlige spørsmål hentes alltid i stedet for produktmanualen Omstrukturerte dokumentoverskrifter som en midlertidig løsning; eskalert til plattformteamet Delvis
FA-019 Plattformbegrensning Tvetydig spørring kan ikke pålitelig hente riktig kilde Dokumentert som kjent begrensning; overvåkes i produksjon Nei (kjent avvik)

Detaljert feillogg

Den detaljerte feilloggen er for team som trenger å dele funn, følge status på tvers av sprinter, eller bygge institusjonell kunnskap på tvers av flere agenter.

Notat

Last ned en CSV-versjon av denne malen.

Registrering per feil

Felt Verdi
Testsaks-ID (fra evalueringssettet, f.eks. KG-003)
Evalueringssett (hvilket evalueringssett denne posten tilhører)
Kvalitetssignal (faktisk nøyaktighet, kunnskapsgrunnlag, verktøykalling osv.)
Årsakstype (evalueringsoppsett, agentkonfigurasjon, plattformbegrensning, verktøyintegrasjon, uklassifisert)
Detaljer om rotårsaken (spesifikk undertype, som «utdatert forventet svar», «verktøybeskrivelsestvetydighet»)
Feil observert (hva agenten gjorde kontra hva den burde ha gjort)
Diagnosebane (hvilke soteringsspørsmål som førte til denne klassifiseringen, f.eks. «Trinn 1, Sp1.2 – forventet svar utdatert»)
Utbedringstiltak (hva som ble endret; spesifikke nok detaljer til å kunne gjenskapes)
Status (åpen, pågående, løst, vil ikke rette)
Begrunnelse for vil ikke rette (hvis Vil ikke rette: hvorfor, og hvilken overvåking som er på plass)
Verifisering (resultat fra ny kjøring: bestått eller ikke bestått, dato, gjentakelsesnummer)
Dato for sortering ___
Stortert etter ___

Eksempel (utfylt)

Felt Verdi
Testsaks-ID KG-005
Evalueringssett Kunnskapsgrunnlag
Kvalitetssignal Kunnskapsgrunnlag
Årsakstype Agentkonfigurasjon
Detaljer om rotårsaken Feil informasjon, agentgenerert innhold finnes ikke i noen kunnskapskilde
Feil observert Agenten hevdet «3-års utvidet garanti som dekker alle deler og arbeid» når kilden sier «2-års standardgaranti»
Diagnosebane Trinn 1 bestått (evaluering gyldig) → Trinn 2, Sp2.4 (besvart uten kilde) + Sp2.5 (motsagt kilde)
Utbedringstiltak Lagt til i systeminstruksjonen: «Svar bare basert på informasjon funnet i kunnskapskildene dine. Hvis informasjonen ikke er tilgjengelig, si ifra.»
Status Løst
Begrunnelse for vil ikke rette Ikke tilgjengelig
Verifisering Godkjent (gjentakelse 2, 15. februar)
Dato for sortering 14. februar
Stortert etter [navn]

Logg for gjentakelsessammendrag

Spor poengsummer og endringer på tvers av gjentakelser for trendanalyse.

Gjentakelse Dato Endring gjort Påvirket evalueringssett Poengsum før Poengsum etter Delta Merknader
1 ___ Grunnlinje (ingen endringer) Alle ___% Første kjøring
2 ___ ___ ___ ___% ___% ___ ___
3 ___ ___ ___ ___% ___% ___ ___

Oppsummering av konsentrasjon

Etter hver sorteringsøkt, teller rotårsakstyper for å finne konsentrasjonsmønstre.

Årsakstype Antall % av totalt Systemisk?
Evalueringsoppsett ___ ___% (80 %+ = pause agentarbeid, utbedre evalueringer først)
Agentkonfigurasjon ___ ___% (80 %+ i ett område = arkitektonisk problem)
Plattformbegrensning ___ ___% (80 %+ = revurder omfang, eskaler)
Verktøy eller integrering ___ ___% (rett serverdel, ikke agent)
Uklassifisert ___ ___% (overvåk; kan bli klassifisert med mer data)
Totalt ___ 100%

Anbefalt fremgangsmåte for vedlikehold av loggen

  • Oppdater i sanntid under sortering. Ikke samle opp oppdateringer etter økten.
  • Registrer også negative resultater, for eksempel «prøvde X, hjalp ikke». Denne praksisen bidrar til å forhindre at du prøver feilslåtte fremgangsmåter på nytt.
  • Gjennomgå før hver gjentakelse. Se etter mønstre før du behandler individuelle feil.
  • Del med teamet. Del loggen med teamet slik at alle ser tidligere funn.
  • Arkiver, ikke slett. Behold løste oppføringer for mønsteranalyse. Flytt oppføringer til en arkivøkt hvis den aktive loggen blir lang.

Neste trinn

Etter å ha dokumentert dine feil: