Lag 4: Analyser mønstre og forbedre agenten din kontinuerlig

Etter at du har behandlet individuelle testfeil, kan du utføre tiltak og likevel se liten eller ingen forbedring i agentens samlede ytelse. Dette resultatet indikerer ofte et systemisk problem, ikke en samling av ikke-relaterte feil.

Mønsteranalyse hjelper deg å se på tvers av flere mislykkede testtilfeller for å identifisere gjentakende signaler og felles rotårsaker. Bruk mønsteranalyse for å fokusere på endringer som retter grupper av feil samtidig, i stedet for å fikse hver feil enkeltvis.

Viktig!

Bruk denne veiledningen etter at du har fullført feilsorteringen og implementert utbedringsendringer. Mønsteranalyse er mest nyttig etter at du har sortert minst fem feil.

Når bør mønsteranalyse brukes?

Mønsteranalyse er mest nyttig når du observerer én eller flere av følgende situasjoner:

  • Mange feil i samme evalueringssett.
  • Gjentatte feil med lignende symptomer.
  • Forbedringer av individuelle testtilfeller som ikke påvirker de totale poengsummene.
  • Forbedringer på ett område som fører til regresjoner på et annet.

Det å løse feil én etter én er ineffektivt i slike situasjoner. Mønsteranalyse hjelper deg å identifisere hva feilene har til felles, slik at du kan ta tak i den underliggende årsaken.

Konsentrasjonsanalyse

Etter at du har klassifisert individuelle feil, se etter mønstre i hele feilsettet.

Mønster Hva det indikerer Anbefalt handling
80 % eller flere feil er problemer med evalueringsoppsett Evalueringspakken trenger kalibrering, ikke endringer av agenten Stans agentens gjentakelse midlertidig. Gå gjennom og forbedre evalueringskvaliteten først, kjør deretter testen på nytt for å få et tydelig signal.
80 % eller mer av feilene er problemer med agentkonfigurasjon innen ett område (f.eks. alle relatert til kunnskap) Systemisk konfigurasjonsmangel hos agenten Fokuser utbedringen på det området. Dette problemet er ofte et arkitekturproblem (f.eks. strukturen på kunnskapskilden), ikke utbedringer av individuelle testtilfeller.
80 % eller flere av feilene skyldes plattformbegrensninger Agenten når plattformens grenser Revurder agentens omfang Eskaler til plattformteamet. Juster terskler eller behandle berørte elementer som kjente begrensninger der det er hensiktsmessig.
Feil fordeler seg jevnt på tvers av rotårsakstyper Ikke ett enkelt systemisk problem Fortsett utbedringen fra sak til sak ved bruk av utbedringskartlegging.

Slik utfører du konsentrasjonsanalyse

  1. Tell opp de klassifiserte feilene etter type rotårsak:

    • Problemer med evalueringsoppsett
    • Problemer med agentkonfigurasjon
    • Plattformbegrensninger
    • Uklassifisert
  2. Beregn prosentandelen for hver type.

  3. Hvis én enkelt type er 80 % eller høyere – som indikerer et systemisk problem – utbedre kategorien, ikke enkelttilfeller.

  4. Hvis problemer med agentkonfigurasjon samler seg rundt ett kvalitetssignal (f.eks. fem av seks er kunnskapsforankring), tyder dette mønsteret på en arkitektonisk rotårsak.

Mønstre på tvers av signaler

Når feil oppstår på tvers av flere evalueringssett, peker de ofte på en felles rotårsak. Se etter følgende mønstre:

Mønster Hva det sannsynligvis indikerer Hva bør undersøkes?
Både faktanøyaktighet og kunnskapsforankring feiler Problem med kunnskapskilde (feil, mangler, utilgjengelig eller utdatert) Kunnskapskonfigurasjon, indekseringsstatus og innholdets aktualitet
Både verktøykall og utløserruting feiler Problem med konfigurasjon av iverksetting – emner og verktøy er ikke riktig koblet sammen Gjennomgå hvordan emner rutes til verktøy. Kontroller om det finnes frakoblede eller feilkonfigurerte flyter.
Tonen består ikke, men nøyaktigheten består Agenten får riktig svar, men leverer det dårlig Fokuser på instruksjoner om spørsmålsstil; nøyaktighetsinfrastrukturen er solid.
Sikkerhet består, men nøyaktighet består ikke Agenten kan ha for mange begrensninger – for forsiktig, nekter å svare når den burde Revider sikkerhetsinstruksjonene for å identifisere altfor brede restriksjoner som blokkerer legitime svar.
Alt som består, bortsett fra kanttilfeller Kjerneatferden er sunn Fokuser på å øke robustheten i marginene; dette mønsteret er et godt tegn.
Nøyaktigheten forbedres, men tonen forringes Instruksjonskonflikt – nye nøyaktighetsinstruksjoner kan fortrenge toneveiledning Gå gjennom nylige spørsmålsendringer, og tenk på «instruksjonsbudsjettet».
Flere evalueringssett forringes alle samtidig Sannsynligvis én enkelt rotårsak med bred innvirkning Kontroller om det har vært nylige endringer i systeminstruks eller oppdateringer av kunnskapskilder eller plattformmodell.

Hva som må gjøres med mønstre på tvers av signaler

  1. Identifiser den delte rotårsaken: Hvis to signaler feiler samtidig, deler de sannsynligvis en avhengighet, for eksempel en kunnskapskilde, en spørsmålseksjon eller en verktøykonfigurasjon.
  2. Reparer den felles avhengigheten: Ikke reparer hvert signal separat.
  3. Kjør begge evalueringssettene på nytt: Etter at feilen er rettet, bekreft at begge settene forbedres.
  4. Hvis bare ett forbedres, har signalene faktisk ikke en felles rotårsak. Sorter de resterende feilene separat.

Trendanalyse gjennom gjentakelser

Spor hvordan poengsummer utvikler seg gjennom gjentakelsessyklusene dine for å forstå om utbedringsstrategien din fungerer.

Trend Tolkning Handling
Poengsummer som forbedres på tvers av gjentakelser Utbedringen fungerer Fortsett til terskler er nådd.
Poengsummene forblir uendret til tross for endringer Utbedringen retter seg ikke mot den egentlige rotårsaken Gjennomfør ny sortering; klassifiseringen av rotårsak kan være feil.
Poengsummen blir dårligere etter en endring Regresjon – endringen medførte at noe ble brutt Rull tilbake endringen. Undersøk hva som forverret seg og hvorfor.
Ett av evalueringssettene forbedres, et annet forringes Avveining – å reparere én dimensjon skadet en annen Undersøk kobling, ofte forårsaket av instruksjonskonflikt (se Reise 3).
Poengsummer som varierer mellom kjøringer (mer enn +/-10 % avvik) Ustabilitet hos sensor eller ikke-determinisme hos agenten Valider sensors pålitelighet først (se Validering av sensor). Kjør minst tre ganger per gjentakelse.

Bygge en trendoversikt

Etter hver gjentakelse, registrer følgende:

  • Dato
  • Endring gjort
  • Evalueringssett
  • Poengsum før
  • Poengsum etter
  • Delta

Denne informasjonen hjelper deg med følgende:

  • Bekreft at du konvergerer mot terskler
  • Identifiser regresjoner raskt
  • Identifiser platåer tidlig (Reise 2)

Dokumenter feil

Strukturerte feilregistre bygger institusjonell kunnskap gjennom gjentakelsessykluser. Uten dokumentasjon gjentar team ofte det samme analysearbeidet.

Hvorfor dokumentere feil?

  • Raskere fremtidig sortering: Du gjenkjenner umiddelbart kjente feilmønstre.
  • Bygg eskaleringsgrunnlag: Samle logger over plattformbegrensninger for å styrke argumentene til plattformteamet.
  • Muliggjør teamlæring: Loggen hjelper til med å forhindre dupliserte undersøkelser når flere personer jobber med samme agent.
  • Spor kjente mangler: Ikke glem å loggføre feil klassifisert som «lar seg ikke reparere» eller «kjent begrensning.»

Bruk feilloggmalen

Bruk feilloggmalen for å registrere feil i et enkelt eller detaljert format, avhengig av teamstørrelse og prosessmodenhet.

Hva skal registreres?

Som minimum bør du registrere følgende informasjon for hver sorterte feil:

  1. Hvilket testtilfelle feilet.
  2. Hvilken rotårsakstype klassifiserte du det som.
  3. Hva gikk galt spesifikt.
  4. Hva du endret for å rette det.
  5. Om løsningen fungerte.

For uløste feil, noter også:

  • Tiltak som er forsøkt til nå.
  • Hvorfor det fortsatt er uløst.
  • Tidspunkt for revurdering (for eksempel «etter plattformoppdatering X»).

Kontinuerlig forbedringsprosess

Bruk denne sjekklisten etter hver sorterings- og utbedringssyklus for å bekrefte at du har dokumentert resultatene og neste trinn.

Sjekkliste etter gjentakelse

Ferdig? Oppgave
Registrer alle sorterte feil i feilloggen.
Identifiser og noter konsentrasjoner av rotårsaker.
Sjekk mønstre på tvers av signaler.
Registrer resultater for trendsporing.
Dokumenter kjente begrensninger med løsninger.
Identifiser prioriteringer for neste gjentakelse basert på gjenværende feil.
Fastsett tidsplan for ny kjøring (hvilke evalueringssett, når).

Når bør du slutte å gjenta?

Slutt å gjenta når:

  • Alle evalueringssett ligger over terskler.
  • Du har dokumentert kjente mangler.
  • Poengsummene er konsekvente (< 5 % varians).
  • Ingen åpne problemer med agentkonfigurasjon for blokkering av signaler.

Ikke stopp gjentakelsen når

  • du ikke undersøkte vedvarende feil
  • Du fjernet vanskelige testtilfeller for å nå terskler.
  • Du dokumenterte ikke plattformbegrensninger.

Du finner mer informasjon i Bestem når gjentakelsen er fullført.

Neste trinn

  • Gå gjennom praktiske eksempler som viser hvordan rammeverkslagene fungerer sammen i virkelige scenarioer.
  • Bruk feilloggmalen til å holde oversikt over funnene dine.