Lag 2: Triagering af agentfejl

Efter du har fortolket evalueringsresultater og identificeret fokusområder, skal du afgøre, hvorfor de enkelte testtilfælde fejlede, og hvem der skal handle.

Denne artikel giver struktureret vejledning til diagnosticering af fejl på testcase-niveau. Det hjælper dig med at klassificere den grundlæggende årsag, skelne mellem agent-, evaluerings- og infrastrukturproblemer og vælge den passende næste handling.

Inden du starter

Inden du påbegynder fejltriage:

  1. Gennemfør scorefortolkning og parathedsvurdering, og identificer, hvilke evalueringssæt der kræver opmærksomhed.
  2. Fokuser på de højest prioriterede fejl baseret på parathed og risiko.

Vigtigt!

Hvis du springer dette trin over, kan du ende med at bruge tid på problemer med lav påvirkning eller som ikke blokerer.

Forhånds-triage-tjek: Verificér infrastrukturens sundhed

Før du diagnosticerer individuelle fejl, skal du bekræfte, at afhængighederne fungerede korrekt under evalueringen. Infrastrukturproblemer kan forårsage fejl, der ligner agent- eller evalueringsproblemer, men som ikke er relateret til nogen af delene.

Kontrollér følgende:

  • Videnskilder er tilgængelige og fuldt indekserede.
  • API-backends eller connectors returnerer ikke fejl, timeouts eller begrænsningssvar.
  • Autentiseringstokens er gyldige under hele evalueringen.
  • Evalueringsmiljøet matcher den tiltænkte agentkonfiguration.

Hvis en afhængighed ikke fungerer korrekt, skal du rette problemet og gentage evalueringen, før du fortsætter. Udvælgelse af resultater fra en ustabil evaluering kan føre til forkerte konklusioner.

Trin 0: Prioriter fejl

Inden du gennemgår de enkelte testcases, skal du beslutte, hvor du vil fokusere først.

Prioriter fejl i denne rækkefølge:

Prioritet Triage først Begrundelse
1 Sikkerhed og overholdelse af angivne standardfejl Størst konsekvens. Løs disse fejl før udrulning.
2 Fejl i kerneforretningsscenarier Direkte indflydelse på agentens værdiforslag.
3 Fejl i det evalueringssæt, der har den laveste score Sandsynligvis systemisk. At rette rodårsagen kan løse flere fejl.
4 Tilbagevendende fejl på tværs af flere gennemløb Konsistente fejl er lettere at diagnosticere.
5 Fejl i kapabilitetsscenarier Vigtige, men typisk mindre betydningsfulde.

Hvis du har mange fejl (for eksempel mere end 15), så gennemgå ikke hver fejl individuelt. Start med evalueringssættet med lavest score og gennemgå manuelt et par fejl. Hvis fejlene har samme årsag, kan udbedring af denne løse mange fejl på én gang.

Identificer kvalitetssignalet for en fejlet test

Hvis et evalueringsresultat viser et fejlet testtilfælde, men ikke tydeligt identificerer kvalitetssignalet, skal du bruge evalueringssættet og bedømmelsesmetoden til at udlede signalet.

Eksempel:

  • Evalueringssættet angiver kompetenceområdet, såsom sikkerhed, forankring eller værktøjsbrug.
  • Bedømmelsesmetoden, såsom nøgleordsmatch eller rubrikbaseret scoring, giver mere kontekst.

At identificere det tilsigtede kvalitetssignal hjælper dig med at vælge de mest relevante diagnostiske spørgsmål.

Trin 1: Verificér evalueringsopsætningen

Vigtigt!

Start altid her. Før du undersøger agenten, skal du sikre dig, at evalueringsopsætningen er korrekt.

For hver fejl gennemgår du manuelt agentens faktiske svar sammen med forventet værdi og bedømmelsesmetoden.

Gennemgå de følgende spørgsmål i den angivne rækkefølge. Stop, når du når et resultat.

  1. Er agentens svar acceptabelt? Ville en rigtig bruger være tilfreds med dette svar, selvom det ikke bestod evalueringen?

    • Hvis ja, er der en fejl i evalueringsopsætningen: graderen eller den forventede værdi er forkert.
    • Hvis nej, fortsæt til næste spørgsmål.
  2. Er det forventede svar aktuelt og nøjagtigt i forhold til kilden?

    • Hvis ja, fortsæt til næste spørgsmål.
    • Hvis nej, er der et problem med evalueringsopsætningen: Det forventede svar er forældet eller forkert.
  3. Afspejler testtilfældet realistisk brugerinput?

    • Hvis ja, fortsæt til næste spørgsmål.
    • Hvis Nej, er der et problem med evalueringsopsætningen: Testcasen er urealistisk.
  4. Kan et rimeligt alternativt svar også være korrekt, men at bedømmeren ikke tillader det?

    • Hvis Ja, har evalueringsopsætningen et problem: Graderen er for stiv og tager ikke højde for gyldige variationer.
    • Hvis nej, fortsæt til næste spørgsmål.
  5. Er evalueringsmetoden passende til det, du tester?

    • Hvis Ja, er evalueringen gyldig. Gå videre til trin 2: Diagnosticér agenten.
    • Hvis nej, er der et problem med evalueringsopsætningen: Evalueringsmetoden er ikke egnet til dette kvalitetssignal.

Vurdering af svaracceptabilitet

Brug følgende signaler til at vurdere, om agentens svar er acceptabelt:

  • Samme nøglefakta, forskellig formulering → Ofte acceptabelt (vurderingspersonen kan være for streng).
  • Manglende kritisk information fundet i kilden → ofte ikke acceptabelt.
  • Uklar "god nok"-grænse → Acceptkriterier kan være uklare (markér til trin 4).

Er du i tvivl, så sammenlign indholdet med den oprindelige kilde frem for kun det forventede svar.

Disse signaler vejleder din dømmekraft, men kan ikke erstatte den.

Almindelige fejltyper i evalueringsopsætninger

Fejltype Beskrivelse Eksempel
Forældet forventet svar Kildeindholdet blev ændret, men den forventede værdi blev ikke opdateret Politikken blev opdateret til 15 dage, men evalueringen forventer stadig "30-dages returvindue."
Overdrevent stiv bedømmer Nøgleordsmatch fejler på et gyldigt synonym eller en omformulering Forventet "koldt vand." agentens svar lød "køligt vand, 30 grader C," hvilket er semantisk korrekt.
Urealistisk testcase Testscenariet matcher ikke den faktiske brugeradfærd Test af en forespørgsel på 4 afsnit, når rigtige brugere skriver 5-10 ord.
Forkert evalueringsmetode Evalueringsmetoden stemmer ikke overens med det, der faktisk testes Anvendelse af Nøgleord-match (Alle) til et syntesespørgsmål, hvor Sammenlign betydning er den rette metode.
Grader faktuel fejl Sprogmodellen som dommer opfinder en fejlårsag, der ikke er reel (isoleret fejl) Sprogmodel grader siger "svar nævner ikke returpolitikken", når det tydeligt gør det.
Vurderingssystematisk bias Sprogmodellen som dommer anvender en inkonsistent standard på tværs af testtilfælde (kalibreringsproblem) Grader består korte svar, men fejler længere svar på det samme kvalitetssignal, uanset indhold.
Tvetydige acceptkriterier Det forventede svar kan tolkes på flere måder "Bør inkludere prisinformation." Månedligt? Årligt? Pr. bruger?

Validering af bedømmer

Bedømmerens pålidelighed er en forudsætning for pålidelig fejltriage. Hvis selve bedømmeren er upålidelig, fejldiagnosticerer du hver fejl, den behandler.

For at validere graderens pålidelighed:

  1. Vælg 5-10 testeksempler, hvor du kender det korrekte bestået/ikke bestået udfald fra manuel gennemgang.
  2. Kør evalueringen og sammenlign graderens output med den manuelle vurdering.
  3. Hvis graderen er uenig i mere end 20% af tilfældene, skal graderen rekalibreres, før agenten fejlfindes.

Tegn en grader kræver opmærksomhed:

  • Den samme testsag giver forskellige afgørelser på tværs af kørsler.
  • Fejl samler sig i evalueringssæt, der bruger modelbaseret bedømmelse, mens deterministiske metoder består.
  • Graderen markerer problemer, som du ikke kan genskabe ved at gennemgå agentens svar.

Kalibreringsmuligheder for grader:

  • Brug deterministiske metoder, hvor det er muligt.
  • Tilføj eksplicitte "acceptable" og "ikke acceptable" eksempler til bedømmelsesvejledningen.
  • Udvid nøgleordsættene til at inkludere synonymer og gyldige omformuleringer.
  • Brug Sammenlign betydning i stedet for Nøgleord-match (Alle) til kontrol af semantisk ækvivalens.

Trin 2: Diagnosticér agenten

På dette tidspunkt er evalueringen gyldig, og agenten har givet et forkert svar. Diagnosticer hvad der gik galt i agentkonfigurationen.

Tip

Nogle diagnostiske spørgsmål kræver indsigt i, hvad agenten gjorde internt (for eksempel, hvilken videnskilde der blev hentet, hvilket værktøj der blev kaldt, eller hvilket emne der blev aktiveret). Brug sporingslogfiler, samtaleafskrifter eller testanalyser, når de er tilgængelige. Hvis din platform ikke viser disse detaljer, så udled dem ud fra svaret (for eksempel: indhold, der kun findes i Kilde A, kommer sandsynligvis fra Kilde A).

Tjek for faktuel nøjagtighed og problemer med videnforankring

Spørgsmål Hvis ja → rodårsag
Hentede agenten fra den forkerte videnskilde? Konfiguration af videnskilde Forkert kilde indekseret eller prioriteret.
Hentede agenten den korrekte kilde, men udtrak den forkerte information? prompt- eller instruktionsgap Modellen har brug for vejledning til udtræk.
Er selve kildeindholdet forkert eller forældet? Videnskildeindhold. Opdater kildedokumentet.
Svarede agenten uden at bruge nogen videnskilde (fandt på et svar)? Kildetilgængelighed. Kilden er ikke indekseret, eller forespørgselsformuleringen stemmer ikke overens med kildens vokabular.
Modsagde agenten oplysningerne, der er i kilden? Forkert information. Tilføj eksplicit grounding-instruktion.

Tjek for fejl i værktøjsinvokation

Spørgsmål Hvis ja → rodårsag
Skød det forkerte værktøj? Uklarhed i værktøjsbeskrivelser. Beskrivelserne overlapper mellem værktøjerne.
Blev det rigtige værktøj aktiveret med forkerte parametre? Definition af parameter. Skema eller beskrivelse uklar.
Blev værktøjet slet ikke aktiveret? Udløserbetingelse. Input opfylder ikke kravene til påkaldelse.
Blev værktøjet aktiveret, når det ikke burde? Negativt værn mangler. Ingen instruktion om, hvornår man ikke skal kalde værktøjet.
Blev værktøjet affyret korrekt, men svaret misbrugte outputtet? Svarinstruktion. Agenten har brug for vejledning i formatering af værktøjsoutput.
Affyrede værktøjet korrekt, men fejlede værktøjet selv (fejl, timeout, forkerte data)? Værktøjs- eller integrationsproblem; fejlen er i backend-systemet, ikke i agenten. Ret værktøjet, ikke agenten.

Tjek for fejl i trigger-rutning

Spørgsmål Hvis ja → rodårsag
Skød det forkerte emne? Emne-triggeroverlap Triggere er tvetydige på tværs af emner.
Var der ingen udløst emne (aktivere fallback)? Emne-dækningsgab. Ingen emner håndterer denne inddatatype.
Matchede flere emner med forkert fjernelse af flere udtryk? Logisk fjernelse af flere udtryk. Prioritets- eller afklaringsflow er fejlagtigt konfigureret

Kontrollér for fejl i tone- og svarkvalitet

Spørgsmål Hvis ja → rodårsag
Er agentens tone ikke i overensstemmelse med systempromptens vejledning? Mangel på tonevejledning. Løs manglende eller modstridende vejledning.
Er svaret for langt eller for kort i forhold til spørgsmålet? Formatinstruktion. Tilføj længde- eller strukturvejledning.
Mangler agenten empati i følsomme sammenhænge? Empati-instruktionsgab. Tilføj eksplicit vejledning om følelsesmæssige input.
Er svaret dårligt struktureret (lang tekst uden opdeling, ingen trin)? Formatinstruktion. Tilføj formateringskrav.

Tjek for sikkerheds- og grænsefejl

Spørgsmål Hvis ja → rodårsag
Afslørede agenten systemoplysninger? Systempromptbeskyttelse. Tilføj "må ikke afsløre"-instruktioner.
Gik agenten uden for området? Definition af omfangskløft. Definer grænser tydeligere.
Var agenten i overensstemmelse med promptinjektionen? Sikkerhedsinstruktioner. Tilføj vejledning om modstandsdygtighed over for angreb.
Håndterede agenten persondata forkert? Regler for håndtering af persondata. Tilføj databeskyttelsesinstruktioner.

Kontrollér, om der er eskalering og yndefuld fejl

Spørgsmål Hvis ja → rodårsag
Mislykkedes agenten med at eskalere, da den skulle? Udløser til eskalering. Kriterier er ikke defineret eller for snævre.
Eskalerede agenten for tidligt? Eskalationsgrænse. Kriterierne er for følsomme.
Blev samtalens kontekst tabt under eskaleringen? Konfiguration af aflevering. Kontekstbevarelse er ikke indstillet.
Gik agenten i loop i stedet for at anerkende fejl? Fallback-logik. Gentagelsesgrænse eller fallback-adfærd er ikke konfigureret.

Efter diagnosticering, kortlæg fejlmønstre til afhjælpningsstrategier efter rodårsag.

Trin 3: Identificer platformens begrænsninger

Hvis evalueringen er korrekt, og rimelige konfigurationsændringer ikke forbedrer resultaterne, kan problemet være en platformbegrænsning.

Platformbegrænsningsindikatorer

Indikator Hvad det antyder
Den samme fejl fortsætter på tværs af flere prompt- og konfigurationsvariationer Ikke et konfigurationsproblem
Hentning returnerer konsekvent forkerte dokumenter på trods af korrekt kildekonfiguration Begrænsning i hentningsrangering
Agenten er ikke i stand til at udføre den krævede ræsonnement trods klare instruktioner Modellens kapacitetsgrænse
Påkrævet orkestreringsmønster understøttes ikke af nogen konfigurationsmulighed Begrænsning i orkestreringslogik
Den modelbaserede bedømmelsesmodel fejlklassificerer konsekvent på trods af justering af vurderingskriterierne Bedømmelsesmodellens begrænsning

Handlingssti for platformbegrænsninger

  1. Dokumentér begrænsningen klart (hvad der fejler, hvad du har forsøgt, og dokumentation for at det ikke skyldes konfiguration).
  2. Anvend en workaround, når det er muligt (for eksempel omstrukturér kildedokumentet for at forbedre hentningen).
  3. Markér testcasen som en kendt begrænsning, eller juster tærskelværdierne, så den ikke hindrer øvrig fremgang.
  4. Eskaler med beviser til platformteamet.
  5. Registrér elementet i fejlloggen til genvurdering, når platformens funktioner opdateres.

Efter klassificering, gennemgå vejledningen til workaround og eskalering for håndtering af platformbegrænsninger.

Når en fejl ikke passer ind i rammen

Nogle fejl kan ikke klart tilskrives én enkelt rodårsagstype. Som almindelige eksempler kan nævnes:

  • Kvalitetsproblemer med backend-data: Videnskildeindholdet er teknisk korrekt, men formuleret tvetydigt, så hverken agenten eller evalueringen kan klandres.
  • Intermitterende infrastrukturproblemer: Netværkstimeouts, API-hastighedsbegrænsning og connectorproblemer, der ikke reproduceres konsekvent.
  • Ændringer i modelversion: agentens adfærd ændrede sig efter en opdatering af platformens model, som ikke var initieret af dig.
  • Tvetydige testcases: Scenariet er tvetydigt, og fornuftige mennesker er uenige om det korrekte svar.

Anbefalet fremgangsmåde: Dokumentér det, du observerede (fejlen, agentens svar, hvad du undersøgte). Registrer elementet som "uklassificeret" i fejlloggen. Hvis fejlen gentager sig, bliver den ofte klassificeret med yderligere beviser.

Håndtering af sammensatte årsager

En enkelt fejl kan have flere medvirkende rodårsager. Eksempel:

  • En nøjagtighedsfejl, hvor det forventede svar er en smule forældet (evalueringsopsætning), og videnskilden også er ufuldstændig (agentkonfiguration).
  • En fejl i værktøjsaktivering, hvor værktøjsbeskrivelsen er tvetydig (agentkonfiguration), og orkestreringen ikke understøtter betingede værktøjskald (platformbegrænsning).

Anbefalet tilgang: Udfør den fulde triage for hver fejl. Hvis flere rodårsagstyper gælder, håndteres de i prioriteret rækkefølge:

  1. Ret evalueringen først: for at få et klart signal om, hvorvidt ændringen af agenten faktisk hjælper.
  2. Ret agentkonfigurationen for at afgøre, om den tilbageværende fejl faktisk er et platformproblem.
  3. Dokumentér først platformbegrænsningen , når 1 og 2 er adresseret.

Genkør de berørte testtilfælde efter hver ændring, inden du fortsætter.

Håndtering af samtalefejl med flere sving

For scenarier med flere ture opstår fejl kun over sving.

Hvornår skal man mistænke et problem med flere ture

  • Agenten svarer korrekt i de tidlige runder, men modsiger sig selv senere.
  • Agenten mister kontekst fra et tidligere værktøjskald eller videnshentning i en senere runde.
  • Timingen for eskalering giver kun mening, når den fulde samtalehistorik tages i betragtning.
  • Agentens tone forringes gradvist, efterhånden som samtalen skrider frem.
  • Agenten beder om information, som brugeren allerede har givet.

Tip

En fejl kan vise sig i en senere omgang, mens rodårsagen opstod tidligere. Spor tilbage for at identificere det første sving, hvor samtalen spredte sig.

Yderligere diagnostiske spørgsmål

Spørgsmål Hvis ja → rodårsag
Var fejlen afhængig af information fra en tidligere samtaleudveksling, der var gået tabt? Kontekststyringsproblem; samtaletilstand bevares ikke på tværs af samtaleudvekslinger.
Modsagde agenten noget, den sagde i en tidligere samtaleudveksling? Manglende konsistensvejledning; ingen instruktion om at sikre sammenhæng mellem replikker.
Spørger agenten igen om oplysninger, som brugeren allerede har givet? Konteksthentningsproblem; agenten refererer ikke til tidligere samtalevendinger.
Opstod fejlen først efter mange ture (5+)? Effektiv kontekstlængde overskredet.

Afhjælpningsvejledning for multi-turn problemer

  • Konteksttab: Kontroller samtalestatus-konfigurationen. Sørg for, at værktøjsoutput og nøglefakta vedvarer i samtalens omgange
  • Modsigelser: Tilføj en instruktion om konsistens, for eksempel: "Vær konsekvent i forhold til dine tidligere svar i denne samtale."
  • Gentager spørgsmål: Verificér platformens konfiguration af samtalehukommelsen.
  • Forringelse ved lange samtaler: Overvej strategier for samtaleopsummering eller kontekstbeskæring.

Validering af beståelse af testcases (falsk positiv kontrol)

Denne ramme fokuserer på testcases, der fejler. Dog kan en testcase, der fejlagtigt består, skabe skjulte kvalitetsgab.

Anbefalet praksis: Gennemgå manuelt 5-10% af beståede testcases pr. evalueringskørsel, især for:

  • Modelbaseret bedømmelse (højere risiko for falske positiver)
  • Subjektive signaler (tone, hjælpsomhed)
  • Testcases, der tidligere fejlede, men nu består efter en ændring

Hvis du finder falske positiver, kalibrer graderen.

Næste trin

Efter gennemførelse af fejltriage: