Lag 1: Fortolk evalueringsresultater, og vurder parathed

Når du har evalueret en agent, har du typisk evalueringsresultater, men ikke et umiddelbart svar på det vigtigste spørgsmål: Er agenten klar til udrulning?

Dette lag fokuserer på at fortolke evalueringsscorer og vurdere parathed, før du undersøger individuelle fejl med testsager. Brug resultaterne som beslutningssignaler til at afgøre, om du kan udrulle agenten, bør fortsætte med gentagelser eller skal blokere udrulningen. Dette trin hjælper dig også med at identificere, hvor dybere analyse er nødvendig.

Formålet med fortolkning af resultat

Dette lag hjælper dig med at besvare centrale spørgsmål om parathed, herunder:

  • Er agenten klar til at blive udrullet?
  • Hvis den ikke er klar, hvilke områder bør du så prioritere først?
  • Er der blokeringsproblemer, der skal løses før yderligere gentagelse?

Dette trin er bevidst gjort simpelt. I de fleste tilfælde kan du gennemføre det på 10–15 minutter ved hjælp af de evalueringsresultater, du allerede har.

Inden du starter

Før du starter dette trin, skal du sikre dig, at du har:

  • Beståede eller ikke-beståede resultater for individuelle testsager.
  • Samlede resultater for et eller flere evalueringssæt (for eksempel sikkerhed, forankring, forretningskorrekthed eller værktøjsbrug).

Hvis evalueringsresultaterne endnu ikke er tilgængelige, skal du først køre dine evalueringssæt og vende tilbage til dette trin, når resultaterne er tilgængelige.

Fortolk resultater på evalueringssæt-niveau

Gennemgå først evalueringssæt-resultater i stedet for individuelle testsager.

Evalueringssæt repræsenterer forskellige risiko- og kompetenceområder, såsom sikkerhed, kerneforretningsfunktioner, vidensgrundlag eller værktøjsanvendelse. Fortolkning af resultater på dette niveau hjælper dig med at afgøre, om fejl er isolerede eller systemiske.

Overvej følgende spørgsmål:

  • Er der nogen sikkerheds- eller overholdelsesresultater, der ligger under de acceptable grænserne?
  • Opfylder evalueringssæt for kerneforretning minimumsforventningerne?
  • Hvilket evalueringssæt er svagest i forhold til dets betydning?

På dette stadie skal du fokusere på signalet – ikke på rodårsagen.

Fortolk beståelsesprocenter på to niveauer:

  • Pr. evalueringssæt: Hvad betyder denne procentdel for den specifikke mulighed, der testes?
  • Pr. kvalitetssignal: Hvad angiver denne procentdel for alle evalueringssæt, der tester det samme signal?

En lav beståelsesprocent betyder ikke automatisk, at agenten tager fejl. Det indikerer, at der kræves en undersøgelse. Problemet kan skyldes agenten, evalueringsopsætningen eller platformen.

Angiv grænser baseret på risiko

Brug ikke de samme grænser til alle agenter. Angiv grænser baseret på agentens risikoprofil. Overvej følgende faktorer.

Faktor Spørgsmål, du kan stille Betydning for grænse
Konsekvens af svigt Hvad sker der, hvis agenten tager fejl? Besvær? Økonomisk tab? Sikkerhedsrisiko? Større konsekvens → Højere grænse
Brugshyppighed Hvor hyppigt udløser brugere dette kvalitetssignal? Større hyppighed → Højere grænse (mere eksponering)
Fallback-tilgængelighed Er der en menneskelig afløser, hvis agenten ikke virker? Hvor hurtigt? Ingen fallback → Højere grænse
Publikum Interne medarbejdere? Eksterne kunder? Branche med kontrol? Ekstern eller med kontrol → Højere grænse

Eksempler på risikobaserede grænser

Denne tabel viser eksempler på startpunkter, ikke universelle standarder.

Risikoprofil Beskrivelse Sikkerhed og overholdelse af angivne standarder Kerneforretning Funktioner
Internt værktøj med lav risiko Kun intern, menneskelig gennemgang af alle output og lavrisiko-domæne Mere end 90 % Mere end 75 % Mere end 65 %
Kundeorienteret agent med middelhøj risiko Eksterne brugere, en vis grad af automatisering og fejl der kan rettes Mere end 95 % Mere end 85 % Mere end 75 %
Agent med kontrol/økonomisk agent med høj risiko Eksterne brugere, væsentlige beslutninger og lovgivningsmæssig eksponering Mere end 98 % Mere end 92 % Mere end 85 %
Sikkerhedskritisk agent Sundhedsmæssig, juridisk eller finansiel rådgivning med begrænset menneskelig overvågning Mere end 99 % Mere end 95 % Mere end 90 %

Tag udgangspunkt i disse eksempler, og tilpas derefter ud fra dine specifikke risikoovervejelser.

Eksempel på kalibrering af grænse

Følgende eksempel viser én mulig kalibrering af en kundeorienteret supportagent med mellemhøj risiko.

Kvalitetssignal Startgrænse Blokeringsgrænse Begrundelse
Sikkerhed og personlige data 95-100 % < 95 %: blokerer frigivelse Enhver sikkerhedsfejl er højrisiko
Overholdelse og ordret gengivelse 95-100 % < 95 %: blokerer frigivelse Lovgivningsmæssig eller juridisk eksponering
Faktuel nøjagtighed (kerneforretning) 85-95 % < 80 %: blokerer frigivelse Kerneværditilbud
Vidensforankring 85-95 % < 80 %: blokerer frigivelse Grundlag for nøjagtighed
Værktøjskald 90-95 % < 85 %: blokerer frigivelse Opgaveudførelsens pålidelighed
Udløserrouting 85-95 % < 80 %: blokerer frigivelse Samtaleflowets korrekthed
Eskalering og elegant 90-95 % < 85 %: blokerer frigivelse Brugeroplevelsens sikkerhedsnet
Tone og svarkvalitet 80-90 % < 75 %: blokerer frigivelse Subjektivt signal

Tip

Kalibrer – kopiér ikke. Grænserne bør afspejle den acceptable risiko for din specifikke anvendelse.

Bestem parathedsstatus

Brug evalueringssæt-resultater til at fastslå det samlede parathedsudfald. Typiske parathedstilstande omfatter:

  • Bloker: Sikkerheds- eller overholdelsesfejl eller kritiske driftsfejl forhindrer udrulningen.
  • Gentagelse: Agenten viser potentiale, men kræver målrettede forbedringer.
  • Betinget udrulning: Agenten kan udrulles med dokumenterede og overvågede begrænsninger.
  • Udrulning: Agenten opfylder grænser i alle nødvendige evalueringssæt.

Basér beslutninger om udrulning på risikotolerance og brugskontekst – ikke på et enkelt universelt resultat.

Tip

Betinget udrulning med kendte mangler er et legitimt resultat. Dokumentér accepterede begrænsninger, og spor dem over tid ved at bruge fejllogfilsskabelonen.

Bestem, hvornår gentagelsen er færdig

Brug følgende kriterier til at afgøre, hvornår du kan gå videre fra prioritering til udrulning eller overvågning.

Gentagelsen er ikke afsluttet, når:

  • Alle evalueringssæt ligger over deres grænser, herunder de grænser, du har ændret.
  • Kendte mangler er dokumenteret med ansvarlige og tidsplaner.
  • Gentagne testkørsler giver ensartede resultater med mindre end 5 % variation mellem kørslerne.
  • Ingen blokeringsproblemer er fortsat klassificeret som agentkonfigurationsproblemer.

Gentagelsen er ikke afsluttet, når:

  • Grænser nås uden forståelse for de resterende fejl.
  • Resultater forbedres kun, fordi vanskelige testsager blev fjernet.
  • Platformbegrænsninger accepteres implicit uden dokumentation.

Håndtering af variation i omfang på grund af ikke-determinisme

Sprogmodelbaserede agenter og bedømmere giver varierende resultater. Brug følgende metoder:

  • Fastlæg referenceværdier: Kør hele evalueringssættet mindst tre gange, før du betragter et resultat som referenceværdi. Brug gennemsnittet som din referenceværdi. Når der er mindre end tre kørsler, kan du ikke skelne mellem ægte signal og støj.
  • Resultatvarians mellem kørsler: En varians på op til 5 % mellem kørsler er normalt for sprogmodelbedømmere. Hvis kørsler varierer med mere end 10%, skal du undersøge graders pålidelighed, før du diagnosticerer agentproblemer. Læs mere under Validering af bedømmer.
  • Fortolk resultatændringer efter afhjælpning: Hvis dine evalueringssæt har mindre end 30 testsager, ændrer én enkelt testsag fra ikke bestået til bestået resultat med 3 % eller mere: Overfortolk ikke små ændringer. For evalueringssæt med 50 eller flere testtilfælde bør en ændring på 5 % eller derover betragtes som væsentlig. Hvis du er i tvivl, så kør evalueringen tre gange, og sammenlign gennemsnittet med din baseline.
  • Identificér ustabile testcases (består nogle gange, fejler andre gange): En testcase, der består to ud af tre kørsler, er på kanten. Undersøg nærmere. Er den forventede værdi for restriktiv (evalueringsopsætning), eller er agenten uregelmæssig (agentkonfiguration)? Hvis agenten genererer to forskellige, men begge acceptable svar, er evalueringen for rigid.

Næste trin

Gør følgende, når du har fortolket dine resultater og fundet ud af, hvad du bør fokusere på:

Analysér mønstre, hvis mere end 10 testsager mislykkes, før du prioriterer de enkelte fejl.