Bemærk
Adgang til denne side kræver godkendelse. Du kan prøve at logge på eller ændre mapper.
Adgang til denne side kræver godkendelse. Du kan prøve at ændre mapper.
Når du har evalueret en agent, har du typisk evalueringsresultater, men ikke et umiddelbart svar på det vigtigste spørgsmål: Er agenten klar til udrulning?
Dette lag fokuserer på at fortolke evalueringsscorer og vurdere parathed, før du undersøger individuelle fejl med testsager. Brug resultaterne som beslutningssignaler til at afgøre, om du kan udrulle agenten, bør fortsætte med gentagelser eller skal blokere udrulningen. Dette trin hjælper dig også med at identificere, hvor dybere analyse er nødvendig.
Formålet med fortolkning af resultat
Dette lag hjælper dig med at besvare centrale spørgsmål om parathed, herunder:
- Er agenten klar til at blive udrullet?
- Hvis den ikke er klar, hvilke områder bør du så prioritere først?
- Er der blokeringsproblemer, der skal løses før yderligere gentagelse?
Dette trin er bevidst gjort simpelt. I de fleste tilfælde kan du gennemføre det på 10–15 minutter ved hjælp af de evalueringsresultater, du allerede har.
Inden du starter
Før du starter dette trin, skal du sikre dig, at du har:
- Beståede eller ikke-beståede resultater for individuelle testsager.
- Samlede resultater for et eller flere evalueringssæt (for eksempel sikkerhed, forankring, forretningskorrekthed eller værktøjsbrug).
Hvis evalueringsresultaterne endnu ikke er tilgængelige, skal du først køre dine evalueringssæt og vende tilbage til dette trin, når resultaterne er tilgængelige.
Fortolk resultater på evalueringssæt-niveau
Gennemgå først evalueringssæt-resultater i stedet for individuelle testsager.
Evalueringssæt repræsenterer forskellige risiko- og kompetenceområder, såsom sikkerhed, kerneforretningsfunktioner, vidensgrundlag eller værktøjsanvendelse. Fortolkning af resultater på dette niveau hjælper dig med at afgøre, om fejl er isolerede eller systemiske.
Overvej følgende spørgsmål:
- Er der nogen sikkerheds- eller overholdelsesresultater, der ligger under de acceptable grænserne?
- Opfylder evalueringssæt for kerneforretning minimumsforventningerne?
- Hvilket evalueringssæt er svagest i forhold til dets betydning?
På dette stadie skal du fokusere på signalet – ikke på rodårsagen.
Fortolk beståelsesprocenter på to niveauer:
- Pr. evalueringssæt: Hvad betyder denne procentdel for den specifikke mulighed, der testes?
- Pr. kvalitetssignal: Hvad angiver denne procentdel for alle evalueringssæt, der tester det samme signal?
En lav beståelsesprocent betyder ikke automatisk, at agenten tager fejl. Det indikerer, at der kræves en undersøgelse. Problemet kan skyldes agenten, evalueringsopsætningen eller platformen.
Angiv grænser baseret på risiko
Brug ikke de samme grænser til alle agenter. Angiv grænser baseret på agentens risikoprofil. Overvej følgende faktorer.
| Faktor | Spørgsmål, du kan stille | Betydning for grænse |
|---|---|---|
| Konsekvens af svigt | Hvad sker der, hvis agenten tager fejl? Besvær? Økonomisk tab? Sikkerhedsrisiko? | Større konsekvens → Højere grænse |
| Brugshyppighed | Hvor hyppigt udløser brugere dette kvalitetssignal? | Større hyppighed → Højere grænse (mere eksponering) |
| Fallback-tilgængelighed | Er der en menneskelig afløser, hvis agenten ikke virker? Hvor hurtigt? | Ingen fallback → Højere grænse |
| Publikum | Interne medarbejdere? Eksterne kunder? Branche med kontrol? | Ekstern eller med kontrol → Højere grænse |
Eksempler på risikobaserede grænser
Denne tabel viser eksempler på startpunkter, ikke universelle standarder.
| Risikoprofil | Beskrivelse | Sikkerhed og overholdelse af angivne standarder | Kerneforretning | Funktioner |
|---|---|---|---|---|
| Internt værktøj med lav risiko | Kun intern, menneskelig gennemgang af alle output og lavrisiko-domæne | Mere end 90 % | Mere end 75 % | Mere end 65 % |
| Kundeorienteret agent med middelhøj risiko | Eksterne brugere, en vis grad af automatisering og fejl der kan rettes | Mere end 95 % | Mere end 85 % | Mere end 75 % |
| Agent med kontrol/økonomisk agent med høj risiko | Eksterne brugere, væsentlige beslutninger og lovgivningsmæssig eksponering | Mere end 98 % | Mere end 92 % | Mere end 85 % |
| Sikkerhedskritisk agent | Sundhedsmæssig, juridisk eller finansiel rådgivning med begrænset menneskelig overvågning | Mere end 99 % | Mere end 95 % | Mere end 90 % |
Tag udgangspunkt i disse eksempler, og tilpas derefter ud fra dine specifikke risikoovervejelser.
Eksempel på kalibrering af grænse
Følgende eksempel viser én mulig kalibrering af en kundeorienteret supportagent med mellemhøj risiko.
| Kvalitetssignal | Startgrænse | Blokeringsgrænse | Begrundelse |
|---|---|---|---|
| Sikkerhed og personlige data | 95-100 % | < 95 %: blokerer frigivelse | Enhver sikkerhedsfejl er højrisiko |
| Overholdelse og ordret gengivelse | 95-100 % | < 95 %: blokerer frigivelse | Lovgivningsmæssig eller juridisk eksponering |
| Faktuel nøjagtighed (kerneforretning) | 85-95 % | < 80 %: blokerer frigivelse | Kerneværditilbud |
| Vidensforankring | 85-95 % | < 80 %: blokerer frigivelse | Grundlag for nøjagtighed |
| Værktøjskald | 90-95 % | < 85 %: blokerer frigivelse | Opgaveudførelsens pålidelighed |
| Udløserrouting | 85-95 % | < 80 %: blokerer frigivelse | Samtaleflowets korrekthed |
| Eskalering og elegant | 90-95 % | < 85 %: blokerer frigivelse | Brugeroplevelsens sikkerhedsnet |
| Tone og svarkvalitet | 80-90 % | < 75 %: blokerer frigivelse | Subjektivt signal |
Tip
Kalibrer – kopiér ikke. Grænserne bør afspejle den acceptable risiko for din specifikke anvendelse.
Bestem parathedsstatus
Brug evalueringssæt-resultater til at fastslå det samlede parathedsudfald. Typiske parathedstilstande omfatter:
- Bloker: Sikkerheds- eller overholdelsesfejl eller kritiske driftsfejl forhindrer udrulningen.
- Gentagelse: Agenten viser potentiale, men kræver målrettede forbedringer.
- Betinget udrulning: Agenten kan udrulles med dokumenterede og overvågede begrænsninger.
- Udrulning: Agenten opfylder grænser i alle nødvendige evalueringssæt.
Basér beslutninger om udrulning på risikotolerance og brugskontekst – ikke på et enkelt universelt resultat.
Tip
Betinget udrulning med kendte mangler er et legitimt resultat. Dokumentér accepterede begrænsninger, og spor dem over tid ved at bruge fejllogfilsskabelonen.
Bestem, hvornår gentagelsen er færdig
Brug følgende kriterier til at afgøre, hvornår du kan gå videre fra prioritering til udrulning eller overvågning.
Gentagelsen er ikke afsluttet, når:
- Alle evalueringssæt ligger over deres grænser, herunder de grænser, du har ændret.
- Kendte mangler er dokumenteret med ansvarlige og tidsplaner.
- Gentagne testkørsler giver ensartede resultater med mindre end 5 % variation mellem kørslerne.
- Ingen blokeringsproblemer er fortsat klassificeret som agentkonfigurationsproblemer.
Gentagelsen er ikke afsluttet, når:
- Grænser nås uden forståelse for de resterende fejl.
- Resultater forbedres kun, fordi vanskelige testsager blev fjernet.
- Platformbegrænsninger accepteres implicit uden dokumentation.
Håndtering af variation i omfang på grund af ikke-determinisme
Sprogmodelbaserede agenter og bedømmere giver varierende resultater. Brug følgende metoder:
- Fastlæg referenceværdier: Kør hele evalueringssættet mindst tre gange, før du betragter et resultat som referenceværdi. Brug gennemsnittet som din referenceværdi. Når der er mindre end tre kørsler, kan du ikke skelne mellem ægte signal og støj.
- Resultatvarians mellem kørsler: En varians på op til 5 % mellem kørsler er normalt for sprogmodelbedømmere. Hvis kørsler varierer med mere end 10%, skal du undersøge graders pålidelighed, før du diagnosticerer agentproblemer. Læs mere under Validering af bedømmer.
- Fortolk resultatændringer efter afhjælpning: Hvis dine evalueringssæt har mindre end 30 testsager, ændrer én enkelt testsag fra ikke bestået til bestået resultat med 3 % eller mere: Overfortolk ikke små ændringer. For evalueringssæt med 50 eller flere testtilfælde bør en ændring på 5 % eller derover betragtes som væsentlig. Hvis du er i tvivl, så kør evalueringen tre gange, og sammenlign gennemsnittet med din baseline.
- Identificér ustabile testcases (består nogle gange, fejler andre gange): En testcase, der består to ud af tre kørsler, er på kanten. Undersøg nærmere. Er den forventede værdi for restriktiv (evalueringsopsætning), eller er agenten uregelmæssig (agentkonfiguration)? Hvis agenten genererer to forskellige, men begge acceptable svar, er evalueringen for rigid.
Næste trin
Gør følgende, når du har fortolket dine resultater og fundet ud af, hvad du bør fokusere på:
- Brug Lag 2: Prioriter fejl til at diagnosticere mislykkede testsager.
- Brug Lag 3: Kortlæg fejlmønstre til afhjælpningsstrategier for at anvende målrettede rettelser.
- Brug Lag 4: Analyser mønstre for at identificere systemiske problemer.
- Gennemgå praktiske eksempler , der demonstrerer, hvordan rammelagene arbejder sammen i virkelige scenarier.
Analysér mønstre, hvis mere end 10 testsager mislykkes, før du prioriterer de enkelte fejl.