Lag 1: Tolk evalueringsresultater og vurder beredskap

Etter at du har kjørt evalueringer på en agent, har du vanligvis scorer, men ikke et umiddelbart svar på det viktigste spørsmålet: Er agenten klar til å deployere?

Dette laget fokuserer på å tolke evalueringsscore og vurdere beredskap før du undersøker feil i individuelle testtilfeller. Bruk score som beslutningssignaler for å avgjøre om du kan ta agenten i bruk, bør fortsette å iterere, eller må forhindre utrulling. Dette trinnet hjelper deg også å identifisere hvor det er behov for dypere analyse.

Formål med tolkning av evalueringsscore

Dette laget hjelper deg å svare på overordnede spørsmål om utrullingsklarhet, inkludert:

  • Er agenten klar for utrulling?
  • Hvis ikke, hvilke områder bør prioriteres først?
  • Er det noen blokkerende problemer som må adresseres før videre iterasjon?

Dette steget er bevisst lettvekts. I de fleste tilfeller kan du gjennomføre steget på 10–15 minutter ved å bruke evalueringsresultatene du allerede har.

Før du starter

Før du starter dette laget, må du kontrollere at du har:

  • Resultater for bestått og ikke bestått på individuelle testtilfeller.
  • Aggregerte poengsummer for ett eller flere evalueringssett (f.eks. sikkerhet, kunnskapsforankring, forretningskorrekthet eller verktøybruk).

Hvis evalueringsresultatene ikke er tilgjengelige ennå, kjør evalueringssettene først og returner til dette trinnet når poengsummene er klare.

Tolk poeng på evalueringsnivå

Start med å gjennomgå poengsummer fra evalueringssett i stedet for individuelle testtilfeller.

Evalueringssett representerer ulike risiko- og funksjonsområder, som for eksempel sikkerhet, kjerneforretningsatferd, kunnskapsgrunnlag eller bruk av verktøy. Å tolke poengsummer på dette nivået hjelper deg med å avgjøre om feil er isolerte eller systemiske.

Tenk deg følgende spørsmål:

  • Er noen sikkerhets- eller compliance-score under akseptable terskler?
  • Oppfyller kjernesettene til forretningsevalueringer minimumsforventningene?
  • Hvilket evalueringssett er svakest i forhold til sin betydning?

På dette stadiet, fokuser på signal, ikke grunnårsak.

Vurder beståttprosenter på to nivåer:

  • Per evalueringssett: Hva betyr denne prosentandelen for den spesifikke egenskapen som testes?
  • Per kvalitetssignal: Hva indikerer denne prosentandelen på tvers av alle evalueringssett som tester det samme signalet?

En lav beståttprosent betyr ikke nødvendigvis at agenten er ukorrekt. Det indikerer at undersøkelse er nødvendig. Problemet kan ligge i agenten, evalueringsoppsettet eller plattformen.

Sett terskler basert på risiko

Ikke bruk de samme terskelene på alle agenter. Sett terskler basert på agentens risikoprofil. Tenk deg følgende faktorer:

Faktor Spørsmål som skal stilles Påvirkning på terskel
Konsekvens av feil Hva skjer hvis agenten tar feil? Ulempe? Økonomisk tap? Sikkerhetsrisiko? Høyere konsekvens → Høyere terskel
Bruksfrekvens Hvor ofte utløser brukere dette kvalitetssignalet? Høyere frekvens → Høyere terskel (mer eksponering)
Fallback-tilgjengelighet Hvis agenten feiler, finnes det en menneskelig sikkerhetskopi? Hvor raskt? Ingen reserve → Høyere terskel
Målgruppe Interne ansatte? Eksterne kunder? Regulert bransje? Ekstern eller regulert → Høyere terskel

Eksempler på risikobaserte terskler

Denne tabellen viser typiske startpunkter, ikke universelle standarder.

Risikoprofil Description Sikkerhet og overholdelse Kjernevirksomhet Funksjoner
Lavrisiko internt verktøy Kun intern bruk, manuell gjennomgang av alle utdata, lavrisikoområde Mer enn 90 % Mer enn 75 % Mer enn 65 %
Mellomrisiko kundevendt agent Eksterne brukere, noe automatisering, korrigerbare feil Mer enn 95 % Mer enn 85 % Mer enn 75 %
Høyrisiko regulert/finansiell agent Eksterne brukere, beslutninger med betydelige konsekvenser, regulatorisk eksponering Mer enn 98 % Mer enn 92 % Mer enn 85 %
Sikkerhetskritisk agent Helse-, juridisk eller økonomisk rådgivning med begrenset menneskelig tilsyn Mer enn 99 % Mer enn 95 % Mer enn 90 %

Bruk disse eksemplene som referansepunkt, og juster deretter basert på dine spesifikke risikovurderinger.

Eksempel på kalibrering av terskel

Det følgende eksempelet viser én mulig kalibrering for en kundevendt supportagent med middels risikoprofil.

Kvalitetssignal Startterskel Blokkeringsgrense Begrunnelsen
Sikkerhet og personopplysninger 95-100 % < 95 % blokkerer utrulling Enhver sikkerhetssvikt er høyrisiko
Etterlevelse og ordrett innhold 95-100 % < 95 % blokkerer utrulling Regulatorisk eller juridisk eksponering
Faktisk nøyaktighet (kjernevirksomhet) 85-95 % < 80 % blokkerer utrulling Kjerneverdiforslag
Kunnskapsfaktagrunnlag 85-95 % < 80 % blokkerer utrulling Nøyaktighetsgrunnlag
Verktøyaktivering 90-95 % < 85 % blokkerer utrulling Oppgaveutførelsespålitelighet
Utløserruting 85-95 % < 80 % blokkerer utrulling Korrekthet i samtaleflyt
Eskalering og smidig 90-95 % < 85 % blokkerer utrulling Sikkerhetsnett for brukeropplevelsen
Tone og svarkvalitet 80-90 % < 75 % blokkerer utrulling Subjektivt signal

Tips

Kalibrer, ikke kopier. Terskler bør gjenspeile akseptabel risiko for ditt spesifikke bruksscenario.

Bestem beredskapsstatus

Bruk evalueringssettets resultater for å fastslå en samlet utrullingsstatus. Vanlige beredskapsstater inkluderer:

  • Blokkering: Sikkerhet, etterlevelse eller kritiske forretningsfeil hindrer utrulling.
  • Iterer: Agenten viser lovende takter, men krever målrettede forbedringer.
  • Betinget utrulling: Agenten kan utrulles med dokumenterte og overvåkede begrensninger.
  • Utrulling: Agenten oppfyller alle terskler i nødvendige evalueringssett.

Basér beredskapsbeslutninger på risikotoleranse og brukskontekst, ikke på en enkelt universell score.

Tips

Betinget utrulling med kjente begrensninger er et legitimt utfall. Dokumenter aksepterte begrensninger og spor dem over tid ved å bruke feilloggmalen.

Bestem når iterasjonen er fullført

Bruk følgende kriterier for å avgjøre når du kan gå videre fra triage til utplassering eller overvåking.

Iterasjonen er fullført når:

  • Alle evalueringssettene er over sine terskler, inkludert tersklene du justerte.
  • Kjente mangler dokumenteres med eiere og tidslinjer.
  • Gjentatte kjøringer gir stabile poengsummer med mindre enn 5 % variasjon mellom hver kjøring.
  • Ingen blokkeringsproblemer er fortsatt klassifisert som agentkonfigurasjonsproblemer.

Iterasjonen er ikke fullført når:

  • Terskler nås uten å forstå gjenværende feil.
  • Resultatene forbedres kun fordi vanskelige testtilfeller ble fjernet.
  • Plattformens begrensninger aksepteres implisitt uten dokumentasjon.

Håndtering av ikke-determinisme i score

Språkmodellbaserte agenter og vurderere produserer variable resultater. Bruk følgende praksiser:

  • Etabler grunnlinjer: Kjør hele evalueringssettet minst tre ganger før du bruker en score som grunnlinje. Bruk gjennomsnittet som din arbeidsscore. Med færre enn tre kjøringer kan du ikke skille det reelle signalet fra støy.
  • Poengvarians mellom kjøringer: Opptil 5 % varians mellom kjøringer er normalt for språkmodellvurderere. Hvis kjøringer varierer med mer enn 10 %, må du undersøke graderingspålitelighet før du diagnostiserer agentproblemer. Les mer om Graderingsvalidering.
  • Tolk endringer i poengsummen etter utbedring: For evalueringssett med færre enn 30 testtilfeller, vil poengsummen øke med 3 % eller mer hvis én enkelt testtilfelle endres fra ikke bestått til bestått. Ikke overtolk små endringer. For evalueringssett med 50 eller flere testtilfeller, regn en endring på 5 % eller mer som betydningsfull. Hvis du er i tvil, kjør evalueringen tre ganger og sammenlign gjennomsnittet med baseline-gjennomsnittet.
  • Identifiser ustabile testtilfeller (består noen ganger, feiler andre): Et testtilfelle som består to av tre ganger er på grensen. Undersøk nærmere. Er den forventede verdien satt for strengt (evalueringsoppsett), eller er agenten virkelig inkonsekvent (agentkonfigurasjon)? Hvis agenten produserer to forskjellige, men begge akseptable svar, er evalueringsoppsettet for streng.

Neste trinn

Når du har tolket resultatene dine og identifisert hvor du bør rette oppmerksomheten:

Hvis mer enn 10 testtilfeller feiler, analyser mønstre før du prioriterer individuelle feil.