Merk
Tilgang til denne siden krever autorisasjon. Du kan prøve å logge på eller endre kataloger.
Tilgang til denne siden krever autorisasjon. Du kan prøve å endre kataloger.
Etter at du har kjørt evalueringer på en agent, har du vanligvis scorer, men ikke et umiddelbart svar på det viktigste spørsmålet: Er agenten klar til å deployere?
Dette laget fokuserer på å tolke evalueringsscore og vurdere beredskap før du undersøker feil i individuelle testtilfeller. Bruk score som beslutningssignaler for å avgjøre om du kan ta agenten i bruk, bør fortsette å iterere, eller må forhindre utrulling. Dette trinnet hjelper deg også å identifisere hvor det er behov for dypere analyse.
Formål med tolkning av evalueringsscore
Dette laget hjelper deg å svare på overordnede spørsmål om utrullingsklarhet, inkludert:
- Er agenten klar for utrulling?
- Hvis ikke, hvilke områder bør prioriteres først?
- Er det noen blokkerende problemer som må adresseres før videre iterasjon?
Dette steget er bevisst lettvekts. I de fleste tilfeller kan du gjennomføre steget på 10–15 minutter ved å bruke evalueringsresultatene du allerede har.
Før du starter
Før du starter dette laget, må du kontrollere at du har:
- Resultater for bestått og ikke bestått på individuelle testtilfeller.
- Aggregerte poengsummer for ett eller flere evalueringssett (f.eks. sikkerhet, kunnskapsforankring, forretningskorrekthet eller verktøybruk).
Hvis evalueringsresultatene ikke er tilgjengelige ennå, kjør evalueringssettene først og returner til dette trinnet når poengsummene er klare.
Tolk poeng på evalueringsnivå
Start med å gjennomgå poengsummer fra evalueringssett i stedet for individuelle testtilfeller.
Evalueringssett representerer ulike risiko- og funksjonsområder, som for eksempel sikkerhet, kjerneforretningsatferd, kunnskapsgrunnlag eller bruk av verktøy. Å tolke poengsummer på dette nivået hjelper deg med å avgjøre om feil er isolerte eller systemiske.
Tenk deg følgende spørsmål:
- Er noen sikkerhets- eller compliance-score under akseptable terskler?
- Oppfyller kjernesettene til forretningsevalueringer minimumsforventningene?
- Hvilket evalueringssett er svakest i forhold til sin betydning?
På dette stadiet, fokuser på signal, ikke grunnårsak.
Vurder beståttprosenter på to nivåer:
- Per evalueringssett: Hva betyr denne prosentandelen for den spesifikke egenskapen som testes?
- Per kvalitetssignal: Hva indikerer denne prosentandelen på tvers av alle evalueringssett som tester det samme signalet?
En lav beståttprosent betyr ikke nødvendigvis at agenten er ukorrekt. Det indikerer at undersøkelse er nødvendig. Problemet kan ligge i agenten, evalueringsoppsettet eller plattformen.
Sett terskler basert på risiko
Ikke bruk de samme terskelene på alle agenter. Sett terskler basert på agentens risikoprofil. Tenk deg følgende faktorer:
| Faktor | Spørsmål som skal stilles | Påvirkning på terskel |
|---|---|---|
| Konsekvens av feil | Hva skjer hvis agenten tar feil? Ulempe? Økonomisk tap? Sikkerhetsrisiko? | Høyere konsekvens → Høyere terskel |
| Bruksfrekvens | Hvor ofte utløser brukere dette kvalitetssignalet? | Høyere frekvens → Høyere terskel (mer eksponering) |
| Fallback-tilgjengelighet | Hvis agenten feiler, finnes det en menneskelig sikkerhetskopi? Hvor raskt? | Ingen reserve → Høyere terskel |
| Målgruppe | Interne ansatte? Eksterne kunder? Regulert bransje? | Ekstern eller regulert → Høyere terskel |
Eksempler på risikobaserte terskler
Denne tabellen viser typiske startpunkter, ikke universelle standarder.
| Risikoprofil | Description | Sikkerhet og overholdelse | Kjernevirksomhet | Funksjoner |
|---|---|---|---|---|
| Lavrisiko internt verktøy | Kun intern bruk, manuell gjennomgang av alle utdata, lavrisikoområde | Mer enn 90 % | Mer enn 75 % | Mer enn 65 % |
| Mellomrisiko kundevendt agent | Eksterne brukere, noe automatisering, korrigerbare feil | Mer enn 95 % | Mer enn 85 % | Mer enn 75 % |
| Høyrisiko regulert/finansiell agent | Eksterne brukere, beslutninger med betydelige konsekvenser, regulatorisk eksponering | Mer enn 98 % | Mer enn 92 % | Mer enn 85 % |
| Sikkerhetskritisk agent | Helse-, juridisk eller økonomisk rådgivning med begrenset menneskelig tilsyn | Mer enn 99 % | Mer enn 95 % | Mer enn 90 % |
Bruk disse eksemplene som referansepunkt, og juster deretter basert på dine spesifikke risikovurderinger.
Eksempel på kalibrering av terskel
Det følgende eksempelet viser én mulig kalibrering for en kundevendt supportagent med middels risikoprofil.
| Kvalitetssignal | Startterskel | Blokkeringsgrense | Begrunnelsen |
|---|---|---|---|
| Sikkerhet og personopplysninger | 95-100 % | < 95 % blokkerer utrulling | Enhver sikkerhetssvikt er høyrisiko |
| Etterlevelse og ordrett innhold | 95-100 % | < 95 % blokkerer utrulling | Regulatorisk eller juridisk eksponering |
| Faktisk nøyaktighet (kjernevirksomhet) | 85-95 % | < 80 % blokkerer utrulling | Kjerneverdiforslag |
| Kunnskapsfaktagrunnlag | 85-95 % | < 80 % blokkerer utrulling | Nøyaktighetsgrunnlag |
| Verktøyaktivering | 90-95 % | < 85 % blokkerer utrulling | Oppgaveutførelsespålitelighet |
| Utløserruting | 85-95 % | < 80 % blokkerer utrulling | Korrekthet i samtaleflyt |
| Eskalering og smidig | 90-95 % | < 85 % blokkerer utrulling | Sikkerhetsnett for brukeropplevelsen |
| Tone og svarkvalitet | 80-90 % | < 75 % blokkerer utrulling | Subjektivt signal |
Tips
Kalibrer, ikke kopier. Terskler bør gjenspeile akseptabel risiko for ditt spesifikke bruksscenario.
Bestem beredskapsstatus
Bruk evalueringssettets resultater for å fastslå en samlet utrullingsstatus. Vanlige beredskapsstater inkluderer:
- Blokkering: Sikkerhet, etterlevelse eller kritiske forretningsfeil hindrer utrulling.
- Iterer: Agenten viser lovende takter, men krever målrettede forbedringer.
- Betinget utrulling: Agenten kan utrulles med dokumenterte og overvåkede begrensninger.
- Utrulling: Agenten oppfyller alle terskler i nødvendige evalueringssett.
Basér beredskapsbeslutninger på risikotoleranse og brukskontekst, ikke på en enkelt universell score.
Tips
Betinget utrulling med kjente begrensninger er et legitimt utfall. Dokumenter aksepterte begrensninger og spor dem over tid ved å bruke feilloggmalen.
Bestem når iterasjonen er fullført
Bruk følgende kriterier for å avgjøre når du kan gå videre fra triage til utplassering eller overvåking.
Iterasjonen er fullført når:
- Alle evalueringssettene er over sine terskler, inkludert tersklene du justerte.
- Kjente mangler dokumenteres med eiere og tidslinjer.
- Gjentatte kjøringer gir stabile poengsummer med mindre enn 5 % variasjon mellom hver kjøring.
- Ingen blokkeringsproblemer er fortsatt klassifisert som agentkonfigurasjonsproblemer.
Iterasjonen er ikke fullført når:
- Terskler nås uten å forstå gjenværende feil.
- Resultatene forbedres kun fordi vanskelige testtilfeller ble fjernet.
- Plattformens begrensninger aksepteres implisitt uten dokumentasjon.
Håndtering av ikke-determinisme i score
Språkmodellbaserte agenter og vurderere produserer variable resultater. Bruk følgende praksiser:
- Etabler grunnlinjer: Kjør hele evalueringssettet minst tre ganger før du bruker en score som grunnlinje. Bruk gjennomsnittet som din arbeidsscore. Med færre enn tre kjøringer kan du ikke skille det reelle signalet fra støy.
- Poengvarians mellom kjøringer: Opptil 5 % varians mellom kjøringer er normalt for språkmodellvurderere. Hvis kjøringer varierer med mer enn 10 %, må du undersøke graderingspålitelighet før du diagnostiserer agentproblemer. Les mer om Graderingsvalidering.
- Tolk endringer i poengsummen etter utbedring: For evalueringssett med færre enn 30 testtilfeller, vil poengsummen øke med 3 % eller mer hvis én enkelt testtilfelle endres fra ikke bestått til bestått. Ikke overtolk små endringer. For evalueringssett med 50 eller flere testtilfeller, regn en endring på 5 % eller mer som betydningsfull. Hvis du er i tvil, kjør evalueringen tre ganger og sammenlign gjennomsnittet med baseline-gjennomsnittet.
- Identifiser ustabile testtilfeller (består noen ganger, feiler andre): Et testtilfelle som består to av tre ganger er på grensen. Undersøk nærmere. Er den forventede verdien satt for strengt (evalueringsoppsett), eller er agenten virkelig inkonsekvent (agentkonfigurasjon)? Hvis agenten produserer to forskjellige, men begge akseptable svar, er evalueringsoppsettet for streng.
Neste trinn
Når du har tolket resultatene dine og identifisert hvor du bør rette oppmerksomheten:
- Bruk lag 2: Triage feil for å diagnostisere feilaktige testtilfeller.
- Bruk Lag 3: Kartlegg feilmønstre og knytt dem til utbedringsstrategier for å gjennomføre presise utbedringer.
- Bruk Lag 4: Analyser mønstre for å identifisere systemiske problemer.
- Gå gjennom praktiske eksempler som viser hvordan rammeverkslagene fungerer sammen i virkelige scenarioer.
Hvis mer enn 10 testtilfeller feiler, analyser mønstre før du prioriterer individuelle feil.