Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
Dopo aver eseguito le valutazioni su un agente, di solito hai dei punteggi ma non hai subito la risposta alla domanda più importante: l'agente è pronto per essere messo in produzione?
Questo livello si concentra sull'interpretazione dei punteggi delle valutazioni e sulla valutazione dell'idoneità dell'agente prima di esaminare gli errori dei singoli test case. Usa i punteggi come indicatori decisionali per determinare se puoi mettere in produzione l'agente, continuare con le iterazioni o bloccare la distribuzione. Questo passaggio ti aiuta anche a identificare dove è necessaria un'analisi più approfondita.
Scopo dell'interpretazione dei punteggi
Questo livello ti aiuta a rispondere a domande complessive sull'idoneità, tra cui:
- L'agente è pronto per essere messo in produzione?
- Se la risposta è no, quali aree richiedono attenzione prioritaria?
- Ci sono problemi bloccanti che devono essere affrontati prima di ulteriori iterazioni?
Questo passaggio è volutamente semplificato. Nella maggior parte dei casi, puoi completarlo in 10–15 minuti usando i risultati delle valutazioni che già possiedi.
Prima di iniziare
Prima di iniziare questo livello, assicurati di avere:
- Risultati di superamento o mancato superamento per singoli test case.
- Punteggi aggregati per uno o più set di valutazione (es. sicurezza, grounding, correttezza aziendale o uso degli strumenti).
Se i risultati della valutazione non sono ancora disponibili, esegui prima i set di valutazione e torna a questo passaggio una volta disponibili i punteggi.
Interpretare i punteggi a livello di insieme di valutazione
Inizia rivedendo i punteggi dei set di valutazione piuttosto che i singoli test case.
I set di valutazione rappresentano diverse aree di rischio e competenza, come sicurezza, comportamento aziendale, grounding della conoscenza o invocazione di strumenti. Interpretare i punteggi a questo livello ti aiuta a determinare se gli errori sono isolati o sistemici.
Prendere in considerazione le domande seguenti:
- Ci sono punteggi di sicurezza o conformità inferiori alle soglie accettabili?
- I set di valutazione delle attività principali soddisfano le aspettative minime?
- Quale set di valutazione è il più debole rispetto alla sua importanza?
In questa fase, focalizzati sul segnale, non sulla causa radice.
Interpreta le percentuali di superamento a due livelli:
- Per set di valutazione: cosa significa questa percentuale per la specifica funzionalità in esame?
- Per segnale di qualità: cosa indica questa percentuale tra tutti i set di valutazione che testano lo stesso segnale?
Una percentuale di superamento bassa non indica automaticamente che l'agente è sbagliato. Indica che è necessario un esame diagnostico. Il problema potrebbe riguardare l'agente, la configurazione della valutazione o la piattaforma.
Impostare soglie in base al rischio
Non applicare le stesse soglie a ogni agente. Stabilisci delle soglie in base al profilo di rischio dell'agente. Prendi in considerazione i fattori seguenti.
| Fattore | Domande da porsi | Impatto sulla soglia |
|---|---|---|
| Conseguenza dell'errore | Cosa succede se l'agente sbaglia? Inconveniente? Perdita finanziaria? Rischio per la sicurezza? | Conseguenza maggiore → soglia più alta |
| Frequenza d'uso | Quanto spesso gli utenti attivano questo segnale di qualità? | Frequenza più alta → soglia più alta (maggiore esposizione) |
| Disponibilità di fallback | Se l'agente fallisce, è previsto un intervento umano? Quanto rapidamente? | Nessun fallback → soglia più alta |
| Partecipanti | Dipendenti interni? Clienti esterni? Settore regolamentato? | Esterno o regolamentato → Soglia più alta |
Esempi di soglie basate sul rischio
Questa tabella mostra punti di partenza di esempio, non standard universali.
| Profilo di rischio | Descrizione | Sicurezza e conformità | Attività principale | Funzionalità |
|---|---|---|---|---|
| Strumento interno a basso rischio | Solo per uso interno, revisione umana su tutti gli output, dominio a basso rischio | Oltre 90% | Oltre 75% | Oltre 65% |
| Agente a rischio medio a contatto con il cliente | Utenti esterni, automazione parziale, errori recuperabili | Oltre 95% | Oltre 85% | Oltre 75% |
| Agente ad alto rischio in ambito regolamentato o finanziario | Utenti esterni, decisioni rilevanti, esposizione normativa | Oltre 98% | Oltre 92% | Oltre 85% |
| Agente critico per la sicurezza | Consulenza sanitaria, legale o finanziaria con supervisione umana limitata | Oltre 99% | Oltre 95% | Oltre 90% |
Usa questi esempi come riferimento, poi adatta in base alle tue specifiche considerazioni di rischio.
Esempio di calibrazione della soglia
Il seguente esempio mostra una possibile calibrazione per un agente di supporto a rischio medio, rivolto al cliente.
| Segnale di qualità | Soglia di partenza | Soglia di blocco | Spiegazione |
|---|---|---|---|
| Sicurezza e dati personali | 95-100% | < 95% di blocchi di spedizione | Qualsiasi errore di sicurezza comporta un rischio elevato |
| Conformità e contenuto letterale | 95-100% | < 95% di blocchi di spedizione | Esposizione normativa o legale |
| Accuratezza fattuale (attività aziendali principali) | 85-95% | < 80% di blocchi di spedizione | Proposta di valore principale |
| Grounding delle conoscenze | 85-95% | < 80% di blocchi di spedizione | Base per l'accuratezza |
| Chiamata allo strumento | 90-95% | < 85% di blocchi di spedizione | Affidabilità dell'esecuzione delle attività |
| Routing dei trigger | 85-95% | < 80% di blocchi di spedizione | Correttezza del flusso conversazionale |
| Escalation e gestione ordinata | 90-95% | < 85% di blocchi di spedizione | Rete di sicurezza per l'esperienza utente |
| Tono e qualità della risposta | 80-90% | < 75% di blocchi di spedizione | Segnale soggettivo |
Suggerimento
Esegui la calibrazione, non copiare. Le soglie dovrebbero riflettere il rischio accettabile per il tuo caso d'uso specifico.
Determinare lo stato di idoneità
Usa i punteggi del set di valutazione per determinare un risultato complessivo di idoneità. Gli stati di idoneità comuni includono:
- Blocco: sicurezza, conformità o errori aziendali critici impediscono la distribuzione.
- Iterare: l'agente mostra potenzialità ma ha bisogno di miglioramenti mirati.
- Distribuzione condizionale: l'agente può essere distribuito con limitazioni documentate e monitorate.
- Distribuisci: l'agente soddisfa le soglie in tutti i set di valutazione necessari.
Basa le decisioni di idoneità sulla tolleranza al rischio e sul contesto d'uso, non su un singolo punteggio universale.
Suggerimento
La distribuzione condizionale con lacune note è un esito legittimo. Documenta le limitazioni accettate e tracciale nel tempo utilizzando il modello di registro degli errori.
Determina quando l'iterazione è completa
Usa i seguenti criteri per stabilire quando puoi passare dal triage alla distribuzione o al monitoraggio.
L'iterazione è completa quando:
- Tutti i set di valutazione superano le rispettive soglie, incluse quelle che hai modificato.
- Le lacune note sono documentate con proprietari e sequenze temporali.
- Le esecuzioni ripetute producono punteggi costanti con una variazione inferiore al 5% tra le esecuzioni.
- Nessun problema bloccante rimane classificato come problema di configurazione degli agenti.
L'iterazione non è completa quando:
- Le soglie vengono soddisfatte senza capire le rimanenti criticità.
- I punteggi migliorano solo perché sono stati rimossi i test case difficili.
- Le limitazioni della piattaforma vengono accettate implicitamente senza documentazione.
Gestione del non-determinismo nei punteggi
Gli agenti e i valutatori basati su modelli linguistici producono output variabili. Applica le procedure seguenti:
- Stabilisci valori di riferimento: esegui l'intero set di valutazione almeno tre volte prima di considerare qualsiasi punteggio come valore di riferimento. Usa la media come punteggio di riferimento. Con meno di tre esecuzioni, non è possibile distinguere il segnale reale dal rumore.
- Varianza dei punteggi tra le esecuzioni: una varianza fino al 5% tra le esecuzioni è normale per i valutatori di modelli linguistici. Se le esecuzioni variano di più del 10%, indagare l'affidabilità del valutatore prima di diagnosticare i problemi dell'agente. Scopri di più in Convalida del valutatore.
- Interpreta le variazioni del punteggio dopo la correzione: per i set di valutazione con meno di 30 test case, il cambiamento di un singolo test case da non superato a superato modifica il punteggio del 3% o più. Non dare troppo peso a piccole variazioni. Per i set di valutazione con almeno 50 test case, considera significativo un cambiamento del 5% o più. In caso di dubbio, riesegui la valutazione tre volte e confronta la media con la tua media di riferimento.
- Identificare i test case flaky (a volte superati, altre volte no): un caso di test che supera due esecuzioni su tre tentativi è borderline. Approfondisci. Il valore atteso è troppo rigido (impostazione della valutazione) o l'agente è realmente incoerente (configurazione dell'agente)? Se l'agente produce due risposte diverse ma entrambe accettabili, la valutazione è troppo rigida.
Passaggi successivi
Una volta interpretati i tuoi punteggi e individuato dove concentrarti:
- Usa Layer 2: triage errori per diagnosticare i casi di test falliti.
- Usa Livello 3: associa i modelli di errore alle strategie di correzione per applicare interventi mirati.
- Utilizza Livello 4: analizza i modelli per identificare problemi sistemici.
- Rivedi esempi pratici che mostrano come i livelli del framework funzionano insieme in scenari reali.
Se più di 10 test case generano errore, analizza i criteri prima di gestire i singoli errori.