Applica il framework di triage della valutazione attraverso scenari pratici

Le procedure dettagliate end-to-end illustrano come i livelli del framework di valutazione collaborano nella pratica. Ogni percorso inizia da uno scenario di valutazione diverso e segue un percorso diagnostico distinto.

Le guide dettagliate mostrano come applicare il framework passo dopo passo. Utilizza questi esempi per comprendere come passare dai risultati della valutazione alla diagnosi, alla correzione e alla verifica in scenari reali di valutazione degli agenti.

Suggerimento

Prima di affrontare questi esempi, rivedi gli obiettivi del framework, inclusi i concetti e i principi fondamentali.

Percorso Situazione iniziale Cosa dimostra
Percorso 1 Prima esecuzione della valutazione Flusso end-to-end: interpretare → assegnare priorità → valutare → correggere → verificare
Percorso 2 I punteggi si stabilizzano dopo più iterazioni Analisi dei modelli, riclassificazione e soluzioni per le limitazioni della piattaforma
Percorso 3 I punteggi regrediscono dopo una modifica Rilevamento della regressione, diagnosi di conflitti di istruzioni e risoluzione dei compromessi

Nota

Questi esempi sono illustrativi e si basano su schemi comuni osservati in più esecuzioni di valutazione dei clienti. I test case, i punteggi e i dettagli dell'agente sono compositi rappresentativi anziché record di una singola interazione. Gli approcci diagnostici e le strategie di correzione mostrate riflettono pratiche utilizzate nelle implementazioni reali.

Percorso1: prima esecuzione della valutazione

Esegui la tua suite di valutazione per la prima volta su un agente del servizio clienti. Ecco i risultati:

Set valutazione Percentuale di superamento
Sicurezza e dati personali 100%
Domande e risposte sull'attività principale 87%
Grounding delle conoscenze 71%
Chiamata allo strumento 92% 
Routing dei trigger 88%
Tono e qualità 83%
Riassegnazione 90%
Complessivo 85%

Passaggio 1: interpreta i punteggi (livello 1)

Utilizza la tabella di interpretazione dei punteggi per calibrare le soglie e individuare quali set di valutazione sono inferiori alle soglie di blocco.

Set valutazione Punteggio Soglia Status
Sicurezza e dati personali 100% Bloccaggio 95% Positivo
Domande e risposte sull'attività principale 87% Bloccaggio 80% Positivo
Grounding delle conoscenze 71% Bloccaggio 80% Sotto la soglia di blocco
Chiamata allo strumento 92%  Bloccaggio 85% Positivo
Routing dei trigger 88% Bloccaggio 80% Positivo
Tono e qualità 83% Bloccaggio 75% Positivo
Riassegnazione 90% Bloccaggio 85% Positivo

Valutazione dell'idoneità: iterazione. Il grounding della conoscenza è al di sotto della soglia di blocco. Focalizza la correzione lì.

Passaggio 2: assegna le priorità agli errori (livello 2, passaggio 0)

Situazione: il grounding della conoscenza ha sette test case. Due test case falliscono: KG-003 e KG-005. Entrambi i test case sono in un set di valutazione dell'attività principale, quindi sono di priorità 2. Poiché ci sono solo due elementi, eseguire il triage di entrambi.

Riferimento: assegna la priorità agli errori (livello 2, passaggio 0)

Passaggio 3: eseguire il triage di KG-003 (livello 2, passaggi 1-2)

Caso di test KG-003:

  • Input di esempio: "Qual è la vostra politica di reso?"
  • Risposta attesa: "Offriamo un periodo di reso di 30 giorni per tutti gli acquisti."
  • Risposta dell'agente: "La nostra politica di reso consente resi entro 15 giorni lavorativi dall'acquisto."
  • Metodo di valutazione:corrispondenza di parole chiave
  • Risultato: Errore (previsto "30 giorni", l'agente ha detto "15 giorni lavorativi")

Verifica la configurazione della valutazione (passaggio 1 del livello 2):

Domanda Risposta Risultato
La risposta dell'agente è accettabile? È necessario controllare il documento di origine. Controlla prima l'origine.
La risposta prevista è ancora aggiornata? Il documento di origine dice "15 giorni lavorativi". La politica è stata aggiornata. Nr. La risposta prevista è obsoleta.

Classificazione: problema di configurazione della valutazione. Risposta prevista obsoleta. L'agente è corretto. La valutazione è errata.

Passaggio 4: eseguire il triage di KG-005 (livello 2, passaggi 1-2)

Caso di test KG-005:

  • Input di esempio: "Il piano Premium include una garanzia estesa?"
  • Risposta attesa: "Il piano Premium include una garanzia standard di due anni." Le opzioni di garanzia estesa sono disponibili per l'acquisto separatamente."
  • Risposta dell'agente: "Sì, il piano Premium include una garanzia estesa di tre anni che copre tutte le parti e la manodopera."
  • Metodo di valutazione: confronto del significato
  • Risultato: Errore (l'agente ha inventato i dettagli della garanzia)

Verifica la configurazione della valutazione (passaggio 1 del livello 2):

Domanda Risposta Risultato
La risposta dell'agente è accettabile? Nr. "Garanzia estesa di tre anni" è stata introdotta. Continua
La risposta attesa è aggiornata? Sì. L'origine conferma la garanzia standard di due anni. Continua
Il test case è realistico? Sì. Domanda comune di un cliente. Continua
Potrebbe essere corretta una risposta alternativa? Nr. I dettagli della garanzia sono concreti. Continua
Il metodo di valutazione è appropriato? Sì.Il confronto del significato è corretto per l'accuratezza semantica. La valutazione è valida.

Esegui la diagnostica sull'agente (passaggio 2 del livello 2):

Domanda Risposta
Il contenuto dell'origine è errato? Nr. L'origine dice "garanzia standard di due anni".
L'agente ha contraddetto le informazioni nell'origine? Sì. L'origine dice "garanzia standard di due anni", ma l'agente ha detto "garanzia estesa di tre anni".
L'agente ha risposto senza usare alcuna origine? Probabilmente sì. Il dettaglio della "garanzia estesa di tre anni che copre tutte le parti e la manodopera" non è presente in alcuna origine.

Classificazione: problema di configurazione dell'agente. Gap di conoscenze. L'agente ha prodotto dettagli della garanzia che non sono presenti nelle fonti delle informazioni configurate.

Passaggio 5: correzione (livello 3)

KG-003 (Correzione della configurazione della valutazione):

  • Modifica: aggiorna il valore atteso da "finestra di reso di 30 giorni" a "15 giorni lavorativi"
  • Nuova esecuzione: solo KG-003
  • Risultato atteso: Riuscito

KG-005 (Correzione della configurazione dell'agente):

  • Modifica: Aggiungere istruzioni contestuali al prompt di sistema: "Rispondere solo in base alle informazioni trovate nelle fonti delle informazioni. Se le informazioni non sono disponibili, dillo."
  • Nuova esecuzione: set di valutazione delle conoscenze contestuali complete (la modifica della configurazione dell'agente può avere effetti più ampi)
  • Risultato atteso: KG-005 completato. Altri test case non dovrebbero subire regressioni.

Passaggio 6: verifica

Dopo entrambe le modifiche, rieseguire il set di valutazione del grounding della conoscenza:

Prima Dopo
71% (5/7 risultati positivi) 86% (6/7 risultati positivi)

Valutazione: il grounding della conoscenza è ora sopra la soglia di blocco dell'80%. Un errore (KG-007) persiste e non blocca l'idoneità. Esaminalo nell'iterazione successiva.

Passaggio 7: documentare (Livello 4)

Registra nel registro degli errori:

Caso di test Tipo di causa radice Problema riscontrato Modifica applicata Risolto
KG-003 Configurazione della valutazione Risposta attesa obsoleta (la politica è stata modificata da 30 giorni a 15 giorni lavorativi). Valore atteso aggiornato
KG-005 Configurazione dell'agente Dettagli di garanzia errati non presenti in alcuna origine. Aggiunta dell'istruzione di base al prompt di sistema

Nota sul modello: verifica i valori attesi rispetto ai documenti di origine prima di ogni esecuzione di valutazione. Aggiungi questo passaggio all'elenco di controllo della pre-valutazione.

Ricontrollo dell'idoneità: tutti i set di valutazione ora al di sopra delle soglie di blocco.

Valutazione dell'idoneità: distribuisci l'agente con lacune note (KG-007 documentato, piano di monitoraggio in essere).

Riferimento: Livello 4: analizza gli schemi e migliora continuamente il tuo agente

Percorso 2: punteggio in fase di plateau

Situazione: esegui quattro iterazioni su un agente di supporto al prodotto. L'accuratezza effettiva rimane al 78% in tutte le quattro esecuzioni. Le modifiche al prompt vengono apportate dopo ogni esecuzione, ma non si vede alcun miglioramento.

Passaggio 1: controlla gli schemi (livello 4)

Rivedi il log degli errori in tutte e quattro le iterazioni:

Iterazione Punteggio Modifica applicata Result
1 78% (riferimento)
2 79% Aggiunto "Sii preciso sulle specifiche del prodotto" Nessun cambiamento significativo
3 77% Riorganizzato il prompt per dare priorità alle istruzioni sulla precisione Nessun cambiamento significativo
4 78% Aggiunti esempi risolti di risposte corrette del prodotto Nessun cambiamento significativo

Tendenza: costante. L'intervento correttivo non affronta la causa radice effettiva.

Riferimento: Livello 4: analizza gli schemi e migliora continuamente il tuo agente

Passaggio 2: analizza i test case non riusciti

Esamina i sei errori persistenti in tutte le iterazioni.

Caso di test Fallisce da Problema riscontrato
FA-002 Iterazione 1 L'agente cita la pagina delle domande frequenti invece del manuale del prodotto
FA-005 Iterazione 1 L'agente cita la pagina delle domande frequenti invece del manuale del prodotto
FA-008 Iterazione 1 L'agente cita la pagina delle domande frequenti invece del manuale del prodotto
FA-011 Iterazione 1 L'agente cita la pagina delle domande frequenti invece del manuale del prodotto
FA-014 Iterazione 1 L'agente cita la pagina delle domande frequenti invece del manuale del prodotto
FA-019 Iterazione 2 L'agente fornisce una risposta parziale dalle domande frequenti, senza riportare i dettagli del manuale

Analisi della concentrazione: cinque errori su sei (83%) hanno la stessa causa radice: l’agente recupera informazioni dalla pagina delle domande frequenti invece che dal manuale del prodotto.

Passaggio 3: nuovo triage (livello 2)

Inizialmente, classifica gli errori come Problema di configurazione dell'agente: origine recuperata errata.

Applica più modifiche alla configurazione dell'agente, inclusa la riformulazione dei prompt, il riordinamento e l'aggiunta di esempi. Questi cambiamenti non portano a miglioramenti misurabili. A questo punto, convalida l'errore a fronte degli indicatori di limitazione della piattaforma.

Indicatore Controllo
L'errore persiste su più variazioni di prompt o configurazione Sì. Quattro iterazioni senza modifiche.
Il sistema di recupero restituisce costantemente documenti errati nonostante una configurazione corretta dell'origine Sì. Le domande frequenti vengono recuperate sistematicamente al posto del manuale del prodotto.

Riclassificazione: questo problema è una limitazione della piattaforma relativa alla classificazione del recupero. La piattaforma assegna costantemente la priorità alle domande frequenti rispetto al manuale del prodotto per queste query e ulteriori modifiche ai prompt o alle istruzioni non modificano il comportamento di recupero.

Riferimento: Livello 2: triage errori dell'agente

Passaggio 4: correzione (livello 3—Limitazione della piattaforma)

Quando si classifica un errore come una limitazione della piattaforma, l’intervento dovrebbe concentrarsi su soluzioni alternative e sulla documentazione, invece che su modifiche alla configurazione dell’agente.

Riferimento: Risposta alla limitazione della piattaforma

Strategia di soluzione alternativa: applica uno o più dei seguenti approcci di mitigazione per ridurre l'impatto:

  • Ristruttura il manuale del prodotto con intestazioni di sezione più chiare, allineate al vocabolario utilizzato nelle query degli utenti.
  • Duplica le specifiche critiche del prodotto dal manuale nelle domande frequenti per creare percorsi di recupero ridondanti.
  • Effettua il refactoring del contenuto del manuale in modo che ogni sezione risponda a una singola domanda ben definita, per migliorare la corrispondenza dei blocchi recuperati.

Queste strategie puntano a influenzare il comportamento del recupero senza ricorrere a modifiche di prompt o istruzioni.

Escalation e monitoraggio: se la limitazione persiste, documenta e inoltra il problema al team della piattaforma.

  • Documenta la limitazione come segue: "Le query relative alle <specifiche del prodotto> portano sempre alla pagina delle domande frequenti (ultimo aggiornamento: <data>, <n> pagine) invece che al manuale del prodotto (ultimo aggiornamento: <data>, <N> pagine), nonostante il manuale contenga le informazioni autorevoli."
  • Fornisci prove a supporto: includi diversi test case che mostrino la query, l'origine prevista e l'origine effettivamente recuperata.
  • Invia per l'indagine.
  • Condividi la limitazione documentata e le prove con il team della piattaforma per il monitoraggio e il follow-up.

Passaggio 5: verifica

Dopo aver ristrutturato il manuale del prodotto e aggiunto domande frequenti ridondanti, esegui nuovamente il set di valutazione rilevante per verificarne l'impatto.

Prima Dopo
78% (invariato in quattro iterazioni) 89%

Valutazione: la soluzione alternativa migliora le prestazioni complessive. Un errore persiste (FA-019). La query è troppo ambigua per recuperare in modo affidabile l'origine corretta, anche con contenuti ristrutturati. Questo errore è registrato come una limitazione nota.

Passaggio 6: documento

Aggiorna il registro degli errori per riflettere la classificazione finale e i risultati.

Caso di test Tipo di causa radice Problema riscontrato Modifica applicata Risolto
FA-002, 005, 008, 011, 014 Limitazione della piattaforma La classificazione del recupero dà priorità alle domande frequenti rispetto al manuale del prodotto Ristrutturazione delle intestazioni del manuale; duplicazione delle specifiche critiche nelle domande frequenti
FA-019 Limitazione della piattaforma La query ambigua non riesce a recuperare in modo affidabile l'origine corretta Documentato come limitazione nota No

Punti chiave: se i punteggi di valutazione rimangono invariati attraverso più modifiche ai prompt o alle istruzioni, è improbabile che la causa radice sia il prompt. Convalida il comportamento dell'infrastruttura e della piattaforma prima di investire di più nella progettazione dei prompt.

Percorso 3: regressione post-aggiornamento

Situazione: hai aggiornato il prompt di sistema per migliorare tono ed empatia. I punteggi di tono sono aumentati, ma l'accuratezza effettiva è diminuita al di sotto della soglia di blocco, introducendo una regressione.

Prima della modifica:

Set valutazione Punteggio
Accuratezza fattuale 91%
Tono e qualità 83%
Tutti gli altri Sopra la soglia

Hai aggiunto la seguente istruzione al prompt di sistema: "Riconosci sempre la preoccupazione del cliente e mostra empatia prima di fornire la tua risposta." Inizia ogni risposta convalidando l'esperienza del cliente."

Dopo la modifica:

Set valutazione Prima Dopo Delta
Accuratezza fattuale 91% 76% -15%
Tono e qualità 83% 91% +8%

Passaggio 1: interpreta (livello 1)

L'accuratezza fattuale è ora sotto la soglia di blocco dell'80%. Questa modifica introduce una regressione e blocca l'idoneità.

Riferimento: Livello 1: interpreta i punteggi e identifica gli errori

Passaggio 2: controlla gli schemi (livello 4)

Corrispondenza del modello di segnale incrociato: il tono migliora mentre l'accuratezza si riduce.

Causa radice indicata: conflitto di istruzioni.

Le linee guida per il tono appena aggiunte competono con istruzioni di accuratezza per l'attenzione del modello.

Riferimento: Livello 4: analizza gli schemi e migliora continuamente il tuo agente

Passaggio 3: triage dei nuovi errori (livello 2)

Rivedi i casi di test di accuratezza fattuale che venivano superati prima della modifica e ora non vengono più superati.

Caso di test FA-007:

  • Input: "Qual è la dimensione massima per il caricamento dei file?"
  • Previsto: "La dimensione massima per il caricamento dei file è di 25 MB per gli account standard e 100 MB per gli account aziendali."
  • Agente precedente: "La dimensione massima per il caricamento dei file è 25 MB per gli account standard e 100 MB per gli account aziendali."
  • Agente dopo: "Capisco perfettamente la tua preoccupazione riguardo alle dimensioni di caricamento dei file: può essere frustrante quando si cerca di caricare documenti importanti!" Voglio assicurarmi che tu abbia tutte le informazioni di cui hai bisogno. La dimensione massima di caricamento è di 25 MB per i piani standard."

Passaggio 1. Verifica la valutazione: La risposta attesa è corretta e la valutazione è valida. La risposta dopo l'aggiornamento omette il dettaglio dell'account aziendale.

Passaggio 2. Esegui la diagnostica: La nuova istruzione sul tono richiede un preambolo di empatia in ogni risposta. Questo requisito consuma il budget di risposta e l'attenzione del modello e porta a risposte fattuali incomplete.

Classificazione: problema di configurazione dell'agente. Conflitto di istruzioni tra tono e indicazioni sull'accuratezza.

Riferimento: Livello 2: triage errori dell'agente

Passaggio 4: correzione (livello 3)

Il problema non è la guida sul tono, ma le priorità concorrenti nel prompt di sistema. La correzione si concentra sulla separazione e sull'assegnazione delle priorità alle istruzioni.

Vecchia istruzione (singola, in conflitto): "Riconosci sempre la preoccupazione del cliente e mostra empatia prima di fornire la tua risposta." Inizia ogni risposta convalidando l'esperienza del cliente."

Nuova istruzione (separata, prioritaria): "Includi sempre la risposta completa e fattuale alla domanda del cliente." Non omettere dettagli per brevità. Inoltre, quando il cliente esprime frustrazione o preoccupazione, riconoscilo brevemente."

Modifiche importanti:

  • L'accuratezza ha esplicitamente la priorità.
  • La completezza delle risposte fattuali è affermata esplicitamente.
  • L'empatia è condizionata, non universale.
  • "Brevemente" vincola l'empatia per evitare il troncamento del contenuto.

Riferimento: Livello 3: eseguire il mapping dei modelli di errore alle strategie di correzione

Passaggio 5: verifica

Eseguire nuovamente la suite di valutazione completa, perché le modifiche ai prompt di sistema possono avere un impatto ampio.

Set valutazione Prima della modifica Dopo la regressione Dopo la modifica
Accuratezza fattuale 91% 76% 90%
Tono e qualità 83% 91% 89%
Tutti gli altri Sopra la soglia Sopra la soglia Sopra la soglia

Valutazione: entrambi i segnali ora soddisfano le loro soglie di blocco. Tono non torna completamente al suo picco, ma rimane ben al di sopra della soglia di blocco del 75% e mostra un miglioramento rispetto alla linea di base iniziale.

Passaggio 6: documento

Caso di test Tipo di causa radice Problema riscontrato Modifica applicata Risolto
FA-007, FA-012, FA-018 (e altri) Configurazione dell'agente Le linee guida sul tono hanno prevalso sulla completezza fattuale Prompt ristrutturato per privilegiare l'accuratezza e applicare empatia condizionale

Punto chiave: convalida sempre le modifiche al prompt di sistema sull'intera suite di valutazione, non solo sul segnale di destinazione. Le istruzioni competono per l'attenzione del modello e i miglioramenti in un'area possono introdurre regressioni in altre.

Modello da monitorare: questo scenario è un'istanza del problema del budget delle istruzioni. Man mano che i prompt crescono, i conflitti di istruzione diventano più probabili. Il consolidamento e la semplificazione periodici aiutano a mantenere la stabilità.

Schemi comuni nei diversi percorsi

Ogni percorso inizia da uno scenario diverso per illustrare un percorso diagnostico distinto. Per vedere come un singolo agente progredisce attraverso l'intero ciclo di vita della valutazione—interpretazione del punteggio, triage degli errori, correzione e verifica—consulta Percorso 1, che offre la guida end-to-end più completa.

Questa tabella mette in evidenza i modelli ricorrenti riscontrati nei diversi percorsi e le lezioni pratiche che ne derivano.

Schema Dove viene visualizzato Concetto chiave importante
Verificare la valutazione prima dell'agente Percorso 1 Una causa comune di sforzo inutile è analizzare il comportamento dell'agente quando la valutazione stessa è errata.
Punteggi costanti indicano una causa principale erroneamente classificata Percorso 2 Se interventi ripetuti non migliorano i risultati, riclassifica la causa. Probabilmente stai affrontando la causa radice sbagliata.
Eseguire nuovamente la suite di valutazione completa dopo le modifiche al prompt Percorso 3 Le modifiche ai prompt possono influenzare diversi segnali di qualità. Controlla sempre eventuali regressioni fuori dall'area di destinazione.
Documentare risultati e decisioni Tutti i percorsi Il mantenimento di un registro degli errori impedisce di individuare nuovamente le stesse cause radice nelle iterazioni successive.
Le lacune note possono essere accettabili Percorso 1 (KG-007), Percorso 2 (FA-019) Non tutti gli errori devono essere risolti prima della spedizione. Documenta le lacune note e monitorale nel tempo.

Passaggi successivi

Dopo aver esaminato questi esempi, scegli l'azione successiva che meglio si adatta alla tua situazione attuale: