Set di dati di valutazione in Microsoft Foundry

Un set di dati di valutazione è una raccolta riutilizzabile di test case per misurare la qualità del modello o dell'agente. I set di dati di valutazione usano in genere JSONL, con un oggetto JSON per riga. Questo articolo illustra quando usare un set di dati riutilizzabile, la modalità di organizzazione dei dati di valutazione e i modi disponibili per prepararli.

È necessario un set di dati di valutazione?

Creare un set di dati quando si vuole un set di test stabile che è possibile rieseguire su versioni diverse del modello, della richiesta o dell'agente. I set di dati riutilizzabili funzionano bene per i test di regressione, i controlli di qualità CI/CD e i confronti tra esecuzioni di valutazione.

Non è sempre necessario un set di dati. Se l'agente Foundry dispone già di risposte o l'applicazione invia tracce ad Application Insights, è possibile valutare tali dati nel luogo in cui si trovano. Vedere Valutare le interazioni in base all'ID risposta e Valutare le tracce.

Come Foundry usa i dati di valutazione

In un set di dati JSONL il messages campo rappresenta le interazioni tra modelli o agenti. Ogni messaggio identifica un ruolo e il relativo contenuto.

Se il set di dati contiene risposte completate, Foundry valuta direttamente tali risposte. Se si esegue la valutazione su un modello o un agente, Foundry genera una nuova risposta per ogni input e valuta tale risposta. Qualsiasi risposta già archiviata nel set di dati viene ignorata.

Si consideri, ad esempio, un utente che non può accedere. L'agente chiede quale errore viene visualizzato, l'utente indica che la password viene rifiutata e l'agente consiglia una reimpostazione della password. La valutazione a livello di turno assegna un punteggio a una singola risposta dell'agente, ad esempio le linee guida per la reimpostazione della password, usando i messaggi precedenti come contesto. La valutazione a livello di conversazione assegna un punteggio all'interazione completa.

L'impostazione evaluation_level sull'esecuzione controlla la granularità del punteggio. Il set di dati e gli analizzatori selezionati devono supportare tale livello. Per informazioni dettagliate, vedere Scegliere un livello di valutazione. Per colonne ed esempi standard, vedere Schema del set di dati di valutazione.

Scegliere come preparare i dati di valutazione

Situazione Approccio consigliato
Sono stati curati i dati di valutazione Caricare come set di dati Foundry con controllo delle versioni o fornire un piccolo set di dati inline. Vedere Preparare i dati di input.
Si vuole esaminare e riutilizzare i test case generati prima di eseguire una valutazione Generare un set di dati di valutazione sintetica da una definizione dell'agente, da un prompt inline o da un file di riferimento.
Si vuole un set di dati riutilizzabile in base al traffico di produzione Convertire le tracce in un set di dati.
Si vogliono testare scenari simulati a più turni Generare un set di dati di inizializzazione della simulazione o creare scenari di test case come JSONL e quindi simulare le conversazioni.
Sono disponibili ID di risposta Foundry Valutare le interazioni in base all'ID risposta senza creare un set di dati.
Si vogliono valutare le tracce di Application Insights esistenti Valutare le tracce senza creare un set di dati.
Si vogliono generare query, richiamare una destinazione e valutarne le risposte in un flusso di lavoro Generare query sintetiche durante l'esecuzione della valutazione. Foundry salva le query generate come set di dati per il riutilizzo.

Passo successivo