Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
Importante
Gli elementi contrassegnati (anteprima) in questo articolo sono attualmente in anteprima pubblica. Questa anteprima viene fornita senza un contratto di servizio e non è consigliabile per i carichi di lavoro di produzione. Alcune funzionalità potrebbero non essere supportate o potrebbero avere funzionalità limitate. Per altre informazioni, vedere Condizioni supplementari per l'utilizzo delle anteprime di Microsoft Azure.
Testare i modelli e gli agenti di intelligenza artificiale generati eseguendo valutazioni che misurano prestazioni, qualità e sicurezza. Usare valutazioni prima della distribuzione per convalidare il comportamento o dopo la distribuzione per monitorare la qualità di produzione. Le valutazioni eseguono il modello o l'agente sui dati di test e assegnano un punteggio ai risultati utilizzando valutatori integrati o personalizzati.
Questo articolo illustra come creare ed eseguire valutazioni nel portale foundry.
Prerequisiti
Una sottoscrizione di Azure. Creane uno gratis.
Un progetto di Microsoft Foundry. Creare un progetto se non ne è disponibile uno.
Una delle opzioni seguenti, a seconda della destinazione di valutazione:
- Valutazione dell'agente: un agente nel progetto.
- Valutazione del modello: modello distribuito o modello disponibile con accesso immediato.
- Valutazione del set di dati: set di dati di test in formato CSV o JSONL contenente output preesistenti del modello o dell'agente.
Connessione OpenAI Azure con un modello GPT distribuito, ad esempio
gpt-4.1-mini. Obbligatorio per le valutazioni di qualità assistita dall'IA.Ruolo di utente Foundry nel progetto Foundry. Per altre informazioni, vedere Controllo degli accessi in base al ruolo per Microsoft Foundry.
Importante
I ruoli di Controllo degli accessi in base al ruolo di Foundry sono stati recentemente rinominati. Foundry User, Foundry Owner, Foundry Account Owner e Foundry Project Manager erano precedentemente denominati Azure AI User, Azure AI Owner, Azure AI Account Owner e Azure AI Project Manager. È possibile che i nomi precedenti vengano visualizzati in alcune posizioni durante l'esecuzione della ridenominazione. Gli ID ruolo e le autorizzazioni di base sono invariati dalla ridenominazione.
Scegliere un approccio di valutazione
Selezionare un approccio di valutazione in base a ciò che si vuole testare:
| Obiettivo | Ambito | L'origine dei dati | Migliore per |
|---|---|---|---|
| Agente | Conversazioni complete | Dati simulati | Test del comportamento dell'agente end-to-end con scenari sintetici prima della distribuzione. |
| Agente | Conversazioni complete | Conversazioni esistenti | Valutazione delle interazioni utente reali per monitorare la qualità di produzione. |
| Agente | Turni singoli | Set di dati esistente | Debug di risposte di agenti specifiche, test dell'utilizzo degli strumenti, analisi con granularità fine. |
| Agente | Turni singoli | Dati sintetici | Verifica di scenari Q&A o RAG a ciclo singolo con query generate. |
| Agente | Turni singoli | Tracce esistenti | Analisi delle tracce storiche degli agenti del tuo progetto. |
| Modello | Turni singoli | Dati sintetici | Verifica dei completamenti del modello con prompt generati. |
| Modello | Turni singoli | Set di dati esistente | Valutazione comparativa delle prestazioni del modello su un insieme di test selezionato. |
| Set di dati | Turni singoli | (Il set di dati è il target) | Valutazione di output preesistenti senza eseguire nuovamente il modello o l'agente. |
Tip
Inizia con Conversazioni > complete dell'agente > Dati simulati per testare il comportamento dell'agente in scenari controllati. Usa Conversazioni esistenti una volta che il tuo agente è in produzione per monitorare le prestazioni nel mondo reale.
Creare una valutazione
È possibile avviare una valutazione da diverse posizioni nel portale foundry:
- Pagina di valutazione: nel riquadro sinistro selezionare Valutazione>Crea.
- Pagina Modelli: passare al modello, selezionare la scheda Valutazione e quindi selezionare Crea.
- Pagina Agenti: passare all'agente, selezionare la scheda Valutazione e quindi selezionare Crea.
- Playground dell'agente: Vai al tuo agente, seleziona la scheda Playground, quindi seleziona Metriche>Esegui valutazione completa.
Passaggio 1: Selezionare la destinazione di valutazione
Quando si crea una valutazione, scegliere prima di tutto la destinazione di valutazione. L'obiettivo determina contro cosa viene eseguita la valutazione:
| Obiettivo | Description |
|---|---|
| Agente | Valuta l'output generato dall'agente selezionato e dall'input definito dall'utente. Funziona sia per gli agenti immediati che per gli agenti ospitati. |
| Modello | Valuta l'output generato dal modello selezionato e dal prompt definito dall'utente. |
| Set di dati | Valuta gli output preesistenti del modello o dell'agente da un set di dati di test. |
| Traces | Valuta le interazioni dell'agente già acquisite in Application Insights. Selezionare l'agente e l'intervallo di tempo e il portale recupera le tracce corrispondenti per la valutazione. Per l'SDK equivalente, vedere Valutazione della traccia. |
Tip
Accesso immediato: l'accesso immediato è un modello senza distribuzione che è possibile usare immediatamente senza creare una distribuzione. Quando si crea una valutazione, è possibile selezionare un modello istantaneo come target della valutazione o come modello giudice direttamente dal selettore dei modelli.
Passaggio 2: Selezionare l'ambito di valutazione
Nota
Questa fase viene visualizzata solo per le destinazioni Agent e Dataset. Le valutazioni del modello usano sempre singoli turni.
Scegliere come valutare le prestazioni dell'agente:
| Ambito | Description | Migliore per |
|---|---|---|
| Conversazioni complete (anteprima) | Valuta le conversazioni complete a più turni dall'inizio alla fine. Misura la qualità complessiva della conversazione, il completamento delle attività e la soddisfazione dell'utente. | Test delle esperienze degli agenti end-to-end, soddisfazione dei clienti e flusso di conversazione. |
| Turni singoli | Valuta le risposte dei singoli agenti all'interno delle conversazioni. Misura le metriche per turno, ad esempio l'accuratezza della selezione degli strumenti e la qualità della risposta. | Debug di comportamenti specifici dell'agente, test dell'utilizzo degli strumenti e analisi con granularità fine. |
Passaggio 3: Selezionare l'origine dati
Le opzioni dell'origine dati dipendono dalla destinazione di valutazione e dall'ambito.
Per la valutazione delle conversazioni (conversazioni complete dell'agente >) (anteprima)
Scegliere da dove provengono i dati della conversazione:
Dati simulati
Genera conversazioni sintetiche facendo interagire il tuo agente con le descrizioni degli scenari contenute in un set di dati. Usare questa opzione per testare il comportamento dell'agente in scenari controllati prima della distribuzione.
Selezionare Dati simulati.
Selezionare Genera per aprire la finestra di dialogo di configurazione della simulazione.
Selezionare il file: scegliere un set di dati contenente le descrizioni degli scenari. Ogni riga nel set di dati descrive uno scenario usato per generare una conversazione simulata.
Selezionare il modello: scegliere il modello che simula l'utente nella conversazione:
-
gpt-4.1(consigliato per scenari complessi) gpt-4ogpt-4o-minigpt-4.1-mini
-
Configurare le impostazioni di simulazione:
- Numero di conversazioni simulate per scenario: numero di conversazioni da generare per ogni riga nel set di dati (1-5). Più conversazioni per scenario consentono di identificare la varianza nel comportamento dell'agente.
- Numero di turni per conversazione: numero massimo di turni consentiti per conversazione (1-50). La conversazione termina al termine dell'attività o al raggiungimento di questo limite.
Selezionare Conferma per salvare la configurazione della simulazione.
Conversazioni esistenti
Valutare le conversazioni reali che l'agente aveva già con gli utenti.
- Selezionare Conversazioni esistenti.
- Configurare le opzioni di filtro:
- Numero di conversazioni: numero massimo di conversazioni da campionare dall'intervallo di date (1-100).
- Intervallo di tempo: filtra le conversazioni in base al periodo di tempo. Usare filtri rapidi (Last Day, 7D, 1M, 3M) o selezionare un intervallo di date personalizzato.
- Esplorare e selezionare conversazioni specifiche da includere nella valutazione.
Per valutazioni dei singoli turni
Scegliere da dove provengono i dati di valutazione:
Dati sintetici
Genera query di test utilizzando l'intelligenza artificiale. Selezionare Sintetico e configurare il numero di righe e un prompt che descrive i dati da generare. È anche possibile caricare file per migliorare la pertinenza.
Nota
La generazione di dati sintetici richiede un modello con la funzionalità API Risposte. Per la disponibilità, vedere Disponibilità dell'area dell'API Risposte.
Set di dati esistente
Usare un set di dati preparato in formato CSV o JSONL. Selezionare Set di dati esistente e scegliere un file dagli asset di dati del progetto. Sono supportati solo i formati di file CSV e JSONL.
Tracce esistenti (solo agente)
Analizza le tracce storiche degli agenti relative al tuo progetto. Selezionare Tracce esistenti e filtrare in base all'intervallo di date per selezionare le tracce.
Contenuto multimodale (anteprima)
Tutte le destinazioni di valutazione supportano contenuti audio e di immagine. Ogni tipo di contenuto usa uno schema JSONL specifico:
Contenuto immagine:
-
image_url: l'immagine come URI dati (ad esempio,data:image/png;base64,...) o un URL accessibile pubblicamente. -
caption: una descrizione di testo del contenuto dell'immagine.
{"image_url": "data:image/png;base64,iVBOR...", "caption": "A red to blue color gradient"}
Contenuto audio:
-
audio_data: L'audio sotto forma di URI dati, contenente dati WAV codificati in base64 (ad esempio,data:audio/wav;base64,...). -
expected: una descrizione testuale del contenuto audio previsto.
Nota
Attualmente è supportato solo il formato audio WAV.
{"audio_data": "data:audio/wav;base64,UklGR...", "expected": "A short beep tone at 440 Hz"}
I set di dati possono anche usare il formato di conversazione dei messaggi di chat, in cui i dati audio e immagine sono incorporati all'interno di una singola colonna di messaggi di chat come URI dati o URL accessibili pubblicamente.
L'esempio seguente mostra una colonna del set di dati di conversazione con contenuto audio e immagine incorporati:
[
{
"role": "system",
"content": "..."
},
{
"role": "user",
"content": [
{
"type": "text",
"text": "What are in these images?"
},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/path/image.png"
}
},
{
"type": "image_url",
"image_url": {
"url": "data:image/png;base64,iVBORw0KGgo..."
}
}
]
},
{
"role": "assistant",
"content": "..."
},
{
"role": "user",
"content": [
{
"type": "text",
"text": "Tell me the tones for the voices?"
},
{
"type": "input_audio",
"input_audio": {
"data": "https://example.com/path/voice.wav",
"format": "wav"
}
},
{
"type": "input_audio",
"input_audio": {
"data": "data:audio/wav;base64,UklGRigAAA...",
"format": "wav"
}
}
]
}
]
È possibile visualizzare in anteprima le immagini e riprodurre clip audio direttamente nel flusso di creazione della valutazione e nella visualizzazione dei risultati della valutazione.
Passaggio 4: Configurare gli agenti
Nota
Questo passaggio viene visualizzato solo per le valutazioni di Agent .
Personalizzare il comportamento dell'agente durante la valutazione:
- Esaminare l'elenco degli agenti coinvolti nella valutazione.
- Per ogni agente selezionare Configura per personalizzarne il comportamento:
- Prompt di sistema: modificare le istruzioni dell'agente per la valutazione.
- Richiesta utente: specificare la modalità di invio di ogni elemento del set di dati all'agente durante la valutazione.
- L'esecuzione di valutazione mantiene le configurazioni degli agenti.
Configurazione della richiesta utente
Il prompt dell'utente definisce il modo in cui gli input di test vengono passati all'agente. Per impostazione predefinita, il portale usa {{item.query}} per passare la query del set di dati direttamente all'agente.
Nella maggior parte dei casi, è possibile usare il valore predefinito. Modificare questo valore solo se l'agente prevede un formato di input diverso. Ad esempio, se l'agente usa un protocollo dell'agente ospitato o richiede un input strutturato con campi aggiuntivi.
Modelli comuni:
| Formato | Quando utilizzare |
|---|---|
{{item.query}} |
Default. Trasmette direttamente il campo di query dal tuo set di dati. |
{{item.messages}} |
Per gli agenti che prevedono la cronologia delle conversazioni come input. |
| JSON personalizzato | Per gli agenti ospitati o le API che richiedono corpi di richiesta strutturati. |
Tip
Usare prompt personalizzati per testare i casi perimetrali o scenari specifici che potrebbero non verificarsi naturalmente nel set di dati.
Passaggio 5: Configurare il mapping dei campi
Nota
Questo passaggio viene visualizzato quando si usano dati esistenti (conversazioni esistenti, set di dati esistenti o tracce esistenti).
Mappa i tuoi campi dati nei campi attesi da ogni valutatore. I campi obbligatori dipendono dall'ambito di valutazione.
Per la valutazione delle conversazioni (a più turni)
| Campo | Description | Obbligatorio |
|---|---|---|
| messages | Messaggi di conversazione in formato chat. | Sì |
| tool_definitions | Definizioni di strumenti o funzioni disponibili per l'agente. | Sì |
Per le valutazioni dei singoli turni (a turno singolo)
| Campo | Description | Obbligatorio |
|---|---|---|
| query | La richiesta o il prompt dell'utente. | Sì |
| response | Risposta del modello o dell'agente. | Sì |
| context | Contesto ricavato per gli scenari RAG. | No |
| ground_truth | Risposta corretta attesa per il confronto. | No |
| tool_calls | Chiamate effettuate dall'agente tramite lo strumento. | No |
| tool_definitions | Definizioni degli strumenti disponibili. | No |
Il portale tenta automaticamente di eseguire il mapping dei campi del set di dati. Se un campo viene visualizzato come Non assegnato, selezionare l'elenco a discesa per assegnare manualmente una colonna dal set di dati.
Nota
I campi obbligatori sono contrassegnati da un asterisco (*). Gli analizzatori hanno esito negativo se i campi obbligatori vengono lasciati non assegnati.
Passaggio 6: Selezionare i criteri di test
Selezionare gli analizzatori da usare per la valutazione. Microsoft Foundry fornisce tre categorie di analizzatori predefiniti. Gli analizzatori disponibili dipendono dall'ambito di valutazione.
Valutatori di agenti
Valutare in che modo gli agenti gestiscono in modo efficace attività, strumenti e finalità utente. Disponibile solo per singoli turni.
| Valutatore | Description |
|---|---|
| Risoluzione degli intenti | Misura se l'agente ha identificato e risolto correttamente la finalità dell'utente. |
| Adesione al compito | Misura il modo in cui l'agente ha seguito le istruzioni e i vincoli. |
| Richiesta strumento riuscita | Valuta se le chiamate degli strumenti vengono eseguite correttamente. |
| Selezione degli strumenti | Misura se l'agente ha selezionato gli strumenti appropriati per l'attività. |
| Utilizzo dell'output degli strumenti | Valuta quanto efficacemente l'agente ha utilizzato i risultati forniti dagli strumenti nelle sue risposte. |
| Precisione dell'input dello strumento | Misura se l'agente ha inserito input corretti negli strumenti. |
| Accuratezza della chiamata dello strumento | Accuratezza complessiva dell'utilizzo degli strumenti. |
Analizzatori di qualità
Misurare la qualità complessiva delle risposte generate. La maggior parte degli analizzatori di qualità è disponibile per tutti gli ambiti di valutazione. Gli analizzatori contrassegnati con ★ supportano sia l'analisi a livello di conversazione che a livello di turno.
| Valutatore | Description | Supporto per conversazioni |
|---|---|---|
| Soddisfazione | Stima la soddisfazione dell'utente con l'interazione con l'agente. | ★ |
| Completamento attività | Valuta se l'agente ha completato correttamente l'attività richiesta. | ★ |
| Coerenza | Misura il flusso logico e la coerenza delle risposte. | ★ |
| Groundedness | Misura se le risposte sono basate sul contesto fornito. | ★ |
| Completezza della risposta | Valuta se le risposte rispondono completamente alle query utente. | — |
| Fluency | Valuta la qualità del linguaggio naturale. | — |
| Relevance | Valuta quanto le risposte siano pertinenti alla richiesta. | — |
Analizzatori di sicurezza
Identificare i potenziali rischi per la sicurezza e il contenuto. Disponibile solo per singoli turni.
| Valutatore | Description |
|---|---|
| Violenza | Rileva contenuti violenti nelle risposte. |
| Sessuale | Rileva il contenuto sessuale. |
| Autolesionismo | Rileva il contenuto correlato all'autolesionismo. |
| Odio/ingiustità | Rileva contenuti odiosi o distorti. |
Il portale preseleziona gli analizzatori consigliati in base alla destinazione di valutazione e all'ambito:
- Conversazioni complete: Soddisfazione del cliente, Completamento dell'attività, Coerenza, Aderenza ai fatti
- Singoli turni (dati esistenti): Tutti i valutatori degli agenti, nonché i valutatori della qualità e della sicurezza
- Singoli giri (sintetici/tracce): Pertinenza, concretezza, fluidità, coerenza
Tip
È possibile aggiungere o rimuovere analizzatori in base alle esigenze. Selezionare Analizzatori personalizzati per usare gli analizzatori definiti nel progetto.
Passaggio 7: Esaminare e inviare
- Immettere un nome per la valutazione.
- Esaminare la configurazione:
- Destinazione e ambito di valutazione
- Origine dati e set di dati
- Analizzatori selezionati
- Mappatura dei campi (se applicabile)
- Selezionare Invia per avviare la valutazione.
Dopo l'invio, viene avviata l'esecuzione della valutazione. Le valutazioni vengono in genere completate entro pochi minuti, a seconda delle dimensioni del set di dati e del numero di conversazioni simulate.
Per verificare che la valutazione sia stata avviata correttamente:
- Nel riquadro sinistro selezionare Valutazione.
- Trova la tua valutazione nell'elenco. La colonna Stato mostra lo stato corrente:
- In corso: la valutazione è in esecuzione.
- Completato: la valutazione è stata completata correttamente.
- Parziale: Alcune valutazioni sono state completate, ma altre non sono andate a buon fine.
- Non riuscito: la valutazione ha rilevato un errore.
Per visualizzare i risultati dettagliati, selezionare il nome della valutazione o vedere Visualizzare i risultati della valutazione.
Tip
Per i flussi di lavoro di valutazione a livello di codice, usare Azure AI Evaluation SDK. Vedere Come eseguire la valutazione batch con l'SDK.
Risoluzione dei problemi
La valutazione va in timeout o è lenta
- Ridurre il numero di conversazioni o righe del set di dati.
- Per le simulazioni, ridurre il numero massimo di turni per conversazione.
- Verifica che il tuo modello di valutazione disponga di una quota sufficiente.
Errori di mappatura dei campi
- Verificare che il set di dati contenga le colonne necessarie per l'ambito di valutazione.
- Per le valutazioni della conversazione, verificare che la colonna messaggi contenga messaggi di chat formattati correttamente.
- Verificare che i nomi di colonna nel set di dati corrispondano ai nomi dei campi previsti.
Quota modelli superata
- Il modello giudice usato per le valutazioni assistite dall'IA viene conteggiato ai fini della tua quota di Azure OpenAI.
- Usare un set di dati più piccolo o attendere l'aggiornamento della quota.
- È consigliabile usare
gpt-4.1-minianzichégpt-4.1per valutazioni convenienti.
Procedure consigliate
Per le valutazioni basate su simulazione
- Iniziare con una piccola operazione: iniziare con 1 conversazione per scenario e 5-10 turni per convalidare la configurazione prima di aumentare le prestazioni.
- Scenari diversi: includere un'ampia gamma di descrizioni degli scenari per testare diverse funzionalità dell'agente.
- Scorrere le richieste: se gli agenti si comportano in modo imprevisto, usare il passaggio Configura agenti per modificare le richieste.
Per le valutazioni delle conversazioni esistenti
- Esempio rappresentativo: selezionare le conversazioni che rappresentano le interazioni utente tipiche.
- Includi casi perimetrali: non valutare solo conversazioni riuscite, inclusi scenari complessi.
- Valutazione regolare: pianificare valutazioni ricorrenti per tenere traccia delle prestazioni dell'agente nel tempo.
Per le valutazioni del modello
- Set di dati di benchmark: usare set di dati standardizzati per confrontare le prestazioni del modello tra le versioni.
- Testare sia l'accesso distribuito che l'accesso immediato: confrontare le distribuzioni ottimizzate con i modelli di base.
Per le valutazioni dei set di dati
- Precalcola gli output: Genera gli output offline e valutali in blocco per ottimizzare i costi.
- Gestisci le versioni dei tuoi set di dati: Tieni traccia di quale versione del set di dati ha prodotto determinati risultati della valutazione.
Suggerimenti generali
- Confrontare gli analizzatori: eseguire gli stessi dati tramite più analizzatori per ottenere una visualizzazione completa.
- Tenere traccia delle tendenze: usare la cronologia di valutazione per identificare i miglioramenti delle prestazioni o le regressioni.
- Agire sui risultati: usare le informazioni dettagliate sulla valutazione per perfezionare le richieste degli agenti, le definizioni degli strumenti e le configurazioni.
Contenuto correlato
Altre informazioni sulla valutazione dei modelli e degli agenti di intelligenza artificiale generativi: