Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
Note
L'esperienza di valutazione dell'interfaccia della riga di comando per sviluppatori Azure è attualmente in anteprima.
In questo avvio rapido verrà valutato l'agente ospitato distribuito in Distribuzione del primo agente ospitato. È possibile fornire un set di dati di test, scegliere gli analizzatori, eseguire una valutazione sull'agente distribuito ed esaminare i punteggi. Ogni passaggio illustra diversi modi per eseguire la stessa attività: l'interfaccia della riga di comando per sviluppatori Azure (azd), il portale di Microsoft Foundry, l'SDK Python o JavaScript/TypeScript SDK.
La valutazione stabilisce una baseline di qualità per l'agente e consente di impostare soglie di accettazione, ad esempio un tasso di superamento della conformità delle attività, prima di rilasciare le modifiche agli utenti.
Prerequisiti
Prima di iniziare, è necessario disporre di quanto segue:
Un agente ospitato distribuito, invocabile da Distribuire il tuo primo agente ospitato. Per il percorso di Azure Developer CLI, è necessario usare anche la directory del progetto
azdcreata in questo avvio rapido.Il ruolo Utente Foundry nella risorsa Foundry.
Una distribuzione di un modello per il completamento della chat nello stesso progetto Foundry da utilizzare come modello di valutazione che assegna un punteggio alle risposte. È possibile riutilizzare la distribuzione di modello che l'agente usa già, inclusa quella del precedente avvio rapido, pertanto non è necessaria una distribuzione separata.
Important
I ruoli di Controllo degli accessi in base al ruolo di Foundry sono stati recentemente rinominati. Foundry User, Foundry Owner, Foundry Account Owner e Foundry Project Manager erano precedentemente denominati Azure AI User, Azure AI Owner, Azure AI Account Owner e Azure AI Project Manager. È possibile che i nomi precedenti vengano visualizzati in alcune posizioni durante l'esecuzione della ridenominazione. Gli ID ruolo e le autorizzazioni di base sono invariati dalla ridenominazione.
Ogni passaggio offre diversi percorsi. Usare qualsiasi opzione preferita:
-
Azure Developer CLI: L'
azd ai agentestensione (azure.ai.agents), versione 0.1.40-preview o versione successiva, che fornisce i comandiazd ai agent eval. Questa estensione è inclusa nell'estensionemicrosoft.foundryinstallata nella guida introduttiva precedente. Verificare la versione installata conazd ext listed eseguireazd ext upgrade microsoft.foundryse necessario. Accedi conazd auth login. - Portale Foundry: Accesso al portale Foundry.
-
Python SDK: Python 3.9 o versione successiva e il interfaccia della riga di comando di Azure connesso con
az loginin modo cheDefaultAzureCredentialpossa eseguire l'autenticazione. Per l’installazione, vedere Installare l'interfaccia della riga di comando di Azure. -
JavaScript/TypeScript SDK: Node.js 20 LTS o versione successiva e il interfaccia della riga di comando di Azure connesso con
az loginin modo cheDefaultAzureCredentialpossa eseguire l'autenticazione.
Passaggio 1: Confermare l'agente distribuito
La valutazione viene eseguita su un agente distribuito e richiamabile. Verificare che l'agente sia distribuito e disponibile prima di configurare la valutazione.
Dalla directory del progetto azd, verificare che l'agente sia distribuito e richiamabile:
azd ai agent show
Inviare una richiesta di test:
azd ai agent invoke "Write a haiku about deploying cloud applications."
Verrà visualizzata una risposta entro pochi secondi.
Passaggio 2: Configurare analizzatori predefiniti
Iniziare con gli analizzatori predefiniti per assegnare un punteggio all'agente rispetto a un set di dati di test.
Creare prima di tutto un file JSONL di query di test per l'agente. Ogni riga è un oggetto JSON con un query campo. Salvarlo all'interno della cartella di origine dell'agente, come src/<your-agent-name>/tests/queries.jsonl:
{"query": "Write a haiku about deploying cloud applications."}
Creare quindi un eval.yaml file nella stessa cartella di origine dell'agente, come src/<your-agent-name>/eval.yaml. Punta al set di dati ed elenca gli analizzatori predefiniti da applicare. Il percorso dataset.local_uri è relativo a questa cartella. Sostituire <your-agent-name> con il nome dell'agente ospitato e <your-chat-completion-deployment> con la distribuzione del modello di valutazione:
name: agent-eval
agent:
name: <your-agent-name>
kind: hosted
dataset:
local_uri: tests/queries.jsonl
evaluators:
- builtin.intent_resolution
- builtin.task_adherence
options:
eval_model: <your-chat-completion-deployment>
max_samples: 15
Il valore eval_model è il modello di valutazione che assegna i punti alle risposte. È possibile riutilizzare la distribuzione che l'agente usa già.
Passaggio 3: Eseguire la valutazione
Eseguire la suite sull'agente distribuito. Il servizio invia ogni query di test all'agente, acquisisce la risposta e la valuta con i valutatori da te selezionati.
Note
La valutazione basata sul target richiama direttamente l'agente ospitato. Funziona con gli agenti che usano il protocollo di risposte o chiamate con esecuzione sincrona e non in streaming. Per valutare gli agenti che usano il protocollo A2A o Activity o altri modelli di esecuzione, ad esempio a esecuzione prolungata o in streaming, valutare invece le tracce create dall'agente. Vedi Valutazione delle tracce.
Eseguire la valutazione dalla radice dell'area di lavoro azd:
azd ai agent eval run --config eval.yaml
Note
azd ai agent eval run risolve il percorso --config relativamente alla cartella di origine dell'agente in src/ (ad esempio, src/<your-agent-name>/eval.yaml), non rispetto alla directory corrente. Mantieni eval.yaml e il dataset a cui punta local_uri all'interno di quella cartella.
Il comando legge eval.yaml, invia ogni query all'agente, assegna un punteggio alle risposte e stampa un riepilogo al termine:
Eval run started
Eval: eval_b36748dede424e4ba3f8e6c99ca2cf27
Run: evalrun_5f72ef189ad24790a32128e6f230b131
(✓) Done Eval run
Results: 1 total, 1 passed, 0 failed, 0 errored
Per-criteria results:
intent_resolution: 1 passed, 0 failed, 0 errored
task_adherence: 1 passed, 0 failed, 0 errored
Passaggio 4: Esaminare i risultati
Le valutazioni vengono in genere completate in pochi minuti, a seconda del numero di query.
Elencare le valutazioni recenti:
azd ai agent eval list
Eval ID Name Status of last run Runs
------- ---- ------------------ ----
* eval_b36748dede424e4ba3f8e6c99ca2cf27 agent-eval Completed 1
* = active eval in current environment
Mostrare la valutazione più recente e le relative esecuzioni:
azd ai agent eval show
Eval: eval_b36748dede424e4ba3f8e6c99ca2cf27
Name: agent-eval
Agent: <your-agent-name>
Runs: 1
Recent runs:
Run ID Status Passed Failed Created
------ ------ ------ ------ -------
evalrun_5f72ef189ad24790a32128e6f230b131 Completed 1/1 0 2026-06-17 14:52 UTC
Usa i risultati per verificare quale versione dell'agente è stata valutata e quali punteggi del valutatore sono stati prodotti. Per visualizzare i dettagli di ciascun valutatore e un collegamento al report nel portale Foundry, esegui azd ai agent eval show <eval-id> --eval-run-id <run-id>.
Pulire le risorse
Questa guida rapida registra un set di dati, una valutazione e la cronologia delle esecuzioni nel tuo progetto Foundry. Queste risorse comportano costi di esercizio minimi o nulli.
Per rimuovere l'agente ospitato e le risorse Azure create, seguire la procedura di pulizia descritta in Distribuire il primo agente ospitato.
Troubleshooting
| Issue | Soluzione |
|---|---|
Comando azd ai agent eval non trovato |
Esegui azd ext list e verifica che l'estensione azd ai agent sia la versione 0.1.40-preview o una versione successiva. Aggiorna con azd ext upgrade microsoft.foundry. |
azd ai agent eval run non riesce a trovare l'agente |
Verifica che l'agente sia distribuito e invocabile con azd ai agent show. Distribuire nuovamente con azd deploy, se necessario. |
ModuleNotFoundError per azure.ai.projects o azure.identity |
Installare l'SDK: pip install "azure-ai-projects>=2.0.0" azure-identity. |
Errore AuthenticationError, DefaultAzureCredential o Forbidden |
Accedi con az login (o azd auth login per il percorso CLI) e verifica di avere il ruolo Utente Foundry sul progetto. I caricamenti del set di dati richiedono anche l'accesso in scrittura all'archiviazione del progetto. |
| Destinazione agente non trovata | Verificare il nome e la versione dell'agente con project_client.agents.get("<your-agent-name>") o project_client.agents.list(). |
| Molte righe con errori o punteggi inaspettatamente bassi | Apri l'URL del report e verifica se le righe presentano errori di risposta dell'agente o errori del valutatore. Correggere gli errori sottostanti, quindi rieseguire la valutazione. |
| Distribuzione del modello Eval non trovata | Verificare che la distribuzione del modello di valutazione (FOUNDRY_MODEL_NAME per l'SDK o eval_model in eval.yaml) sia presente nel progetto in Compilazione>Distribuzioni. |
Cosa si è appreso
Questo avvio rapido spiega come:
- È stato creato un set di dati di test e sono stati scelti gli analizzatori per l'agente ospitato.
- È stata eseguita una valutazione sull'agente distribuito.
- Risultati aggregati e a livello di riga esaminati.
- È stata completata ogni attività con l'interfaccia della riga di comando per sviluppatori Azure, il portale Foundry, l'SDK di Python o JavaScript/TypeScript SDK.
Passaggi successivi
Continuare a migliorare il flusso di lavoro di valutazione:
- Configurare valutazioni continue e pianificate per tenere traccia della qualità dell'agente nell'ambiente di produzione.
Contenuti correlati
- Valutare gli agenti di intelligenza artificiale
- Eseguire valutazioni batch dall'SDK
- Generare automaticamente un set di dati di valutazione sintetica per creare query di test e analizzatori.
- Risolvere i problemi di valutazione e osservabilità
- Informazioni di riferimento per i valutatori di agenti
- Che cosa sono gli agenti ospitati?