Guida introduttiva: Valuta l'agente ospitato

Note

L'esperienza di valutazione dell'interfaccia della riga di comando per sviluppatori Azure è attualmente in anteprima.

In questo avvio rapido verrà valutato l'agente ospitato distribuito in Distribuzione del primo agente ospitato. È possibile fornire un set di dati di test, scegliere gli analizzatori, eseguire una valutazione sull'agente distribuito ed esaminare i punteggi. Ogni passaggio illustra diversi modi per eseguire la stessa attività: l'interfaccia della riga di comando per sviluppatori Azure (azd), il portale di Microsoft Foundry, l'SDK Python o JavaScript/TypeScript SDK.

La valutazione stabilisce una baseline di qualità per l'agente e consente di impostare soglie di accettazione, ad esempio un tasso di superamento della conformità delle attività, prima di rilasciare le modifiche agli utenti.

Prerequisiti

Prima di iniziare, è necessario disporre di quanto segue:

  • Un agente ospitato distribuito, invocabile da Distribuire il tuo primo agente ospitato. Per il percorso di Azure Developer CLI, è necessario usare anche la directory del progetto azd creata in questo avvio rapido.

  • Il ruolo Utente Foundry nella risorsa Foundry.

  • Una distribuzione di un modello per il completamento della chat nello stesso progetto Foundry da utilizzare come modello di valutazione che assegna un punteggio alle risposte. È possibile riutilizzare la distribuzione di modello che l'agente usa già, inclusa quella del precedente avvio rapido, pertanto non è necessaria una distribuzione separata.

    Important

    I ruoli di Controllo degli accessi in base al ruolo di Foundry sono stati recentemente rinominati. Foundry User, Foundry Owner, Foundry Account Owner e Foundry Project Manager erano precedentemente denominati Azure AI User, Azure AI Owner, Azure AI Account Owner e Azure AI Project Manager. È possibile che i nomi precedenti vengano visualizzati in alcune posizioni durante l'esecuzione della ridenominazione. Gli ID ruolo e le autorizzazioni di base sono invariati dalla ridenominazione.

Ogni passaggio offre diversi percorsi. Usare qualsiasi opzione preferita:

  • Azure Developer CLI: L'azd ai agent estensione (azure.ai.agents), versione 0.1.40-preview o versione successiva, che fornisce i comandi azd ai agent eval. Questa estensione è inclusa nell'estensione microsoft.foundry installata nella guida introduttiva precedente. Verificare la versione installata con azd ext listed eseguire azd ext upgrade microsoft.foundry se necessario. Accedi con azd auth login.
  • Portale Foundry: Accesso al portale Foundry.
  • Python SDK: Python 3.9 o versione successiva e il interfaccia della riga di comando di Azure connesso con az login in modo che DefaultAzureCredential possa eseguire l'autenticazione. Per l’installazione, vedere Installare l'interfaccia della riga di comando di Azure.
  • JavaScript/TypeScript SDK: Node.js 20 LTS o versione successiva e il interfaccia della riga di comando di Azure connesso con az login in modo che DefaultAzureCredential possa eseguire l'autenticazione.

Passaggio 1: Confermare l'agente distribuito

La valutazione viene eseguita su un agente distribuito e richiamabile. Verificare che l'agente sia distribuito e disponibile prima di configurare la valutazione.

Dalla directory del progetto azd, verificare che l'agente sia distribuito e richiamabile:

azd ai agent show

Inviare una richiesta di test:

azd ai agent invoke "Write a haiku about deploying cloud applications."

Verrà visualizzata una risposta entro pochi secondi.

Passaggio 2: Configurare analizzatori predefiniti

Iniziare con gli analizzatori predefiniti per assegnare un punteggio all'agente rispetto a un set di dati di test.

Creare prima di tutto un file JSONL di query di test per l'agente. Ogni riga è un oggetto JSON con un query campo. Salvarlo all'interno della cartella di origine dell'agente, come src/<your-agent-name>/tests/queries.jsonl:

{"query": "Write a haiku about deploying cloud applications."}

Creare quindi un eval.yaml file nella stessa cartella di origine dell'agente, come src/<your-agent-name>/eval.yaml. Punta al set di dati ed elenca gli analizzatori predefiniti da applicare. Il percorso dataset.local_uri è relativo a questa cartella. Sostituire <your-agent-name> con il nome dell'agente ospitato e <your-chat-completion-deployment> con la distribuzione del modello di valutazione:

name: agent-eval
agent:
  name: <your-agent-name>
  kind: hosted
dataset:
  local_uri: tests/queries.jsonl
evaluators:
  - builtin.intent_resolution
  - builtin.task_adherence
options:
  eval_model: <your-chat-completion-deployment>
max_samples: 15

Il valore eval_model è il modello di valutazione che assegna i punti alle risposte. È possibile riutilizzare la distribuzione che l'agente usa già.

Passaggio 3: Eseguire la valutazione

Eseguire la suite sull'agente distribuito. Il servizio invia ogni query di test all'agente, acquisisce la risposta e la valuta con i valutatori da te selezionati.

Note

La valutazione basata sul target richiama direttamente l'agente ospitato. Funziona con gli agenti che usano il protocollo di risposte o chiamate con esecuzione sincrona e non in streaming. Per valutare gli agenti che usano il protocollo A2A o Activity o altri modelli di esecuzione, ad esempio a esecuzione prolungata o in streaming, valutare invece le tracce create dall'agente. Vedi Valutazione delle tracce.

Eseguire la valutazione dalla radice dell'area di lavoro azd:

azd ai agent eval run --config eval.yaml

Note

azd ai agent eval run risolve il percorso --config relativamente alla cartella di origine dell'agente in src/ (ad esempio, src/<your-agent-name>/eval.yaml), non rispetto alla directory corrente. Mantieni eval.yaml e il dataset a cui punta local_uri all'interno di quella cartella.

Il comando legge eval.yaml, invia ogni query all'agente, assegna un punteggio alle risposte e stampa un riepilogo al termine:

Eval run started
   Eval: eval_b36748dede424e4ba3f8e6c99ca2cf27
   Run:  evalrun_5f72ef189ad24790a32128e6f230b131
   (✓) Done  Eval run

Results:    1 total, 1 passed, 0 failed, 0 errored

Per-criteria results:
  intent_resolution: 1 passed, 0 failed, 0 errored
  task_adherence: 1 passed, 0 failed, 0 errored

Passaggio 4: Esaminare i risultati

Le valutazioni vengono in genere completate in pochi minuti, a seconda del numero di query.

Elencare le valutazioni recenti:

azd ai agent eval list
    Eval ID                                Name        Status of last run  Runs
    -------                                ----        ------------------  ----
*   eval_b36748dede424e4ba3f8e6c99ca2cf27  agent-eval  Completed           1

* = active eval in current environment

Mostrare la valutazione più recente e le relative esecuzioni:

azd ai agent eval show
Eval:   eval_b36748dede424e4ba3f8e6c99ca2cf27
Name:   agent-eval
Agent:  <your-agent-name>
Runs:   1

Recent runs:
  Run ID                                    Status     Passed  Failed  Created
  ------                                    ------     ------  ------  -------
  evalrun_5f72ef189ad24790a32128e6f230b131  Completed  1/1     0       2026-06-17 14:52 UTC

Usa i risultati per verificare quale versione dell'agente è stata valutata e quali punteggi del valutatore sono stati prodotti. Per visualizzare i dettagli di ciascun valutatore e un collegamento al report nel portale Foundry, esegui azd ai agent eval show <eval-id> --eval-run-id <run-id>.

Pulire le risorse

Questa guida rapida registra un set di dati, una valutazione e la cronologia delle esecuzioni nel tuo progetto Foundry. Queste risorse comportano costi di esercizio minimi o nulli.

Per rimuovere l'agente ospitato e le risorse Azure create, seguire la procedura di pulizia descritta in Distribuire il primo agente ospitato.

Troubleshooting

Issue Soluzione
Comando azd ai agent eval non trovato Esegui azd ext list e verifica che l'estensione azd ai agent sia la versione 0.1.40-preview o una versione successiva. Aggiorna con azd ext upgrade microsoft.foundry.
azd ai agent eval run non riesce a trovare l'agente Verifica che l'agente sia distribuito e invocabile con azd ai agent show. Distribuire nuovamente con azd deploy, se necessario.
ModuleNotFoundError per azure.ai.projects o azure.identity Installare l'SDK: pip install "azure-ai-projects>=2.0.0" azure-identity.
Errore AuthenticationError, DefaultAzureCredential o Forbidden Accedi con az login (o azd auth login per il percorso CLI) e verifica di avere il ruolo Utente Foundry sul progetto. I caricamenti del set di dati richiedono anche l'accesso in scrittura all'archiviazione del progetto.
Destinazione agente non trovata Verificare il nome e la versione dell'agente con project_client.agents.get("<your-agent-name>") o project_client.agents.list().
Molte righe con errori o punteggi inaspettatamente bassi Apri l'URL del report e verifica se le righe presentano errori di risposta dell'agente o errori del valutatore. Correggere gli errori sottostanti, quindi rieseguire la valutazione.
Distribuzione del modello Eval non trovata Verificare che la distribuzione del modello di valutazione (FOUNDRY_MODEL_NAME per l'SDK o eval_model in eval.yaml) sia presente nel progetto in Compilazione>Distribuzioni.

Cosa si è appreso

Questo avvio rapido spiega come:

  • È stato creato un set di dati di test e sono stati scelti gli analizzatori per l'agente ospitato.
  • È stata eseguita una valutazione sull'agente distribuito.
  • Risultati aggregati e a livello di riga esaminati.
  • È stata completata ogni attività con l'interfaccia della riga di comando per sviluppatori Azure, il portale Foundry, l'SDK di Python o JavaScript/TypeScript SDK.

Passaggi successivi

Continuare a migliorare il flusso di lavoro di valutazione: