Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
Usare le valutazioni cloud per testare le applicazioni di intelligenza artificiale generati su larga scala senza gestire le risorse di calcolo locali. Questo articolo configura il client SDK condiviso e consente di scegliere un flusso di lavoro per la pre-distribuzione o la valutazione di produzione.
Prerequisiti
Progetto Foundry.
Una distribuzione Azure OpenAI con un modello GPT che supporta il completamento della chat, ad esempio
gpt-5-mini.Il ruolo Utente Foundry nel progetto Foundry.
Importante
I ruoli RBAC di Foundry sono stati recentemente rinominati. Foundry User, Foundry Owner, Foundry Account Owner e Foundry Project Manager erano precedentemente denominati Azure AI User, Azure AI Owner, Azure AI Account Owner e Azure AI Project Manager. È possibile che i nomi precedenti vengano visualizzati in alcune posizioni durante l'esecuzione della ridenominazione. Gli ID ruolo e le autorizzazioni di base sono invariati dalla ridenominazione.
Facoltativo: account di archiviazione personale per i dati di valutazione.
Alcune funzionalità di valutazione hanno restrizioni a livello di area. Prima di iniziare, esaminare le aree supportate .
Configurare il client SDK
Installare l'SDK per la lingua. Impostare queste variabili di ambiente condivise:
-
AZURE_AI_PROJECT_ENDPOINT: L'endpoint del progetto Foundry, ad esempiohttps://<account_name>.services.ai.azure.com/api/projects/<project_name>. -
AZURE_AI_MODEL_DEPLOYMENT_NAME: La distribuzione del modello usata dai valutatori assistiti dall'IA. -
DATASET_NAMEeDATASET_VERSION: valori facoltativi per i set di dati riutilizzabili.
Eseguire l'autenticazione con DefaultAzureCredential, creare il client del progetto e ottenere il client OpenAI usato dall'API di valutazione.
pip install "azure-ai-projects>=2.2.0"
import os
from azure.identity import DefaultAzureCredential
from azure.ai.projects import AIProjectClient
from azure.ai.projects.models import TestingCriterionAzureAIEvaluator
from openai.types.eval_create_params import DataSourceConfigCustom
from openai.types.evals.create_eval_jsonl_run_data_source_param import (
CreateEvalJSONLRunDataSourceParam,
SourceFileContent,
SourceFileContentContent,
SourceFileID,
)
endpoint = os.environ["AZURE_AI_PROJECT_ENDPOINT"]
model_deployment_name = os.environ.get(
"AZURE_AI_MODEL_DEPLOYMENT_NAME", ""
)
dataset_name = os.environ.get("DATASET_NAME", "")
dataset_version = os.environ.get("DATASET_VERSION", "1")
project_client = AIProjectClient(
endpoint=endpoint,
credential=DefaultAzureCredential(),
)
openai_client = project_client.get_openai_client()
Per usare un modello connesso tramite connessioni amministrative come destinazione, modello di giudice o simulatore di conversazione, vedere Usare modelli connessi all'amministratore nelle valutazioni cloud.
Informazioni sul flusso di lavoro di valutazione
Una valutazione cloud prevede tre passaggi:
- Definire la forma dei dati e gli analizzatori che la valutano.
- Creare la valutazione con
openai_client.evals.create(). - Avviare un'esecuzione con
openai_client.evals.runs.create(), eseguire il polling fino al completamento e recuperare i risultati con punteggio.
I risultati della valutazione cloud vengono archiviati nel progetto Foundry. È possibile recuperarli tramite l'SDK, esaminarli nel portale o instradarli ad Application Insights quando è connesso.
Scegliere gli analizzatori
I valutatori si collegano ai campi nei tuoi dati tramite le mappature delle colonne. I flussi di lavoro del dataset espongono i campi degli elementi, mentre i flussi di lavoro generati dal target espongono anche l'output del modello o dell'agente tramite lo schema di esempio.
Esaminare gli analizzatori predefiniti e gli analizzatori personalizzati prima di configurare i criteri di test.
Scegliere il punto di partenza
| Punto di partenza | Workflow |
|---|---|
| Sono disponibili dati di test JSONL o CSV con query e risposta. | Valutare i set di dati nel cloud |
| Hai delle query e vuoi che un modello o un agente generi risposte. | Valutare modelli e agenti nel cloud |
| Hai distribuito il modello o l'agente con le tracce di Application Insights. | Valutare le interazioni tra agente distribuito e modello |
| Hai dati completi delle conversazioni o tracce delle conversazioni di produzione. | Valutare le conversazioni nel cloud |
| Hai bisogno di query sintetiche o conversazioni simulate. | Generare dati sintetici |
| È necessario eseguire il polling, interpretare, annullare o risolvere i problemi di un'esecuzione. | Ottenere i risultati della valutazione cloud |
Per i test di sicurezza avversariale, utilizza AI red teaming. Per creare un set di dati autonomo, vedere Generare un set di dati di valutazione sintetica.