Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Verwenden Sie Cloud-Auswertungen, um generative KI-Anwendungen im großen Maßstab zu testen, ohne die lokale Berechnung zu verwalten. Dieser Artikel richtet den freigegebenen SDK-Client ein und hilft Ihnen bei der Auswahl eines Workflows für die Vorabbereitstellung oder Produktionsauswertung.
Voraussetzungen
Ein Foundry-Projekt.
Eine Azure OpenAI-Bereitstellung mit einem GPT-Modell, das Chatvervollständigung unterstützt, wie z. B.
gpt-5-mini.Die Rolle " Foundry User " im Foundry-Projekt.
Important
Die Foundry-RBAC-Rollen wurden kürzlich umbenannt. Foundry User, Foundry Owner, Foundry Account Owner und Foundry Project Manager wurden zuvor Azure KI-Benutzer, Azure KI-Besitzer, Azure KI-Kontobesitzer und Azure AI Project Manager benannt. Möglicherweise werden die vorherigen Namen an einigen Stellen weiterhin angezeigt, während der Umbenennungsrollout ausgeführt wird. Die Rollen-IDs und Kernberechtigungen bleiben durch die Umbenennung unverändert.
Optional kann Ihr eigenes Speicherkonto für Auswertungsdaten verwendet werden.
Einige Auswertungsfeatures weisen regionale Einschränkungen auf. Überprüfen Sie die unterstützten Regionen , bevor Sie beginnen.
Einrichten des SDK-Clients
Installieren Sie das SDK für Ihre Sprache. Legen Sie diese gemeinsamen Umgebungsvariablen fest:
-
AZURE_AI_PROJECT_ENDPOINT: Ihr Foundry-Projektendpunkt, z. Bhttps://<account_name>.services.ai.azure.com/api/projects/<project_name>. . -
AZURE_AI_MODEL_DEPLOYMENT_NAME: Die Modellbereitstellung für KI-gestützte Bewerter. -
DATASET_NAMEundDATASET_VERSION: Optionale Werte für wiederverwendbare Datasets.
Authentifizieren mit DefaultAzureCredential, erstellen Sie den Projektclient, und rufen Sie den OpenAI-Client ab, der von der Auswertungs-API verwendet wird.
pip install "azure-ai-projects>=2.2.0"
import os
from azure.identity import DefaultAzureCredential
from azure.ai.projects import AIProjectClient
from azure.ai.projects.models import TestingCriterionAzureAIEvaluator
from openai.types.eval_create_params import DataSourceConfigCustom
from openai.types.evals.create_eval_jsonl_run_data_source_param import (
CreateEvalJSONLRunDataSourceParam,
SourceFileContent,
SourceFileContentContent,
SourceFileID,
)
endpoint = os.environ["AZURE_AI_PROJECT_ENDPOINT"]
model_deployment_name = os.environ.get(
"AZURE_AI_MODEL_DEPLOYMENT_NAME", ""
)
dataset_name = os.environ.get("DATASET_NAME", "")
dataset_version = os.environ.get("DATASET_VERSION", "1")
project_client = AIProjectClient(
endpoint=endpoint,
credential=DefaultAzureCredential(),
)
openai_client = project_client.get_openai_client()
Informationen zum Verwenden eines Modells, das über Administratorverbindungen als Ziel-, Richtermodell- oder Unterhaltungssimulator verbunden ist, finden Sie unter Verwenden von vom Administrator verbundenen Modellen in Cloudauswertungen.
Grundlegendes zum Auswertungsworkflow
Eine Cloudauswertung umfasst drei Schritte:
- Definieren Sie die Datenstruktur und die Auswerter zu ihrer Bewertung.
- Erstellen Sie die Auswertung mit
openai_client.evals.create(). - Starten Sie eine Ausführung mit
openai_client.evals.runs.create(), rufen Sie ab, bis sie abgeschlossen ist, und rufen Sie die bewerteten Ergebnisse ab.
Die Ergebnisse der Cloudauswertung werden in Ihrem Foundry-Projekt gespeichert. Sie können sie über das SDK abrufen, sie im Portal überprüfen oder an Application Insights weiterleiten, wenn sie verbunden sind.
Evaluatoren auswählen
Auswerter werden über Spaltenzuordnungen mit Feldern in Ihren Daten verknüpft. Datasetworkflows machen Elementfelder verfügbar, während zielgenerierte Workflows auch die Modell- oder Agentausgabe über das Beispielschema verfügbar machen.
Überprüfen Sie die integrierten Bewerter und benutzerdefinierten Bewerter , bevor Sie Testkriterien konfigurieren.
Auswählen des Startpunkts
| Startpunkt | Workflow |
|---|---|
| Sie verfügen über JSONL- oder CSV-Testdaten mit Abfrage und Antwort. | Auswerten von Datasets in der Cloud |
| Sie haben Abfragen und möchten, dass ein Modell oder Agent Antworten generiert. | Auswerten von Modellen und Agents in der Cloud |
| Sie haben ein Modell oder einen Agent mit Application-Insights-Ablaufverfolgung bereitgestellt. | Auswerten der bereitgestellten Agent- und Modellinteraktionen |
| Sie verfügen über vollständige Konversationsdaten oder Konversationsprotokolle aus der Produktion. | Bewerten von Unterhaltungen in der Cloud |
| Sie benötigen synthetische Abfragen oder simulierte Unterhaltungen. | Generieren synthetischer Daten |
| Sie müssen einen Lauf abfragen, interpretieren, abbrechen oder Fehler beheben. | Abrufen von Cloudauswertungsergebnissen |
Verwenden Sie für adversariale Sicherheitstests KI-rotes Teaming. Informationen zum Erstellen eines eigenständigen Datasets finden Sie unter Generieren eines synthetischen Auswertungsdatensatzes.