Übersicht über die Agent-Evaluierung CLI

Die Microsoft 365 Copilot Agent Evaluations CLI (@microsoft/m365-copilot-eval) hilft Ihnen, die Qualität Ihrer Agenten mit strukturierten Auswertungen und umfassenden Ergebnisberichten mit KI-basierter Bewertung zu testen, zu messen und zu verbessern.

Mögliche Aktionen

Das Evaluierungstool bietet die folgenden Funktionen:

  • Führen Sie Stapel- und interaktive Auswertungen aus.
  • Bewerten Sie die Antworten automatisch mithilfe der Microsoft Foundry-Cloudauswertung und der integrierten Metriken.
  • Teste mit JSON-Datasets, Inline-Prompts oder interaktiven Eingaben.
  • Generieren Sie Berichte im HTML-, JSON- oder CSV-Format.

Auswertung Metriken

Jede Antwort wird mithilfe von Standardauswertungsmetriken bewertet.

Evaluator Typ Skalierung Standardschwellenwert Default
Relevanz LLM-basiert 1-5 3 Ja
Kohärenz LLM-basiert 1-5 3 Ja
Groundedness LLM-basiert 1-5 3 Nein
Ähnlichkeit LLM-basiert 1-5 3 Nein
RetrievalQuery Nicht-LLM Erfolgreich/nicht bestanden Nicht zutreffend Nein
RetrievalResult Nicht-LLM Proportional 1.0 Nein
Zitate Anzahlbasiert >= 0 1 Nein
Exakter Treffer Übereinstimmung der Zeichenfolge Boolescher Wert Nicht zutreffend Nein
PartialMatch Übereinstimmung der Zeichenfolge 0.0-1.0 0.5 Nein

Ausführliche Informationen zu den einzelnen Evaluatoren, einschließlich Konfigurationsoptionen und Beispieldatasets, finden Sie in der Referenz zu Evaluatoren.

Funktionsweise des Bewertungsworkflows

Auswertungen folgen einem einheitlichen Workflow:

  1. Installieren und konfigurieren Sie die CLI.
  2. Geben Sie die Umgebungskonfiguration und Anmeldeinformationen an.
  3. Erstellen Sie ein Dataset mit Testeingabeaufforderungen.
  4. Führen Sie Bewertungen für Ihren Agent aus.
  5. Überprüfen Sie die Ergebnisse und wiederholen Sie sie.

Erforderliche Umgebungsvariablen

Das Evaluierungstool verwendet Umgebungsvariablen zur Authentifizierung und Verbindung mit Ihrem Mandanten und Microsoft Foundry-Projekt.

Variable Beschreibung Default
TENANT_ID Microsoft Entra-Mandanten-ID, in der Ihr Agent bereitgestellt wird. Keine
AZURE_AI_PROJECT_ENDPOINT Microsoft Foundry-Projektendpunkt, der für die Cloud-Auswertung verwendet wird. Keine
AZURE_AI_MODEL_NAME Modellimplementierungsname in Ihrem Microsoft Foundry-Projekt. gpt-5-mini
M365_TITLE_ID (optional) Titel-ID, die für die automatische Erkennung der Microsoft 365-Agent-ID für die Auswertung verwendet wird. Keine
M365_AGENT_ID (optional) Explizite Agent-ID für die Auswertung. Automatisch erkannt von M365_TITLE_ID

Diese Werte aktivieren die Authentifizierung und ermöglichen dem Tool die Ausführung einer LLM-basierten Auswertungsbewertung mithilfe von Microsoft Foundry. Weitere Informationen zum Abrufen dieser Werte finden Sie unter Abrufen von Werten für Umgebungsvariablen.