Schnellstart: Verwenden der Agent-Evaluierungs-CLI

Die Microsoft 365 Copilot Agent Evaluations CLI (@microsoft/m365-copilot-eval) hilft Ihnen, die Qualität Ihrer Agenten durch automatisierte Prompt-Bewertung und KI-basiertes Scoring zu testen, zu messen und zu verbessern. In dieser Schnellstartanleitung werden Sie durch die Installation des Agent-Evaluierungstools, die Konfiguration Ihrer Umgebung, das Erstellen Ihres ersten Datasets und das Ausführen einer Auswertung geführt.

Voraussetzungen

Stellen Sie zunächst sicher, dass Sie über Folgendes verfügen:

  • Ein auf Ihrem Mandanten bereitgestellter Microsoft 365 Copilot-Agent.
  • Node.js 24.12.0 oder höher (zur Überprüfung verwenden node --version ).
  • Copilot-Guthaben in Ihrem Mandanten verfügbar. Die Agent-Evaluierungs-CLI verbraucht Copilot-Guthaben, wenn sie Test-Prompts an Ihren Agent sendet. Ihr Mandantenadministrator aktiviert die verbrauchsbasierte (getaktete) Abrechnung im Microsoft 365 Admin Center, indem er zum Copilot>Cost Management-Knoten wechselt. Weitere Informationen finden Sie unter Verwalten von Copilot-Guthaben.
  • Ein Microsoft Foundry-Projekt mit einem GPT-5-Modell, das zur Bewertung von Antworten bereitgestellt wird. Weitere Informationen finden Sie unter Abrufen von Werten für Umgebungsvariablen.
  • Microsoft Entra-Administratoreinwilligung für Work IQ in Ihrem Mandanten erteilt. Wenn Sie kein Mandantenadministrator sind, bitten Sie Ihren Administrator, vor der ersten Ausführung runevals Ihre Zustimmung zu erteilen. Weitere Informationen finden Sie unter Erteilen der Administratoreinwilligung.
  • Ihre Mandanten-ID und der Microsoft Foundry-Projektendpunkt. Wenn Sie diese Werte nicht haben, lesen Sie Abrufen von Werten für Umgebungsvariablen.

Hinweis

In dieser Schnellstartanleitung wird davon ausgegangen, dass Sie eine Windows-Entwicklungsumgebung verwenden. Die Authentifizierungsunterstützung für andere Betriebssysteme ist in Kürze verfügbar.

Schritt 1: Installieren der CLI

Installieren Sie die Agent-Evaluierungs-CLI global mithilfe von npm:

npm install -g @microsoft/m365-copilot-eval

Überprüfen Sie die Installation:

runevals --version

Nach der Installation ist der runevals Befehl global auf Ihrem System verfügbar.

Schritt 2: Einrichten der Projektstruktur

Führen Sie das Evaluierungstool aus dem Projektverzeichnis Ihres Microsoft 365-Agents (in dem sich der Agentcode befindet) und nicht aus dem Repository des Evaluierungstools aus.

cd /path/to/your-agent-project

Ihr Agentprojekt sollte die folgenden Dateien und Ordner enthalten:

my-agent/
├── .env.local              # Agent configuration (Agents Toolkit projects)
├── .env.local.user         # Secrets — never committed
├── evals/
│   └── evals.json          # Your test dataset (auto-discovered)
└── .evals/
    └── <generated reports> # Results written here (YYYY-MM-DD_HH-MM-SS.html)

Sie erstellen das evals/evals.json Dataset in Schritt 4. Der .evals/ Berichtsordner wird bei der ersten Ausführung automatisch erstellt.

Schritt 3: Konfigurieren von Umgebungsvariablen

Wählen Sie die Option aus, die Ihrem Projekttyp entspricht.

Tipp

Wenn Sie Ihren Agent mit dem Microsoft 365 Agents Toolkit erstellt haben, verfügen Sie bereits über .env.local Ihre Agent-Konfiguration. Erstellen Sie .env.local.user in Ihrem Projekt den Stamm für Geheimnisse.

Microsoft 365 Agents Toolkit-Projekte

Sie legen nicht direkt fest M365_AGENT_ID – die CLI erkennt es automatisch aus M365_TITLE_ID ..env.local Weitere Informationen finden Sie unter Abrufen Ihrer Agent-ID.

Geheimnisse hinzufügen zu .env.local.user:

# .env.local.user (NOT checked in — secrets go here)
TENANT_ID="your-tenant-id-here"
AZURE_AI_PROJECT_ENDPOINT="https://<account>.services.ai.azure.com/api/projects/<project>"
AZURE_AI_MODEL_NAME="gpt-5-mini" # default

Die CLI für Agent-Auswertungen bewertet Antworten mithilfe der Microsoft Foundry-Cloudauswertung, die sich bei Microsoft Entra authentifiziert. Melden Sie sich mit der Azure CLI (az login) an, bevor Sie die runevals Weitere Informationen zu diesen Werten finden Sie unter Abrufen von Werten für Umgebungsvariablen.

Zu Ihrem .gitignorehinzufügen .env.local.user :

# User-specific secrets — never commit
.env.local.user
env/.env.local.user

Schritt 4: Erstellen Ihres ersten Datasets

Erstellen Sie evals/evals.json mit einer kleinen Anzahl von Eingabeaufforderungen und erwarteten Antworten. In diesem Beispiel wird das einfachste gültige Schema für Singleturn-Auswertungen verwendet.

{
  "schemaVersion": "1.0.0",
  "items": [
    {
      "prompt": "What is Microsoft 365?",
      "expected_response": "Microsoft 365 is a cloud-based productivity suite that includes Office apps, cloud services, and device management."
    },
    {
      "prompt": "How do I share a file in Microsoft Teams?",
      "expected_response": "To share a file in Teams, you can upload it to a channel or chat, or share it from OneDrive with specific permissions."
    }
  ]
}

Tipp

Wenn Sie diesen Schritt überspringen, bietet das Tool an, bei der ersten Ausführung runevalseine Startdatei mit Beispielprompts zu generieren.

Vollständiges Datasetschema, Kategorien und erweiterte Muster finden Sie unter Erstellen von Evaluierungstestsammlungen.

Schritt 5: Ausführen der ersten Auswertung

Für Agents Toolkit-Projekte (verwendet .env.local automatisch und .env.local.user):

runevals

Für Nicht-Agents-Toolkit-Projekte:

runevals --env dev

Schritt 6: Bestätigen der erfolgreichen Einrichtung

Ein erfolgreicher Lauf produziert:

  • Eine Abschlussmeldung im Terminal ähnlich der folgenden Nachricht.

    M365 Copilot Agent Evaluations CLI
    
    Loading environment: dev
    Agent ID: T_my-agent.declarativeAgent
    Using prompts file: ./evals/evals.json
    
    Running evaluations...
    
    Evals completed successfully!
    Results saved to: ./.evals/2026-04-22_14-30-45.html
    
  • Ein darin gespeicherter ./.evals/YYYY-MM-DD_HH-MM-SS.html HTML-Bericht, der automatisch in Ihrem Browser geöffnet wird.

Der Bericht enthält Bewertungen für jede Eingabeaufforderung.

Evaluator Typ Skalierung Standardschwellenwert Default
Relevanz LLM-basiert 1-5 3 Ja
Kohärenz LLM-basiert 1-5 3 Ja
Groundedness LLM-basiert 1-5 3 Nein
Ähnlichkeit LLM-basiert 1-5 3 Nein
Zitate Anzahlbasiert >= 0 1 Nein
Exakter Treffer Übereinstimmung der Zeichenfolge Boolescher Wert Nicht zutreffend Nein
PartialMatch Übereinstimmung der Zeichenfolge 0.0-1.0 0.5 Nein

Wenn diese Ergebnisse nicht angezeigt werden, lesen Sie "Problembehandlung".