Auswertungsdatensätze in Microsoft Foundry

Ein Auswertungsdatensatz ist eine wiederverwendbare Sammlung von Testfällen zur Messung der Modell- oder Agentenqualität. Auswertungsdatensets verwenden in der Regel JSONL mit einem JSON-Objekt pro Zeile. In diesem Artikel wird erläutert, wann sie ein wiederverwendbares Dataset verwenden, wie Auswertungsdaten organisiert werden, und die verfügbaren Möglichkeiten zum Vorbereiten.

Benötigen Sie ein Auswertungsdatenset?

Erstellen Sie ein Dataset, wenn Sie einen stabilen Testsatz benötigen, den Sie für verschiedene Modell-, Eingabeaufforderungs- oder Agentversionen erneut ausführen können. Wiederverwendbare Datensätze eignen sich gut für Regressionstests, CI/CD-Qualitäts-Gates und Vergleiche zwischen Evaluierungsläufen.

Sie benötigen nicht immer ein Dataset. Wenn Ihr Foundry-Agent bereits Antworten hat oder Ihre Anwendung Traces an Application Insights sendet, können Sie diese Daten dort auswerten, wo sie bereits vorhanden sind. Siehe Interaktionen nach Antwort-ID auswerten und Traces auswerten.

Wie Foundry Auswertungsdaten verwendet

In einem JSONL-Dataset stellt das messages Feld Modell- oder Agentinteraktionen dar. Jede Nachricht identifiziert eine Rolle und deren Inhalt.

Wenn Ihr Dataset abgeschlossene Antworten enthält, wertet Foundry diese Antworten direkt aus. Wenn Sie die Auswertung für ein Modell oder einen Agent ausführen, generiert Foundry für jede Eingabe eine neue Antwort und wertet diese Antwort aus. Alle bereits im Dataset gespeicherten Antworten werden ignoriert.

Ziehen Sie beispielsweise einen Benutzer in Betracht, der sich nicht anmelden kann. Der Agent fragt, welcher Fehler angezeigt wird, der Benutzer sagt, dass sein Kennwort abgelehnt wird, und der Agent empfiehlt eine Kennwortzurücksetzung. Die Turn-Level-Evaluierung bewertet eine einzelne Antwort eines Agenten, z. B. die Anleitung zum Zurücksetzen des Kennworts, unter Verwendung vorheriger Nachrichten als Kontext. Die Bewertung auf Konversationsebene bewertet die gesamte Interaktion.

Die evaluation_level-Einstellung für die Ausführung steuert die Bewertungsgranularität. Das Dataset und die ausgewählten Auswertungen müssen diese Ebene unterstützen. Ausführliche Informationen finden Sie unter "Auswählen einer Auswertungsstufe". Standardspalten und Beispiele finden Sie unter Evaluation-Datasetschema.

Auswählen, wie Auswertungsdaten vorbereitet werden sollen

Situation Empfohlener Ansatz
Sie haben Auswertungsdaten zusammengestellt Laden Sie es als versionsiertes Foundry-Dataset hoch, oder stellen Sie ein kleines Dataset inline bereit. Siehe Vorbereiten von Eingabedaten.
Sie möchten generierte Testfälle überprüfen und wiederverwenden, bevor Sie eine Auswertung ausführen. Generieren Sie ein synthetisches Auswertungsdatenset aus einer Agentdefinition, Inlineaufforderung oder Referenzdatei.
Sie möchten ein wiederverwendbares Dataset basierend auf dem Produktionsdatenverkehr Wandeln Sie Ablaufverfolgungen in einen Datensatz um.
Sie möchten simulierte Multi-Turn-Szenarien testen Generieren Sie ein Simulations-Seed-Dataset oder erstellen Sie Testfallszenarien als JSONL, und simulieren Sie dann Unterhaltungen.
Sie haben Foundry-Antwort-IDs Bewerten sie Interaktionen nach Antwort-ID , ohne ein Dataset zu erstellen.
Sie möchten vorhandene Application Insights-Ablaufverfolgungen auswerten Traces bewerten, ohne einen Datensatz zu erstellen.
Sie möchten Abfragen generieren, ein Ziel aufrufen und deren Antworten in einem Workflow auswerten. Generieren Sie synthetische Abfragen während der Auswertungsausführung. Foundry speichert die generierten Abfragen als Dataset für die Wiederverwendung.

Nächster Schritt