Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Important
Die in diesem Artikel markierten Elemente (Vorschau) sind aktuell als öffentliche Vorschau verfügbar. Diese Vorschauversion wird ohne Vereinbarung zum Servicelevel bereitgestellt und sollte nicht für Produktionsworkloads verwendet werden. Manche Features werden möglicherweise nicht unterstützt oder sind nur eingeschränkt verwendbar. Weitere Informationen finden Sie unter Supplementale Nutzungsbedingungen für Microsoft Azure Previews.
Eine Rubrikwertung bewertet einen Agent oder eine Modellantwort anhand von benutzerdefinierten, gewichteten Kriterien, die Sie definieren, mithilfe eines LLM als Richter. Es bietet Ihnen die vollständige Kontrolle darüber, was "gut" für Ihren Anwendungsfall bedeutet, während Sie dieses Urteil konsistent im Maßstab anwenden.
Eine Rubrik ist eine Reihe von Kriterien, die definieren, wie die Antwort bewertet wird. Jede Rubrik enthält Bewertungsdimensionen; jede Dimension hat eine Beschreibung dessen, was sie misst, und eine Gewichtung, die ihre relative Bedeutung widerspiegelt. Der LLM-Richter bewertet jede anwendbare Dimension von 1 bis 5 für eine einzelne Antwort oder multi-turn-Unterhaltung. Die Gesamtbewertung der Rubriken ist der gewichtete Durchschnitt dieser Punkte, normalisiert auf einen Bereich von 0 bis 1.
Verwenden Sie Rubrikenbewertungen als primäres Maß für die Qualität der Agenten, da sie Ihnen die genauen Kriterien für Ihren Anwendungsfall ausdrücken können. Koppeln Sie sie mit integrierten Bewertern für Sicherheit, Erdheit und Inhaltsschäden, um Risiken abzudecken, die die Rubrik nicht misst. Im restlichen Artikel wird beschrieben, wie Sie eine Rubrik, die darin enthaltenen Felder, das Auswählen eines LLM-Bewertungsmodells und die Überprüfung der Ergebnisse generieren.
Generieren eines Rubrikenwerts
Sie können eine Rubrikenbewertung auf zwei Arten erstellen:
Automatisches Generieren einer Rubrik (empfohlen)
Sie können automatisch eine Rubrikenbewertung erstellen, indem Sie ein LLM-Modell auswählen, um die Rubrik aus dem Kontext Ihres Agents zu generieren. Stellen Sie mindestens einen der folgenden Basiseingaben bereit:
- Gießerei-Agent – Wählen Sie einen vorhandenen Foundry-Agent aus. Der Dienst ruft die Anweisungen des Agents (für Eingabeaufforderungs-Agents) oder seine Beschreibung (für gehostete Agents) als Generierungskontext ab.
- Agent-Systemaufforderung – Fügen Sie die Anweisungen ein, die das beabsichtigte Verhalten Ihres Agents definieren. Verwenden Sie dies, wenn der Agent nicht in Foundry registriert ist oder wenn sein registrierter Kontext sein Verhalten nicht vollständig erfasst.
- Referenzdateien – Dokumente, Wissensbasisinhalte oder Domänenrichtlinien, die den Kontext Ihres Agents und die erwartete Antwortqualität beschreiben.
Um optimale Ergebnisse zu erzielen, fügen Sie die Produktionsablaufverfolgungen von Agenten über jeder Basiseingabe oben hinzu, um die Rubrik in der realen Nutzung zu ergründen:
- Ablaufverfolgungen – Agent-Produktionsablaufverfolgungen, die aus der Foundry-Ablaufverfolgung in Application Insights gesammelt wurden. Ablaufverfolgungen können nicht allein verwendet werden; koppeln Sie sie mit einem Foundry-Agent, einer Agent-Systemaufforderung oder Referenzdateien.
Jede generierte Rubrik enthält die folgenden Felder:
| Feld | Beschreibung |
|---|---|
id |
Stabile, lesbare Striche, die vom Dienst in der ersten Generation zugewiesen wurden. Wenn Sie Kriterien bearbeiten und als neue Version speichern, geben Sie das vorhandene id Echo an, um die Identität in allen Versionen beizubehalten. Der Dienst zuweisen keine IDs beim Bearbeiten neu. |
description |
Was dieses Kriterium misst – eine klare, spezifische Qualitätsdimension. |
weight |
Relative Bedeutung des Kriteriums. Die Erzeugungspipeline weist genau ein Kriterium einer Gewichtung von 8–10 (die wichtigste Ergebnisdimension) und alle anderen 1-6 zu. Benutzerbearbeitungen werden von dieser Heuristik nicht eingeschränkt. |
always_applicable |
Wenn trueder LLM-Richter dieses Kriterium unabhängig von der Relevanz immer bewertet (überspringt die Anwendbarkeitsbewertung). Wird für das allgemeine Qualitätskriterium verwendet. Wird standardmäßig auf false festgelegt. |
Auswählen eines LLM-Richtermodells
Nicht alle Modelle führen ebenso wie Rubrikenrichter aus. In der folgenden Tabelle sind die unterstützten Chatmodelle für die Rubrikengenerierung und Bewertung aufgeführt.
| Modell | Recommendation |
|---|---|
gpt-5.5 |
Empfohlen |
gpt-5.4 |
Empfohlen |
gpt-5.4-mini |
Empfohlen – optimales Verhältnis von Leistung und Kosten |
gpt-5.4-nano |
Empfohlen |
gpt-5.2 |
Empfohlen |
gpt-5.1 |
Empfohlen |
gpt-5 |
Empfohlen |
gpt-5-mini |
Empfohlen |
gpt-5-nano |
Empfohlen |
gpt-4.1 |
Akzeptabel |
gpt-4o |
Akzeptabel |
Manuelles Erstellen einer Rubrik
Schreiben Sie Ihre eigene Rubrik, indem Sie die einzelnen Dimensionen id, descriptionund weight. Verwenden Sie diesen Ansatz, wenn Sie bereits eine Rubrik an anderer Stelle definiert haben, die Sie in die Gießerei integrieren möchten.
Tip
Erstellen Sie zunächst einen automatisch generierten Rubrikenauswerter, und verfeinern Sie sie manuell. Die automatische Generation bietet Ihnen eine starke Basislinie, die Sie an Ihre spezifischen Qualitätsstandards anpassen können.
Überprüfen und Anpassen der Rubrik
Nachdem Sie eine Rubrik generiert oder erstellt haben, überprüfen Sie die Dimensionen, um zu bestätigen, dass sie Ihren Erwartungen an die Agentqualität entsprechen. Sie haben folgende Möglichkeiten:
-
Bearbeiten
id,descriptionundweight– Verfeinern Sie die Sprache, um spezifischer zu sein, welche Qualifizierer für die einzelnen Dimensionebenen gelten. Präzise Beschreibungen und Gewichtung verbessern die Bewertungskonsistenz. - Hinzufügen oder Entfernen von Dimensionen – Fügen Sie Qualitätsdimensionen ein, die für Ihre Domäne wichtig sind, oder entfernen Sie solche, die nicht angewendet werden.
- Anpassen von Schwellenwerten – Legen Sie den Passschwellenwert fest, um zu steuern, welche Gesamtbewertung als übergeben qualifiziert wird. Die Werte reichen von 0,0 bis 1,0, wobei 1,0 der höchste Wert ist. Erhöhen Sie den Schwellenwert für einen strengeren Qualitätsstandard, oder senken Sie ihn, um weniger zulässig zu sein.
- Set always applicable – Select or clear the Always applicable checkbox for a criterion. Bei Auswahl bewertet der LLM-Richter dieses Kriterium für jede Antwort, ohne zuerst die Relevanz zu überprüfen.
In den erweiterten Einstellungen für jede Rubrik können Sie auch die Bewertungsstufe und Kategorie für diese Rubrikenbewertung anzeigen.
Iterieren Sie die Rubrik, bis sie zuverlässig zwischen akzeptablen und inakzeptablen Agentenantworten unterscheidet. Führen Sie eine kleine Auswertung für ein Beispiel-Dataset aus, um zu überprüfen, ob die Rubrikenergebnisse mit Ihrem eigenen Urteil übereinstimmen, bevor Sie sie im Maßstab verwenden.
Beispielrubrik
Das folgende Beispiel zeigt eine Rubrik für einen Restaurantreservierungsmitarbeiter. Jedes Kriterium zielt auf eine bestimmte Qualitätsdimension ab, wobei Gewichte die relative Wichtigkeit widerspiegeln:
[
{
"id": "intent_recognition",
"description": "Correctly identifies the user's reservation intent (book, modify, cancel, inquire) and pursues the appropriate workflow without unnecessary clarification.",
"weight": 9
},
{
"id": "tool_usage_accuracy",
"description": "Calls the correct tool with correct parameters. Does not call tools unnecessarily, and does not skip tool calls when they are needed.",
"weight": 6
},
{
"id": "policy_enforcement",
"description": "Enforces business rules: dinner service 17:00-22:00, max party size 8, 30-day booking window. Does not create reservations that violate these constraints.",
"weight": 5
},
{
"id": "information_gathering",
"description": "Collects all required information (date, time, party size, contact) before attempting to create a reservation. Does not ask for information already provided.",
"weight": 4
},
{
"id": "communication_clarity",
"description": "Provides clear, concise responses. Confirms reservation details before finalizing. Uses a professional and helpful tone.",
"weight": 2
},
{
"id": "general_quality",
"description": "Other important quality factors not already covered by the listed criteria.",
"weight": 5,
"always_applicable": true
}
]
In dieser Rubrik intent_recognition hat die höchste Gewichtung (9), da die richtige Identifizierung, was der Benutzer wünscht, der wichtigste Faktor ist. Das general_quality Kriterium verwendet always_applicable: true , sodass der Bewertungswert für jede Antwort bewertet wird, auch wenn andere Kriterien möglicherweise nicht gelten.
Verwenden von Rubrikenauswertern zum Ausführen der Auswertung
Rubrikenbewertungen funktionieren gut für domänenspezifische oder organisationsspezifische Qualitätskriterien, die allgemeine Auswertungen nicht erfassen können. Definieren Sie eine Rubrik, wenn Sie Bewertungen benötigen, die die spezifischen Qualitätsstandards Ihres Teams widerspiegeln, z. B. Kundensupportton, medizinische Genauigkeit oder rechtliche Compliance.
Der LLM-Richter liest die Rubrik, untersucht die zugeordneten Eingabedaten, weist eine Bewertung zu und gibt einen Grund für seine Bewertungsentscheidung. Dieser Ansatz kombiniert die Flexibilität von benutzerdefinierten Kriterien mit der Konsistenz der LLM-basierten Bewertung.
Ausführliche Informationen zum Ausführen von Auswertungen und konfigurieren von Datenquellen finden Sie unter Ausführen von Auswertungen aus dem SDK.
Ein runnables Beispiel finden Sie unter sample_rubric_evaluator_generation_basic.py. Weitere Rubrikenbeispiele (Generierung aller Quellen, iterative Bearbeitung, vollständiger Lebenszyklus und manuelle Erstellung) finden Sie in den Auswertungsbeispielen README.
Beispielausgabe
Der Rubrikenwert gibt eine gewichtete Bewertung für jede Dimension, eine Gesamtbewertung, eine Pass-/Fail-Beschriftung und einen Grund zur Erläuterung der Entscheidung zurück. Der Standarddurchlaufschwellenwert ist 0,5. Bewertungen bei oder über dem Schwellenwert werden als Übergeben betrachtet.
Beispiel erfolgreich
In diesem Beispiel wird ein Benutzer aufgefordert, eine Tabelle am Freitag um 17:30 Uhr zu buchen. Der Agent identifiziert die Buchungsabsicht korrekt, ruft das Reservierungstool mit gültigen Parametern auf und bestätigt die Reservierung:
{
"score": 0.9419354839,
"label": "pass",
"reason": "The verdict is driven most by intent_recognition (5), tool_usage_accuracy (5), and policy_enforcement (5). The assistant correctly identified the booking intent, called the reservation tool with valid parameters (Friday 7:30 PM, party of 4), and returned a clear confirmation with the reservation details.",
"threshold": 0.5,
"passed": true,
"properties": {
"dimension_scores": [
{
"id": "intent_recognition",
"score": 5,
"applicable": true,
"weight": 9,
"reason": "The user's request to book a table is correctly identified, and the assistant pursues the booking workflow without unnecessary clarification."
},
{
"id": "tool_usage_accuracy",
"score": 5,
"applicable": true,
"weight": 6,
"reason": "The reservation tool is called once with the correct date, time, and party size parameters derived from the user's request."
},
{
"id": "policy_enforcement",
"score": 5,
"applicable": true,
"weight": 5,
"reason": "The reservation falls within dinner service hours, the party size is within the maximum of 8, and the date is within the 30-day booking window."
},
{
"id": "information_gathering",
"score": 4,
"applicable": true,
"weight": 4,
"reason": "All required information (date, time, party size, contact) is captured from the request without asking for details already provided."
},
{
"id": "communication_clarity",
"score": 5,
"applicable": true,
"weight": 2,
"reason": "The confirmation is concise and includes the reservation date, time, and party size in a single clear message."
},
{
"id": "general_quality",
"score": 4,
"applicable": true,
"weight": 5,
"reason": "Overall execution is strong: the assistant handles the booking end to end with no unnecessary turns or recovery steps."
}
]
}
}
Beispiel für Fehler
In diesem Beispiel wird ein Benutzer aufgefordert, eine Tabelle für 12 Personen am Samstag zu buchen. Die maximale Partygröße beträgt 8, aber der Agent fährt trotzdem weiter, ohne die Richtlinienverletzung zu kennzeichnen:
{
"score": 0.3548387097,
"label": "fail",
"reason": "The verdict is driven by very low policy_enforcement (1), tool_usage_accuracy (1), and general_quality (1). The user requested a table for 12, which exceeds the maximum party size of 8, but the assistant proceeded to call the reservation tool and confirmed a booking that violates business rules.",
"threshold": 0.5,
"passed": false,
"properties": {
"dimension_scores": [
{
"id": "intent_recognition",
"score": 3,
"applicable": true,
"weight": 9,
"reason": "The booking intent is identified, but the assistant fails to flag that the requested party size cannot be accommodated under business rules."
},
{
"id": "tool_usage_accuracy",
"score": 1,
"applicable": true,
"weight": 6,
"reason": "The reservation tool is called with a party size that the business rules prohibit, producing an invalid booking."
},
{
"id": "policy_enforcement",
"score": 1,
"applicable": true,
"weight": 5,
"reason": "The 8-person maximum party size is not enforced; the assistant should have declined or offered to split the party before attempting to book."
},
{
"id": "information_gathering",
"score": 2,
"applicable": true,
"weight": 4,
"reason": "The assistant collected the party size and date but did not confirm a specific time, leaving required information incomplete."
},
{
"id": "communication_clarity",
"score": 2,
"applicable": true,
"weight": 2,
"reason": "The final confirmation message is clear in form, but it asserts a booking that the system shouldn't have allowed, creating a misleading outcome."
},
{
"id": "general_quality",
"score": 1,
"applicable": true,
"weight": 5,
"reason": "Overall quality is poor: the assistant violates a core business rule without warning the user or recovering, undermining trust in the booking outcome."
}
]
}
}
Jedes Ausgabeelement enthält Bewertungen pro Dimension mit Gründen. Die markierten "applicable": false Dimensionen werden übersprungen und tragen nicht zum Gesamtergebnis bei. Die Gesamtbewertung ist ein gewichteter Durchschnitt aller anwendbaren Dimensionsergebnisse, normalisiert auf einen Bereich von 0 bis 1.
Note
Rubrikenwerter verwenden DIE LLM-as-judge-Bewertung und führen modellbasierte Ableitungskosten pro Auswertungsaufruf aus. Die Zuverlässigkeit der Bewertung kann bei sehr kurzen Antworten variieren. Schreiben Sie Rubrikbeschreibungen, die spezifisch und eindeutig sind, um die Bewertungskonsistenz in allen Bewertungen zu verbessern.
Einrichten einer kontinuierlichen Auswertung mit Rubrikenvaluatoren
Sobald Ihr Rubrikenwert zuverlässig Ihre Qualitätsstandards widerspiegelt, konfigurieren Sie sie für eine kontinuierliche und geplante Auswertung in den Monitoreinstellungen. Die fortlaufende Auswertung führt die Rubrik automatisch gegen neuen Agentdatenverkehr aus, sodass Sie Qualitätsregressionen in der Produktion erfassen können, während sie auftreten – ohne manuelle Ausführung auszulösen.
Schritte zum Einrichten finden Sie unter Überwachen von Agents im Dashboard.