Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Important
Objekt markerade (förhandsversion) i den här artikeln är för närvarande i offentlig förhandsversion. Den här förhandsversionen tillhandahålls utan ett serviceavtal och vi rekommenderar det inte för produktionsarbetsbelastningar. Vissa funktioner kanske inte stöds eller kan vara begränsade. Mer information finns i Kompletterande villkor för användning av Microsoft Azure-förhandsversioner.
En utvärderingsutvärdering av kriterier poängsätter ett agent- eller modellsvar mot anpassade, viktade kriterier som du definierar med hjälp av en LLM som domare. Det ger dig fullständig kontroll över vad "bra" betyder för ditt användningsfall samtidigt som du tillämpar den domen konsekvent i stor skala.
Ett kriterium är en uppsättning kriterier som definierar hur svaret ska betygsättas. Varje kriterier innehåller bedömningsdimensioner. varje dimension har en beskrivning av vad den mäter och en vikt som återspeglar dess relativa betydelse. LLM-domaren poängsätter varje tillämplig dimension från 1 till 5 på ett enda svar eller konversation med flera svar. Den övergripande poängen är det viktade medelvärdet av dessa poäng, normaliserat till ett intervall på 0–1.
Använd utvärderingsutvärderingar som ditt primära mått på agentkvalitet eftersom de låter dig uttrycka de exakta kriterier som är viktiga för ditt användningsfall. Para ihop dem med inbyggda utvärderare för säkerhet, grund och innehållsskador för att täcka risker som kriteriet inte mäter. Resten av den här artikeln beskriver hur du genererar ett kriterium, fälten som den innehåller, hur du väljer en LLM-bedömningsmodell och hur du granskar resultaten.
Generera en utvärderingsutvärdering av kriterier
Du kan skapa en utvärderingsutvärdering på två sätt:
Generera en kurs automatiskt (rekommenderas)
Du kan automatiskt skapa en utvärderingsutvärdering genom att välja en LLM-modell för att generera kriteriet från agentens kontext. Ange minst en av följande basindata:
- Foundry-agent – Välj en befintlig Foundry-agent. Tjänsten hämtar agentens instruktioner (för promptagenter) eller dess beskrivning (för värdbaserade agenter) som ska användas som generationskontext.
- Systemprompt för agent – Klistra in de instruktioner som definierar agentens avsedda beteende. Använd detta när agenten inte är registrerad i Foundry eller när dess registrerade kontext inte helt registrerar dess beteende.
- Referensfiler – Dokument, kunskapsbasinnehåll eller domänriktlinjer som beskriver agentens kontext och den förväntade svarskvaliteten.
För bästa resultat lägger du till agentproduktionsspårningar ovanpå eventuella basindata ovan för att jorda kriteriet i verklig användning:
- Traces – Agentproduktionsspårningar som samlats in från Foundry-spårning i Application Insights. Spårningar kan inte användas ensamt. parkoppla dem med en Foundry-agent, en agentsystemprompt eller referensfiler.
Varje genererat kriterier innehåller följande fält:
| Fält | Description |
|---|---|
id |
Stabil, läsbar snigel som tilldelats av tjänsten på första generationen. När du redigerar kriterier och sparar som en ny version ska du upprepa den befintliga id för att bevara identiteten mellan olika versioner. Tjänsten omtilldelar inte ID vid redigering. |
description |
Vad detta kriterium mäter – en tydlig, specifik kvalitetsdimension. |
weight |
Kriteriets relativa betydelse. Generationspipelinen tilldelar exakt ett kriterium med en vikt på 8–10 (den mest resultat avgörande dimensionen) och alla andra 1–6. Användarredigeringar begränsas inte av denna heuristiska. |
always_applicable |
När truebedömer LLM alltid det här kriteriet oavsett relevans (hoppar över tillämplighetsbedömningen). Används för det allmänna kvalitetskriteriet. Standardinställningen är false. |
Välj en LLM-domarmodell
Alla modeller fungerar inte lika som kriterier. I följande tabell visas de chattmodeller som stöds för generering och bedömning av kriterier.
| Modell | Recommendation |
|---|---|
gpt-5.5 |
Rekommenderad |
gpt-5.4 |
Rekommenderad |
gpt-5.4-mini |
Rekommenderas – bästa balans mellan prestanda och kostnad |
gpt-5.4-nano |
Rekommenderad |
gpt-5.2 |
Rekommenderad |
gpt-5.1 |
Rekommenderad |
gpt-5 |
Rekommenderad |
gpt-5-mini |
Rekommenderad |
gpt-5-nano |
Rekommenderad |
gpt-4.1 |
Acceptabelt |
gpt-4o |
Acceptabelt |
Skapa ett kriterier manuellt
Skriv ditt eget kriterier genom att definiera varje dimensions id, descriptionoch weight. Använd den här metoden när du redan har ett kriterium definierat någon annanstans som du vill använda i Foundry.
Tip
Börja med att skapa en automatiskt genererad utvärderingsutvärdering och förfina den manuellt. Automatisk generering ger dig en stark baslinje som du kan justera för att passa dina specifika kvalitetsstandarder.
Granska och justera kriteriet
När du har genererat eller skapat ett ämne granskar du dimensionerna för att bekräfta att de matchar dina förväntningar på agentkvalitet. Du kan:
-
Redigera
id,descriptionochweight– Förfina språket så att det blir mer specifikt om vad som kvalificerar för varje dimensionsnivå. Exakta beskrivningar och vikt förbättrar bedömningskonsekvensen. - Lägg till eller ta bort dimensioner – Infoga kvalitetsdimensioner som är viktiga för din domän eller ta bort de som inte gäller.
- Justera tröskelvärden – Ange tröskelvärdet för passering för att kontrollera vilken övergripande poäng som kvalificerar sig som godkänd. Värden varierar från 0,0 till 1,0, där 1,0 är den högsta poängen. Höj tröskelvärdet för en striktare kvalitetsstandard eller sänk det så att det blir mer tillåtande.
- Ange alltid tillämpligt – Markera eller avmarkera kryssrutan Alltid tillämpligt för ett kriterium. När den väljs bedömer LLM-domaren det här kriteriet för varje svar utan att först kontrollera relevansen.
I de avancerade inställningarna för varje kriterier kan du också visa utvärderingsnivån och kategorin för den här utvärderingsutvärderingen.
Iterera på kriteriet tills det på ett tillförlitligt sätt skiljer mellan acceptabla och oacceptabla agentsvar. Kör en liten utvärdering på en exempeldatauppsättning för att verifiera att kriterierna överensstämmer med din egen bedömning innan du använder den i stor skala.
Exempel på kriterier
I följande exempel visas ett kriterium för en restaurangreservationsagent. Varje kriterium är inriktat på en specifik kvalitetsdimension, med vikter som återspeglar relativ betydelse:
[
{
"id": "intent_recognition",
"description": "Correctly identifies the user's reservation intent (book, modify, cancel, inquire) and pursues the appropriate workflow without unnecessary clarification.",
"weight": 9
},
{
"id": "tool_usage_accuracy",
"description": "Calls the correct tool with correct parameters. Does not call tools unnecessarily, and does not skip tool calls when they are needed.",
"weight": 6
},
{
"id": "policy_enforcement",
"description": "Enforces business rules: dinner service 17:00-22:00, max party size 8, 30-day booking window. Does not create reservations that violate these constraints.",
"weight": 5
},
{
"id": "information_gathering",
"description": "Collects all required information (date, time, party size, contact) before attempting to create a reservation. Does not ask for information already provided.",
"weight": 4
},
{
"id": "communication_clarity",
"description": "Provides clear, concise responses. Confirms reservation details before finalizing. Uses a professional and helpful tone.",
"weight": 2
},
{
"id": "general_quality",
"description": "Other important quality factors not already covered by the listed criteria.",
"weight": 5,
"always_applicable": true
}
]
I det här kriteriet intent_recognition har den högsta vikten (9) eftersom korrekt identifiering av vad användaren vill ha är den mest resultat avgörande faktorn.
general_quality Kriteriet använder always_applicable: true så att domaren poängsätter det för varje svar, även när andra kriterier kanske inte gäller.
Använda utvärderingsutvärderingar för att köra utvärdering
Utvärderingsutvärderingar fungerar bra för domänspecifika eller organisationsspecifika kvalitetskriterier som utvärderare för generell användning inte kan samla in. Definiera ett kriterier när du behöver poängsättning som återspeglar ditt teams specifika kvalitetsstandarder, till exempel kundsupportton, medicinsk noggrannhet eller juridisk efterlevnad.
LLM-domaren läser kriteriet, undersöker de mappade indata, tilldelar en poäng och ger en anledning till sitt bedömningsbeslut. Den här metoden kombinerar flexibiliteten i anpassade kriterier med konsekvensen i LLM-baserad utvärdering.
Mer information om hur du kör utvärderingar och konfigurerar datakällor finns i Köra utvärderingar från SDK.
Ett körbart exempel finns i sample_rubric_evaluator_generation_basic.py. Ytterligare kriterier (all-sources generation, iterativ redigering, fullständig livscykel och manuell redigering) finns i utvärderingsexemplen README.
Exempel på utdata
Utvärderaren för kriterier returnerar en viktad poäng för varje dimension, en övergripande poäng, en godkänd/misslyckad etikett och en orsak som förklarar beslutet. Standardtröskelvärdet för passering är 0,5. Poäng vid eller över tröskelvärdet anses passera.
Pass-exempel
I det här exemplet ber en användare att boka en tabell för 4 på fredag klockan 19:30. Agenten identifierar avsikten med bokningen korrekt, anropar reservationsverktyget med giltiga parametrar och bekräftar reservationen:
{
"score": 0.9419354839,
"label": "pass",
"reason": "The verdict is driven most by intent_recognition (5), tool_usage_accuracy (5), and policy_enforcement (5). The assistant correctly identified the booking intent, called the reservation tool with valid parameters (Friday 7:30 PM, party of 4), and returned a clear confirmation with the reservation details.",
"threshold": 0.5,
"passed": true,
"properties": {
"dimension_scores": [
{
"id": "intent_recognition",
"score": 5,
"applicable": true,
"weight": 9,
"reason": "The user's request to book a table is correctly identified, and the assistant pursues the booking workflow without unnecessary clarification."
},
{
"id": "tool_usage_accuracy",
"score": 5,
"applicable": true,
"weight": 6,
"reason": "The reservation tool is called once with the correct date, time, and party size parameters derived from the user's request."
},
{
"id": "policy_enforcement",
"score": 5,
"applicable": true,
"weight": 5,
"reason": "The reservation falls within dinner service hours, the party size is within the maximum of 8, and the date is within the 30-day booking window."
},
{
"id": "information_gathering",
"score": 4,
"applicable": true,
"weight": 4,
"reason": "All required information (date, time, party size, contact) is captured from the request without asking for details already provided."
},
{
"id": "communication_clarity",
"score": 5,
"applicable": true,
"weight": 2,
"reason": "The confirmation is concise and includes the reservation date, time, and party size in a single clear message."
},
{
"id": "general_quality",
"score": 4,
"applicable": true,
"weight": 5,
"reason": "Overall execution is strong: the assistant handles the booking end to end with no unnecessary turns or recovery steps."
}
]
}
}
Exempel på fel
I det här exemplet ber en användare att boka en tabell för 12 personer på lördag. Den maximala partistorleken är 8, men agenten fortsätter att boka ändå utan att flagga principöverträdelsen:
{
"score": 0.3548387097,
"label": "fail",
"reason": "The verdict is driven by very low policy_enforcement (1), tool_usage_accuracy (1), and general_quality (1). The user requested a table for 12, which exceeds the maximum party size of 8, but the assistant proceeded to call the reservation tool and confirmed a booking that violates business rules.",
"threshold": 0.5,
"passed": false,
"properties": {
"dimension_scores": [
{
"id": "intent_recognition",
"score": 3,
"applicable": true,
"weight": 9,
"reason": "The booking intent is identified, but the assistant fails to flag that the requested party size cannot be accommodated under business rules."
},
{
"id": "tool_usage_accuracy",
"score": 1,
"applicable": true,
"weight": 6,
"reason": "The reservation tool is called with a party size that the business rules prohibit, producing an invalid booking."
},
{
"id": "policy_enforcement",
"score": 1,
"applicable": true,
"weight": 5,
"reason": "The 8-person maximum party size is not enforced; the assistant should have declined or offered to split the party before attempting to book."
},
{
"id": "information_gathering",
"score": 2,
"applicable": true,
"weight": 4,
"reason": "The assistant collected the party size and date but did not confirm a specific time, leaving required information incomplete."
},
{
"id": "communication_clarity",
"score": 2,
"applicable": true,
"weight": 2,
"reason": "The final confirmation message is clear in form, but it asserts a booking that the system shouldn't have allowed, creating a misleading outcome."
},
{
"id": "general_quality",
"score": 1,
"applicable": true,
"weight": 5,
"reason": "Overall quality is poor: the assistant violates a core business rule without warning the user or recovering, undermining trust in the booking outcome."
}
]
}
}
Varje utdataobjekt innehåller poäng per dimension med orsaker. Dimensionerna som är markerade "applicable": false hoppas över och bidrar inte till den övergripande poängen. Totalpoängen är ett viktat genomsnitt av alla tillämpliga dimensionspoäng, normaliserat till ett intervall på 0–1.
Note
Utvärderingsutvärderingar använder LLM-as-judge-bedömning och medför modellinferenskostnader per utvärderingsanrop. Bedömningstillförlitligheten kan variera för mycket korta svar. Skriv rubric beskrivningar som är specifika och entydiga för att förbättra bedömningskonsekvensen mellan utvärderingar.
Konfigurera kontinuerlig utvärdering med kriterier för utvärdering
När din kriterier utvärderare på ett tillförlitligt sätt återspeglar dina kvalitetsstandarder konfigurerar du den för kontinuerlig och schemalagd utvärdering i Övervakningsinställningar. Kontinuerlig utvärdering kör kriteriet automatiskt mot ny agenttrafik, så att du kan fånga upp kvalitetsregressioner i produktionen när de sker – utan att utlösa manuella körningar.
Installationssteg finns i Övervaka agenter på instrumentpanelen.