Inbyggd referens för utvärderare

Important

Objekt markerade (förhandsversion) i den här artikeln är för närvarande i offentlig förhandsversion. Den här förhandsversionen tillhandahålls utan ett serviceavtal och vi rekommenderar det inte för produktionsarbetsbelastningar. Vissa funktioner kanske inte stöds eller har begränsade funktioner. Mer information finns i Supplemental Terms of Use for Microsoft Azure Previews.

Microsoft Foundry innehåller inbyggda utvärderare för att bedöma kvaliteten, säkerheten och tillförlitligheten hos AI-svar under hela utvecklingslivscykeln. Den här referensen visar alla tillgängliga utvärderare, deras syften och vägledning om hur du väljer rätt för ditt användningsfall. Du kan också skapa anpassade utvärderare som är skräddarsydda för dina specifika utvärderingskriterier.

När du väljer utvärderare kan Microsoft Foundry Skill hjälpa dig att ansluta den här referensen till utvärderingskonfiguration, snabboptimering och felsökning av arbetsflöden.

Utvärderare för generell användning

Utvärderare Purpose
Samstämmighet Mäter logisk konsekvens och flöde av svar.
Flytandehet Mäter kvalitet och läsbarhet för naturligt språk.

Mer information finns i Utvärderare för generell användning.

Utvärderare för textlikhet

Utvärderare Purpose
Likhet AI-assisterad textlikhetsmätning.
F1-poäng Harmoniskt medelvärde av precision och återkallande i token överlappar mellan svar och grund sanning.
BLEU Tvåspråkig utvärderingspoäng för översättningskvalitetsmått överlappar i n-gram mellan svars- och grundsanning.
GLEU Google-BLEU variant för meningsnivåbedömningsmått överlappar i n-gram mellan svar och grundsanning.
ROUGE Recall-Oriented Student for Gisting Evaluation-mått överlappar i n-gram mellan svar och verklighetsuppfattning.
Meteor Mått för utvärdering av översättning med explicita ordningsmått överlappar i n-gram mellan svar och grund sanning.

Mer information finns i Utvärderare för textlikhet.

RAG-utvärderare

Utvärderare Purpose
Hämtning Mäter hur effektivt systemet hämtar relevant information.
Dokumenthämtning Mäter noggrannheten i hämtningsresultatet givet grundsanning.
Förankring Mäter hur grundat svaret är i den hämtade kontexten. Returnerar en poäng från 1–5 med hjälp av en modellbaserad bedömning.
Groundedness Pro (förhandsversion) Mäter om svaret är grundat i den hämtade kontexten med hjälp av Azure AI Innehållsäkerhet-tjänsten. Returnerar ett binärt pass/misslyckas utan att en modelldistribution krävs.
Relevans Mäter hur relevant svaret är för frågan.
Svars completeness (förhandsversion) Mäter i vilken utsträckning svaret är fullständigt (saknar inte kritisk information) med avseende på grundsanningen.

Mer information finns i Rag-utvärderare (Retrieveal-augmented Generation).

Risk- och säkerhetsutvärderingar

Utvärderare Purpose
Hat och orättvisa Identifierar partiskt, diskriminerande eller hatiskt innehåll.
Sexuell Identifierar olämpligt sexuellt innehåll.
Våld Identifierar våldsamt innehåll eller uppvigling.
Självskada Identifierar innehåll som främjar eller beskriver självskadebeteende.
Skyddade material Identifierar obehörig användning av upphovsrättsskyddat eller skyddat innehåll.
Indirekt attack (XPIA) Mäter om svaret föll för ett indirekt jailbreak-försök som injicerats genom hämtad kontext.
Kodsårbarhet Identifierar säkerhetsproblem i genererad kod.
Ogrundade attribut Identifierar fabricerad eller felaktig information som härleds från användarinteraktioner.
Otillåtna åtgärder Mäter en AI-agents förmåga att delta i beteenden som uttryckligen bryter mot otillåtna åtgärder.
Läckage av känsliga data Mäter en AI-agents sårbarhet för att exponera känslig information.

Mer information finns i Risk- och säkerhetsutvärderingar.

Agentutvärderingar

Utvärderare Purpose
Uppgiftsefterlevnad (förhandsversion) Mäter om agenten följer efter identifierade uppgifter enligt systeminstruktioner.
Slutförd aktivitet (förhandsversion) Mäter om agenten har slutfört den begärda aktiviteten från slutpunkt till slutpunkt.
Kundnöjdhet (förhandsversion) Mäter holistisk användarnöjdhet i en konversation med hjälp av sex dimensioner: användbarhet, fullständighet, klarhet, ton, upplösning och anpassningsbarhet.
Avsiktsmatchning (förhandsversion) Mäter hur korrekt agenten identifierar och hanterar användarens avsikter.
Aktivitetsnavigeringseffektivitet Avgör om agentens stegsekvens matchar en optimal eller förväntad sökväg för att mäta effektiviteten.
Noggrannhet för verktygsanrop Mäter den övergripande kvaliteten på verktygsanrop, inklusive urval, parametern korrekthet och effektivitet.
Val av verktyg Mäter om agenten har valt de lämpligaste och effektivaste verktygen för en uppgift.
Precision för verktygsinmatning Verifierar att alla parametrar för verktygsanrop är korrekta med strikta kriterier, inklusive grundning, typ, format, fullständighet och lämplighet.
Verktygsutdataanvändning Mäter om agenten korrekt tolkar och använder verktygets utdata kontextuellt i svar och efterföljande anrop.
Verktygsanrop lyckades Utvärderar om alla verktygsanrop har körts utan tekniska fel.
Kvalitetsklassare (förhandsversion) Möjliggör kvalitetsutvärdering över flera dimensioner – relevans, nedlagda röster, svars fullständighet, grund och kontexttäckning – i en enda utvärderare i stället för att köra enskilda utvärderare separat.

Mer information finns i Agentutvärderingar.

Utvärderingar av kriterier (förhandsversion)

Utvärderare Purpose
Bedömningskriterier Poängsätter ett svar eller konversation med flera turer mot anpassade, viktade kriterier med hjälp av en LLM som domare. Returnerar en viktad genomsnittlig poäng som normaliseras till 0–1 med resonemang per dimension.

Mer information finns i Kriterier utvärderare.

Azure OpenAI-väghyvlar

Utvärderare Purpose
Modelletikett Klassificerar innehåll med hjälp av anpassade riktlinjer och etiketter.
Kontroll av strängar Utför flexibel textvalidering och mönstermatchning.
Textjämförelse Utvärderar textens kvalitet eller fastställer semantisk närhet.
Modellbedömare Genererar numeriska poäng (anpassat intervall) för innehåll baserat på anpassade riktlinjer.

Mer information finns i Azure OpenAI Graders.

Anpassade utvärderare (förhandsversion)

Förutom inbyggda utvärderare kan du skapa anpassade utvärderare som är skräddarsydda för dina specifika utvärderingskriterier. Med anpassade utvärderare kan du definiera unik bedömningslogik, valideringsregler och kvalitetsmått som överensstämmer med dina affärskrav och programspecifika behov.

Mer information finns i Anpassade utvärderare.

Utvärderingsnivåer

Varje utvärderare stöder specifika utvärderingsnivåer, vilket anges av fältet supported_evaluation_levels i utvärderingskatalogen:

Nivå Description
turn Utvärderar enskilda agentsvar (standard)
conversation Utvärderar hela konversationer med flera turer

När du skapar en utvärderingskörning anger du evaluation_level så att den matchar utvärderarnas nivåer som stöds. Om det utelämnas är turnstandardvärdet .

Utvärderare på konversationsnivå bedömer den fullständiga interaktionen snarare än enskilda svängar. Använd dem för att mäta resultat som användarnöjdhet, slutförande av uppgifter i flera steg eller konversationsomfattande konsekvens.

Important

Alla utvärderare i en körning måste ha stöd för den angivna evaluation_level. Du kan inte blanda utvärderare med inkompatibla nivåer i samma utvärderingskörning.

Kombinera utvärderare

Kombinera flera utvärderare för omfattande kvalitetsbedömning:

  • RAG-program: Hämtning + grundlighet + relevans + innehållssäkerhet
  • Agentprogram: Verktygsanropsnoggrannhet + uppgiftsefterlevnad + avsiktsmatchning + rubric + innehållssäkerhet
  • Översättningsprogram: BLEU + METEOR + Fluency + Koherens
  • Alla tillämpningar: Lägg till risk- och säkerhetsbedömare (Hat och Orättvisa, Sexuell, Våld, Self-Harm) för ansvarsfulla AI-metoder