Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Important
Objekt markerade (förhandsversion) i den här artikeln är för närvarande i offentlig förhandsversion. Den här förhandsversionen tillhandahålls utan ett serviceavtal och vi rekommenderar det inte för produktionsarbetsbelastningar. Vissa funktioner kanske inte stöds eller har begränsade funktioner. Mer information finns i Supplemental Terms of Use for Microsoft Azure Previews.
Microsoft Foundry innehåller inbyggda utvärderare för att bedöma kvaliteten, säkerheten och tillförlitligheten hos AI-svar under hela utvecklingslivscykeln. Den här referensen visar alla tillgängliga utvärderare, deras syften och vägledning om hur du väljer rätt för ditt användningsfall. Du kan också skapa anpassade utvärderare som är skräddarsydda för dina specifika utvärderingskriterier.
När du väljer utvärderare kan Microsoft Foundry Skill hjälpa dig att ansluta den här referensen till utvärderingskonfiguration, snabboptimering och felsökning av arbetsflöden.
Utvärderare för generell användning
| Utvärderare | Purpose |
|---|---|
| Samstämmighet | Mäter logisk konsekvens och flöde av svar. |
| Flytandehet | Mäter kvalitet och läsbarhet för naturligt språk. |
Mer information finns i Utvärderare för generell användning.
Utvärderare för textlikhet
| Utvärderare | Purpose |
|---|---|
| Likhet | AI-assisterad textlikhetsmätning. |
| F1-poäng | Harmoniskt medelvärde av precision och återkallande i token överlappar mellan svar och grund sanning. |
| BLEU | Tvåspråkig utvärderingspoäng för översättningskvalitetsmått överlappar i n-gram mellan svars- och grundsanning. |
| GLEU | Google-BLEU variant för meningsnivåbedömningsmått överlappar i n-gram mellan svar och grundsanning. |
| ROUGE | Recall-Oriented Student for Gisting Evaluation-mått överlappar i n-gram mellan svar och verklighetsuppfattning. |
| Meteor | Mått för utvärdering av översättning med explicita ordningsmått överlappar i n-gram mellan svar och grund sanning. |
Mer information finns i Utvärderare för textlikhet.
RAG-utvärderare
| Utvärderare | Purpose |
|---|---|
| Hämtning | Mäter hur effektivt systemet hämtar relevant information. |
| Dokumenthämtning | Mäter noggrannheten i hämtningsresultatet givet grundsanning. |
| Förankring | Mäter hur grundat svaret är i den hämtade kontexten. Returnerar en poäng från 1–5 med hjälp av en modellbaserad bedömning. |
| Groundedness Pro (förhandsversion) | Mäter om svaret är grundat i den hämtade kontexten med hjälp av Azure AI Innehållsäkerhet-tjänsten. Returnerar ett binärt pass/misslyckas utan att en modelldistribution krävs. |
| Relevans | Mäter hur relevant svaret är för frågan. |
| Svars completeness (förhandsversion) | Mäter i vilken utsträckning svaret är fullständigt (saknar inte kritisk information) med avseende på grundsanningen. |
Mer information finns i Rag-utvärderare (Retrieveal-augmented Generation).
Risk- och säkerhetsutvärderingar
| Utvärderare | Purpose |
|---|---|
| Hat och orättvisa | Identifierar partiskt, diskriminerande eller hatiskt innehåll. |
| Sexuell | Identifierar olämpligt sexuellt innehåll. |
| Våld | Identifierar våldsamt innehåll eller uppvigling. |
| Självskada | Identifierar innehåll som främjar eller beskriver självskadebeteende. |
| Skyddade material | Identifierar obehörig användning av upphovsrättsskyddat eller skyddat innehåll. |
| Indirekt attack (XPIA) | Mäter om svaret föll för ett indirekt jailbreak-försök som injicerats genom hämtad kontext. |
| Kodsårbarhet | Identifierar säkerhetsproblem i genererad kod. |
| Ogrundade attribut | Identifierar fabricerad eller felaktig information som härleds från användarinteraktioner. |
| Otillåtna åtgärder | Mäter en AI-agents förmåga att delta i beteenden som uttryckligen bryter mot otillåtna åtgärder. |
| Läckage av känsliga data | Mäter en AI-agents sårbarhet för att exponera känslig information. |
Mer information finns i Risk- och säkerhetsutvärderingar.
Agentutvärderingar
| Utvärderare | Purpose |
|---|---|
| Uppgiftsefterlevnad (förhandsversion) | Mäter om agenten följer efter identifierade uppgifter enligt systeminstruktioner. |
| Slutförd aktivitet (förhandsversion) | Mäter om agenten har slutfört den begärda aktiviteten från slutpunkt till slutpunkt. |
| Kundnöjdhet (förhandsversion) | Mäter holistisk användarnöjdhet i en konversation med hjälp av sex dimensioner: användbarhet, fullständighet, klarhet, ton, upplösning och anpassningsbarhet. |
| Avsiktsmatchning (förhandsversion) | Mäter hur korrekt agenten identifierar och hanterar användarens avsikter. |
| Aktivitetsnavigeringseffektivitet | Avgör om agentens stegsekvens matchar en optimal eller förväntad sökväg för att mäta effektiviteten. |
| Noggrannhet för verktygsanrop | Mäter den övergripande kvaliteten på verktygsanrop, inklusive urval, parametern korrekthet och effektivitet. |
| Val av verktyg | Mäter om agenten har valt de lämpligaste och effektivaste verktygen för en uppgift. |
| Precision för verktygsinmatning | Verifierar att alla parametrar för verktygsanrop är korrekta med strikta kriterier, inklusive grundning, typ, format, fullständighet och lämplighet. |
| Verktygsutdataanvändning | Mäter om agenten korrekt tolkar och använder verktygets utdata kontextuellt i svar och efterföljande anrop. |
| Verktygsanrop lyckades | Utvärderar om alla verktygsanrop har körts utan tekniska fel. |
| Kvalitetsklassare (förhandsversion) | Möjliggör kvalitetsutvärdering över flera dimensioner – relevans, nedlagda röster, svars fullständighet, grund och kontexttäckning – i en enda utvärderare i stället för att köra enskilda utvärderare separat. |
Mer information finns i Agentutvärderingar.
Utvärderingar av kriterier (förhandsversion)
| Utvärderare | Purpose |
|---|---|
| Bedömningskriterier | Poängsätter ett svar eller konversation med flera turer mot anpassade, viktade kriterier med hjälp av en LLM som domare. Returnerar en viktad genomsnittlig poäng som normaliseras till 0–1 med resonemang per dimension. |
Mer information finns i Kriterier utvärderare.
Azure OpenAI-väghyvlar
| Utvärderare | Purpose |
|---|---|
| Modelletikett | Klassificerar innehåll med hjälp av anpassade riktlinjer och etiketter. |
| Kontroll av strängar | Utför flexibel textvalidering och mönstermatchning. |
| Textjämförelse | Utvärderar textens kvalitet eller fastställer semantisk närhet. |
| Modellbedömare | Genererar numeriska poäng (anpassat intervall) för innehåll baserat på anpassade riktlinjer. |
Mer information finns i Azure OpenAI Graders.
Anpassade utvärderare (förhandsversion)
Förutom inbyggda utvärderare kan du skapa anpassade utvärderare som är skräddarsydda för dina specifika utvärderingskriterier. Med anpassade utvärderare kan du definiera unik bedömningslogik, valideringsregler och kvalitetsmått som överensstämmer med dina affärskrav och programspecifika behov.
Mer information finns i Anpassade utvärderare.
Utvärderingsnivåer
Varje utvärderare stöder specifika utvärderingsnivåer, vilket anges av fältet supported_evaluation_levels i utvärderingskatalogen:
| Nivå | Description |
|---|---|
turn |
Utvärderar enskilda agentsvar (standard) |
conversation |
Utvärderar hela konversationer med flera turer |
När du skapar en utvärderingskörning anger du evaluation_level så att den matchar utvärderarnas nivåer som stöds. Om det utelämnas är turnstandardvärdet .
Utvärderare på konversationsnivå bedömer den fullständiga interaktionen snarare än enskilda svängar. Använd dem för att mäta resultat som användarnöjdhet, slutförande av uppgifter i flera steg eller konversationsomfattande konsekvens.
Important
Alla utvärderare i en körning måste ha stöd för den angivna evaluation_level. Du kan inte blanda utvärderare med inkompatibla nivåer i samma utvärderingskörning.
Kombinera utvärderare
Kombinera flera utvärderare för omfattande kvalitetsbedömning:
- RAG-program: Hämtning + grundlighet + relevans + innehållssäkerhet
- Agentprogram: Verktygsanropsnoggrannhet + uppgiftsefterlevnad + avsiktsmatchning + rubric + innehållssäkerhet
- Översättningsprogram: BLEU + METEOR + Fluency + Koherens
- Alla tillämpningar: Lägg till risk- och säkerhetsbedömare (Hat och Orättvisa, Sexuell, Våld, Self-Harm) för ansvarsfulla AI-metoder
Relaterat innehåll
- Observerbarhet i generativ AI
- Utvärderare för generell användning
- Utvärderare för textlikhet
- Rag-utvärderare (Retrieval Augmented Generation)
- Risk- och säkerhetsutvärderingar
- Agentutvärderingar
- Utvärderingar av kriterier
- Azure OpenAI Graders
- Anpassade utvärderare
- Utvärdera generativa AI-appar i Foundry