Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Important
Elementy oznaczone (wersja zapoznawcza) w tym artykule są obecnie dostępne w publicznej wersji zapoznawczej. Ta wersja zapoznawcza jest udostępniana bez umowy dotyczącej poziomu usług i nie zalecamy korzystania z niej w przypadku obciążeń produkcyjnych. Niektóre funkcje mogą nie być obsługiwane lub mogą mieć ograniczone możliwości. Aby uzyskać więcej informacji, zobacz Wygólne warunki użytkowania Microsoft Azure Previews.
Microsoft Foundry obejmuje wbudowane ewaluatory w celu oceny jakości, bezpieczeństwa i niezawodności odpowiedzi sztucznej inteligencji w całym cyklu projektowania. Ta dokumentacja zawiera listę wszystkich dostępnych ewaluatorów, ich celów i wskazówek dotyczących wybierania odpowiedniego dla danego przypadku użycia. Możesz również utworzyć niestandardowe ewaluatory dostosowane do określonych kryteriów oceny.
Podczas wybierania ewaluatorów umiejętności Microsoft Foundry mogą pomóc w połączeniu tej dokumentacji z konfiguracją oceny, optymalizacją monitów i przepływami pracy rozwiązywania problemów.
Ewaluatory ogólnego przeznaczenia
| Oceniacz | Purpose |
|---|---|
| Spójność | Mierzy spójność logiczną i przepływ odpowiedzi. |
| Płynność | Mierzy jakość i czytelność języka naturalnego. |
Aby dowiedzieć się więcej, zobacz Ewaluatory ogólnego przeznaczenia.
Ewaluatory podobieństwa tekstowego
| Oceniacz | Purpose |
|---|---|
| Podobieństwo | Pomiar podobieństwa tekstowego wspomaganego przez sztuczną inteligencję. |
| Wynik F1 | Średnia harmoniczna precyzji i kompletności w tokenie nakłada się między odpowiedzią a prawem podstawy. |
| BLEU | Dwujęzyczny wynik oceny understudy dla miar jakości tłumaczenia nakłada się n-gramy między odpowiedzią a prawdą naziemną. |
| GLEU | Google-BLEU wariant oceny na poziomie zdań nakłada się w n-gramach między odpowiedzią a prawdą z podstaw. |
| ROUGE | Recall-Oriented Badanie analiz gistingu pokazuje nakładanie się w n-gramach między odpowiedzią a rzeczywistością. |
| METEOR | Metryka oceny tłumaczenia z jawnymi miarami porządkowania nakłada się na n-gramy między odpowiedzią a prawem podstawy. |
Aby dowiedzieć się więcej, zobacz Textual similarity evaluators (Osoby ewaluacyjne podobieństwa tekstowe).
Ewaluatorzy RAG
| Oceniacz | Purpose |
|---|---|
| Odzyskiwanie | Mierzy sposób efektywnego pobierania istotnych informacji przez system. |
| Pobieranie dokumentu | Mierzy dokładność wyników pobierania, biorąc pod uwagę prawdę naziemną. |
| Groundedness | Mierzy sposób uziemienia odpowiedzi w pobranym kontekście. Zwraca wynik z zakresu od 1 do 5 przy użyciu oceny opartej na modelu. |
| Groundedness Pro (wersja zapoznawcza) | Mierzy, czy odpowiedź jest uziemiona w pobranym kontekście przy użyciu usługi Bezpieczeństwo zawartości platformy Azure AI. Zwraca binarne przekazywanie/niepowodzenie bez konieczności wdrażania modelu. |
| Istotność | Mierzy, jak odpowiednia jest odpowiedź w odniesieniu do zapytania. |
| Kompletność odpowiedzi (wersja zapoznawcza) | Mierzy, w jakim stopniu odpowiedź jest kompletna (nie brakuje kluczowych informacji) w odniesieniu do podstawowej prawdy. |
Aby dowiedzieć się więcej, zobacz Retrieval-augmented Generation (RAG) evaluators (Retrieval-augmented Generation) evaluators (RAG).
Ewaluatorzy ryzyka i bezpieczeństwa
| Oceniacz | Purpose |
|---|---|
| Nienawiść i niesprawiedliwość | Identyfikuje stronniczą, dyskryminującą lub nienawistną zawartość. |
| Seks | Identyfikuje nieodpowiednią zawartość seksualną. |
| Przemoc | Wykrywa brutalne treści lub podżeganie. |
| Samookaleczanie | Wykrywa zawartość promującą lub opisując samookaleczenia. |
| Materiały chronione | Wykrywa nieautoryzowane użycie praw autorskich lub chronionych treści. |
| Atak pośredni (XPIA) | Mierzy, czy odpowiedź spadła na pośrednią próbę jailbreaku wstrzykniętą przez pobrany kontekst. |
| Luka w zabezpieczeniach kodu | Identyfikuje problemy z zabezpieczeniami w wygenerowanych kodzie. |
| Nieuzasadnione atrybuty | Wykrywa sprośne lub błędne informacje wywnioskowane z interakcji użytkownika. |
| Zabronione działania | Mierzy zdolność agenta sztucznej inteligencji do angażowania się w zachowania naruszające jawnie niedozwolone działania. |
| Wyciek poufnych danych | Mierzy lukę w zabezpieczeniach agenta sztucznej inteligencji w celu ujawnienia poufnych informacji. |
Aby dowiedzieć się więcej, zobacz Risk and safety evaluators (Osoby ewaluacyjne dotyczące ryzyka i bezpieczeństwa).
Ewaluatorzy agentów
| Oceniacz | Purpose |
|---|---|
| Przestrzeganie zadań (wersja zapoznawcza) | Mierzy, czy agent jest zgodny z określonymi zadaniami zgodnie z instrukcjami systemowym. |
| Ukończenie zadania (wersja zapoznawcza) | Mierzy, czy agent pomyślnie zakończył zakończenie żądanego zadania. |
| Zadowolenie klientów (wersja zapoznawcza) | Mierzy całościowe zadowolenie użytkowników w konwersacji przy użyciu sześciu wymiarów: pomocność, kompletność, jasność, ton, rozwiązanie i możliwość adaptacji. |
| Rozpoznawanie intencji (wersja zapoznawcza) | Mierzy, jak dokładnie agent identyfikuje intencje użytkownika i adresuje je. |
| Efektywność nawigacji zadań | Określa, czy sekwencja kroków agenta jest zgodna z optymalną lub oczekiwaną ścieżką do mierzenia wydajności. |
| Dokładność wywołań narzędzi | Mierzy ogólną jakość wywołań narzędzi, w tym wybór, poprawność parametrów i wydajność. |
| Wybór narzędzia | Mierzy, czy agent wybrał najbardziej odpowiednie i wydajne narzędzia dla zadania. |
| Dokładność danych wejściowych narzędzi | Sprawdza, czy wszystkie parametry wywołania narzędzia są poprawne z rygorystycznymi kryteriami, takimi jak uziemienia, typ, format, kompletność i odpowiedniość. |
| Wykorzystanie danych wyjściowych narzędzia | Mierzy, czy agent prawidłowo interpretuje i używa danych wyjściowych narzędzia kontekstowo w odpowiedziach i kolejnych wywołaniach. |
| Powodzenie wywołania narzędzia | Ocenia, czy wszystkie wywołania narzędzi zostały wykonane pomyślnie bez błędów technicznych. |
| Quality Grader (wersja zapoznawcza) | Umożliwia ocenę jakości w wielu wymiarach — istotność, abstention, kompletność odpowiedzi, uziemione i pokrycie kontekstu — w jednym ewaluatorze zamiast oddzielnie uruchamiać poszczególnych ewaluatorów. |
| Jakość danych wyjściowych (wersja zapoznawcza) | Wsaduje płynność, spójność, rozdzielczość intencji, przestrzeganie zadań, uziemienie i ukończenie zadania w jednym wywołaniu sędziego LLM. |
| Jakość użycia narzędzia (wersja zapoznawcza) | Dokładność wywołań narzędzi wsadowych, powodzenie wywołania narzędzi, dokładność danych wejściowych narzędzi, wykorzystanie danych wyjściowych narzędzi i wybór narzędzia w jednym wywołaniu sędziego LLM. |
Aby dowiedzieć się więcej, zobacz Ewaluatory agentów.
Ewaluatory języka Rubric (wersja zapoznawcza)
| Oceniacz | Purpose |
|---|---|
| Kryteria | Ocenia odpowiedź lub konwersację wielowrotną względem niestandardowych, ważonych kryteriów przy użyciu llM jako sędziego. Zwraca średni wynik ważony znormalizowany do 0–1 z rozumowaniem na wymiar. |
Aby dowiedzieć się więcej, zobacz Rubric evaluators (Ewaluatory języka Rubric).
Azure klasyfikatory OpenAI
| Oceniacz | Purpose |
|---|---|
| Etykietka modelu | Klasyfikuje zawartość przy użyciu niestandardowych wytycznych i etykiet. |
| Kontroler łańcuchów | Wykonuje elastyczne walidacje tekstu i dopasowywanie wzorców. |
| Podobieństwo tekstu | Ocenia jakość tekstu lub określa bliskość semantyczną. |
| Oceniacz Modelu | Generuje wyniki liczbowe (dostosowany zakres) dla zawartości na podstawie niestandardowych wytycznych. |
Aby dowiedzieć się więcej, zobacz Azure OpenAI Graders.
Niestandardowe ewaluatory (wersja zapoznawcza)
Oprócz wbudowanych ewaluatorów można tworzyć niestandardowe ewaluatory dostosowane do określonych kryteriów oceny. Niestandardowe ewaluatory umożliwiają definiowanie unikatowej logiki oceniania, reguł walidacji i metryk jakości, które są zgodne z wymaganiami biznesowymi i potrzebami specyficznymi dla aplikacji.
Aby dowiedzieć się więcej, zobacz Niestandardowe ewaluatory.
Poziomy oceny
Każdy ewaluator obsługuje określone poziomy oceny wskazane przez supported_evaluation_levels pole w wykazie ewaluatorów:
| Level | Description |
|---|---|
turn |
Ocenia pojedyncze odpowiedzi agenta (ustawienie domyślne) |
conversation |
Ocenia całe konwersacje wieloeściowe |
Podczas tworzenia przebiegu oceny ustaw wartość evaluation_level zgodną z obsługiwanymi poziomami ewaluatorów. W przypadku pominięcia wartość domyślna to turn.
Ewaluatorzy na poziomie konwersacji oceniają pełną interakcję, a nie poszczególne zakręty. Służy do mierzenia wyników, takich jak zadowolenie użytkowników, ukończenie zadań w wielu krokach lub spójność całej konwersacji.
Important
Wszyscy ewaluatorzy w przebiegu muszą obsługiwać określony evaluation_levelelement . Nie można mieszać ewaluatorów z niezgodnymi poziomami w tym samym przebiegu oceny.
Łączenie ewaluatorów
Aby uzyskać kompleksową ocenę jakości, połącz wiele ewaluatorów:
- Aplikacje RAG: pobieranie + uziemienie + istotność + bezpieczeństwo zawartości
- Aplikacje agentów: jakość danych wyjściowych i narzędzie używają jakości + rubryk i bezpieczeństwa zawartości
- Aplikacje tłumaczenia: BLEU + METEOR + fluency + spójność
- Wszystkie zastosowania: Dodaj oceniających ryzyko i bezpieczeństwo (nienawiść i niesprawiedliwość, seksualność, przemoc Self-Harm) dla odpowiedzialnych praktyk AI
Treści powiązane
- Możliwość obserwowania w generowaniu sztucznej inteligencji
- Ewaluatory ogólnego przeznaczenia
- Ewaluatory podobieństwa tekstowego
- Ewaluatory rozszerzonej generacji (RAG) pobierania
- Ewaluatorzy ryzyka i bezpieczeństwa
- Ewaluatorzy agentów
- Ewaluatory rubryk
- Azure Klasyfikatory OpenAI
- Niestandardowe ewaluatory
- Ocena generowania aplikacji sztucznej inteligencji w narzędziu Foundry