Analizowanie wyników oceny za pomocą analizy klastra (wersja zapoznawcza)

Ważne

Elementy oznaczone podglądem w tym artykule są obecnie w wersji zapoznawczej. Ta wersja zapoznawcza jest udostępniana bez umowy dotyczącej poziomu usług, a Microsoft nie zaleca korzystania z niej w przypadku obciążeń produkcyjnych. Niektóre funkcje mogą nie być obsługiwane lub mogą mieć ograniczone możliwości. Aby uzyskać więcej informacji, zobacz Wygólne warunki użytkowania Microsoft Azure Previews.

Po uruchomieniu co najmniej jednego przebiegu oceny można wygenerować analizę klastrową oceny w celu zrozumienia wyników oceny. Ta analiza zapewnia intuicyjny sposób identyfikowania najważniejszych wzorców i błędów w przebiegach oceny oraz zalecanych następnych kroków w celu poprawy wyników ewaluatora.

W tym artykule opisano sposób generowania i interakcji z analizą klastra ewaluacyjnego.

Wymagania wstępne

Generowanie analizy klastra ewaluacyjnej

  1. Na stronie szczegółowych informacji o ocenie wybierz co najmniej jeden ukończony proces oceny.
  2. Wybierz pozycję Analiza klastra. Otwarte zostanie okno konfiguracji, które pokazuje szacowany czas i użycie tokenów na podstawie liczby próbek w wybranych przebiegach.
  3. Wybierz model z listy rozwijanej, aby użyć jej do wygenerowania analizy.
  4. Wybierz pozycję Generuj. Analiza jest generowana, a mapa klastra zostanie otwarta automatycznie.

Zrzut ekranu przedstawiający okno konfiguracji analizy klastra z listą rozwijaną wyboru modelu i szacowanym użyciem tokenu.

Ważne

Wynik analizy nie jest przechowywany. Jeśli opuścisz stronę, wynik zostanie utracony. Aby zachować kopię, pobierz analizę przed przejściem dalej.

Wyświetlanie analizy klastra

Analiza klastra zapewnia intuicyjną wizualizację wydajności przez grupowanie przykładów wyników oceny z podobnymi problemami lub wzorcami odpowiedzi. Ułatwia to szybkie identyfikowanie cyklicznych typów błędów, zrozumienie dystrybucji między kategoriami błędów i określanie priorytetów obszarów pod kątem ulepszeń.

Zrzut ekranu przedstawiający stronę analizy klastra.

W górnej części widoku wyświetlane są statystyki podsumowania przebiegu oceny:

  • Łączna liczba próbek — łączna liczba ocenionych odpowiedzi (na przykład 48).
  • Klastry — liczba automatycznie zidentyfikowanych klastrów (na przykład 2).
  • Zakończone powodzeniem/niepowodzeniem — podział pomyślnych i problematycznych próbek.
  • Średni wynik — ogólny średni wynik jakości dla przebiegu.

Uwaga

Umieść kursor na etykiecie kropki lub klastra, aby wyświetlić szczegółowe informacje, w tym przykładowe odpowiedzi i opinie ewaluatora. Wybierz, aby otworzyć panel szczegółów.

Wizualizacja

Każda kropka reprezentuje przykład z zestawu danych oceny. Kropki są pogrupowane według semantycznego podobieństwa, przy użyciu klastryzacji opartej na osadzaniach danych wyjściowych modelu i sygnałów zwrotnych.

  • Kolor: wskazuje przypisanie klastra (na przykład nieodpowiednią ostateczną odpowiedź lub niepoprawną odpowiedź).
  • Pozycja: Próbki znajdujące się bliżej siebie mają podobne cechy lub problemy.

Panel szczegółów

Klastra

Po wybraniu klastra zostanie otwarty panel boczny zawierający następujące elementy:

  • Wybrany klaster — nazwa grupy problemów najwyższego poziomu.
  • Liczba pozycji — łączna liczba próbek w tym klastrze.
  • Subclusters — podział powiązanych podkategorii.
  • Opis — automatycznie wygenerowane podsumowanie diagnostyczne wyjaśniające prawdopodobną przyczynę lub wzorzec charakterystyki.
  • Zalecenia — sugerowane następne kroki w celu ograniczenia ryzyka lub ulepszenia agenta.

Zrzut ekranu przedstawiający wybrany klaster z otwartym panelem bocznym.

Podklasa

Po wybraniu podklasy zostanie otwarty panel boczny zawierający następujące elementy:

  • Cluster — wskazuje klaster nadrzędny, do którego należy ten podklaster (na przykład inadequate_final_answer).
  • Selected subcluster — określony podzestaw analizowany (na przykład invalid_or_missing_api_key).
  • Liczba pozycji — liczba pojedynczych próbek pogrupowanych w tej podklasie.
  • Karty
    • Analiza — udostępnia statystyki podsumowania, średnie oceny i szczegółowe informacje jakościowe (jeśli są dostępne).
    • Wpisy — wyświetla każdą próbkę danych (identyfikator wpisu) w podklastrze z poszczególnymi wynikami, takimi jak płynność, zakotwiczenie lub dokładność.

Zrzut ekranu przedstawiający wybraną podklasę z otwartym panelem bocznym.

Identyfikator wpisu

Po wybraniu kropki lub identyfikatora wpisu zostanie otwarty panel boczny zawierający następujące elementy:

  • Hierarchia klastra
    • Wyświetla pełną ścieżkę do miejsca, do którego należy ten wpis: Klaster → Podklaster → Identyfikator wpisu, na przykład inadequate_final_answer → invalid_or_missing_api_key → Identyfikator wpisu: 17-fluency.
  • Karty
  • Konwersacja — pokazuje interakcję z pełnym tekstem dla wybranego przykładu:
    • Podsumowanie kontekstu (jeśli dotyczy) — dowolne tło lub poprzedni kontekst używany w ocenie.
    • Zapytanie — pytanie dotyczące modelu lub pytania użytkownika (na przykład "Jak mogę przesłać wniosek o zwrot kosztów fsA?").
    • Odpowiedź — wygenerowane dane wyjściowe modelu dla tego zapytania.
  • Metadata — zawiera dodatkowe informacje dotyczące oceny, takie jak oceny, ewaluatory, znaczniki czasu, identyfikatory agentów i identyfikatory śledzenia.

Zrzut ekranu przedstawiający wybieranie identyfikatora wpisu z otwartym panelem bocznym.

Panel filtru

Panel filtru po prawej stronie widoku analizy klastra umożliwia dostosowanie sposobu wyświetlania klastrów na potrzeby inspekcji docelowej.

  • Koloruj według
    • Dostosuj sposób, w jaki próbki są kodowane kolorami na wizualizacji.
    • Opcje zazwyczaj obejmują:
      • Cluster — przykłady kolorów według kategorii problemu najwyższego poziomu.
      • Podklasa — próbki kolorów według bardziej szczegółowych podkategorii w każdym klastrze.
      • Lub wynik oceny, typ oceny, wynik i identyfikator agenta.

Zrzut ekranu przedstawiający panel filtru analizy klastra.

  • Zaawansowane filtrowanie
    • Narzędzia do skupiania wizualizacji na określonych podzbiorach danych.
    • Zdefiniuj filtry na podstawie metadanych lub atrybutów oceny.
      • Wybierz pozycję Parametr — wybierz pole do filtrowania (na przykład wynik, typ ewaluatora, znacznik czasu).
      • Równe / Zawiera / Nie równe — zdefiniuj warunek filtrowania.
      • Wybierz wartość — wybierz lub wprowadź konkretną wartość, która ma być zgodna.
      • Dodaj filtr — zastosuj warunek, aby dynamicznie zaktualizować widok.

Zrzut ekranu przedstawiający zaawansowane filtrowanie analizy klastra.

Pobieranie analizy

Aby wyświetlić analizę w trybie offline, wybierz pozycję Pobierz , aby uzyskać kopię analizy w formacie CSV i wyświetlić ją w innych aplikacjach.

Uwaga

Wynik analizy nie jest przechowywany. Jeśli opuścisz stronę, wynik analizy zostanie utracony.

Następne kroki

Użyj szczegółowych informacji z analizy klastra, aby:

  • Uściślij monity zapytań — zaktualizuj instrukcje agenta, aby rozwiązać powtarzające się wzorce błędów zidentyfikowane w klastrach.
  • Ponowne trenowanie lub dostrajanie — użyj zidentyfikowanych kategorii usterek jako sygnału do opracowania i dostrajania danych.
  • Ponownie oceń — po wprowadzeniu zmian uruchom nową ocenę i wygeneruj nową analizę klastra, aby porównać wyniki. Zobacz Przeprowadzanie ewaluacji z zestawu SDK.

Rozwiązywanie problemów

Objaw Prawdopodobna przyczyna Naprawić
Przycisk Analiza klastra jest niedostępny Nie wybrano ukończonych procesów oceny Wybierz co najmniej jeden ukończony przebieg oceny na stronie szczegółów oceny przed wybraniem pozycji Analiza klastra.
W oknie generowania nie są wyświetlane żadne modele W projekcie nie są wdrażane żadne modele Wdróż model w projekcie. Zobacz Tworzenie wdrożeń modelu.
Generowanie analizy kończy się niepowodzeniem lub limitem czasu Zbyt duży wolumin danych lub ograniczanie przepustowości usługi Zmniejsz liczbę wybranych prób oceny lub spróbuj ponownie później.
Analiza znika po opuszczeniu strony Wyniki nie są utrwalane Wykonaj ponownie analizę klastra i pobierz wyniki przed opuszczeniem strony.