Wybieranie modeli przy użyciu testów porównawczych
Wskazówka
Aby uzyskać więcej szczegółów, zobacz kartę Tekst i obrazy .
Przed wdrożeniem modelu chcesz zrozumieć, jak działa w różnych wymiarach. Testy porównawcze modelu zapewniają obiektywne, wymierne dane ułatwiające porównywanie modeli i podejmowanie świadomych decyzji dotyczących wyboru. Portal Microsoft Foundry oferuje kompleksowe narzędzia do testów porównawczych zorganizowane w metryki jakości, bezpieczeństwa, kosztów i wydajności.
testy porównawcze modelu Access
Testy porównawcze można eksplorować na dwa sposoby w portalu Microsoft Foundry:
W wykazie modeli wyświetl ranking modeli, aby zobaczyć rankingi porównawcze we wszystkich dostępnych modelach. Ten widok ułatwia identyfikowanie modeli o najwyższej wydajności dla określonych metryk lub scenariuszy. Ranking przedstawia najlepsze modele sklasyfikowane według jakości, bezpieczeństwa, szacowanych kosztów i przepływności.
Aby uzyskać szczegółowe testy porównawcze dla określonego modelu, otwórz kartę modelu i wybierz kartę Testy porównawcze . W tym widoku pokazano, jak poszczególne modele działają w różnych metrykach i zestawach danych, a wykresy porównania umieszczają je w stosunku do podobnych modeli.
Testy porównawcze jakości
Testy porównawcze jakości oceniają, jak dobrze model generuje dokładne, spójne i kontekstowe odpowiednie odpowiedzi. Te metryki używają publicznych zestawów danych i standardowych metod oceny w celu zapewnienia spójności.
Indeks jakości zawiera ogólne omówienie przez średnie wyniki dokładności w wielu zestawach danych porównawczych, które mierzą rozumowanie, wiedzę, odpowiadanie na pytania, możliwości matematyczne i umiejętności kodowania. Wartości indeksów o wyższej jakości wskazują większą ogólną wydajność zadań językowych ogólnego przeznaczenia.
Testy porównawcze jakości używają zestawów danych, takich jak:
- Arena-Hard - przeciwstawne odpowiadanie na pytania
- BIG-Bench Hard — możliwości rozumowania
- GPQA — pytania wielodyscyplinowe na poziomie absolwenta
- HumanEval+ i MBPP+ — zadania generowania kodu
- MATEMATYKA — rozumowanie matematyczne
- MMLU-Pro — ogólna ocena wiedzy
- IFEval — instrukcja następująca
Wyniki testów porównawczych to znormalizowane indeksy od zera do jednego, gdzie wyższe wartości wskazują lepszą wydajność.
Testy porównawcze bezpieczeństwa
Metryki bezpieczeństwa zapewniają, że modele nie generują szkodliwych, stronniczych ani nieodpowiednich treści. Te testy porównawcze mają kluczowe znaczenie dla aplikacji udostępnianych użytkownikom końcowym, zwłaszcza w branżach regulowanych lub scenariuszach dla klientów.
Firma Microsoft Foundry ocenia modele w wielu wymiarach bezpieczeństwa:
Wykrywanie szkodliwych zachowań używa testu porównawczego HarmBench do mierzenia, jak dobrze modele opierają się na generowaniu niebezpiecznej zawartości. Ocena oblicza współczynnik powodzenia ataku (ASR), gdzie niższe wartości wskazują bezpieczniejsze, bardziej niezawodne modele. HarmBench testuje trzy obszary funkcjonalne:
- Standardowe szkodliwe zachowania — cyberprzestępczość, nielegalne działania, ogólne szkody
- Kontekstowe szkodliwe zachowania - dezinformacja, nękanie, zastraszanie
- Naruszenia praw autorskich — odtwarzanie materiałów chronionych prawami autorskimi
Wykrywanie zawartości toksycznej używa zestawu danych ToxiGen do mierzenia, jak dobrze modele identyfikują niepożądane i niejawne mowy nienawiści. Wyższe wyniki F1 wskazują na lepszą skuteczność wykrywania w odniesieniu do referencji do grup mniejszościowych.
Wiedza o domenie poufnej korzysta z testu porównawczego WMDP (proxy broni masowego rażenia), aby mierzyć wiedzę modelu w zakresie biobezpieczeństwa, cyberbezpieczeństwa i bezpieczeństwa chemicznego. Wyższe wyniki WMDP wskazują na większą wiedzę na temat potencjalnie niebezpiecznych możliwości.
Wyniki bezpieczeństwa pomagają zrozumieć niezawodność modelu, szczególnie ważne dla aplikacji przeznaczonych dla klientów, w których szkodliwe dane wyjściowe stanowią istotne problemy.
Wzorce kosztów
Zrozumienie wpływu finansowego użycia modelu pomaga zrównoważyć wymagania dotyczące jakości z ograniczeniami budżetowymi. Testy porównawcze kosztów w Microsoft Foundry pokazują koszty wdrożeń bezserwerowych API i modeli Azure OpenAI.
Koszt na tokeny wejściowe pokazuje cenę przetwarzania 1 milionów tokenów wejściowych (tekst wysyłany do modelu).
Koszt na tokeny wyjściowe wskazuje cenę generowania 1 milionów tokenów wyjściowych (tekst generowany przez model).
Szacowany koszt łączy koszty wejściowe i wyjściowe przy użyciu typowego współczynnika 3:1 (trzy tokeny wejściowe dla każdego tokenu wyjściowego), co daje pojedynczą liczbę do porównania. Niższe wartości wskazują bardziej ekonomiczne modele.
Testy porównawcze kosztów ułatwiają identyfikowanie modeli zapewniających jakość potrzebną w punkcie cen, który pasuje do wzorców użycia i budżetu aplikacji.
Testy porównawcze wydajności
Metryki wydajności mierzą, jak szybko i wydajnie modele reagują na żądania. Te testy porównawcze mają znaczenie dla aplikacji czasu rzeczywistego, w których środowisko użytkownika zależy od czasu odpowiedzi.
Pomiary opóźnienia obejmują:
- Średnia opóźnienie — średni czas w sekundach przetwarzania żądania
- Opóźnienie P50 (mediana) — 50% zapytań jest realizowanych szybciej niż w tym okresie.
- Opóźnienie P90 – 90% żądań jest realizowanych szybciej niż w czasie określonym przez P90
- Opóźnienie P95 – 95% żądań jest przetwarzane wcześniej niż ten czas
- Opóźnienie P99 - 99% żądań kończy się szybciej niż ten czas
- Czas pierwszego tokenu (TTFT) — czas do momentu odebrania pierwszego tokenu podczas korzystania z przesyłania strumieniowego
Pomiary przepływności obejmują:
- Wygenerowane tokeny na sekundę (GTPS) — tokeny wyjściowe generowane na sekundę
- Łączna liczba tokenów na sekundę (TTPS) — połączone tokeny wejściowe i wyjściowe przetwarzane na sekundę
- Czas między tokenami — interwał między odbieraniem kolejnych tokenów
Ranking podsumowuje wydajność przy użyciu średniego czasu do pierwszego tokenu (niższe jest lepsze) i średnie wygenerowane tokeny na sekundę (wyższe jest lepsze). Modele o wysokiej przepływności i małych opóźnieniach zapewniają lepsze środowisko użytkownika w aplikacjach interaktywnych. W przypadku zadań przetwarzania wsadowego, w przypadku których szybkość ma mniejsze znaczenie niż koszt, można określić priorytety innych czynników.
Korzystanie z rankingów i funkcji porównania
Ranking modelu umożliwia wyświetlanie najważniejszych modeli dla określonych metryk. Możesz sortować według jakości, bezpieczeństwa, szacowanych kosztów i przepływności, aby zidentyfikować modele, które najlepiej spełniają wymagania.
Rankingi scenariuszy ułatwiają znajdowanie modeli zoptymalizowanych pod kątem określonych przypadków użycia, takich jak rozumowanie, kodowanie, matematyka, odpowiadanie na pytania lub uziemienie. Jeśli aplikacja mapuje się na określony scenariusz, zacznij od odpowiedniego rankingu scenariusza zamiast polegać wyłącznie na ogólnym indeksie jakości.
Wykresy kompromisu wyświetlają dwie metryki jednocześnie, takie jak jakość w stosunku do kosztów lub jakość w stosunku do przepływności. Te wizualizacje ułatwiają znalezienie optymalnej równowagi dla wymagań. Użyj listy rozwijanej, aby porównać jakość z kosztami, przepływnością lub bezpieczeństwem. Modele bliżej prawego górnego rogu wykresu działają dobrze w obu metrykach. Model, który jest nieco mniej dokładny, ale znacznie szybszy lub tańszy może lepiej spełniać Twoje potrzeby.
Porównanie równoległe umożliwia wybranie dwóch lub trzech modeli z rankingu i porównanie ich w wielu wymiarach:
- Testy porównawcze wydajności (jakość, bezpieczeństwo, przepływność)
- Szczegóły modelu (okno kontekstu, dane szkoleniowe, obsługiwane języki)
- Obsługiwane punkty końcowe (opcje wdrażania)
- Obsługa funkcjonalności (wywoływanie funkcji, wyjście strukturalne, przetwarzanie obrazów)
Zaznacz modele, zaznaczając pola wyboru obok ich nazw, a następnie wybierz pozycję Porównaj , aby otworzyć szczegółowy widok porównania.