Obserwowalność w generatywnej sztucznej inteligencji (klasyczna)

Aktualnie wyświetlane:Wersja - Przełączanie do wersji dla nowego portalu Foundry

Ważne

Elementy oznaczone (wersja zapoznawcza) w tym artykule są obecnie dostępne w publicznej wersji zapoznawczej. Ta wersja zapoznawcza jest udostępniana bez umowy dotyczącej poziomu usług i nie zalecamy korzystania z niej w przypadku obciążeń produkcyjnych. Niektóre funkcje mogą nie być obsługiwane lub mogą mieć ograniczone możliwości. Aby uzyskać więcej informacji, zobacz Wygólne warunki użytkowania Microsoft Azure Previews.

Cykl życia aplikacji sztucznej inteligencji wymaga niezawodnych struktur ewaluacyjnych, aby zapewnić, że systemy sztucznej inteligencji zapewniają dokładne, odpowiednie i niezawodne dane wyjściowe. Bez rygorystycznej oceny systemy sztucznej inteligencji ryzykują generowanie odpowiedzi, które są niedokładne, niespójne, słabo uziemione lub potencjalnie szkodliwe. Możliwość obserwacji umożliwia zespołom pomiar i poprawę jakości i bezpieczeństwa danych wyjściowych sztucznej inteligencji w całym cyklu projektowania — od wyboru modelu przez monitorowanie produkcyjne.

Uwaga

Zestaw SDK Microsoft Foundry do oceny oraz portal Foundry są dostępne w publicznej wersji zapoznawczej, ale interfejsy API są ogólnie dostępne do oceny modelu i zestawu danych (ocena agenta pozostaje w publicznej wersji zapoznawczej). Zestaw SDK oceny AI Azure i ewaluatory oznaczone jako (wersja zapoznawcza) w tym artykule są obecnie dostępne wszędzie w publicznej wersji zapoznawczej.

Co to jest obserwowanie?

Możliwość obserwowania sztucznej inteligencji odnosi się do możliwości monitorowania, zrozumienia i rozwiązywania problemów z systemami sztucznej inteligencji w całym cyklu życia. Zespoły mogą śledzić, oceniać i integrować automatyczne bramy jakości z potokami ciągłej integracji/ciągłego wdrażania oraz zbierać sygnały, takie jak metryki oceny, dzienniki, ślady i dane wyjściowe modelu, aby uzyskać wgląd w wydajność, jakość, bezpieczeństwo i kondycję operacyjną.

Podstawowe możliwości obserwacji

Microsoft Foundry zapewnia trzy podstawowe możliwości, które współpracują ze sobą w celu zapewnienia kompleksowej obserwacji w całym cyklu życia aplikacji sztucznej inteligencji:

Oceny

Ewaluatorzy mierzą jakość, bezpieczeństwo i niezawodność odpowiedzi sztucznej inteligencji w całym rozwoju. Microsoft Foundry udostępnia wbudowane ewaluatory dla metryk jakości ogólnego przeznaczenia (spójność, płynność), metryk specyficznych dla RAG (osadzenie w rzeczywistości, istotność), bezpieczeństwa i ochrony (nienawiść/niesprawiedliwość, przemoc, ochrona materiałów) i metryk specyficznych dla agenta (dokładność wywołań narzędzi, ukończenie zadań). Zespoły mogą również tworzyć niestandardowe ewaluatory dostosowane do wymagań specyficznych dla danej domeny.

Aby uzyskać pełną listę wbudowanych ewaluatorów, zobacz Dokumentacja wbudowanych ewaluatorów.

Monitorowanie

Monitorowanie produkcji zapewnia, że wdrożone aplikacje sztucznej inteligencji zachowują jakość i wydajność w rzeczywistych warunkach. Microsoft Foundry, zintegrowana z usługą Azure Monitor Application Insights, dostarcza pulpity nawigacyjne w czasie rzeczywistym śledzące metryki operacyjne, konsumpcję tokenów, opóźnienia, wskaźniki błędów oraz oceny jakości. Zespoły mogą konfigurować alerty, gdy dane wyjściowe kończą się niepowodzeniem progów jakości lub generują szkodliwą zawartość, umożliwiając szybkie rozwiązywanie problemów.

Aby uzyskać szczegółowe informacje na temat konfigurowania monitorowania produkcyjnego, zobacz Monitorowanie generowanych aplikacji sztucznej inteligencji i Ciągła ocena agentów sztucznej inteligencji.

Śledzenie

Śledzenie rozproszone przechwytuje przepływ wykonywania aplikacji sztucznej inteligencji, zapewniając wgląd w wywołania dużych modeli językowych (LLM), wywołania narzędzi, decyzje agentów i zależności między usługami. Umożliwiające debugowanie złożonych zachowań agentów, identyfikowanie wąskich gardeł wydajności oraz zrozumienie wieloetapowych łańcuchów rozumowania śledzenie jest oparte na standardach OpenTelemetry i zintegrowane z usługą Application Insights. Microsoft Foundry obsługuje śledzenie popularnych frameworków, w tym LangChain, Semantic Kernel i SDK agentów OpenAI.

Aby uzyskać wskazówki dotyczące implementowania śledzenia, zobacz Śledzenie aplikacji i Śledź za pomocą zestawu SDK Agentów.

Co to są ewaluatory?

Ewaluatorzy to wyspecjalizowane narzędzia, które mierzą jakość, bezpieczeństwo i niezawodność odpowiedzi sztucznej inteligencji w całym cyklu projektowania.

Aby uzyskać pełną listę wbudowanych ewaluatorów, zobacz Dokumentacja wbudowanych ewaluatorów.

Ewaluatorzy integrują się z każdym etapem cyklu życia sztucznej inteligencji, aby zapewnić niezawodność, bezpieczeństwo i skuteczność.

Diagram cyklu życia aplikacji sztucznej inteligencji przedstawiający wybór modelu, tworzenie aplikacji sztucznej inteligencji i operacjonalizacja.

Trzy etapy oceny cyklu życia aplikacji sztucznej inteligencji

Wybór modelu podstawowego

Wybierz odpowiedni model podstaw, porównując jakość, wydajność zadań, zagadnienia etyczne i profile bezpieczeństwa w różnych modelach.

Tools available: Microsoft Foundry benchmark do porównywania modeli na publicznych lub własnych zestawach danych oraz Azure AI Evaluation SDK do testowania określonych punktów końcowych modelu.

Ocena przedprodukcyjna

Przed wdrożeniem dokładne testowanie gwarantuje, że agent lub aplikacja sztucznej inteligencji jest gotowa do użycia w środowisku produkcyjnym. Ten etap weryfikuje wydajność za pomocą zestawów danych oceny, identyfikuje przypadki brzegowe, ocenia niezawodność i mierzy kluczowe metryki, w tym przestrzeganie zadań, uziemienie, istotność i bezpieczeństwo. Aby utworzyć agentów gotowych do produkcji z konwersacjami wielozadaniowymi, wywoływaniem narzędzi i zarządzaniem stanem, zobacz Foundry Agent Service.

Diagram oceny przedprodukcyjnej dla modeli i aplikacji z sześcioma krokami.

Narzędzia do oceny i podejścia:

  • Przynieś własne dane: Oceń agentów i aplikacje sztucznej inteligencji przy użyciu własnych danych pod kątem jakości, bezpieczeństwa lub przy użyciu niestandardowych ewaluatorów. Użyj kreatora oceny rozwiązania Foundry lub zestawu SDK oceny AI Azure i wyświetl wyniki w portalu Foundry.

  • AI red teaming agent: AI red teaming agent symuluje złożone ataki typu red teaming przy użyciu frameworku PyRIT firmy Microsoft w celu zidentyfikowania luk w bezpieczeństwie i zabezpieczeniach. Najlepiej stosować z procesami z człowiekiem w pętli.

Alternatywnie możesz również użyć portalu Foundry do testowania generowanych aplikacji sztucznej inteligencji.

Monitorowanie po produkcji

Po wdrożeniu ciągłe monitorowanie zapewnia, że aplikacja sztucznej inteligencji utrzymuje jakość w rzeczywistych warunkach:

  • Metryki operacyjne: regularny pomiar kluczowych metryk operacyjnych agenta sztucznej inteligencji
  • Ciągła ocena: ocena jakości i bezpieczeństwa ruchu produkcyjnego z częstotliwością próbkowania
  • Zaplanowana ocena: zaplanowana jakość i ocena bezpieczeństwa przy użyciu testowych zestawów danych do wykrywania dryfu systemu
  • Zaplanowane testy red teaming: Zaplanowane testowanie ofensywne w celu sondowania podatności na zagrożenia dotyczące bezpieczeństwa i zabezpieczeń
  • alerty Azure Monitor: Powiadomienia, gdy wyniki nie spełniają progów jakości lub generują szkodliwą zawartość

Zintegrowany z usługą Azure Monitor Application Insights pulpit obserwacyjny Foundry oferuje wgląd w czasie rzeczywistym w dane dotyczące wydajności, bezpieczeństwa i jakości, umożliwiając szybkie rozwiązywanie problemów i utrzymywanie zaufania użytkowników.

Ściągawka dotycząca oceny

Cel Proces Parametry, wskazówki i przykłady
Jak skonfigurować śledzenie? Konfigurowanie śledzenia rozproszonego Śledzenie aplikacji

Śledzenie za pomocą agenta SDK
Co oceniasz? Identyfikowanie lub tworzenie odpowiednich ewaluatorów Wbudowane ewaluatory

Niestandardowe ewaluatory

Przykłady SDK dla Pythona

C# sdk samples
Jakich danych należy użyć? Przekazywanie lub generowanie odpowiedniego zestawu danych Generowanie syntetycznych zestawów danych

Uruchom testy zespołu czerwonego sztucznej inteligencji w chmurze
Jak przeprowadzić ewaluacje? Uruchamianie oceny Przebiegi oceny agenta

Uruchamianie chmury zdalnej

Uruchamianie lokalne
Jak działa mój model/aplikacja? Analizowanie wyników Wyświetlanie wyników oceny
Jak mogę ulepszyć? Analizowanie wyników oceny i optymalizowanie agentów Zoptymalizuj agentów, uruchamiając ponownie oceny, zobacz Ocena generowania modeli i aplikacji sztucznej inteligencji w portalu.

Analizowanie wyników oceny.

Obsługa regionów, limity szybkości i obsługa sieci wirtualnej

Aby dowiedzieć się, które regiony obsługują ewaluatorów wspomaganych przez sztuczną inteligencję, limity szybkości stosowane do przebiegów ewaluacyjnych oraz jak skonfigurować obsługę sieci wirtualnej pod kątem izolacji sieciowej, zobacz obsługa regionów, limity szybkości i obsługa sieci wirtualnej na potrzeby oceny.

Ceny

Funkcje monitorowania, takie jak oceny ryzyka i bezpieczeństwa oraz oceny ciągłe, są rozliczane na podstawie zużycia, jak pokazano na naszej stronie cennika Azure.

Ważne

Oceny w środowisku agentów są domyślnie włączone dla wszystkich projektów Foundry i są uwzględniane w rozliczeniach opartych na zużyciu. Aby wyłączyć oceny w środowisku testowym, wybierz pole metryk w środowisku testowym agentów i usuń zaznaczenie wszystkich ewaluatorów.

Zrzut ekranu portalu Foundry przedstawiający plac zabaw agentów z wybranym polem metryk.