Kod Genie do obserwacji i oceny agenta

Genie Code zapewnia interfejs w naturalnym języku do rozumienia, debugowania i ulepszania agentów w MLflow. Ma dostęp do odczytu do wszystkich elementów eksperymentu, od śladów, monitów i zestawów danych do przebiegów oceny, wyników i sesji etykietowania — dzięki czemu możesz eksplorować dane z obserwacji i oceny, zamiast pisać zapytania lub nawigować po wielu stronach interfejsu użytkownika.

Aby rozpocząć, kliknij ikonę Genie Code (Kod genie) w prawym górnym rogu obszaru roboczego podczas przeglądania eksperymentu.

Kod Genie na potrzeby obserwacji i oceny agenta

Capabilities

Kod Genie może pomóc w wielu zadaniach obserwacji i oceny, w tym:

  • Analiza śladów i debugowanie: badanie niepoprawnych śladów, znajdowanie błędów, badanie drzew zakresu, identyfikowanie głównych przyczyn, analizowanie opóźnień i identyfikowanie wąskich gardeł w przepływie wykonawczym agenta. Zagłęb się w śledzenie, aby dokładnie przeanalizować całą hierarchię, w tym dane wejściowe, dane wyjściowe, metadane i użycie tokenów na każdym etapie.
  • Metryki i wydajność: Percentyle opóźnienia obliczeniowego (P50/P95/P99), śledzenie współczynników błędów i przepływności w czasie, analizowanie wzorców użycia tokenów i kosztów oraz porównywanie wydajności w różnych okresach czasu lub filtrach.
  • Jakość i oceny: Przejrzyj wyniki oceny z opinii człowieka, sędziów LLM i kontroli programowych. Sprawdź zestawy danych oceny, zobacz zarejestrowane klasyfikatory i ich konfiguracje oraz uzyskaj pomoc w konfigurowaniu mlflow.genai.evaluate() z właściwymi klasyfikatorami.
  • Etykietowanie i przegląd: Wyświetlanie sesji etykietowania i osób przypisanych do przeglądania śladów oraz sprawdzanie schematów etykietowania w celu zrozumienia kryteriów opinii, takich jak oceny, komentarze i oczekiwania.
  • Rejestr monitów: przeglądaj podpowiedzi w Unity Catalog, wyświetl szablony, wersje i aliasy.
  • Instrumentation guidance: Uzyskaj pomoc w dodawaniu śledzenia do swojego kodu za pomocą autolog(), @mlflow.trace lub ręcznych zakresów, z fragmentami kodu do uruchomienia, które można bezpośrednio wkleić do notatników Azure Databricks.

Note

Genie Code odczytuje dane zapisane w twoim eksperymencie MLflow: ślady, drzewa spanów, wyniki oceny, sesje etykietowania, zarejestrowane polecenia i funkcje oceniające. Funkcja analizy śladów i debugowania odczytuje te zarejestrowane dane, a nie kod źródłowy aplikacji. "Wskazanie przyczyn źródłowych" oznacza identyfikację zakresu, wzorca wejściowego lub kroku wykonania w śladach, gdzie doszło do awarii, a nie linii kodu źródłowego, która ją spowodowała. Szablony promptów niezarejestrowane w Unity Catalog również wykraczają poza jego zakres.

Przykładowe pytania

Oto kilka rzeczy, o które możesz zapytać dotyczące kodu Genie.

  • "Pomóż mi wykryć problemy z narzędziem agenta wywołującym ślady tego eksperymentu w ciągu ostatnich 3 godzin"
  • "Identyfikowanie przypadków, w których użytkownicy są sfrustrowani rozmowami z moim agentem"
  • "Które sesje mają najniższe wyniki opinii użytkowników i co poszło nie tak w tych rozmowach?"
  • Jakie są najczęstsze wzorce błędów w moich prześledzeniach w ubiegłym tygodniu i jakie oceniacze należy dodać, aby je wykryć?
  • Które odcinki zużywają najwięcej tokenów w całych moich śladach?
  • Znajdź przypadki, w których retriever nie zwrócił żadnych wyników, ale agent mimo to próbował odpowiedzieć
  • Pomóż mi skonfigurować ewaluację dla mojego agenta RAG z odpowiednimi wskaźnikami oceny

Wymagania

Aby użyć kodu Genie do obserwacji i oceny agenta, obszar roboczy wymaga następujących elementów:

Dodatkowe zasoby