Śledzenie użycia modelu

Ta strona opisuje, jak monitorować wykorzystanie usług Unity Gateway za pomocą tabeli systemu śledzenia użycia.

Tabela śledzenia użycia automatycznie zapisuje szczegóły żądań i odpowiedzi dla usługi modelowej, rejestrując kluczowe metryki, takie jak zużycie tokenów i latencja. Dane w tej tabeli umożliwiają monitorowanie użytkowników, śledzenie kosztów i uzyskiwanie wglądu w wydajność i zużycie usługi modelu.

Śledzenie użycia obejmuje również ai_query żądania do usług modeli udostępnianych przez Databricks.

Administratorzy kont i obszarów roboczych mogą wyświetlić skonsolidowane omówienie użycia sztucznej inteligencji na stronie AI w Centrum ładu.

Requirements

Pricing

Śledzenie użytkowania to płatna funkcja Unity Gateway. Azure Databricks pobiera opłaty za wykorzystanie rejestrowane w tabeli system.ai_gateway.usage. Zobacz ceny Unity Gateway.

Zapytanie do tabeli użycia

Unity Gateway rejestruje dane o użytkowaniu do tabeli systemowej system.ai_gateway.usage . Tabelę można wyświetlić w interfejsie użytkownika lub wykonać zapytanie za pomocą Databricks SQL albo notebooka.

Note

Domyślnie do wyświetlania tabeli system.ai_gateway.usage lub wykonywania względem niej zapytań wymagane są zarówno rola administratora konta, jak i rola administratora metastore. Administratorzy mogą zarządzać dostępem do tabel systemowych , aby kontrolować uprawnienia dla użytkowników, grup i zasad usług.

Aby wyświetlić tabelę w interfejsie użytkownika, kliknij link do tabeli śledzenia użycia na stronie usługi modelu, aby otworzyć ją w Catalog Explorer.

Aby wysłać zapytanie do tabeli z bazy danych Databricks SQL lub notesu:

SELECT * FROM system.ai_gateway.usage;

Tip

Kod Genie (tryb agenta) może to zrobić za Ciebie. Wypróbuj ten przykładowy monit:

Query the system.ai_gateway.usage table to analyze AI Gateway usage showing request count and total tokens, grouped by endpoint name for the last 7 days.

Wbudowany panel użytkowania

Note

Niektóre obszary robocze nie wyświetlają jeszcze listy rozwijanej Govern. W tych przestrzeniach roboczych użyj samodzielnych przycisków Create Dashboard, View Dashboard i Update na stronie Unity Gateway.

Stwórz wbudowany pulpit użytkowy

Administratorzy kont mogą stworzyć wbudowany pulpit użycia Unity Gateway, aby monitorować zużycie, śledzić koszty i zdobywać informacje o wydajności i zużyciu usług modelu. Na stronie Unity Gateway kliknij Govern w prawym górnym rogu, a następnie wybierz Create Usage Dashboard. Hurtownia danych, w której są uruchamiane zapytania pulpitu nawigacyjnego, jest wybierana automatycznie.

Note

Tworzenie panelu jest dostępne tylko dla administratorów konta, ponieważ wymaga uprawnień SELECT do tabeli system.ai_gateway.usage. Dane pulpitu nawigacyjnego usage podlegają zasadom przechowywania tabeli. Zobacz Które tabele systemowe są dostępne?.

Gdy dostępna jest nowsza wersja wbudowanego panelu użytkowania, administratorzy kont mogą kliknąć Aktualizuj w wierszu wersji panelu w rozwijanym menu Govern na stronie Unity Gateway.

Do zarządzania pulpitem nawigacyjnym można użyć następujących opcji konfiguracji pulpitu nawigacyjnego:

  • Zakres: wybierz, czy chcesz ograniczyć zakres pulpitu nawigacyjnego do konta, czy obszaru roboczego.
  • Uprawnienia: Wybierz, czy zapytania mają być uruchamiane przy użyciu uprawnień właściciela panelu, czy uprawnień każdego użytkownika przeglądającego panel. Zobacz Co to są uprawnienia do danych udostępnionych?.
  • Automatyczne aktualizacje: Po włączeniu tej opcji dashboard aktualizuje się automatycznie, gdy tylko pojawi się nowsza wersja, a administrator konta odwiedzi stronę Unity Gateway.

Opcje panelu aktualizacji ai-gateway

Po zaktualizowaniu pulpitu nawigacyjnego do wersji 0.3 lub nowszej zostanie automatycznie utworzony harmonogram odświeżania pulpitu nawigacyjnego co 6 godzin. W razie potrzeby ten harmonogram można wyłączyć na pulpicie nawigacyjnym usługi Lakeview. Zobacz Tworzenie harmonogramu.

Zobacz panel użycia

Aby zobaczyć panel nawigacyjny, kliknij Govern w prawym górnym rogu strony Unity Gateway, a następnie kliknij Usage Dashboard. Panel otwiera się w nowej karcie. Wbudowany panel oferuje kompleksowy wgląd w wykorzystanie usług, wydajność i koszty modelu Unity Gateway. Zawiera wiele stron poświęconych monitorowaniu żądań, zużycia tokenów, metryk opóźnień, współczynników błędów, zestawień kosztów, ruchu do i z zewnętrznych serwerów MCP oraz aktywności agenta kodującego.

dashboard użycia bramy AI

Pulpit nawigacyjny domyślnie udostępnia analizę między obszarami roboczymi. Wszystkie strony pulpitu nawigacyjnego można filtrować według zakresu dat i identyfikatora obszaru roboczego.

  • Karta Przegląd: pokazuje ogólne metryki użycia, w tym dzienny wolumen żądań, trendy użycia tokenów w czasie, najlepsi użytkownicy według zużycia tokenów oraz łączną liczbę unikatowych użytkowników. Użyj tej zakładki, aby szybko zobaczyć ogólną aktywność Unity Gateway i zidentyfikować najbardziej aktywnych użytkowników oraz modeli.
  • Karta Wydajność: śledzi kluczowe metryki wydajności, w tym percentyle opóźnienia (P50, P90, P95, P99), czas pierwszego bajtu, współczynniki błędów i dystrybucje kodu stanu HTTP. Ta karta służy do monitorowania stanu usługi modelowej oraz identyfikowania wąskich gardeł wpływających na wydajność i problemów z niezawodnością.
  • Karta „Użycie”: przedstawia szczegółowy podział wykorzystania według usługi modelowej, obszaru roboczego i inicjatora żądania. Na tej karcie przedstawiono wzorce użycia tokenów, rozkład żądań i współczynniki trafień w pamięci podręcznej.
  • Karta obserwowalności kosztów: Pokazuje podział kosztów według usług modeli, modelu docelowego, użytkownika, tagów usług i tagów żądań. Ta zakładka zawiera również szacunkowy koszt modeli zewnętrznych. Zobacz Analizuj koszt Unity Gateway.
  • Zewnętrzna karta serwera MCP: pokazuje liczbę żądań, współczynniki błędów, użytkowników i połączenia oraz dzienne trendy użycia dla zewnętrznego ruchu serwera MCP.
  • Zakładka Coding Agents: Śledzi aktywność zintegrowanych agentów kodujących, w tym Claude Code, Codex CLI, Cursor i Gemini CLI. Na tej karcie są wyświetlane metryki, takie jak dni aktywne, sesje kodowania, zatwierdzenia i wiersze kodu dodane lub usunięte w celu monitorowania użycia narzędzi deweloperskich. Aby uzyskać więcej informacji, zobacz Pulpit nawigacyjny agenta kodowania .

Schemat tabeli użycia

Tabela system.ai_gateway.usage ma następujący schemat:

Nazwa kolumny Typ Opis Example
account_id STRING Identyfikator konta. 11d77e21-5e05-4196-af72-423257f74974
workspace_id STRING Identyfikator przestrzeni roboczej. 1653573648247579
request_id STRING Unikalny identyfikator żądania. b4a47a30-0e18-4ae3-9a7f-29bcb07e0f00
invocation_id STRING Unikatowy identyfikator dla każdego poszczególnego wywołania inferencji. Wiele wywołań może współdzielić ten sam request_id, na przykład sprawdzenia guardrail lub wieloturowe wywołania agenta. Użyj invocation_id, aby je rozróżnić. c0a8012e-9f3b-4d21-8a7e-1b2c3d4e5f60
schema_version INTEGER Wersja schematu rekordu użycia. 1
endpoint_id STRING Unikalny identyfikator usługi modelu Unity Gateway. 43addf89-d802-3ca2-bd54-fe4d2a60d58a
endpoint_name STRING Nazwa modelu usługi Unity Gateway. system.ai.gpt-5-2
endpoint_tags MAP Tagi skonfigurowane w usłudze modelowej podczas jej tworzenia lub aktualizacji. Są one stosowane do wszystkich żądań do usługi modelu i są przydatne do kategoryzowania usług według zespołu, centrum kosztów lub projektu. {"team": "engineering"}
endpoint_metadata STRUCT Metadane usługi modelu obejmujące creator, creation_time, last_updated_time, destinations, inference_table i fallbacks. {"creator": "user.name@email.com", "creation_time": "2026-01-06T12:00:00.000Z", ...}
event_time TIMESTAMP Sygnatura czasowa odebrania żądania. 2026-01-20T19:48:08.000+00:00
latency_ms LONG Łączne opóźnienie w milisekundach. 300
time_to_first_byte_ms LONG Czas do pierwszego bajtu w milisekundach. 300
destination_type STRING Typ miejsca docelowego (na przykład model zewnętrzny lub model podstawowy). PAY_PER_TOKEN_FOUNDATION_MODEL
destination_name STRING Nazwa modelu docelowego lub dostawcy. system.ai.gpt-5-2
destination_id STRING Unikatowy identyfikator miejsca docelowego. 507e7456151b3cc89e05ff48161efb87
destination_model STRING Określony model używany w ramach żądania. GPT-5.2
requester STRING Identyfikator użytkownika lub jednostki usługi, która złożyła żądanie. user.name@email.com
requester_type STRING Typ obiektu żądającego (użytkownik, jednostka usługi lub grupa użytkowników). USER
ip_address STRING Adres IP obiektu żądającego. 1.2.3.4
url STRING Adres URL żądania. https://<workspace-url>/ai-gateway/mlflow/v1/chat/completions
user_agent STRING Agent użytkownika żądającego. OpenAI/Python 2.13.0
api_type STRING Typ wywołania interfejsu API (na przykład czat, ukończenie lub osadzanie). mlflow/v1/chat/completions
request_tags MAP Tagi dostarczone przez użytkownika wysyłane z poszczególnymi żądaniami przy użyciu nagłówka Databricks-Ai-Gateway-Request-Tags HTTP. Tagi żądań umożliwiają przypisywanie użycia określonych projektów, zespołów, środowisk lub użytkowników końcowych. Zobacz Tag requests for usage tracking and Tag requests for usage tracking (Żądania tagów dotyczące śledzenia użycia i tagów na potrzeby śledzenia użycia). {"project": "chatbot", "team": "ml-platform"}
invocation_metadata STRUCT Metadane wygenerowane przez system dotyczące wywołania wnioskowania. Zawiera source usługę lub ścieżkę, która zainicjowała wywołanie. {"source": "EXTERNAL_CLIENT"}
input_tokens LONG Liczba tokenów wejściowych. 100
output_tokens LONG Liczba tokenów wyjściowych. 100
total_tokens LONG Całkowita liczba tokenów (dane wejściowe i wyjściowe). 200
token_details STRUCT Szczegółowy podział tokenów, w tym cache_read_input_tokens, cache_creation_input_tokensi output_reasoning_tokens. {"cache_read_input_tokens": 100, ...}
response_content_type STRING Typ zawartości odpowiedzi. application/json
status_code INT Kod statusu HTTP odpowiedzi. 200
routing_information STRUCT Szczegóły routingu dla prób powrotu . Zawiera tablicę z elementami attempts, priority, action, destination, destination_id, status_code, error_code, latency_ms, start_time i end_time dla każdego modelu wypróbowanego podczas żądania. {"attempts": [{"priority": "1", ...}]}

Oznacz żądania do śledzenia użycia

Tagi żądań to niestandardowe pary klucz-wartość, które obiekt wywołujący dołącza do poszczególnych żądań. Użyj tagów żądań, aby przypisywać użycie według projektu, zespołu, środowiska, użytkownika końcowego lub dowolnego innego wymiaru istotnego dla organizacji. Tagi żądań są rejestrowane w system.ai_gateway.usage tabeli i mogą służyć do filtrowania, agregowania i analizowania danych użycia.

Aby oznaczyć poszczególne żądania, dołącz nagłówek HTTP Databricks-Ai-Gateway-Request-Tags zawierający obiekt JSON mapujący klucze tekstowe na wartości tekstowe. Tagi żądań są rejestrowane w request_tags kolumnie tabeli użycia oraz w tabelach inferencji.

Przykłady pokazujące, jak ustawiać tagi żądań za pomocą interfejsu API REST, OpenAI SDK i Anthropic SDK, można znaleźć w temacie Tagowanie żądań na potrzeby śledzenia użycia.

Na przykład można agregować użycie według projektu przy użyciu tagów żądań:

SELECT
  request_tags['project'] AS project,
  COUNT(*) AS request_count,
  SUM(total_tokens) AS total_tokens
FROM system.ai_gateway.usage
WHERE request_tags['project'] IS NOT NULL
GROUP BY request_tags['project']
ORDER BY total_tokens DESC;

Limitations

  • Unity Gateway nie śledzi użycia tokenów w przypadku odpowiedzi innych niż strumieniowe i osadzania, większych niż 1 MiB.

Dodatkowe zasoby