Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Ta strona opisuje, jak monitorować wykorzystanie usług Unity Gateway za pomocą tabeli systemu śledzenia użycia.
Tabela śledzenia użycia automatycznie zapisuje szczegóły żądań i odpowiedzi dla usługi modelowej, rejestrując kluczowe metryki, takie jak zużycie tokenów i latencja. Dane w tej tabeli umożliwiają monitorowanie użytkowników, śledzenie kosztów i uzyskiwanie wglądu w wydajność i zużycie usługi modelu.
Śledzenie użycia obejmuje również ai_query żądania do usług modeli udostępnianych przez Databricks.
Administratorzy kont i obszarów roboczych mogą wyświetlić skonsolidowane omówienie użycia sztucznej inteligencji na stronie AI w Centrum ładu.
Requirements
- Obszar roboczy usługi Azure Databricks w regionie obsługiwanym przez Unity Gateway.
- Katalog Unity włączony dla obszaru roboczego. Zobacz Umożliwienie obszaru roboczego dla Unity Catalog.
Pricing
Śledzenie użytkowania to płatna funkcja Unity Gateway. Azure Databricks pobiera opłaty za wykorzystanie rejestrowane w tabeli system.ai_gateway.usage. Zobacz ceny Unity Gateway.
Zapytanie do tabeli użycia
Unity Gateway rejestruje dane o użytkowaniu do tabeli systemowej system.ai_gateway.usage . Tabelę można wyświetlić w interfejsie użytkownika lub wykonać zapytanie za pomocą Databricks SQL albo notebooka.
Note
Domyślnie do wyświetlania tabeli system.ai_gateway.usage lub wykonywania względem niej zapytań wymagane są zarówno rola administratora konta, jak i rola administratora metastore. Administratorzy mogą zarządzać dostępem do tabel systemowych , aby kontrolować uprawnienia dla użytkowników, grup i zasad usług.
Aby wyświetlić tabelę w interfejsie użytkownika, kliknij link do tabeli śledzenia użycia na stronie usługi modelu, aby otworzyć ją w Catalog Explorer.
Aby wysłać zapytanie do tabeli z bazy danych Databricks SQL lub notesu:
SELECT * FROM system.ai_gateway.usage;
Tip
Kod Genie (tryb agenta) może to zrobić za Ciebie. Wypróbuj ten przykładowy monit:
Query the system.ai_gateway.usage table to analyze AI Gateway usage showing request count and total tokens, grouped by endpoint name for the last 7 days.
Wbudowany panel użytkowania
Note
Niektóre obszary robocze nie wyświetlają jeszcze listy rozwijanej Govern. W tych przestrzeniach roboczych użyj samodzielnych przycisków Create Dashboard, View Dashboard i Update na stronie Unity Gateway.
Stwórz wbudowany pulpit użytkowy
Administratorzy kont mogą stworzyć wbudowany pulpit użycia Unity Gateway, aby monitorować zużycie, śledzić koszty i zdobywać informacje o wydajności i zużyciu usług modelu. Na stronie Unity Gateway kliknij Govern w prawym górnym rogu, a następnie wybierz Create Usage Dashboard. Hurtownia danych, w której są uruchamiane zapytania pulpitu nawigacyjnego, jest wybierana automatycznie.
Note
Tworzenie panelu jest dostępne tylko dla administratorów konta, ponieważ wymaga uprawnień SELECT do tabeli system.ai_gateway.usage. Dane pulpitu nawigacyjnego usage podlegają zasadom przechowywania tabeli. Zobacz Które tabele systemowe są dostępne?.
Gdy dostępna jest nowsza wersja wbudowanego panelu użytkowania, administratorzy kont mogą kliknąć Aktualizuj w wierszu wersji panelu w rozwijanym menu Govern na stronie Unity Gateway.
Do zarządzania pulpitem nawigacyjnym można użyć następujących opcji konfiguracji pulpitu nawigacyjnego:
- Zakres: wybierz, czy chcesz ograniczyć zakres pulpitu nawigacyjnego do konta, czy obszaru roboczego.
- Uprawnienia: Wybierz, czy zapytania mają być uruchamiane przy użyciu uprawnień właściciela panelu, czy uprawnień każdego użytkownika przeglądającego panel. Zobacz Co to są uprawnienia do danych udostępnionych?.
- Automatyczne aktualizacje: Po włączeniu tej opcji dashboard aktualizuje się automatycznie, gdy tylko pojawi się nowsza wersja, a administrator konta odwiedzi stronę Unity Gateway.
Po zaktualizowaniu pulpitu nawigacyjnego do wersji 0.3 lub nowszej zostanie automatycznie utworzony harmonogram odświeżania pulpitu nawigacyjnego co 6 godzin. W razie potrzeby ten harmonogram można wyłączyć na pulpicie nawigacyjnym usługi Lakeview. Zobacz Tworzenie harmonogramu.
Zobacz panel użycia
Aby zobaczyć panel nawigacyjny, kliknij Govern w prawym górnym rogu strony Unity Gateway, a następnie kliknij Usage Dashboard. Panel otwiera się w nowej karcie. Wbudowany panel oferuje kompleksowy wgląd w wykorzystanie usług, wydajność i koszty modelu Unity Gateway. Zawiera wiele stron poświęconych monitorowaniu żądań, zużycia tokenów, metryk opóźnień, współczynników błędów, zestawień kosztów, ruchu do i z zewnętrznych serwerów MCP oraz aktywności agenta kodującego.
Pulpit nawigacyjny domyślnie udostępnia analizę między obszarami roboczymi. Wszystkie strony pulpitu nawigacyjnego można filtrować według zakresu dat i identyfikatora obszaru roboczego.
- Karta Przegląd: pokazuje ogólne metryki użycia, w tym dzienny wolumen żądań, trendy użycia tokenów w czasie, najlepsi użytkownicy według zużycia tokenów oraz łączną liczbę unikatowych użytkowników. Użyj tej zakładki, aby szybko zobaczyć ogólną aktywność Unity Gateway i zidentyfikować najbardziej aktywnych użytkowników oraz modeli.
- Karta Wydajność: śledzi kluczowe metryki wydajności, w tym percentyle opóźnienia (P50, P90, P95, P99), czas pierwszego bajtu, współczynniki błędów i dystrybucje kodu stanu HTTP. Ta karta służy do monitorowania stanu usługi modelowej oraz identyfikowania wąskich gardeł wpływających na wydajność i problemów z niezawodnością.
- Karta „Użycie”: przedstawia szczegółowy podział wykorzystania według usługi modelowej, obszaru roboczego i inicjatora żądania. Na tej karcie przedstawiono wzorce użycia tokenów, rozkład żądań i współczynniki trafień w pamięci podręcznej.
- Karta obserwowalności kosztów: Pokazuje podział kosztów według usług modeli, modelu docelowego, użytkownika, tagów usług i tagów żądań. Ta zakładka zawiera również szacunkowy koszt modeli zewnętrznych. Zobacz Analizuj koszt Unity Gateway.
- Zewnętrzna karta serwera MCP: pokazuje liczbę żądań, współczynniki błędów, użytkowników i połączenia oraz dzienne trendy użycia dla zewnętrznego ruchu serwera MCP.
- Zakładka Coding Agents: Śledzi aktywność zintegrowanych agentów kodujących, w tym Claude Code, Codex CLI, Cursor i Gemini CLI. Na tej karcie są wyświetlane metryki, takie jak dni aktywne, sesje kodowania, zatwierdzenia i wiersze kodu dodane lub usunięte w celu monitorowania użycia narzędzi deweloperskich. Aby uzyskać więcej informacji, zobacz Pulpit nawigacyjny agenta kodowania .
Schemat tabeli użycia
Tabela system.ai_gateway.usage ma następujący schemat:
| Nazwa kolumny | Typ | Opis | Example |
|---|---|---|---|
account_id |
STRING | Identyfikator konta. | 11d77e21-5e05-4196-af72-423257f74974 |
workspace_id |
STRING | Identyfikator przestrzeni roboczej. | 1653573648247579 |
request_id |
STRING | Unikalny identyfikator żądania. | b4a47a30-0e18-4ae3-9a7f-29bcb07e0f00 |
invocation_id |
STRING | Unikatowy identyfikator dla każdego poszczególnego wywołania inferencji. Wiele wywołań może współdzielić ten sam request_id, na przykład sprawdzenia guardrail lub wieloturowe wywołania agenta. Użyj invocation_id, aby je rozróżnić. |
c0a8012e-9f3b-4d21-8a7e-1b2c3d4e5f60 |
schema_version |
INTEGER | Wersja schematu rekordu użycia. | 1 |
endpoint_id |
STRING | Unikalny identyfikator usługi modelu Unity Gateway. | 43addf89-d802-3ca2-bd54-fe4d2a60d58a |
endpoint_name |
STRING | Nazwa modelu usługi Unity Gateway. | system.ai.gpt-5-2 |
endpoint_tags |
MAP | Tagi skonfigurowane w usłudze modelowej podczas jej tworzenia lub aktualizacji. Są one stosowane do wszystkich żądań do usługi modelu i są przydatne do kategoryzowania usług według zespołu, centrum kosztów lub projektu. | {"team": "engineering"} |
endpoint_metadata |
STRUCT | Metadane usługi modelu obejmujące creator, creation_time, last_updated_time, destinations, inference_table i fallbacks. |
{"creator": "user.name@email.com", "creation_time": "2026-01-06T12:00:00.000Z", ...} |
event_time |
TIMESTAMP | Sygnatura czasowa odebrania żądania. | 2026-01-20T19:48:08.000+00:00 |
latency_ms |
LONG | Łączne opóźnienie w milisekundach. | 300 |
time_to_first_byte_ms |
LONG | Czas do pierwszego bajtu w milisekundach. | 300 |
destination_type |
STRING | Typ miejsca docelowego (na przykład model zewnętrzny lub model podstawowy). | PAY_PER_TOKEN_FOUNDATION_MODEL |
destination_name |
STRING | Nazwa modelu docelowego lub dostawcy. | system.ai.gpt-5-2 |
destination_id |
STRING | Unikatowy identyfikator miejsca docelowego. | 507e7456151b3cc89e05ff48161efb87 |
destination_model |
STRING | Określony model używany w ramach żądania. | GPT-5.2 |
requester |
STRING | Identyfikator użytkownika lub jednostki usługi, która złożyła żądanie. | user.name@email.com |
requester_type |
STRING | Typ obiektu żądającego (użytkownik, jednostka usługi lub grupa użytkowników). | USER |
ip_address |
STRING | Adres IP obiektu żądającego. | 1.2.3.4 |
url |
STRING | Adres URL żądania. | https://<workspace-url>/ai-gateway/mlflow/v1/chat/completions |
user_agent |
STRING | Agent użytkownika żądającego. | OpenAI/Python 2.13.0 |
api_type |
STRING | Typ wywołania interfejsu API (na przykład czat, ukończenie lub osadzanie). | mlflow/v1/chat/completions |
request_tags |
MAP | Tagi dostarczone przez użytkownika wysyłane z poszczególnymi żądaniami przy użyciu nagłówka Databricks-Ai-Gateway-Request-Tags HTTP. Tagi żądań umożliwiają przypisywanie użycia określonych projektów, zespołów, środowisk lub użytkowników końcowych. Zobacz Tag requests for usage tracking and Tag requests for usage tracking (Żądania tagów dotyczące śledzenia użycia i tagów na potrzeby śledzenia użycia). |
{"project": "chatbot", "team": "ml-platform"} |
invocation_metadata |
STRUCT | Metadane wygenerowane przez system dotyczące wywołania wnioskowania. Zawiera source usługę lub ścieżkę, która zainicjowała wywołanie. |
{"source": "EXTERNAL_CLIENT"} |
input_tokens |
LONG | Liczba tokenów wejściowych. | 100 |
output_tokens |
LONG | Liczba tokenów wyjściowych. | 100 |
total_tokens |
LONG | Całkowita liczba tokenów (dane wejściowe i wyjściowe). | 200 |
token_details |
STRUCT | Szczegółowy podział tokenów, w tym cache_read_input_tokens, cache_creation_input_tokensi output_reasoning_tokens. |
{"cache_read_input_tokens": 100, ...} |
response_content_type |
STRING | Typ zawartości odpowiedzi. | application/json |
status_code |
INT | Kod statusu HTTP odpowiedzi. | 200 |
routing_information |
STRUCT | Szczegóły routingu dla prób powrotu . Zawiera tablicę z elementami attempts, priority, action, destination, destination_id, status_code, error_code, latency_ms, start_time i end_time dla każdego modelu wypróbowanego podczas żądania. |
{"attempts": [{"priority": "1", ...}]} |
Oznacz żądania do śledzenia użycia
Tagi żądań to niestandardowe pary klucz-wartość, które obiekt wywołujący dołącza do poszczególnych żądań. Użyj tagów żądań, aby przypisywać użycie według projektu, zespołu, środowiska, użytkownika końcowego lub dowolnego innego wymiaru istotnego dla organizacji. Tagi żądań są rejestrowane w system.ai_gateway.usage tabeli i mogą służyć do filtrowania, agregowania i analizowania danych użycia.
Aby oznaczyć poszczególne żądania, dołącz nagłówek HTTP Databricks-Ai-Gateway-Request-Tags zawierający obiekt JSON mapujący klucze tekstowe na wartości tekstowe. Tagi żądań są rejestrowane w request_tags kolumnie tabeli użycia oraz w tabelach inferencji.
Przykłady pokazujące, jak ustawiać tagi żądań za pomocą interfejsu API REST, OpenAI SDK i Anthropic SDK, można znaleźć w temacie Tagowanie żądań na potrzeby śledzenia użycia.
Na przykład można agregować użycie według projektu przy użyciu tagów żądań:
SELECT
request_tags['project'] AS project,
COUNT(*) AS request_count,
SUM(total_tokens) AS total_tokens
FROM system.ai_gateway.usage
WHERE request_tags['project'] IS NOT NULL
GROUP BY request_tags['project']
ORDER BY total_tokens DESC;
Limitations
- Unity Gateway nie śledzi użycia tokenów w przypadku odpowiedzi innych niż strumieniowe i osadzania, większych niż 1 MiB.