Rozliczenia dla funkcji sztucznej inteligencji

Funkcje AI używają wbudowanego punktu końcowego dużego modelu językowego (LLM) hostowanego na platformie Fabric do przekształcania i wzbogacania danych bez konieczności oddzielnej konfiguracji punktu końcowego. W tym artykule wyjaśniono licznik rozliczeniowy, wskaźniki zużycia oraz opcje monitorowania użycia dla tego wbudowanego punktu końcowego.

Ważna

Ten artykuł dotyczy funkcji sztucznej inteligencji korzystających z wbudowanego punktu końcowego Fabric LLM. W przypadku pandas i PySpark możesz przynieść własny model przez niestandardowy endpoint kompatybilny z Azure OpenAI, Microsoft Foundry lub OpenAI. Fabric nie pobiera opłat za wywołania modelu do twojego niestandardowego punktu końcowego. Twój dostawca LLM pobiera opłaty za zużycie tokenów, a opłaty obliczeniowe Fabric nadal są obowiązywane. Aby uzyskać szczegółowe informacje na temat konfiguracji, zobacz Dostosowywanie funkcji sztucznej inteligencji za pomocą biblioteki pandas i Dostosowywanie funkcji sztucznej inteligencji za pomocą narzędzia PySpark.

Licznik do rozliczeń

Wywołania funkcji AI za pośrednictwem wbudowanego punktu końcowego LLM usługi Fabric są rozliczane w ramach Twojej pojemności Fabric przy użyciu miernika rozliczeniowego Copilot i AI. W aplikacji Microsoft Fabric Capacity Metrics użycie jest wyświetlane jako operacja usługi AI Functions.

Usage Licznik rozliczeniowy lub operacja
Wywołania modeli przez wbudowany punkt końcowy Fabric LLM Copilot i miernik AI, raportowane jako Funkcje AI.
Wywołania modelu przez niestandardowy endpoint Nie pobiera opłaty za modelki od Fabric. Twój dostawca LLM rozlicza zużycie tokenów.
Zasoby obliczeniowe Spark do uruchamiania notatnika lub zadania Spark Licznik rozliczeniowy Spark.
Warstwa obliczeniowa Dataflow Gen2 uruchamiająca przekształcenia Użycie Dataflow Gen2.
Moc obliczeniowa zapytań dla magazynu danych lub punktu końcowego analityki SQL Użycie magazynu danych lub punktu końcowego analizy SQL.

Wyświetlanie kosztów i wydatków

Użyj aplikacji Metryki pojemności, aby monitorować wydatki na funkcje sztucznej inteligencji i wpływ na pojemność:

  1. Otwórz aplikację Microsoft Fabric Capacity Metrics.
  2. Filtruj według pojemności, obszaru roboczego i zakresu czasu, w którym uruchomiono obciążenie usługi AI Functions.
  3. W widokach poziomu operacji wyszukaj Funkcje AI w obszarze miary Copilot i AI.
  4. Porównaj operację AI Functions z operacjami Spark, Dataflow Gen2 lub magazynu danych, aby oddzielić zużycie związane z wywołaniami modelu od zasobów obliczeniowych, które koordynowały to obciążenie.

Monitorowanie użycia środowiska uruchomieniowego

Podczas programowania użyj statystyk użycia środowiska uruchomieniowego, aby oszacować i zweryfikować użycie przed skalowaniem potoku.

W notesach pandas i PySpark uzyskaj dostęp do ai.stats w wynikach funkcji AI, aby wyświetlić szczegóły wykonania i użycia tokenów, w tym:

  • num_successful, num_exceptions, num_unevaluated i num_harmful.
  • cached_tokens, input_tokens, output_tokens i reasoning_tokens.
  • client_type, input_types oraz model.
# This code uses AI. Always review output for mistakes.

df["summary"] = df["text"].ai.summarize()
display(df["summary"].ai.stats)
display(df.ai.stats)

Dane wyjściowe mogą wyglądać następująco:

num_successful num_exceptions num_unevaluated num_harmful cached_tokens input_tokens output_tokens tokeny_rozumowania client_type input_types model
2 0 0 0 0 555 4 0 fabric_llm_endpoint {"text": 2} gpt-5-mini

W notatnikach pandas ustaw progress_bar_mode="stats", aby podczas działania funkcji wyświetlać szacunkową liczbę tokenów i jednostek pojemności w czasie rzeczywistym:

import synapse.ml.aifunc as aifunc

aifunc.default_conf.progress_bar_mode = "stats"

Pasek postępu wyświetla bieżące i prognozowane szacunki dotyczące buforowanych danych wejściowych, danych wejściowych, danych wyjściowych oraz jednostek pojemności, a po zakończeniu operacji — wartości końcowe. Zobacz Tryby paska postępu i Dostosowywanie funkcji sztucznej inteligencji za pomocą narzędzia PySpark.

Stawki zużycia

Jeśli nie skonfigurujesz innego modelu, funkcje AI języka Python dla bibliotek pandas i PySpark domyślnie używają gpt-5-mini, a parametr reasoning_effort jest ustawiony na low. Zużycie zależy od liczby wykorzystanych tokenów. Tokeny wejściowe, buforowane i wyjściowe mogą mieć różne stawki.

Modele językowe

Model Nazwa wdrożenia Okno kontekstu (tokeny) Dane wejściowe (na 1000 tokenów) Buforowane dane wejściowe (na 1000 tokenów) Wydajność (na 1000 tokenów)
gpt-5.1-2025-11-13 gpt-5.1 400,000
Maksymalna liczba danych wyjściowych: 128 000
42,02 sekundy CU 4,20 CU s 336,13 CU sek
gpt-5-mini-2025-08-07 gpt-5-mini 400,000
Maksymalna liczba danych wyjściowych: 128 000
8,40 sekundy CU 0,84 CU sekundy 67,23 CU sekundy

Osadzanie modeli

Model Nazwa wdrożenia Okno kontekstu (tokeny) Dane wejściowe (na 1000 tokenów)
Ada text-embedding-ada-002 8,192 3,36 CU sekundy

Stawki zużycia mogą ulec zmianie. Aby zapoznać się z pełną listą stawek zużycia i zasadami zmian stawek, zobacz Wskaźnik zużycia w narzędziach Foundry w usłudze Fabric.

Wskazówki dotyczące migracji modelu

W przypadku bardziej zaawansowanych przekształceń można skonfigurować gpt-5.1 lub dostosować reasoning_effort do większej liczby obliczeń w celu uzyskania wyników o wyższej jakości. Aby uzyskać szczegółowe informacje na temat konfiguracji, zobacz Dostosowywanie funkcji sztucznej inteligencji za pomocą biblioteki pandas i Dostosowywanie funkcji sztucznej inteligencji za pomocą narzędzia PySpark.