Fakturering för AI Functions

AI Functions använder den inbyggda slutpunkten Fabric värdbaserad stor språkmodell (LLM) för att transformera och utöka dina data utan separat slutpunktskonfiguration. I den här artikeln beskrivs alternativen för faktureringsmätare, förbrukning och användningsövervakning för den inbyggda slutpunkten.

Important

Den här artikeln gäller för AI Functions som använder den inbyggda Fabric LLM-slutpunkten. För pandas och PySpark kan du ta med din egen modell via en anpassad Azure OpenAI, Microsoft Foundry eller OpenAI-kompatibel endpoint. Fabric tar inte betalt för modellanrop till din anpassade endpoint. Din LLM-leverantör tar betalt för tokenanvändning, och Fabric-beräkningsavgifter gäller fortfarande. Information om konfiguration finns i Anpassa AI Functions med Pandas och Anpassa AI Functions med PySpark.

Faktureringsmätare

AI-funktionsanrop via den inbyggda Fabric LLM-slutpunkten faktureras till din Fabric kapacitet under Copilot- och AI-mätaren. I appen Microsoft Fabric Capacity Metrics visas användningen som operationen AI Functions.

Usage Faktureringsmätare eller åtgärd
Modellanrop via den inbyggda Fabric LLM-endpointen Copilot och AI-mätare, rapporterade som AI Functions.
Modellera anrop via en anpassad endpoint Ingen modelluppringningsavgift från Fabric. Din LLM-leverantör fakturerar tokenanvändning.
Spark-beräkning som kör en notebook eller ett Spark-jobb Spark-faktureringsmätare.
Dataflow Gen2-beräkning som kör transformationer Användning av Dataflöde Gen2.
Informationslager- eller SQL Analytics-slutpunktsfrågeberäkning Data Warehouse- eller SQL-analysslutpunktsanvändning.

Visa kostnader och utgifter

Använd appen Kapacitetsmått för att övervaka ai-funktioners utgifter och kapacitetspåverkan:

  1. Öppna appen Kapacitetsmått för Microsoft Fabric.
  2. Filtrera efter den kapacitet, arbetsyta och tidsperiod där arbetsbelastningen för AI Functions kördes.
  3. I vyer på åtgärdsnivå letar du efter AI Functions under Copilot- och AI-mätaren.
  4. Jämför AI Functions-åtgärden med Spark-, Dataflow Gen2- eller lageråtgärder för att separera modellanropsförbrukning från den beräkning som orkestrerade arbetsbelastningen.

Övervaka användning under körning

Under utvecklingsfasen använder du körningsstatistik för att uppskatta och validera förbrukningen innan du skalar upp en pipeline.

I anteckningsböcker för pandas och PySpark får du tillgång till ai.stats på AI-funktionsresultat för att visa information om körning och tokenanvändning, inklusive:

  • num_successful, num_exceptions, num_unevaluated och num_harmful.
  • cached_tokens, input_tokens, output_tokens och reasoning_tokens.
  • client_type, input_types och model.
# This code uses AI. Always review output for mistakes.

df["summary"] = df["text"].ai.summarize()
display(df["summary"].ai.stats)
display(df.ai.stats)

Utdata kan se ut som i den här tabellen:

num_successful num_exceptions num_unevaluated num_harmful cached_tokens input_tokens output_tokens reasoning_tokens klienttyp indatatyper model
2 0 0 0 0 555 4 0 fabric_llm_endpoint {"text": 2} gpt-5-mini

I pandas-anteckningsböcker ställer du in progress_bar_mode="stats" så att uppskattningar i realtid av token och kapacitetsenheter visas medan funktionen körs:

import synapse.ml.aifunc as aifunc

aifunc.default_conf.progress_bar_mode = "stats"

Förloppsindikatorn visar live- och projicerade cachelagrade indata, indata, utdata och kapacitetsenhetsuppskattningar och visar sedan slutliga värden när åtgärden är klar. Se Förloppsindikatorns lägen och Anpassa AI-funktioner med PySpark.

Förbrukningsnivåer

Om du inte konfigurerar en annan modell använder Python AI Functions för pandas och PySpark som standard gpt-5-mini, med reasoning_effort inställt på low. Förbrukningen baseras på tokenanvändning. Indata, cachelagrade indata och utdatatoken kan ha olika frekvenser.

Språkmodeller

Modell Distributionsnamn Kontextfönster (token) indata (per 1 000 token) Cachelagrad indata (per 1 000 tokens) utdata (per 1 000 token)
gpt-5.1-2025-11-13 gpt-5.1 400,000
Maximalt antal utdata: 128 000
42,02 CU sekunder 4,20 CU sekunder 336,13 CU sekunder
gpt-5-mini-2025-08-07 gpt-5-mini 400,000
Maximalt antal utdata: 128 000
8,40 CU-sekunder 0,84 CU sekunder 67,23 CU-sekunder

Inbäddningsmodeller

Modell Distributionsnamn Kontextfönster (token) Indata (per 1 000 token)
Ada text-embedding-ada-002 8,192 3,36 CU-sekunder

Förbrukningsfrekvensen kan komma att ändras. För den fullständiga listan över förbrukningshastigheter och policyn för ändringar av förbrukningshastigheter, se Förbrukningshastighet i Foundry Tools i Fabric.

Vägledning för modellmigrering

För mer avancerade transformeringar kan du konfigurera gpt-5.1 eller finjustera reasoning_effort för att använda mer beräkning för resultat av högre kvalitet. Information om konfiguration finns i Anpassa AI Functions med Pandas och Anpassa AI Functions med PySpark.