Fakturering for AI-funksjoner

AI-funksjoner bruker det innebygde Fabric-hosted large language model (LLM)-endepunktet for å transformere og berike dataene dine uten separat endepunktoppsett. Denne artikkelen forklarer faktureringsmåler, forbrukspriser og bruksovervåkingsalternativer for det innebygde endepunktet.

Viktig!

Denne artikkelen gjelder AI-funksjoner som bruker det innebygde Fabric LLM-endepunktet. For pandas og PySpark kan du ta med din egen modell gjennom en tilpasset Azure OpenAI, Microsoft Foundry eller OpenAI-kompatibel endepunkt. Fabric tar ikke betalt for modellkall til ditt tilpassede endepunkt. Din LLM-leverandør tar betalt for tokenbruk, og Fabric-beregningskostnader påløper fortsatt. For oppsettsdetaljer, se Tilpass AI-funksjoner med pandaer og Tilpass AI-funksjoner med PySpark.

Faktureringsmåler

AI-funksjonskall gjennom den innebygde Fabric LLM-endepunktet faktureres til din Fabric-kapasitet under Copilot- og AI-måleren. I Microsoft Fabric Capacity Metrics-appen vises bruken som AI Functions-operasjonen.

Bruk Faktureringsmåler eller drift
Modellkall gjennom det innebygde Fabric LLM-endepunktet Copilot og AI-måler, rapportert som AI-funksjoner.
Modellkall gjennom et tilpasset endepunkt Ingen modellkallingsavgift fra Fabric. Din LLM-leverandør fakturerer token-bruk.
Spark-beregning som kjører en notatbok eller Spark-jobb Gnistfaktureringsmåler.
Dataflow Gen2-beregning som kjører transformasjoner Dataflow Gen2-bruk.
Lager- eller SQL-analyseendepunktsspørringsberegning Bruk av datalager eller SQL-analyse-endepunkter.

Se kostnader og utgifter

Bruk appen Capacity Metrics for å overvåke AI-funksjoners utgifter og kapasitetspåvirkning:

  1. Åpne Microsoft Fabric Capacity Metrics-appen.
  2. Filtrer etter kapasitet, arbeidsområde og tidsperiode som kjørte AI-funksjonene dine.
  3. I operasjonsnivåvisninger, se etter AI-funksjoner under Copilot- og AI-måleren.
  4. Sammenlign AI Functions-operasjonen med Spark, Dataflow Gen2 eller lageroperasjoner for å skille modellanropsforbruket fra beregningen som orkestrerte arbeidsmengden.

Overvåk kjøretidsbruk

Under utviklingen bør du bruke runtime-bruksstatistikk for å estimere og validere forbruket før du skalerer en pipeline.

I pandas- og PySpark-notatbøker får du tilgang ai.stats til AI-funksjonsresultater for å se detaljer om utførelse og tokenbruk, inkludert:

  • num_successful, num_exceptions, num_unevaluated, og num_harmful.
  • cached_tokens, input_tokens, output_tokens, og reasoning_tokens.
  • client_type, input_types, og model.
# This code uses AI. Always review output for mistakes.

df["summary"] = df["text"].ai.summarize()
display(df["summary"].ai.stats)
display(df.ai.stats)

Utdataene kan se ut som denne tabellen:

num_successful num_exceptions num_unevaluated num_harmful cached_tokens input_tokens output_tokens reasoning_tokens client_type input_types modell
2 0 0 0 0 555 4 0 fabric_llm_endpoint {"text": 2} GPT-5-mini

I pandas-notatbøker, sett progress_bar_mode="stats" til å vise sanntids token- og kapasitetsestimater mens funksjonen kjører:

import synapse.ml.aifunc as aifunc

aifunc.default_conf.progress_bar_mode = "stats"

Fremdriftslinjen viser sanntids- og projiserte cache-estimater for inndata, inndata, utgang og kapasitetsenheter, og viser deretter endelige verdier når operasjonen er fullført. Se fremgangsbar-moduser og Tilpass AI-funksjoner med PySpark.

Forbruksrater

Med mindre du konfigurerer en annen modell, går Python AI Functions for pandas og PySpark som standard til gpt-5-mini med reasoning_effort satt til low. Forbruket baseres på tokenbruk. Input, bufret input og output tokens kan ha forskjellige hastigheter.

Språkmodeller

Modell Navn på distribusjon Kontekstvindu (Tokens) inndata (per 1000 tokener) Cachet input (per 1 000 tokens) utdata (per 1000 tokener)
GPT-5.1-2025-11-13 gpt-5.1 400,000
Maks produksjon: 128 000
42,02 CU-sekunder 4,20 CU-sekunder 336,13 CU sekunder
GPT-5-mini-2025-08-07 gpt-5-mini 400,000
Maks produksjon: 128 000
8,40 CU-sekunder 0,84 CU-sekunder 67,23 CU-sekunder

Embeddingsmodeller

Modell Utplasseringsnavn Kontekstvindu (tokens) Input (per 1 000 tokens)
Ada text-embedding-ada-002 8,192 3,36 CU sekunder

Forbruksratene kan endres. For full liste over forbrukssatser og kursendringspolicy, se Consumption rate in Foundry Tools in Fabric.

Veiledning for modellmigrering

For mer sofistikerte transformasjoner kan du konfigurere gpt-5.1 eller justere reasoning_effort for å bruke mer beregning for høyere kvalitet på resultatene. For oppsettsdetaljer, se Tilpass AI-funksjoner med pandaer og Tilpass AI-funksjoner med PySpark.