Tekoälytoimintojen laskutus

Tekoälyfunktiot käyttävät sisäänrakennettua Fabric-isännöityä suurkielimallia (LLM) muuntaakseen ja rikastaakseen dataasi ilman erillistä päätepisteen asettamista. Tässä artikkelissa selitetään, että laskutusmittari, kulutusprosentit ja käytön seurantavaihtoehdot kyseiselle sisäänrakennetulle päätepisteelle.

Important

Tämä artikkeli koskee tekoälytoimintoja, jotka käyttävät sisäänrakennettua Fabric LLM -päätepistettä. Pandoille ja PySparkille voit tuoda oman mallisi räätälöidyn Azure OpenAI:n, Microsoft Foundryn tai OpenAI-yhteensopivan päätelaitteen kautta. Fabric ei veloita mallikutsuista mukautetulle päätepisteellesi. LLM-palveluntarjoajasi veloittaa tokenin käytöstä, ja Fabric-laskentamaksut ovat edelleen voimassa. Asetuksia varten katso Mukauta tekoälytoimintoja pandoilla ja Räätälöi tekoälytoimintoja PySparkilla.

Laskutusmittari

Tekoälyfunktiokutsut sisäänrakennetun Fabric LLM -päätepisteen kautta laskutetaan Fabric-kapasiteettisi mukaan Copilot- ja AI-mittarin kautta. Microsoft Fabric Capacity Metrics -sovelluksessa käyttö näkyy AI Functions -toimintona.

Käyttö Laskutusmittari tai toiminta
Mallikutsut sisäänrakennetun Fabric LLM -päätepisteen kautta Copilot- ja AI-mittari, raportoitu nimellä AI-toiminnot.
Mallikutsut mukautetun päätepisteen kautta Ei mallikutsumaksua Fabric:lta. LLM-palveluntarjoajasi laskuttaa tokenien käyttöä.
Spark-laskenta, joka suorittaa muistikirjan tai Spark-työn Kipinän laskutusmittari.
Dataflow Gen2 -laskenta, joka suorittaa muunnokset Dataflow Gen2 -käyttö.
Warehouse or SQL Analytics endpoint query compute tietovarasto- tai SQL-analytiikan päätelaitteiden käyttö.

Katso kustannukset ja kulut

Käytä Capacity Metrics -sovellusta tekoälyfunktioiden kulutuksen ja kapasiteetin vaikutuksen seuraamiseen:

  1. Avaa Microsoft Fabric Capacity Metrics -sovellus.
  2. Suodata kapasiteettiin, työtilaan ja aikaväliin, jotka ajoivat tekoälyfunktioiden työkuormaa.
  3. Toimintatason näkymissä etsi tekoälytoimintojaCopilot- ja AI-mittarin alta.
  4. Vertaa tekoälyfunktioiden toimintaa Spark-, Dataflow Gen2- tai varastotoimintoihin, jotta mallikutsujen kulutus voidaan erottaa laskentatoimesta, joka ohjasi työkuorman.

Seuranta ajonaikaisesta käytöstä

Kehityksen aikana käytä ajonaikaista käyttötilastoa kulutuksen arvioimiseen ja validointiin ennen kuin skaalaat putken.

Pandas- ja PySpark-muistikirjoissa tekoälyn toimintojen tuloksiin pääsy ai.stats näkee suoritus- ja tokenin käyttötiedot, mukaan lukien:

  • num_successful, num_exceptions, num_unevaluated, , ja num_harmful.
  • cached_tokens, input_tokens, output_tokens, , ja reasoning_tokens.
  • client_type, ja input_typesmodel.
# This code uses AI. Always review output for mistakes.

df["summary"] = df["text"].ai.summarize()
display(df["summary"].ai.stats)
display(df.ai.stats)

Tulos voisi näyttää tältä taulukolta:

num_successful num_exceptions num_unevaluated num_harmful cached_tokens input_tokens output_tokens reasoning_tokens client_type input_types malli
2 0 0 0 0 555 4 0 fabric_llm_endpoint {"text": 2} GPT-5-MINI

Pandas-muistikirjoissa, asetettuna progress_bar_mode="stats" näyttämään reaaliaikaiset token- ja kapasiteettiyksikköarviot funktion aikana:

import synapse.ml.aifunc as aifunc

aifunc.default_conf.progress_bar_mode = "stats"

Edistymispalkki näyttää reaaliaikaiset ja ennustetut välimuistissa olevat syötteet, syötteet, tulos ja kapasiteettiyksikköarviot, ja lopulliset arvot näyttävät toimenpiteen päätyttyä. Katso edistymispalkkitilat ja Muokkaa tekoälytoimintoja PySparkilla.

Kulutusluvut

Ellet konfiguroi toista mallia, Python AI Functions for Pandas and PySpark oletuksena gpt-5-mini asettaa reasoning_effortlow. Kulutus perustuu tokenien käyttöön. Syöte-, välimuistissa olevat syöte- ja lähtötokenit voivat olla eri nopeuksilla.

Kielimallit

Malli Käyttöönoton nimi Kontekstiikkuna (tokenit) syöte (1 000 tunnusta kohti) Välimuistisyöte (per 1 000 tokenia) tulos (1 000 tunnusta kohti)
GPT-5.1-2025-11-13 gpt-5.1 400,000
Maksimiteho: 128 000
42,02 CU sekuntia 4,20 CU sekuntia 336,13 CU sekuntia
GPT-5-mini-2025-08-07 gpt-5-mini 400,000
Maksimiteho: 128 000
8,40 CU sekuntia 0,84 CU sekuntia 67,23 CU sekuntia

Upotusmallit

Malli Käyttöönoton nimi Kontekstiikkuna (tokenit) Syöte (per 1 000 tokenia)
Ada text-embedding-ada-002 8,192 3,36 CU sekuntia

Kulutusluvut voivat muuttua. Koko kulutusprosenttilistan ja hinnanmuutospolitiikan löydät kohdasta Kulutusprosentti Foundry Tools in Fabric.

Mallin migraatio-ohjaus

Monimutkaisempiin muunnoksiin voit konfiguroida gpt-5.1 tai virittää reasoning_effort käyttämään enemmän laskentatehoa saadaksesi parempia tuloksia. Asetuksia varten katso Mukauta tekoälytoimintoja pandoilla ja Räätälöi tekoälytoimintoja PySparkilla.