Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
KI-Funktionen verwenden den integrierten, in Fabric gehosteten LLM-Endpunkt, um Ihre Daten umzuwandeln und anzureichern, ohne einen separaten Endpunkt einrichten zu müssen. In diesem Artikel werden die Optionen für Abrechnungszähler, Verbrauchssätze und Nutzungsüberwachungsoptionen für diesen integrierten Endpunkt erläutert.
Important
Dieser Artikel bezieht sich auf KI-Funktionen, die den integrierten Fabric LLM-Endpunkt verwenden. Für Pandas und PySpark können Sie Ihr eigenes Modell über einen individuellen Azure OpenAI-, Microsoft Foundry- oder OpenAI-kompatiblen Endpunkt bringen. Fabric verlangt keine Gebühren für Modellaufrufe an deinen benutzerdefinierten Endpunkt. Dein LLM-Anbieter berechnet Gebühren für die Tokennutzung, und es fallen weiterhin Gebühren für die Fabric-Berechnung an. Details zum Einrichten finden Sie unter Anpassen von KI-Funktionen mit Pandas und Anpassen von KI-Funktionen mit PySpark.
Abrechnungsmesser
KI-Funktionsaufrufe über den integrierten Fabric-LLM-Endpunkt werden Ihrer Fabric-Kapazität über den Zähler Copilot and AI in Rechnung gestellt. In der App „Microsoft Fabric Capacity Metrics“ wird die Nutzung als Vorgang „AI Functions“ angezeigt.
| Usage | Abrechnungszähler oder Betrieb |
|---|---|
| Modellaufrufe über den integrierten Fabric LLM-Endpunkt | Copilot und KI-Meter, die als KI-Funktionen gemeldet wurden. |
| Modellaufrufe über einen benutzerdefinierten Endpunkt | Keine Model-Call-Gebühr von Fabric. Dein LLM-Anbieter rechnet die Tokennutzung ab. |
| Spark-Compute, das ein Notebook oder einen Spark-Job ausführt | Spark-Abrechnungszähler |
| Dataflow Gen2-Compute, die Transformationen ausführt | Dataflow Gen2-Verwendung. |
| Rechenleistung für Abfragen an Warehouse- oder SQL-Analytics-Endpunkten | Data Warehouse- oder SQL-Analyseendpunktverwendung. |
Anzeigen von Kosten und Ausgaben
Verwenden Sie die App "Kapazitätsmetriken", um die Ausgaben und Kapazitätsauswirkungen von KI-Funktionen zu überwachen:
- Öffnen Sie die Microsoft Fabric-Kapazitätsmetriken-App.
- Filtern Sie nach der Kapazität, dem Arbeitsbereich und dem Zeitraum, die Ihre KI-Funktionen-Workload ausgeführt haben.
- Suchen Sie in Ansichten auf Vorgangsebene nach KI-Funktionen unter dem Zähler Copilot und KI.
- Vergleichen Sie den KI-Funktionen-Vorgang mit Spark-, Dataflow Gen2- oder Warehouse-Vorgängen, um den Modellaufrufverbrauch von der Berechnung zu trennen, die die Workload koordiniert hat.
Überwachen der Laufzeitnutzung
Verwenden Sie während der Entwicklung Laufzeitnutzungsstatistiken, um den Verbrauch zu schätzen und zu überprüfen, bevor Sie eine Pipeline skalieren.
In Pandas und PySpark-Notizbüchern können Sie auf KI-Funktionsergebnisse zugreifen ai.stats , um Die Ausführungs- und Tokennutzungsdetails anzuzeigen, einschließlich:
-
num_successful,num_exceptions,num_unevaluatedundnum_harmful. -
cached_tokens,input_tokens,output_tokensundreasoning_tokens. -
client_type,input_typesundmodel.
# This code uses AI. Always review output for mistakes.
df["summary"] = df["text"].ai.summarize()
display(df["summary"].ai.stats)
display(df.ai.stats)
Die Ausgabe könnte etwa so aussehen wie in dieser Tabelle:
| num_successful | num_exceptions | num_unevaluated | num_harmful | cached_tokens | input_tokens | output_tokens | Begründungs_Token | client_type | input_types | model |
|---|---|---|---|---|---|---|---|---|---|---|
| 2 | 0 | 0 | 0 | 0 | 555 | 4 | 0 | fabric_llm_endpoint | {"text": 2} |
gpt-5-mini |
Legen Sie in pandas notebooks progress_bar_mode="stats" fest, damit während der Ausführung der Funktion Token- und Kapazitätseinheitenschätzungen in Echtzeit angezeigt werden:
import synapse.ml.aifunc as aifunc
aifunc.default_conf.progress_bar_mode = "stats"
Die Statusanzeige zeigt live und projizierte zwischengespeicherte Eingaben, Eingabe-, Ausgabe- und Kapazitätseinheitenschätzungen an und zeigt dann endwerte an, wenn der Vorgang abgeschlossen ist. Siehe Statusleistenmodi und Anpassen von KI-Funktionen mit PySpark.
Verbrauchsraten
Wenn Sie kein anderes Modell konfigurieren, verwenden Python-KI-Funktionen für pandas und PySpark standardmäßig gpt-5-mini, wobei reasoning_effort auf low festgelegt ist. Der Verbrauch basiert auf der Tokenverwendung. Eingabe-, zwischengespeicherte Eingabe- und Ausgabetoken können unterschiedliche Raten aufweisen.
Sprachmodelle
| Modell | Bereitstellungsname | Kontextfenster (Token) | Eingabe (pro 1.000 Token) | Zwischengespeicherte Eingabe (pro 1.000 Token) | Ausgabe (pro 1.000 Elemente) |
|---|---|---|---|---|---|
| gpt-5.1-2025-11-13 | gpt-5.1 |
400.000 Max. Leistung: 128.000 |
42,02 CU-Sekunden | 4,20 CU-Sekunden | 336,13 CU-Sekunden |
| gpt-5-mini-2025-08-07 | gpt-5-mini |
400.000 Max. Leistung: 128.000 |
8,40 CU-Sekunden | 0,84 CU Sekunden | 67,23 CU-Sekunden |
Einbetten von Modellen
| Modell | Bereitstellungsname | Kontextfenster (Token) | Eingabe (pro 1.000 Token) |
|---|---|---|---|
| Ada | text-embedding-ada-002 |
8.192 | 3,36 CU-Sekunden |
Die Verbrauchsraten können sich ändern. Die vollständige Liste der Verbrauchssätze sowie die Richtlinie zu Satzänderungen finden Sie unter Verbrauchssatz in Foundry Tools in Fabric.
Modellmigrationsleitfaden
Für anspruchsvollere Transformationen können Sie gpt-5.1 konfigurieren oder reasoning_effort so abstimmen, dass mehr Rechenleistung für hochwertigere Ergebnisse genutzt wird. Details zum Einrichten finden Sie unter Anpassen von KI-Funktionen mit Pandas und Anpassen von KI-Funktionen mit PySpark.