Facturation des fonctions IA

Les fonctions d’IA utilisent le point de terminaison intégré d’un grand modèle de langage (LLM) hébergé dans Fabric pour transformer et enrichir vos données, sans configuration distincte d’un point de terminaison. Cet article explique les options de contrôle de facturation, de taux de consommation et de surveillance de l’utilisation pour ce point de terminaison intégré.

Important

Cet article s’applique aux fonctions IA qui utilisent le point de terminaison intégré Fabric LLM. Pour pandas et PySpark, vous pouvez transférer votre propre modèle via un point de terminaison personnalisé Azure OpenAI, Microsoft Foundry ou compatible OpenAI. Fabric ne facture pas les appels de modèle vers votre terminaison personnalisé. Votre fournisseur de LLM facture l’utilisation du jeton, et les frais de calcul Fabric restent en cours. Pour plus d’informations sur la configuration, consultez Personnaliser les fonctions IA avec pandas et personnaliser des fonctions IA avec PySpark.

Compteur de facturation

Les appels de fonction d’IA via le point de terminaison LLM intégré de Fabric sont facturés à votre capacité Fabric au titre du compteur Copilot and AI. Dans l’application Microsoft Fabric Capacity Metrics, l’utilisation apparaît sous l’opération AI Functions.

Usage Compteur de facturation ou opération
Appels de modèles via le terminau intégré du LLM Fabric Copilot et le compteur d’IA, indiqués comme Fonctions IA.
Appels de modèle via un point de terminaison personnalisé Aucun frais d’appel de modèle de la part de Fabric. Votre fournisseur de LLM facture l’utilisation des jetons.
Calcul Spark qui exécute un bloc-notes ou un travail Spark Compteur de facturation Spark.
Moteur de calcul Dataflow Gen2 qui exécute des transformations Utilisation de Dataflow Gen2.
Calcul des requêtes de l’entrepôt de données ou du point de terminaison d’analyse SQL Utilisation de l’entrepôt de données ou du point de terminaison d’analyses SQL.

Afficher les coûts et les dépenses

Utilisez l’application Métriques de capacité pour surveiller les dépenses et l’impact sur la capacité d’AI Functions :

  1. Ouvrez l’application Métriques de capacité Microsoft Fabric.
  2. Filtrez par capacité, espace de travail et plage de temps dans lesquels votre charge de travail Fonctions d’IA s’est exécutée.
  3. Dans les vues au niveau des opérations, recherchez Fonctions d’IA sous l’indicateur Copilot et IA.
  4. Comparez l’opération AI Functions aux opérations Spark, Dataflow Gen2 ou d’entrepôt afin de séparer la consommation liée aux appels de modèle des ressources de calcul ayant orchestré la charge de travail.

Surveiller l’utilisation du runtime

Pendant le développement, utilisez les statistiques d’utilisation du runtime pour estimer et valider la consommation avant de mettre à l’échelle un pipeline.

Dans les notebooks pandas et PySpark, accédez à ai.stats sur les résultats des fonctions d’IA pour afficher les détails sur l’exécution et l’utilisation des jetons, notamment :

  • num_successful, num_exceptions, num_unevaluated et num_harmful.
  • cached_tokens, input_tokens, output_tokens et reasoning_tokens.
  • client_type, input_typeset model.
# This code uses AI. Always review output for mistakes.

df["summary"] = df["text"].ai.summarize()
display(df["summary"].ai.stats)
display(df.ai.stats)

La sortie peut ressembler à ce tableau :

num_successful num_exceptions num_unevaluated num_harmful jetons en cache input_tokens output_tokens jetons_de_raisonnement client_type input_types modèle
2 0 0 0 0 555 4 0 fabric_llm_endpoint {"text": 2} gpt-5-mini

Dans les notebooks Pandas, définissez progress_bar_mode="stats" pour afficher en temps réel les estimations du nombre de jetons et des unités de capacité pendant l’exécution de la fonction :

import synapse.ml.aifunc as aifunc

aifunc.default_conf.progress_bar_mode = "stats"

La barre de progression affiche les estimations d’entrée, d’entrée, de sortie et d’unité de capacité mises en cache actives et projetées, puis affiche les valeurs finales lorsque l’opération se termine. Consultez les modes de barre de progression et personnalisez les fonctions IA avec PySpark.

Taux de consommation

Sauf si vous configurez un autre modèle, les fonctions IA Python pour pandas et PySpark utilisent par défaut gpt-5-mini, avec reasoning_effort défini sur low. La consommation est basée sur l’utilisation des jetons. Les tokens d’entrée, les tokens d’entrée mis en cache et les tokens de sortie peuvent avoir des taux différents.

Modèles de langage

Modèle Nom du déploiement Fenêtre contextuelle (jetons) Entrée (par 1 000 éléments) Entrée mise en cache (par 1 000 jetons) Sortie (par 1 000 jetons)
gpt-5.1-2025-11-13 gpt-5.1 400,000
Sortie maximale : 128 000
42,02 CU secondes 4,20 CU secondes 336,13 secondes CU
gpt-5-mini-2025-08-07 gpt-5-mini 400,000
Sortie maximale : 128 000
8,40 secondes CU 0,84 CU secondes 67,23 CU secondes

Incorporation de modèles

Modèle Nom du déploiement Fenêtre contextuelle (jetons) Entrée (par 1 000 jetons)
Ada text-embedding-ada-002 8,192 3,36 secondes CU

Les taux de consommation sont susceptibles de changer. Pour consulter la liste complète des taux de consommation et la politique de modification des taux, voir Taux de consommation dans les Outils Foundry de Fabric.

Guide de migration du modèle

Pour des transformations plus sophistiquées, vous pouvez configurer gpt-5.1 ou ajuster reasoning_effort pour utiliser davantage de calcul pour obtenir des résultats de meilleure qualité. Pour plus d’informations sur la configuration, consultez Personnaliser les fonctions IA avec pandas et personnaliser des fonctions IA avec PySpark.