Facturación de las funciones de IA

AI Functions utilizan el punto de conexión integrado del modelo lingüístico de gran tamaño (LLM) hospedado en Fabric para transformar y enriquecer sus datos sin necesidad de configurar un punto de conexión independiente. En este artículo se explican las opciones de medición de facturación, tarifas de consumo y supervisión de uso para ese punto de conexión integrado.

Importante

Este artículo se aplica a las funciones de IA que usan el punto de conexión de LLM integrado Fabric. Para pandas y PySpark, puedes llevar tu propio modelo a través de un endpoint personalizado compatible con OpenAI con Azure, Microsoft Foundry o OpenAI. Fabric no cobra por las llamadas a modelos a tu endpoint personalizado. Tu proveedor de LLM cobra por el uso de tokens, y los cargos de cálculo de Fabric siguen aplicándose. Para obtener más información sobre la configuración, consulte Personalización de las funciones de IA con Pandas y Personalización de las funciones de IA con PySpark.

Medidor de facturación

Las llamadas a funciones de IA a través del punto de conexión integrado de LLM de Fabric se cobran a su capacidad de Fabric según el medidor Copilot y AI. En la aplicación Métricas de capacidad de Microsoft Fabric, el uso aparece como la operación AI Functions.

Usage Medidor de facturación u operación
Llamadas a modelos a través del endpoint integrado de Fabric LLM Copilot y medidor de IA, notificados como AI Functions.
Llamadas a modelos a través de un punto final personalizado No hay cargo por llamada de modelo por parte de Fabric. Tu proveedor de LLM factura el uso de tokens.
Proceso de Spark que ejecuta un cuaderno o un trabajo de Spark Medidor de facturación de Spark.
Proceso de datos de Dataflow Gen2 que ejecuta transformaciones Uso de Dataflow Gen2.
Proceso de cálculo de consultas del almacén o del punto de conexión de análisis SQL Uso de Data Warehouse o del punto de conexión para análisis SQL.

Visualización de los costos y los gastos

Use la aplicación Capacity Metrics para supervisar el gasto y el impacto en la capacidad de AI Functions:

  1. Abra la aplicación Métricas de capacidad de Microsoft Fabric.
  2. Filtre por la capacidad, el área de trabajo y el intervalo de tiempo que ejecutó la carga de trabajo de AI Functions.
  3. En las vistas de nivel de operación, busque Funciones de IA bajo el medidor Copilot y AI.
  4. Compare la operación de AI Functions con Spark, Dataflow Gen2 o operaciones de almacenamiento para separar el consumo de llamadas de modelo del proceso que orquestaba la carga de trabajo.

Supervisión del uso del entorno de ejecución

Durante el desarrollo, use estadísticas de uso en tiempo de ejecución para calcular y validar el consumo antes de escalar una canalización.

En los cuadernos de pandas y PySpark, acceda a ai.stats de los resultados de la función de IA para ver los detalles de la ejecución y del uso de tokens, entre los que se incluyen:

  • num_successful, num_exceptions, num_unevaluated y num_harmful.
  • cached_tokens, input_tokens, output_tokens y reasoning_tokens.
  • client_type, input_typesy model.
# This code uses AI. Always review output for mistakes.

df["summary"] = df["text"].ai.summarize()
display(df["summary"].ai.stats)
display(df.ai.stats)

La salida podría ser similar a esta tabla:

num_successful num_exceptions num_unevaluated num_harmful tokens en caché input_tokens output_tokens reasoning_tokens client_type input_types model
2 0 0 0 0 555 4 0 fabric_llm_endpoint {"text": 2} gpt-5-mini

En los cuadernos de Pandas, establezca progress_bar_mode="stats" para mostrar estimaciones de unidades de capacidad y token en tiempo real mientras se ejecuta la función:

import synapse.ml.aifunc as aifunc

aifunc.default_conf.progress_bar_mode = "stats"

La barra de progreso muestra las estimaciones de entrada, entrada, salida y unidad de capacidad en caché activas y proyectadas y, a continuación, muestra los valores finales cuando se completa la operación. Consulte Modos de barra de progreso y Personalización de funciones de IA con PySpark.

Tasas de consumo

A menos que configure un modelo diferente, Python AI Functions para pandas y PySpark usan por defecto gpt-5-mini con reasoning_effort establecido en low. El consumo se basa en el uso del token. Los tokens de entrada, entrada almacenada en caché y salida pueden tener diferentes tasas.

Modelos de lenguaje

Modelo Nombre de implementación Ventana de Contexto (Tokens) Entrada (por 1000 tokens) Entrada almacenada en caché (por 1000 tokens) Salida (por cada 1000 tokens)
gpt-5.1-2025-11-13 gpt-5.1 400,000
Salida máxima: 128 000
42,02 segundos CU 4,20 segundos de CU 336,13 segundos CU
gpt-5-mini-2025-08-07 gpt-5-mini 400,000
Salida máxima: 128 000
8,40 segundos CU 0,84 segundos de CU 67,23 s CU

Inserción de modelos

Modelo Nombre de implementación Ventana de contexto (tokens) Entrada (por 1.000 tokens)
Ada text-embedding-ada-002 8,192 3,36 segundos de CU

Las tarifas de consumo están sujetas a cambios. Para consultar la lista completa de tarifas de consumo y la política de cambio de tarifas, consulta Tarifa de consumo en Foundry Tools de Fabric.

Guía de migración de modelos

Para las transformaciones más sofisticadas, puede configurar gpt-5.1 o ajustar reasoning_effort para usar más proceso para obtener resultados de mayor calidad. Para obtener más información sobre la configuración, consulte Personalización de las funciones de IA con Pandas y Personalización de las funciones de IA con PySpark.