Faturação para Funções de IA

As Funções de IA utilizam o endpoint do grande modelo de linguagem (LLM) integrado em Fabric para transformar e enriquecer os seus dados sem necessidade de configuração separada de endpoints. Este artigo explica o contador de faturação, as taxas de consumo e as opções de monitorização de utilização para esse endpoint incorporado.

Importante

Este artigo aplica-se a Funções de IA que utilizam o endpoint Fabric LLM incorporado. Para pandas e PySpark, pode trazer o seu próprio modelo através de um endpoint personalizado Azure OpenAI, Microsoft Foundry ou OpenAI. O Fabric não cobra pelas chamadas de modelo ao teu endpoint personalizado. O seu fornecedor de LLM cobra pelo uso de tokens, e as taxas de computação do Fabric continuam a aplicar-se. Para detalhes de configuração, veja Personalizar Funções de IA com pandas e Personalizar Funções de IA com PySpark.

Contador de faturação

As chamadas de função de IA através do endpoint LLM incorporado do Fabric são cobradas à capacidade do Fabric no medidor Copilot and AI. Na aplicação Microsoft Fabric Capacity Metrics, o uso aparece como a operação AI Functions.

Usage Medidor de faturação ou operação
Chamadas de modelo através do endpoint Fabric LLM incorporado Copilot e medidor de IA, reportados como Funções de IA.
Chamadas de modelo através de um endpoint personalizado Sem cobrança de chamada de modelo da Fabric. O seu fornecedor de LLM fatura a utilização de tokens.
Computação Spark que executa um notebook ou um trabalho Spark Contador de faturação Spark.
Cálculo de fluxo de dados Gen2 que executa transformações Utilização de Dataflow Gen2.
Computação de consultas do armazém de dados ou do endpoint de análise SQL Utilização do Data Warehouse ou do endpoint de análise SQL.

Ver custos e despesas

Use a aplicação Métricas de Capacidade para monitorizar os gastos e o impacto na capacidade das Funções de IA:

  1. Abra o aplicativo Microsoft Fabric Capacity Metrics.
  2. Filtre por capacidade, espaço de trabalho e intervalo de tempo em que foi executada a carga de trabalho do AI Functions.
  3. Nas vistas ao nível da operação, procure Funções de IA no medidor Copilot e IA.
  4. Compare a operação das Funções de IA com as operações do Spark, Dataflow Gen2 ou warehouse para separar o consumo de chamadas de modelo do cálculo que orquestrou a carga de trabalho.

Monitorizar a utilização em tempo de execução

Durante o desenvolvimento, utilize estatísticas de utilização em tempo de execução para estimar e validar o consumo antes de escalar um pipeline.

Em notebooks do pandas e do PySpark, aceda a ai.stats nos resultados das funções de IA para ver detalhes de execução e sobre a utilização de tokens, incluindo:

  • num_successful, num_exceptions, num_unevaluated e num_harmful.
  • cached_tokens, input_tokens, output_tokens e reasoning_tokens.
  • client_type, input_typese model.
# This code uses AI. Always review output for mistakes.

df["summary"] = df["text"].ai.summarize()
display(df["summary"].ai.stats)
display(df.ai.stats)

A saída pode ser esta tabela:

num_successful num_exceptions num_unevaluated num_harmful cached_tokens input_tokens output_tokens fatores_de_razonamento tipo_de_cliente input_types modelo
2 0 0 0 0 555 4 0 fabric_llm_endpoint {"text": 2} GPT-5-Mini

Nos notebooks do pandas, defina progress_bar_mode="stats" para mostrar estimativas, em tempo real, de tokens e de unidades de capacidade enquanto a função está em execução:

import synapse.ml.aifunc as aifunc

aifunc.default_conf.progress_bar_mode = "stats"

A barra de progresso mostra estimativas em tempo real e projetadas da entrada em cache, da entrada, da saída e das unidades de capacidade, e depois mostra os valores finais quando a operação estiver concluída. Veja os modos da barra de progresso e Personalizar Funções de IA com o PySpark.

Taxas de consumo

A menos que configure um modelo diferente, as Funções de IA do Python para pandas e PySpark utilizam por predefinição gpt-5-mini, com reasoning_effort definido para low. O consumo baseia-se no uso de tokens. Os tokens de entrada, os tokens de entrada em cache e os tokens de saída podem ter taxas diferentes.

Modelos linguísticos

Modelo Nome da implantação Janela de Contexto (Tokens) Entrada (por 1.000 tokens) Entrada em cache (por 1.000 tokens) Saída (por 1.000 tokens)
GPT-5.1-2025-11-13 gpt-5.1 400,000
Saída máxima: 128.000
42,02 segundos CU 4,20 segundos CU 336,13 segundos CU
gpt-5-mini-2025-08-07 gpt-5-mini 400,000
Saída máxima: 128.000
8,40 CU segundos 0,84 segundos de CU 67,23 segundos CU

Incorporação de modelos

Modelo Nome da implantação Janela de contexto (tokens) Entrada (por 1.000 tokens)
Ada text-embedding-ada-002 8,192 3,36 segundos CU

As taxas de consumo estão sujeitas a alterações. Para a lista completa de taxas de consumo e política de alteração de taxas, consulte Taxa de consumo em Foundry Tools in Fabric.

Orientação para migração de modelos

Para transformações mais sofisticadas, pode configurar gpt-5.1 ou ajustar reasoning_effort para usar mais computação e obter resultados de maior qualidade. Para detalhes de configuração, veja Personalizar Funções de IA com pandas e Personalizar Funções de IA com PySpark.