Cobrança para funções de IA

AI Functions usa o endpoint integrado do modelo de linguagem grande (LLM) hospedado no Fabric para transformar e enriquecer seus dados sem a necessidade de configurar um endpoint separadamente. Este artigo explica o medidor de faturamento, as taxas de consumo e as opções de monitoramento de uso para esse endpoint integrado.

Importante

Este artigo se aplica a Funções de IA que usam o endpoint interno do Fabric LLM. Para pandas e PySpark, você pode trazer seu próprio modelo por um endpoint personalizado com Azure OpenAI, Microsoft Foundry ou OpenAI. O Fabric não cobra por chamadas de modelo para seu endpoint personalizado. Seu provedor de LLM cobra pelo uso de tokens, e as taxas de computação do Fabric ainda se aplicam. Para obter detalhes de instalação, consulte Personalizar funções de IA com pandas e personalizar funções de IA com o PySpark.

Medidor de faturamento

As chamadas de função de IA por meio do endpoint interno de LLM do Fabric são cobradas da sua capacidade do Fabric na métrica Copilot e IA. No aplicativo Métricas de Capacidade do Microsoft Fabric, o uso aparece como a operação AI Functions.

Usage Medidor ou operação de cobrança
Chamadas de modelo pelo endpoint Fabric LLM embutido Copilot e medidor de IA, informados como AI Functions.
Chamadas de modelo por meio de um endpoint personalizado Sem cobrança de chamada de modelo da Fabric. Seu provedor de LLM cobra o uso do token.
Ambiente de computação do Spark que executa um notebook ou job do Spark Medidor de faturamento do Spark.
Computação do Dataflow Gen2 que executa transformações Uso do Dataflow Gen2.
Computação de consulta do endpoint de análise SQL ou do warehouse Uso do Data Warehouse ou do endpoint de análise SQL.

Exibir custos e gastos

Use o aplicativo Métricas de Capacidade para monitorar os gastos e o impacto da capacidade do AI Functions:

  1. Abra o aplicativo Métricas de Capacidade do Microsoft Fabric.
  2. Filtre pela capacidade, pelo espaço de trabalho e pelo intervalo de tempo em que a carga de trabalho das Funções de IA foi executada.
  3. Em exibições no nível da operação, procure Funções de IA sob o medidor Copilot e IA.
  4. Compare a operação do AI Functions com as operações Spark, Dataflow Gen2 ou warehouse para separar o consumo de chamada de modelo da computação que orquestrou a carga de trabalho.

Monitorar o uso do runtime

Durante o desenvolvimento, use estatísticas de uso de runtime para estimar e validar o consumo antes de dimensionar um pipeline.

Nos notebooks do pandas e do PySpark, acesse ai.stats nos resultados da função de IA para visualizar detalhes de execução e uso de tokens, incluindo:

  • num_successful, num_exceptions, num_unevaluated e num_harmful.
  • cached_tokens, input_tokens, output_tokens e reasoning_tokens.
  • client_type, input_typese model.
# This code uses AI. Always review output for mistakes.

df["summary"] = df["text"].ai.summarize()
display(df["summary"].ai.stats)
display(df.ai.stats)

A saída pode ser semelhante a esta tabela:

num_successful num_exceptions num_unevaluated num_harmful cached_tokens input_tokens output_tokens reasoning_tokens client_type input_types modelo
2 0 0 0 0 555 4 0 fabric_llm_endpoint {"text": 2} gpt-5-mini

Nos notebooks do pandas, defina progress_bar_mode="stats" para mostrar estimativas em tempo real de tokens e de unidades de capacidade durante a execução da função:

import synapse.ml.aifunc as aifunc

aifunc.default_conf.progress_bar_mode = "stats"

A barra de progresso mostra estimativas dinâmicas e projetadas de entrada, entrada, saída e unidade de capacidade em cache e mostra os valores finais quando a operação é concluída. Consulte modos da barra de progresso e Personalizar funções de IA com PySpark.

Taxas de consumo

A menos que você configure um modelo diferente, Python AI Functions para pandas e PySpark usam gpt-5-mini por padrão, com reasoning_effort definido como low. O consumo é baseado no uso de token. Tokens de entrada, entrada em cache e saída podem ter taxas diferentes.

Modelos de linguagem

Modelo Nome da implantação Janela de Contexto (Tokens) Entrada (por 1.000 tokens) Entrada armazenada em cache (por 1.000 tokens) Saída (por 1.000 tokens)
gpt-5.1-2025-11-13 gpt-5.1 400,000
Saída máxima: 128.000
42,02 segundos CU 4,20 segundos CU 336,13 segundos CU
gpt-5-mini-2025-08-07 gpt-5-mini 400,000
Saída máxima: 128.000
8,40 segundos de CU 0,84 segundos de CU 67,23 segundos de UC

Inserindo modelos

Modelo Nome da implantação Janela de contexto (tokens) Entrada (por 1.000 tokens)
Ada text-embedding-ada-002 8,192 3,36 segundos CU

As taxas de consumo estão sujeitas a alterações. Para obter a lista completa das taxas de consumo e a política de alteração das taxas, consulte Taxa de consumo nas Ferramentas do Foundry no Fabric.

Diretrizes para migração de modelos

Para transformações mais sofisticadas, você pode configurar gpt-5.1 ou ajustar reasoning_effort para usar mais computação para resultados de maior qualidade. Para obter detalhes de instalação, consulte Personalizar funções de IA com pandas e personalizar funções de IA com o PySpark.