Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
As Funções de IA utilizam o endpoint do grande modelo de linguagem (LLM) integrado em Fabric para transformar e enriquecer os seus dados sem necessidade de configuração separada de endpoints. Este artigo explica o contador de faturação, as taxas de consumo e as opções de monitorização de utilização para esse endpoint incorporado.
Importante
Este artigo aplica-se a Funções de IA que utilizam o endpoint Fabric LLM incorporado. Para pandas e PySpark, pode trazer o seu próprio modelo através de um endpoint personalizado Azure OpenAI, Microsoft Foundry ou OpenAI. O Fabric não cobra pelas chamadas de modelo ao teu endpoint personalizado. O seu fornecedor de LLM cobra pelo uso de tokens, e as taxas de computação do Fabric continuam a aplicar-se. Para detalhes de configuração, veja Personalizar Funções de IA com pandas e Personalizar Funções de IA com PySpark.
Contador de faturação
As chamadas de função de IA através do endpoint LLM incorporado do Fabric são cobradas à capacidade do Fabric no medidor Copilot and AI. Na aplicação Microsoft Fabric Capacity Metrics, o uso aparece como a operação AI Functions.
| Usage | Medidor de faturação ou operação |
|---|---|
| Chamadas de modelo através do endpoint Fabric LLM incorporado | Copilot e medidor de IA, reportados como Funções de IA. |
| Chamadas de modelo através de um endpoint personalizado | Sem cobrança de chamada de modelo da Fabric. O seu fornecedor de LLM fatura a utilização de tokens. |
| Computação Spark que executa um notebook ou um trabalho Spark | Contador de faturação Spark. |
| Cálculo de fluxo de dados Gen2 que executa transformações | Utilização de Dataflow Gen2. |
| Computação de consultas do armazém de dados ou do endpoint de análise SQL | Utilização do Data Warehouse ou do endpoint de análise SQL. |
Ver custos e despesas
Use a aplicação Métricas de Capacidade para monitorizar os gastos e o impacto na capacidade das Funções de IA:
- Abra o aplicativo Microsoft Fabric Capacity Metrics.
- Filtre por capacidade, espaço de trabalho e intervalo de tempo em que foi executada a carga de trabalho do AI Functions.
- Nas vistas ao nível da operação, procure Funções de IA no medidor Copilot e IA.
- Compare a operação das Funções de IA com as operações do Spark, Dataflow Gen2 ou warehouse para separar o consumo de chamadas de modelo do cálculo que orquestrou a carga de trabalho.
Monitorizar a utilização em tempo de execução
Durante o desenvolvimento, utilize estatísticas de utilização em tempo de execução para estimar e validar o consumo antes de escalar um pipeline.
Em notebooks do pandas e do PySpark, aceda a ai.stats nos resultados das funções de IA para ver detalhes de execução e sobre a utilização de tokens, incluindo:
-
num_successful,num_exceptions,num_unevaluatedenum_harmful. -
cached_tokens,input_tokens,output_tokensereasoning_tokens. -
client_type,input_typesemodel.
# This code uses AI. Always review output for mistakes.
df["summary"] = df["text"].ai.summarize()
display(df["summary"].ai.stats)
display(df.ai.stats)
A saída pode ser esta tabela:
| num_successful | num_exceptions | num_unevaluated | num_harmful | cached_tokens | input_tokens | output_tokens | fatores_de_razonamento | tipo_de_cliente | input_types | modelo |
|---|---|---|---|---|---|---|---|---|---|---|
| 2 | 0 | 0 | 0 | 0 | 555 | 4 | 0 | fabric_llm_endpoint | {"text": 2} |
GPT-5-Mini |
Nos notebooks do pandas, defina progress_bar_mode="stats" para mostrar estimativas, em tempo real, de tokens e de unidades de capacidade enquanto a função está em execução:
import synapse.ml.aifunc as aifunc
aifunc.default_conf.progress_bar_mode = "stats"
A barra de progresso mostra estimativas em tempo real e projetadas da entrada em cache, da entrada, da saída e das unidades de capacidade, e depois mostra os valores finais quando a operação estiver concluída. Veja os modos da barra de progresso e Personalizar Funções de IA com o PySpark.
Taxas de consumo
A menos que configure um modelo diferente, as Funções de IA do Python para pandas e PySpark utilizam por predefinição gpt-5-mini, com reasoning_effort definido para low. O consumo baseia-se no uso de tokens. Os tokens de entrada, os tokens de entrada em cache e os tokens de saída podem ter taxas diferentes.
Modelos linguísticos
| Modelo | Nome da implantação | Janela de Contexto (Tokens) | Entrada (por 1.000 tokens) | Entrada em cache (por 1.000 tokens) | Saída (por 1.000 tokens) |
|---|---|---|---|---|---|
| GPT-5.1-2025-11-13 | gpt-5.1 |
400,000 Saída máxima: 128.000 |
42,02 segundos CU | 4,20 segundos CU | 336,13 segundos CU |
| gpt-5-mini-2025-08-07 | gpt-5-mini |
400,000 Saída máxima: 128.000 |
8,40 CU segundos | 0,84 segundos de CU | 67,23 segundos CU |
Incorporação de modelos
| Modelo | Nome da implantação | Janela de contexto (tokens) | Entrada (por 1.000 tokens) |
|---|---|---|---|
| Ada | text-embedding-ada-002 |
8,192 | 3,36 segundos CU |
As taxas de consumo estão sujeitas a alterações. Para a lista completa de taxas de consumo e política de alteração de taxas, consulte Taxa de consumo em Foundry Tools in Fabric.
Orientação para migração de modelos
Para transformações mais sofisticadas, pode configurar gpt-5.1 ou ajustar reasoning_effort para usar mais computação e obter resultados de maior qualidade. Para detalhes de configuração, veja Personalizar Funções de IA com pandas e Personalizar Funções de IA com PySpark.