Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
AI Functions usa o endpoint integrado do modelo de linguagem grande (LLM) hospedado no Fabric para transformar e enriquecer seus dados sem a necessidade de configurar um endpoint separadamente. Este artigo explica o medidor de faturamento, as taxas de consumo e as opções de monitoramento de uso para esse endpoint integrado.
Importante
Este artigo se aplica a Funções de IA que usam o endpoint interno do Fabric LLM. Para pandas e PySpark, você pode trazer seu próprio modelo por um endpoint personalizado com Azure OpenAI, Microsoft Foundry ou OpenAI. O Fabric não cobra por chamadas de modelo para seu endpoint personalizado. Seu provedor de LLM cobra pelo uso de tokens, e as taxas de computação do Fabric ainda se aplicam. Para obter detalhes de instalação, consulte Personalizar funções de IA com pandas e personalizar funções de IA com o PySpark.
Medidor de faturamento
As chamadas de função de IA por meio do endpoint interno de LLM do Fabric são cobradas da sua capacidade do Fabric na métrica Copilot e IA. No aplicativo Métricas de Capacidade do Microsoft Fabric, o uso aparece como a operação AI Functions.
| Usage | Medidor ou operação de cobrança |
|---|---|
| Chamadas de modelo pelo endpoint Fabric LLM embutido | Copilot e medidor de IA, informados como AI Functions. |
| Chamadas de modelo por meio de um endpoint personalizado | Sem cobrança de chamada de modelo da Fabric. Seu provedor de LLM cobra o uso do token. |
| Ambiente de computação do Spark que executa um notebook ou job do Spark | Medidor de faturamento do Spark. |
| Computação do Dataflow Gen2 que executa transformações | Uso do Dataflow Gen2. |
| Computação de consulta do endpoint de análise SQL ou do warehouse | Uso do Data Warehouse ou do endpoint de análise SQL. |
Exibir custos e gastos
Use o aplicativo Métricas de Capacidade para monitorar os gastos e o impacto da capacidade do AI Functions:
- Abra o aplicativo Métricas de Capacidade do Microsoft Fabric.
- Filtre pela capacidade, pelo espaço de trabalho e pelo intervalo de tempo em que a carga de trabalho das Funções de IA foi executada.
- Em exibições no nível da operação, procure Funções de IA sob o medidor Copilot e IA.
- Compare a operação do AI Functions com as operações Spark, Dataflow Gen2 ou warehouse para separar o consumo de chamada de modelo da computação que orquestrou a carga de trabalho.
Monitorar o uso do runtime
Durante o desenvolvimento, use estatísticas de uso de runtime para estimar e validar o consumo antes de dimensionar um pipeline.
Nos notebooks do pandas e do PySpark, acesse ai.stats nos resultados da função de IA para visualizar detalhes de execução e uso de tokens, incluindo:
-
num_successful,num_exceptions,num_unevaluatedenum_harmful. -
cached_tokens,input_tokens,output_tokensereasoning_tokens. -
client_type,input_typesemodel.
# This code uses AI. Always review output for mistakes.
df["summary"] = df["text"].ai.summarize()
display(df["summary"].ai.stats)
display(df.ai.stats)
A saída pode ser semelhante a esta tabela:
| num_successful | num_exceptions | num_unevaluated | num_harmful | cached_tokens | input_tokens | output_tokens | reasoning_tokens | client_type | input_types | modelo |
|---|---|---|---|---|---|---|---|---|---|---|
| 2 | 0 | 0 | 0 | 0 | 555 | 4 | 0 | fabric_llm_endpoint | {"text": 2} |
gpt-5-mini |
Nos notebooks do pandas, defina progress_bar_mode="stats" para mostrar estimativas em tempo real de tokens e de unidades de capacidade durante a execução da função:
import synapse.ml.aifunc as aifunc
aifunc.default_conf.progress_bar_mode = "stats"
A barra de progresso mostra estimativas dinâmicas e projetadas de entrada, entrada, saída e unidade de capacidade em cache e mostra os valores finais quando a operação é concluída. Consulte modos da barra de progresso e Personalizar funções de IA com PySpark.
Taxas de consumo
A menos que você configure um modelo diferente, Python AI Functions para pandas e PySpark usam gpt-5-mini por padrão, com reasoning_effort definido como low. O consumo é baseado no uso de token. Tokens de entrada, entrada em cache e saída podem ter taxas diferentes.
Modelos de linguagem
| Modelo | Nome da implantação | Janela de Contexto (Tokens) | Entrada (por 1.000 tokens) | Entrada armazenada em cache (por 1.000 tokens) | Saída (por 1.000 tokens) |
|---|---|---|---|---|---|
| gpt-5.1-2025-11-13 | gpt-5.1 |
400,000 Saída máxima: 128.000 |
42,02 segundos CU | 4,20 segundos CU | 336,13 segundos CU |
| gpt-5-mini-2025-08-07 | gpt-5-mini |
400,000 Saída máxima: 128.000 |
8,40 segundos de CU | 0,84 segundos de CU | 67,23 segundos de UC |
Inserindo modelos
| Modelo | Nome da implantação | Janela de contexto (tokens) | Entrada (por 1.000 tokens) |
|---|---|---|---|
| Ada | text-embedding-ada-002 |
8,192 | 3,36 segundos CU |
As taxas de consumo estão sujeitas a alterações. Para obter a lista completa das taxas de consumo e a política de alteração das taxas, consulte Taxa de consumo nas Ferramentas do Foundry no Fabric.
Diretrizes para migração de modelos
Para transformações mais sofisticadas, você pode configurar gpt-5.1 ou ajustar reasoning_effort para usar mais computação para resultados de maior qualidade. Para obter detalhes de instalação, consulte Personalizar funções de IA com pandas e personalizar funções de IA com o PySpark.