Pagamento prioritário por token para APIs de modelo fundacional

Esta página descreve o modelo de pagamento por token com prioridade para APIs Foundation Model com pagamento por token, incluindo como ele funciona e como enviar solicitações prioritárias.

O que é pagamento prioritário por token?

O pagamento por token prioritário, também chamado de modo prioritário, é um recurso de pagamento por token para aplicações em tempo real sensíveis à latência. Ao enviar uma solicitação com o parâmetro service_tier definido como "priority", o Azure Databricks aceita a solicitação com prioridade em relação ao tráfego padrão de "melhor esforço" (best-effort) com cobrança por token no mesmo modelo. Isso mantém a disponibilidade mais consistente durante períodos de alto tráfego.

O pagamento prioritário por token é opcional para cada solicitação, então você pode enviar solicitações prioritárias e padrão para o mesmo modelo. Ele não requer nenhum compromisso de capacidade e é cobrado a uma taxa por token maior do que as solicitações padrão de pagamento por token.

O Databricks recomenda o modo de prioridade quando:

  • Você precisa de desempenho e disponibilidade mais consistentes do que o pagamento padrão por token, mas não está pronto para se comprometer com a capacidade dedicada.
  • Seus aplicativos de produção exigem maior disponibilidade.

Modelos com suporte

Os seguintes modelos de pagamento por token dão suporte ao modo de prioridade. Para enviar uma solicitação prioritária, use o nome do endpoint do modelo com o parâmetro service_tier definido como "priority".

Importante

O pagamento por token prioritário está disponível para modelos OpenAI e Google Gemini por meio dos Serviços ADI, fornecidos pelo Databricks. Para acessar esses modelos de parceiro em seu ambiente de Azure Databricks, consulte ADI Services.

Modelos de software livre

Provider Model Nome de endpoint Notes
Alibaba Cloud Qwen3.5 122B A10B databricks-qwen35-122b-a10b
  • Esse modelo está disponível na versão prévia. Entre em contato com suas equipes de conta para obter capacitação.
  • Disponível somente na westeurope região.

Como o pagamento prioritário por token se comporta

Considere o seguinte comportamento antes de usar o pagamento prioritário por token:

  • Desempenho e disponibilidade consistentes. O pagamento prioritário por token foi projetado para manter a disponibilidade estável sob alta carga. Isso não garante uma meta específica de tempo até o primeiro token nem de latência de ponta a ponta. As solicitações de prioridade visam uma disponibilidade maior do que as solicitações padrão de pagamento por token. Azure Databricks define a disponibilidade em uma camada como o número de solicitações bem-sucedidas divididas pelo número total de solicitações admitidas nessa camada.
  • Capacidade de melhor esforço. O modo de prioridade não reserva capacidade e não há compromisso de capacidade.
  • Recorrer ao modelo padrão de pagamento por token. Se a capacidade prioritária estiver totalmente ocupada, as solicitações são atendidas com base na disponibilidade padrão de pagamento por token e cobradas pelas tarifas padrão de pagamento por token.
  • Prêmio por token. As solicitações prioritárias são cobradas a uma taxa por token mais alta do que as solicitações padrão de pagamento por token.

Pagamento por token prioritário em comparação com a vazão provisionada

Tanto o pagamento prioritário por token quanto a vazão provisionada são voltados para cargas de trabalho em produção, mas envolvem diferentes concessões:

Consideration Pagamento prioritário por token Capacidade provisionada
Capacity Melhor esforço, compartilhado. Capacidade dedicada e reservada.
Compromisso Nenhum. Ativar mediante solicitação. Requer um endpoint provisionado.
Disponibilidade Mais consistente do que o modelo padrão de pagamento por token sob carga. Previsível, com base na capacidade reservada.
Billing Por token, com um valor adicional em relação à tarifa padrão por token. Com base em unidades de modelo provisionadas.

Enviar uma solicitação de prioridade

Para usar o modo de prioridade, defina o parâmetro service_tier para "priority" por solicitação. O exemplo a seguir usa o cliente OpenAI:

from databricks_openai import DatabricksOpenAI

client = DatabricksOpenAI()

response = client.chat.completions.create(
    model="databricks-model-name",
    messages=[
      {
        "role": "user",
        "content": "What is a mixture of experts model?",
      }
    ],
    max_tokens=256,
    service_tier="priority",
)

Consulte Referência da API REST de modelos de base para a sintaxe de parâmetros e Usar modelos de base para mais opções de consulta.

Limites de capacidade

Cada cluster suporta um número máximo total de tokens por minuto, considerando todos os locatários. Azure Databricks define um limite por locatário durante a integração para que um único locatário não possa consumir toda a capacidade do cluster. Se sua carga de trabalho exigir mais capacidade do que o limite por locatário permite, entre em contato com sua equipe de conta do Databricks.

Para obter mais limites de APIs do Modelo de Base, consulte os limites e cotas das APIs do Modelo de Fundação.

Recursos adicionais