Aplicar limites de taxa aos serviços modelo e MCP

Esta página descreve como configurar limites de taxa para os serviços de IA do Unity AI Gateway . Os limites de tarifa permitem aplicar limites de consumo num serviço modelo ou serviço MCP para gerir a capacidade e os custos.

Os limites de taxa fazem parte da configuração de um serviço. Podes defini-los na interface ou programaticamente quando criares ou atualizares um serviço de modelo ou serviço MCP com a API REST, os SDKs do Azure Databricks, a CLI do Azure Databricks ou o Terraform.

Requirements

  • Um espaço de trabalho Azure Databricks numa região suportada por Unity AI Gateway.

Configurar limites de taxa num serviço modelo ou serviço MCP

Pode definir limites de taxa com base em pedidos por minuto (QPM) ou tokens por minuto (TPM), dependendo do tipo de serviço:

  • Serviços modelo: Definir limites de pedidos por minuto (QPM) e tokens por minuto (TPM).
  • Serviços MCP: Definir limites de pedidos por minuto (QPM). Os limites baseados em tokens não se aplicam aos serviços MCP.

Para ativar limites de taxa, selecione Limites de taxa ao configurar o seu serviço modelo ou serviço MCP. Pode definir limites de taxa nos seguintes níveis:

Field Description
Serviço Especifique o QPM ou TPM máximo que todo o serviço pode suportar. Este limite aplica-se a todo o tráfego, independentemente do utilizador.
Utilizador (Padrão) Especifique um limite padrão de taxa por utilizador que se aplique a todos os utilizadores do serviço, a menos que seja definido um limite de tarifa personalizado mais específico.
Limites de taxa alfandegária Os limites de taxa personalizados podem ser especificados para:
  • Utilizadores individuais ou principais de serviço: Estes têm prioridade sobre os limites de taxa personalizada dos grupos de utilizadores.
  • Grupos de utilizadores: Este limite é um limite de taxa partilhado para todos os membros do grupo.

Detalhes e comportamento

  • Os limites de taxa aplicam-se apenas a utilizadores com permissão para consultar o serviço.
  • Por defeito, não existem limites de taxa configurados para utilizadores ou para o serviço.
  • O limite de taxa de serviço é um máximo global. Se este limite for ultrapassado, todos os pedidos ao serviço são bloqueados, independentemente de quaisquer limites de taxa específicos do utilizador ou do grupo.
  • Se um serviço, utilizador ou principal de serviço tiver especificados tanto um limite de taxa baseado em pedidos como um limite de taxa baseado em tokens, é aplicado o limite de taxa mais restritivo.
  • Os limites de taxa personalizados sobrepõem-se ao limite de taxa do Utilizador (Padrão ).
    • Se um usuário pertencer a um limite específico do usuário e a um limite específico do grupo, o limite específico do usuário será imposto.
    • Se um utilizador pertence a vários grupos de utilizadores com diferentes limites de taxa QPM ou TPM, ele é sujeito a limites se exceder todos os limites de taxa QPM ou todos os limites de taxa TPM nos seus grupos de utilizadores.

Comportamento do limitador de taxa

Quando um limite de taxa é ultrapassado, o serviço devolve uma resposta HTTP 429 (Pedidos a Mais). Os clientes devem implementar lógica de retentativa com recuo exponencial.

O limitador de taxa foi concebido para baixa latência, o que significa que se esperam os seguintes comportamentos:

  • Pedidos simultâneos não são verificados antecipadamente. O sistema regista o uso após o envio de uma resposta, por isso, se vários pedidos chegarem ao mesmo tempo, todos podem ser processados antes de o uso ser contado. Pedidos posteriores são então rejeitados até que a capacidade recupere. Na prática, pode ver surtos de trânsito seguidos de breves pausas num padrão repetitivo.
  • Os limites são aplicados de forma independente entre as instâncias do serviço, pelo que podem ocorrer pequenos períodos ligeiramente acima do limite configurado, especialmente logo após a criação ou atualização de um serviço.

Ao longo de uma janela de tempo mais longa, a taxa média de pedidos converge para o limite configurado.

Limitações

  • Pode especificar um máximo de 20 limites de tarifa por serviço.
  • Pode especificar um máximo de 5 limites de tarifa específicos de grupo por serviço.

Recursos adicionais