Aplicar limites de taxa aos serviços modelo e MCP

Esta página descreve como configurar limites de taxa para os serviços de IA do Gateway de IA do Unity. Os limites de taxa permitem impor limites de consumo em um serviço de modelo ou serviço MCP para gerenciar a capacidade e os custos.

Limites de taxa fazem parte da configuração de um serviço. Você pode configurá-los na interface ou programaticamente ao criar ou atualizar um serviço de modelo ou serviço MCP com a API REST, os SDKs do Azure Databricks, a CLI do Azure Databricks ou o Terraform.

Requirements

  • Um workspace do Azure Databricks em uma região suportada pelo Gateway de IA Unity.

Configurar limites de taxa em um serviço de modelo ou serviço MCP

Você pode definir limites de taxa com base em solicitações por minuto (QPM) ou tokens por minuto (TPM), dependendo do tipo de serviço:

  • Serviços de modelo: definir limites de solicitações por minuto (QPM) e tokens por minuto (TPM).
  • Serviços mcp: definir limites de solicitações por minuto (QPM). Os limites baseados em token não se aplicam aos serviços MCP.

Para habilitar os limites de taxa, selecione Limites de taxa ao configurar seu serviço de modelo ou serviço MCP. Você pode definir limites de taxa nos seguintes níveis:

Campo Descrição
Serviço Especifique o máximo de QPM ou TPM que todo o serviço pode manipular. Esse limite se aplica a todo o tráfego, independentemente do usuário.
Usuário (Padrão) Especifique um limite de taxa por usuário padrão que se aplique a todos os usuários do serviço, a menos que um limite de taxa personalizado mais específico seja definido.
Limites de taxa personalizados Limites de taxa personalizados podem ser especificados para:
  • Usuários individuais ou entidades de serviço: têm prioridade sobre os limites de taxa personalizados do grupo de usuários.
  • Grupos de usuários: esse limite é um limite de taxa compartilhado para todos os membros do grupo.

Detalhes e comportamento

  • Os limites de taxa se aplicam somente aos usuários com permissão para consultar o serviço.
  • Por padrão, não há limites de taxa configurados para os usuários ou o serviço.
  • O limite de taxa de serviço é um máximo global. Se esse limite for excedido, todas as solicitações para o serviço serão bloqueadas, independentemente dos limites de taxa específicos do usuário ou do grupo.
  • Se um serviço, um usuário ou uma entidade de serviço tiver um limite de taxa baseado em solicitação e um limite de taxa baseado em token especificado, o limite de taxa mais restritivo será imposto.
  • Os limites de taxa personalizados substituem o limite de taxa de Usuário (Padrão).
    • Se um usuário pertencer a um limite específico do usuário e a um limite específico do grupo, o limite específico do usuário será imposto.
    • Se um usuário pertencer a vários grupos de usuários com diferentes limites de taxa de QPM ou TPM, o usuário será limitado se exceder todos os limites de taxa do QPM ou todos os limites de taxa do TPM de seus grupos de usuários.

Comportamento do limitador de taxa

Quando um limite de taxa é excedido, o serviço retorna uma resposta HTTP 429 (Muitas Solicitações). Os clientes devem implementar a lógica de nova tentativa com recuo exponencial.

O limitador de taxa foi projetado para baixa latência, o que significa que os seguintes comportamentos são esperados:

  • As solicitações simultâneas não são verificadas antecipadamente. O sistema registra o uso depois que uma resposta é enviada, portanto, se várias solicitações chegarem ao mesmo momento, todas elas poderão passar antes que o uso seja contado. As solicitações posteriores são rejeitadas até que a capacidade seja recuperada. Na prática, você pode ver intermitências de tráfego seguidas por breves pausas em um padrão recorrente.
  • Os limites são impostos independentemente entre instâncias de serviço, portanto, intermitências curtas ligeiramente acima do limite configurado podem ocorrer, especialmente logo após um serviço ser criado ou atualizado.

Em uma janela de tempo mais longa, a taxa média de solicitação converge para o limite configurado.

Limitations

  • Você pode especificar um máximo de 20 limites de taxa por serviço.
  • Você pode especificar um máximo de cinco limites de taxa específicos de grupo por serviço.

Recursos adicionais