Limites e cotas dos Modelos Microsoft Foundry

Este artigo fornece uma referência rápida e uma descrição detalhada das cotas e limites para modelos Foundry vendidos por Azure. Para cotas e limites específicos do OpenAI do Azure em Modelos da Fábrica, consulte Cotas e limites no OpenAI do Azure.

Gerenciamento de cotas no nível da assinatura

Importante

O gerenciamento de cotas no nível da assinatura no Microsoft Foundry começou após 7 de maio de 2026.

Começando por Tradução em Tempo Real e Transcrição em Tempo Real e, em breve, todos os modelos, o Foundry controla a cota de implantações no nível da assinatura, em vez de por recurso ou por região. Essa abordagem traz consistência e previsibilidade para como a cota é gerenciada entre implantações, já que todos os recursos e regiões em uma assinatura compartilham o mesmo pool de cotas.

Essa alteração consolida a cota em pools compartilhados:

  • Padrão global: As implantações do mesmo modelo e versão compartilham um mesmo conjunto de cotas em todas as regiões de uma assinatura.
  • Data Zone Standard: implantações do mesmo modelo e de versão compartilham um pool de cotas por zona de dados (por exemplo, EUA ou UE).

Verificar o escopo do gerenciamento de cotas

Você pode encontrar o sistema de gerenciamento de cotas que se aplica a um determinado modelo acessando a página cota do portal do Foundry. O valor na coluna Escopo de um determinado modelo indica como o Foundry gerencia a cota para esse modelo. Um valor de Escopo de:

  • Global ou Data Zone indica o gerenciamento de cotas no nível da assinatura.
  • Uma região (por exemplo, Leste dos EUA ou Oeste dos EUA), indica o gerenciamento de cotas por região para essa assinatura e modelo.

Alterações para modelos integrados

Para os modelos que são integrados ao sistema de gerenciamento de cotas em nível de assinatura:

  • Todas as implantações do padrão global do mesmo modelo e versão sob uma assinatura agora utilizam um pool de cotas compartilhado único em todas as regiões.
  • Todas as implantações padrão da zona de dados do mesmo modelo e versão sob a mesma assinatura agora utilizam um pool de cotas comum em cada zona de dados.
  • A cota aprovada existente é retida e se aplica automaticamente no nível da assinatura— nenhuma ação necessária.

Essa consolidação permite que Microsoft Foundry ofereçam modelos compatíveis em todas as regiões do Foundry, independentemente de como a cota é distribuída entre recursos ou regiões.

Limites de cota quando um modelo é atualizado

Quando um modelo existente é atualizado, seu novo limite de cota global ou de zona de dados é definido como o maior de:

  • O limite do nível aplicável.
  • A cota total atribuída a todas as implantações existentes desse modelo dentro do escopo de cota.

Por exemplo, se um modelo tiver implantações Padrão Global em cinco regiões, o novo limite de cota global será igual à cota combinada dessas implantações se esse total exceder o limite de camadas. Caso contrário, o limite de camada se aplicará.

Referência de cotas e limites

Importante

Esta seção aborda a cota de modelos que não estão integrados ao sistema de gerenciamento de cotas no nível da assinatura. Para modelos integrados, consulte Gerenciamento de cotas em nível de assinatura.

As seções a seguir fornecem um guia rápido sobre as cotas e limites padrão que se aplicam aos Modelos do Foundry. Cotas e limites não são impostos no nível do locatário. Em vez disso, o nível mais alto de restrições de cota é definido no nível de assinatura Azure. Os tokens por minuto (TPM) e os limites de RPM (solicitações por minuto) são definidos por região, por assinatura e por modelo ou tipo de implantação.

Limites de recursos (por assinatura Azure, por região)

Nome do limite Valor limite
Recursos de fábrica por região por assinatura do Azure 100
Máximo de projetos por recurso 250
Máximo de implantações por recurso (implantações de modelo em um recurso Foundry) 32

Limites de taxa

A tabela a seguir lista os limites dos Modelos de Fundição para os seguintes valores:

  • Tokens por minuto
  • Solicitações por minuto
  • Solicitação simultânea
Modelos Tokens por minuto Solicitações por minuto Solicitações simultâneas
modelos do Azure OpenAI Varia por modelo e SKU. Consulte limits para Azure OpenAI. Varia por modelo e SKU. Consulte limits para Azure OpenAI. Pode variar. Consulte limites do Azure OpenAI.
– Llama 3.3 70B Instruct
- Llama-4-Maverick-17B-128E-Instruct-FP8
400,000 1,000 300
- Flux.2-Pro não aplicável - Baixo (padrão): 15
- Médio: 30
- Alta (Empresarial): 100
não aplicável
- FLUX-1.1-pro
- Flux.1-Kontext Pro
não aplicável 2 unidades de capacidade (6 solicitações por minuto) não aplicável
Restante dos modelos 400,000 1,000 300

Para aumentar sua cota, use Serviço Foundry da Microsoft: Solicitação de aumento de cota para enviar sua solicitação. Devido à alta demanda, as solicitações para aumentar a cota são avaliadas individualmente. Para obter mais informações sobre solicitações de aumento de cotas, consulte solicitar aumentos dos limites padrão.

Outros limites

Nome do limite Valor limite
Número máximo de cabeçalhos personalizados nas solicitaçõesde API 1 10

1 As APIs atuais permitem até 10 cabeçalhos personalizados, que o pipeline passa e retorna. Se você exceder essa contagem de cabeçalho, sua solicitação resultará em um erro HTTP 431. Para resolver esse erro, reduza o volume do cabeçalho. As versões futuras da API não passarão por cabeçalhos personalizados. Não dependa de cabeçalhos personalizados em arquiteturas futuras do sistema.

Camadas de uso

As implantações padrão global usam a infraestrutura global do Azure para rotear dinamicamente o tráfego do cliente para o data center com a melhor disponibilidade para as solicitações de inferência do cliente. Essa infraestrutura permite latência mais consistente para clientes com níveis baixos a médios de tráfego. Clientes com altos níveis sustentados de uso podem ver mais variabilidades na latência de resposta.

O Limite de Uso determina o nível de uso além do qual os clientes podem ver maior variabilidade na latência de resposta. O uso de um cliente é definido por modelo e é o total de tokens consumidos em todas as implantações em todas as assinaturas e em todas as regiões para um determinado locatário.

Solicitar aumentos para os limites padrão

Envie o formulário de solicitação de aumento de cota para solicitar aumentos de cota para Modelos do Foundry vendidos pelo Azure, modelos do Azure OpenAI e modelos da Anthropic. Com exceção de modelos da Anthropic, Modelos de parceiros e comunidade não dão suporte a aumentos de cota.

As solicitações de aumento de cota são processadas na ordem em que são recebidas e a prioridade vai para os clientes que usam ativamente sua alocação de cota existente. Solicitações que não atendem a essa condição podem ser negadas.

Práticas recomendadas gerais para se manter dentro dos limites de taxa

Para minimizar problemas relacionados aos limites de taxa, use as seguintes técnicas:

  • Implemente a lógica de repetição em seu aplicativo.
  • Evite alterações acentuadas na carga de trabalho. Aumente gradualmente a carga de trabalho.
  • Teste diferentes padrões de aumento de carga.
  • Aumente a cota atribuída à sua implantação. Mova a quota de outra implantação, se necessário.

Configurando o tempo limite do lado do cliente

Defina explicitamente o tempo limite do lado do cliente com base nas instruções a seguir.

Nota

Se não for definido explicitamente, o tempo limite do lado do cliente existe de acordo com a biblioteca usada e pode não ser os mesmos limites que acima.

  • Modelos de raciocínio (modelos que geram tokens de raciocínio intermediários antes de produzir uma resposta resumida): até 29 minutos.
  • Modelos sem raciocínio:
    • Para streaming, até 60 segundos.
    • Para solicitações que não são de streaming, até 29 minutos.

29 minutos aqui não significa que todas as solicitações levem 29 minutos, mas, dependendo dos tokens de contexto, dos tokens gerados e das taxas de ocorrência do cache, as solicitações podem levar até 29 minutos.

Defina um tempo limite menor que esses valores, ajustado para seus padrões de tráfego.

Para modelos de raciocínio, incluindo solicitações de streaming, todos os tokens de raciocínio são gerados primeiro e, em seguida, resumidos antes de enviar o primeiro token de resposta de volta para o usuário.

Você pode modificar o parâmetro de esforço de raciocínio para controlar o número de tokens de raciocínio gerados no processo.

Solucionando problemas

Sintoma Causa Resolução
Solicitações HTTP 429 Muitas Solicitações Limite de token por minuto ou de requisição por minuto excedido Implementar lógica de repetição com recuo exponencial. Use o valor do cabeçalho Retry-After.
Campos de cabeçalho de solicitação HTTP 431 muito grandes Mais de 10 cabeçalhos personalizados enviados Reduza os cabeçalhos personalizados para 10 ou menos.
A página de cota mostra 0 disponível Assinatura ou cota regional integralmente alocada Mova quota não utilizada de outra implantação. Para aumentar o limite, solicite um aumento de cota.
Modelo não disponível na região O modelo não é implantado ou tem suporte na região selecionada Verifique a disponibilidade do modelo e escolha uma região disponível.