Roteador modelo para Microsoft Foundry

O roteador de modelo é um modelo de linguagem treinado que roteia inteligentemente seus prompts em tempo real para o LLM (grande modelo de linguagem) mais adequado. Implante o roteador de modelo como qualquer outro modelo do Foundry. Assim, ele oferece alto desempenho, economizando em custos, reduzindo latências e aumentando a capacidade de resposta, mantendo a qualidade comparável, tudo empacotado como uma única implantação de modelo.

O roteador de modelos funciona tanto como uma implantação imediata de modelos quanto como uma camada de otimização. Em um fluxo de trabalho de escalada tradicional, você compara modelos individuais e cria lógica de roteamento à medida que procura um melhor equilíbrio de qualidade, custo e latência. O roteador de modelos encurta esse processo de navegação entre modelos ao gerenciar a seleção do modelo para cada solicitação em uma única implantação. A avaliação permanece importante: compare o roteador de modelo com a linha de base atual para confirmar que o roteamento gerenciado melhora os resultados importantes para sua carga de trabalho. Para obter diretrizes, consulte Avaliar o roteador de modelo para sua carga de trabalho.

Para experimentar o roteador de modelo rapidamente, siga Como usar o roteador de modelo. Após implantar o roteador modelo, envie uma solicitação para a implantação. O roteador de modelo seleciona um modelo subjacente para cada solicitação com base nas configurações de roteamento. Para se aprofundar no pipeline de roteamento, no treinamento e na lógica de decisão, consulte Como funciona o modelo de roteador.

Nota

Você não precisa implantar separadamente os LLMs com suporte para uso com o roteador de modelo, com exceção dos modelos Claude. Para usar o roteador de modelos com seus modelos Claude, primeiro implante-os a partir do catálogo de modelos. As implantações são invocadas pelo roteador de modelo se forem selecionadas para roteamento.

Como funciona o roteador modelo

Como um modelo de linguagem treinado, o roteador de modelo analisa seus prompts em tempo real com base na complexidade, raciocínio, tipo de tarefa e outros atributos. O sistema não armazena seus prompts. Ele roteia apenas para modelos qualificados com base em seus tipos de acesso e implantação, respeitando os limites da zona de dados.

Importante

A janela de contexto eficaz é limitada pelo menor modelo subjacente. Para contextos maiores, use o subconjunto de modelo para selecionar modelos que dão suporte aos seus requisitos.

  • No modo Balanceado (padrão), ele considera todos os modelos subjacentes dentro de um intervalo de qualidade pequeno (por exemplo, 1% a 2% em comparação com o modelo de maior qualidade para esse prompt) e escolhe o modelo mais econômico.
  • No modo Custo, ele considera uma faixa de qualidade maior (por exemplo, 5% a 6% em comparação com o modelo de maior qualidade para esse prompt) e escolhe o modelo mais econômico.
  • No modo Qualidade, ele escolhe o modelo com classificação de qualidade mais alta para o prompt, ignorando o custo.

Por que usar o roteador modelo?

O roteador de modelo otimiza custos e latências, mantendo a qualidade comparável. Modelos menores e mais baratos são usados quando são suficientes para a tarefa, mas modelos maiores e mais caros estão disponíveis para tarefas mais complexas. Além disso, modelos de raciocínio estão disponíveis para tarefas que exigem raciocínio complexo e modelos de não raciocínio são usados de outra forma. O roteador de modelo fornece uma única experiência de implantação e chat que combina os melhores recursos de todos os modelos de chat subjacentes.

A versão atual, 2025-11-18 (mais recente), inclui os seguintes recursos:

  1. Dê suporte a implantações do Padrão Global e do Padrão de Zona de Dados.
  2. Roteia entre modelos da OpenAI, DeepSeek, Meta, xAI e Anthropic. Para o pool de roteamento atual, consulte modelos com suporte.
  3. Implantação rápida ou implantação personalizada com opções de modo de roteamento e subconjunto de modelo.
  4. Modo de roteamento: otimize a lógica de roteamento para suas necessidades. Opções com suporte: Quality, , CostBalanced (padrão).
  5. Subconjunto de modelo: selecione seus modelos preferenciais para criar seu subconjunto de modelo para roteamento.
  6. Suporte para cenários agênticos com ferramentas em modelos qualificados da OpenAI, de código aberto (OSS) e da Anthropic no Serviço de Agente do Foundry.

Versionamento

O roteador de modelos usa versões com carimbo de data. A versão atual é 2025-11-18 (mais recente), que é mantida ativamente – novos modelos e recursos subjacentes são adicionados a essa versão ao longo do tempo sem alterar o identificador de versão.

As versões mais antigas (2025-08-07, 2025-05-19) são congeladas e não recebem novas adições de modelo.

Versão Status Descrição
2025-11-18 Ativo (mais recente) Recebe atualizações contínuas de modelo e recursos
2025-08-07 Congelado Conjunto fixo de modelos; nenhuma adição nova
2025-05-19 Congelado Conjunto fixo de modelos; nenhuma adição nova

Dica

Você não precisa aguardar um novo número de versão para acessar modelos recém-compatíveis. A versão 2025-11-18 é atualizada no local à medida que novos modelos ficam disponíveis.

Se você selecionar a atualização automática na etapa de implantação (consulte atualizações de modelo), a implantação do roteador de modelo será atualizada automaticamente quando novas versões estiverem disponíveis. Quando isso acontece, o conjunto de modelos subjacentes também é alterado, o que pode afetar o desempenho geral do modelo e dos custos.

Modelos com suporte

Nota

Você não precisa implantar separadamente os grandes modelos de linguagem compatíveis para uso com o roteador de modelos, com exceção dos modelos do Claude. Para usar o roteador de modelos com seus modelos Claude, primeiro implante-os a partir do catálogo de modelos. O roteador de modelos invocará as implantações se você as selecionar para roteamento.

Versão do roteador de modelo 2025-11-18 (mais recente)

Formato Modelo Versão
OpenAI gpt-5.6-sol 2026-07-09
OpenAI gpt-5.6-terra 2026-07-09
OpenAI gpt-5.6-luna 2026-07-09
OpenAI gpt-5.5 2026-04-24
OpenAI gpt-5.4 2026-03-05
OpenAI gpt-5.4-mini 2026-03-17
OpenAI gpt-5.4-nano 2026-03-17
OpenAI gpt-5.2 2025-12-11
OpenAI gpt-5 2025-08-07
OpenAI gpt-5-mini 2025-08-07
OpenAI gpt-5-nano 2025-08-07
OpenAI o4-mini 2025-04-16
OpenAI gpt-4.1 2025-04-14
OpenAI gpt-4.1-mini 2025-04-14
OpenAI gpt-4.1-nano 2025-04-14
OpenAI gpt-4o 2024-11-20
OpenAI gpt-4o-mini 2024-07-18
OpenAI gpt-oss-120b 1
Anthropic claude-opus-4-8 1
Anthropic claude-opus-4-7 1
Anthropic claude-opus-4-6 1
Anthropic claude-sonnet-4-5 20250929
Anthropic claude-haiku-4-5 20251001
xAI grok-4-1-fast-reasoning 1
xAI grok-4 1
DeepSeek DeepSeek-V3.2 1
Meta Llama-4-Maverick-17B-128E-Instruct-FP8 1

Regiões com suporte

O roteador de modelos dá suporte a implantações do Padrão Global em todas as regiões a seguir. Uma marca de seleção (✅) indica que o tipo de implantação está disponível. Um hífen (-) indica que ele não está disponível.

Região Padrão Global Padrão de zona de dados
Leste da Austrália
Sul do Brasil -
Canadá Central -
Leste do Canadá -
EUA Central
Leste dos EUA
Leste dos EUA 2
França Central
Centro-oeste da Alemanha
Norte da Itália
Leste do Japão
Oeste do Japão
Coreia Central
Centro-Norte dos EUA
Europa Setentrional
Leste da Noruega
Polônia Central
Norte da África do Sul -
Centro-Sul dos EUA
Sul da Índia
Sudeste Asiático
Espanha Central
Suécia Central
Norte da Suíça
Oeste da Suíça -
Norte dos EAU -
Sul do Reino Unido -
Oeste do Reino Unido -
Centro-oeste dos EUA -
Oeste da Europa
Oeste dos EUA
Oeste dos EUA 3

Nota

Os modelos disponíveis no roteador de modelos em cada região estão limitados aos modelos subjacentes com suporte disponíveis nessa região. Essa expansão regional permite que você use o roteador de modelo para rotear solicitações entre os modelos com suporte disponíveis em cada região listada.

Modo de roteamento

Com a versão mais recente, se você escolher a implantação personalizada, poderá selecionar o modo de roteamento para otimizar a qualidade ou o custo, mantendo um nível de desempenho de linha de base. Definir um modo de roteamento é opcional e, se você não definir um, sua implantação usará como padrão o modo Balanceado.

Modos de roteamento disponíveis:

Modo Descrição
Balanceado (padrão) Considera o custo e a qualidade dinamicamente. Perfeito para cenários de uso geral
Qualidade Prioriza a precisão máxima. Melhor para raciocínio complexo ou saídas críticas
Custo Prioriza mais economia de custos. Ideal para cargas de trabalho de alto volume e sensíveis ao orçamento

Controlar implantações de roteador de modelo

Se sua organização usa o Azure Policy para controlar quais modelos podem ser implantados, o roteador de modelos segue a mesma política interna do Foundry para implantação de modelos que rege as implantações de modelos padrão. A política se aplica ao subconjunto de modelos que um desenvolvedor pode incluir em uma implantação de um roteador de modelos, e é aplicada de forma consistente no portal do Foundry, na API REST, na CLI do Azure e nos modelos do ARM. Para ver quais são as etapas de atribuição do administrador de TI e a experiência para desenvolvedores, consulte Governar implantações do roteador de modelos com o Azure Policy.

Subconjunto de modelo

A versão mais recente do roteador de modelo dá suporte a subconjuntos de modelo: você pode especificar quais modelos subjacentes incluir em decisões de roteamento. Isso oferece mais controle sobre as características de custo, conformidade e desempenho.

Quando novos modelos base estiverem disponíveis, eles não serão incluídos em sua seleção, a menos que você os adicione explicitamente à lista de inclusão da implantação.

Failover automático

Agora, o modelo de roteador inclui failover automático integrado. Ao usar a implantação padrão para rotear para todos os modelos com suporte, o roteador de modelo redireciona de forma transparente a solicitação para o próximo modelo mais apropriado, portanto, problemas transitórios com qualquer modelo não interrompem seu aplicativo. O failover é habilitado por padrão– nenhuma configuração adicional é necessária.

Para configurações de implantação personalizadas:

  • O modo de roteamento selecionado (Balanceamento, Custo ou Qualidade) continua a ser aplicado durante o failover.
  • O subconjunto de modelo configurado também funciona como seu conjunto de fallback para impedir que seus prompts sejam processados por modelos não aprovados. Portanto, selecione subconjuntos de modelo com pelo menos dois modelos para se beneficiar da funcionalidade de fallback.

Para inspecionar as tentativas ordenadas do modelo e determinar se ocorreu fallback para uma solicitação individual de Chat Completions, consulte Monitorar o roteador de modelos.

Cache de prompts

O roteador de modelo suporta o cache de prompts porque as solicitações são processadas pelos modelos subjacentes que o suportam. Quando o roteador de modelo delega uma solicitação a um modelo que dá suporte ao cache de prompts, os tokens armazenados em cache são usados automaticamente – nenhuma configuração extra é necessária.

O comportamento do cache depende de qual modelo subjacente o roteador seleciona para uma determinada solicitação. Como as decisões de roteamento podem variar, os benefícios de cache se aplicam somente quando o mesmo modelo lida com solicitações consecutivas com prefixos de prompt sobrepostos.

Para obter detalhes sobre como o cache de prompt funciona e quais modelos dão suporte a ele, consulte o cache de prompt.

Limitações

Para superar os limites da janela de contexto e dos parâmetros, use o recurso de subconjunto modelo para selecionar seus modelos de roteamento que dão suporte às suas propriedades desejadas.

Nota

O limite da janela de contexto listado para o roteador de modelos é o limite do menor modelo subjacente. Outros modelos subjacentes são compatíveis com janelas de contexto maiores, o que significa que uma chamada à API com um contexto maior só será bem-sucedida se o prompt for roteado para o modelo certo. Para examinar as janelas de contexto dos modelos subjacentes, consulte Azure OpenAI em modelos Microsoft Foundry.

Para encurtar a janela de contexto, você pode fazer um dos seguintes procedimentos:

  • Resuma o prompt antes de passá-lo para o modelo
  • Truncar o prompt em partes mais relevantes
  • Use incorporações de documento e permita que o modelo de chat recupere seções relevantes. Para obter mais informações, consulte O que é Pesquisa de IA do Azure ?

Camadas de cota

Os limites do roteador de modelos variam de acordo com o nível de uso da sua assinatura. Para obter informações sobre como os níveis funcionam, consulte Níveis de cota.

Tier GlobalStandard RPM GlobalStandard TPM DataZoneStandard RPM DataZoneStandard TPM
Nível 1 1,000 1,000,000 300 300,000
Nível 2 2,000 2,000,000 670 670.000
Nível 3 4,000 4.000.000 1,000 1,000,000
Camada 4 7,000 7,000,000 2,000 2,000,000
Nível 5 10,000 10,000,000 3,000 3,000,000
Camada 6 15,000 15.000.000 4,000 4.000.000

Para obter outras informações de limite de taxa, consulte Cotas e limites.

O roteador de modelos aceita entradas de imagem para chats com Visão (todos os modelos subjacentes podem aceitar entrada de imagem), mas a decisão de roteamento é baseada apenas na entrada de texto.

O roteador de modelo não processa a entrada de áudio.

Solucionando problemas

Questão Resolução
Falha na implantação Verifique se o recurso Foundry está em uma região com suporte.
Modelos Claude não estão sendo roteados Verifique se os modelos Claude foram implantados separadamente antes de habilitar no roteador de modelos.
Erro de contexto excedido Reduza o tamanho do prompt ou use o subconjunto de modelo para selecionar modelos com janelas de contexto maiores.
Seleção de modelo inesperada Revise a configuração do modo de roteamento (Balanceado, Custo, Qualidade) e a configuração do subconjunto do modelo.

Para obter uma solução de problemas de implantação detalhada, consulte Como usar o roteador de modelo.

Informações de cobrança

O uso do roteador de modelo é cobrado pelas solicitações de entrada, de acordo com a classificação listada na página de preços.

Você pode monitorar os custos da implantação do roteador de modelo no portal Azure.

Próxima etapa