Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Model router é um modelo de linguagem treinado que encaminha inteligentemente os seus prompts em tempo real para o modelo de linguagem grande (LLM) mais adequado. Implementas o roteador de modelo como qualquer outro modelo Foundry. Assim, oferece alto desempenho enquanto poupa em custos, reduz latências e aumenta a capacidade de resposta, mantendo qualidade comparável, tudo embalado como uma implementação de um único modelo.
O router de modelos funciona tanto como uma implementação imediata de modelos como uma camada de otimização. Num fluxo de trabalho tradicional de subida de colinas, comparas modelos individuais e constróis lógica de encaminhamento enquanto procuras um melhor equilíbrio entre qualidade, custo e latência. O router de modelos encurta esse processo de navegação entre modelos ao gerir a seleção de modelos a cada pedido numa única implementação. A avaliação continua a ser importante: compare o router modelo com a sua linha de base atual para confirmar que o encaminhamento gerido melhora os resultados que importam para a sua carga de trabalho. Para orientação, consulte Avaliar o modelo de router para a sua carga de trabalho.
Para experimentar rapidamente um router modelo, siga Como usar o router modelo. Depois de implementares o router modelo, envia um pedido para a implementação. O router modelo seleciona um modelo subjacente para cada pedido com base nas suas definições de roteamento. Para uma análise aprofundada do pipeline de roteamento, treino e lógica de decisão, veja Como funciona o router modelo.
Nota
Não é necessário implementar separadamente os LLMs suportados para uso com routers modelo, com exceção dos modelos Claude. Para usar o model router com os teus modelos Claude, primeiro implementa-os a partir do catálogo de modelos. As implementações são invocadas pelo router modelo se forem selecionadas para roteamento.
Como funciona o router modelo
Como modelo de linguagem treinado, o model router analisa os seus prompts em tempo real com base na complexidade, raciocínio, tipo de tarefa e outros atributos. Não armazena os seus prompts. Encaminha apenas para modelos elegíveis com base nos seus tipos de acesso e implementação, respeitando os limites das zonas de dados.
Importante
A janela de contexto efetivo é limitada pelo menor modelo subjacente. Para contextos maiores, use subconjunto de modelos para selecionar modelos que suportem os seus requisitos.
- No modo Balanceado (predefinido), considera todos os modelos subjacentes dentro de um pequeno intervalo de qualidade (por exemplo, 1% a 2% comparado com o modelo de maior qualidade para esse prompt) e escolhe o modelo mais rentável.
- No modo Custo, considera uma faixa de qualidade maior (por exemplo, 5% a 6% comparado com o modelo de maior qualidade para esse prompt) e escolhe o modelo mais rentável.
- No modo Qualidade, escolhe o modelo de melhor qualidade para o pedido, ignorando o custo.
Por que usar um modelo de router?
O router modelo otimiza custos e latências, mantendo uma qualidade comparável. Modelos mais pequenos e baratos são usados quando são suficientes para a tarefa, mas modelos maiores e mais caros estão disponíveis para tarefas mais complexas. Além disso, existem modelos de raciocínio disponíveis para tarefas que requerem raciocínio complexo, e, caso contrário, são usados modelos não baseados em raciocínio. O router modelo oferece uma única experiência de implementação e chat que combina as melhores funcionalidades de todos os modelos de chat subjacentes.
A versão atual, 2025-11-18 (mais recente), inclui as seguintes capacidades:
- Apoiar implementações de Normas Globais e Normas de Zona de Dados.
- Rotas através de modelos da OpenAI, DeepSeek, Meta, xAI e Anthropic. Para o pool de encaminhamento atual, veja Modelos suportados.
- Deploy rápido ou implementação personalizada com modo de roteamento e opções de subconjunto de modelos.
-
Modo de encaminhamento: Otimize a lógica de encaminhamento para as suas necessidades. Opções suportadas:
Quality,Cost,Balanced(por defeito). - Subconjunto de modelo: Selecione os seus modelos preferidos para criar o seu subconjunto de modelos para encaminhamento.
- Suporte a cenários agênticos com ferramentas em modelos elegíveis da OpenAI, open-source (OSS) e Anthropic no Foundry Agent Service.
Versionamento
O router modelo utiliza versões com carimbo datado. A versão atual é 2025-11-18 (mais recente), que é mantida ativamente — novos modelos e funcionalidades subjacentes são adicionados a esta versão ao longo do tempo sem alterar o identificador da versão.
As versões mais antigas (2025-08-07, 2025-05-19) estão congeladas e não recebem novas adições de modelos.
| Versão | Status | Descrição |
|---|---|---|
2025-11-18 |
Ativo (mais recente) | Recebe atualizações contínuas de modelos e funcionalidades |
2025-08-07 |
Congelado | Conjunto fixo de modelos; Sem novas adições |
2025-05-19 |
Congelado | Conjunto fixo de modelos; Sem novas adições |
Tip
Não precisas de esperar por um novo número de versão para aceder aos modelos recém-suportados. A 2025-11-18 versão é atualizada à medida que novos modelos ficam disponíveis.
Se selecionar Atualização Automática na etapa de implementação (ver atualizações de modelo), a implementação do seu router modelo atualiza-se automaticamente quando novas versões ficam disponíveis. Quando isso acontece, o conjunto de modelos subjacentes também muda, o que pode afetar o desempenho global do modelo e os custos.
Modelos suportados
Nota
Não precisas de implementar separadamente os grandes modelos de linguagem suportados para uso com o router de modelos, exceto os modelos Claude. Para usar o model router com os teus modelos Claude, primeiro implementa-os a partir do catálogo de modelos. O router modelo invoca as implementações se as selecionares para o encaminhamento.
Versão do modelo do router 2025-11-18 (mais recente)
| Formato | Modelo | Versão |
|---|---|---|
| OpenAI | gpt-5.6-sol |
2026-07-09 |
| OpenAI | gpt-5.6-terra |
2026-07-09 |
| OpenAI | gpt-5.6-luna |
2026-07-09 |
| OpenAI | gpt-5.5 |
2026-04-24 |
| OpenAI | gpt-5.4 |
2026-03-05 |
| OpenAI | gpt-5.4-mini |
2026-03-17 |
| OpenAI | gpt-5.4-nano |
2026-03-17 |
| OpenAI | gpt-5.2 |
2025-12-11 |
| OpenAI | gpt-5 |
2025-08-07 |
| OpenAI | gpt-5-mini |
2025-08-07 |
| OpenAI | gpt-5-nano |
2025-08-07 |
| OpenAI | o4-mini |
2025-04-16 |
| OpenAI | gpt-4.1 |
2025-04-14 |
| OpenAI | gpt-4.1-mini |
2025-04-14 |
| OpenAI | gpt-4.1-nano |
2025-04-14 |
| OpenAI | gpt-4o |
2024-11-20 |
| OpenAI | gpt-4o-mini |
2024-07-18 |
| OpenAI | gpt-oss-120b |
1 |
| Anthropic | claude-opus-4-8 |
1 |
| Anthropic | claude-opus-4-7 |
1 |
| Anthropic | claude-opus-4-6 |
1 |
| Anthropic | claude-sonnet-4-5 |
20250929 |
| Anthropic | claude-haiku-4-5 |
20251001 |
| xAI (Inteligência Artificial Explicável) | grok-4-1-fast-reasoning |
1 |
| xAI (Inteligência Artificial Explicável) | grok-4 |
1 |
| DeepSeek | DeepSeek-V3.2 |
1 |
| Meta | Llama-4-Maverick-17B-128E-Instruct-FP8 |
1 |
Regiões suportadas
O router modelo suporta implementações de Padrões Globais em todas as regiões seguintes. Uma marca de verificação (✅) indica que o tipo de implementação está disponível. Um hífen (-) indica que não está disponível.
| Região | Padrão Global | Padrão de zona de dados |
|---|---|---|
| Leste da Austrália | ✅ | ✅ |
| Sul do Brasil | ✅ | - |
| Canadá Central | ✅ | - |
| Leste do Canadá | ✅ | - |
| E.U.A. Central | ✅ | ✅ |
| E.U.A. Leste | ✅ | ✅ |
| E.U.A. Leste 2 | ✅ | ✅ |
| Centro de França | ✅ | ✅ |
| Alemanha Centro-Oeste | ✅ | ✅ |
| Norte de Itália | ✅ | ✅ |
| Leste do Japão | ✅ | ✅ |
| Oeste do Japão | ✅ | ✅ |
| Coreia Central | ✅ | ✅ |
| E.U.A. Centro-Norte | ✅ | ✅ |
| Europa do Norte | ✅ | ✅ |
| Leste da Noruega | ✅ | ✅ |
| Polónia Central | ✅ | ✅ |
| Norte da África do Sul | ✅ | - |
| E.U.A. Centro-Sul | ✅ | ✅ |
| Sul da Índia | ✅ | ✅ |
| Sudeste Asiático | ✅ | ✅ |
| Espanha Central | ✅ | ✅ |
| Suécia Central | ✅ | ✅ |
| Norte da Suíça | ✅ | ✅ |
| Oeste da Suíça | ✅ | - |
| Norte dos E.A.U. | ✅ | - |
| Sul do Reino Unido | ✅ | - |
| Oeste do Reino Unido | ✅ | - |
| E.U.A. Centro-Oeste | ✅ | - |
| Europa Ocidental | ✅ | ✅ |
| E.U.A. Oeste | ✅ | ✅ |
| E.U.A. Oeste 3 | ✅ | ✅ |
Nota
Os modelos disponíveis para modelar routers em cada região estão limitados aos modelos subjacentes suportados disponíveis nessa região. Esta expansão regional permite-lhe usar o router modelo para encaminhar pedidos entre os modelos suportados disponíveis em cada região listada.
Modo de encaminhamento
Com a versão mais recente, se optar por implementação personalizada, pode selecionar o modo de encaminhamento para otimizar qualidade ou custo, mantendo um nível base de desempenho. Definir um modo de roteamento é opcional e, se não definires um, a tua implementação passa por defeito ao modo Balanceado.
Modos de encaminhamento disponíveis:
| Modo | Descrição |
|---|---|
| Equilibrado (predefinido) | Considera tanto o custo como a qualidade de forma dinâmica. Perfeito para cenários de uso geral |
| Qualidade | Prioriza para máxima precisão. Melhor para raciocínio complexo ou resultados críticos |
| Custo | Prioriza para maior poupança de custos. Ideal para cargas de trabalho de grande volume e sensíveis ao orçamento |
Implementações de routers modelo Govern
Se a sua organização usa o Azure Policy para controlar quais os modelos que podem ser implementados, o model router respeita a mesma política incorporada de implementação de modelos do Foundry que rege as implementações de modelos padrão. A política aplica-se ao subconjunto de modelos que um programador pode incluir numa implementação de router modelo, e é aplicada de forma consistente em todo o portal Foundry, API REST, CLI do Azure e templates ARM. Para os passos de atribuição do administrador de TI e a experiência do programador, consulte Controle as implementações do router de modelo com o Azure Policy.
Subconjunto do modelo
A versão mais recente do Model Router suporta subconjuntos de modelos: Pode especificar quais os modelos subjacentes a incluir nas decisões de roteamento. Isto dá-lhe mais controlo sobre custos, conformidade e características de desempenho.
Quando novos modelos base ficam disponíveis, não são incluídos na sua seleção, a menos que os adicione explicitamente à lista de inclusão da sua implantação.
Failover automático
O router modelo inclui agora failover automático incorporado. Ao usar a implementação por defeito para encaminhar para todos os modelos suportados, o router de modelos redireciona transparentemente o pedido para o modelo seguinte mais apropriado, para que problemas transitórios com qualquer modelo não perturbem a sua aplicação. O failover está ativado por padrão — não é necessária configuração adicional.
Para configurações personalizadas de implantação:
- O modo de encaminhamento selecionado (Balanceado, Custo ou Qualidade) continua a aplicar-se durante o failover.
- O seu subconjunto de modelos configurado também funciona como conjunto de reserva para evitar que os seus prompts sejam processados por modelos não aprovados. Por isso, certifique-se de selecionar subconjuntos de modelos com pelo menos dois modelos para beneficiar da capacidade de recurso.
Para inspecionar tentativas ordenadas de modelo e determinar se houve recurso a um modelo alternativo para um pedido específico de Chat Completions, veja Monitorizar o encaminhador de modelos.
Cache de prompts
O router modelo suporta cache por prompt porque os pedidos são processados pelos modelos subjacentes que o suportam. Quando o router do modelo delega um pedido a um modelo que suporta cache de prompts, os tokens em cache são usados automaticamente — não é necessária uma configuração adicional.
O comportamento da cache depende do modelo subjacente que o router seleciona para um dado pedido. Como as decisões de encaminhamento podem variar, os benefícios de cache aplicam-se apenas quando o mesmo modelo lida com pedidos consecutivos com prefixos de prompt sobrepostos.
Para detalhes sobre como funciona a cache de prompts e quais os modelos que a suportam, veja Cache de prompts.
Limitações
Para ultrapassar os limites na janela de contexto e nos parâmetros, use a funcionalidade de subconjunto do Modelo para selecionar os seus modelos para o encaminhamento que suportem as propriedades desejadas.
Nota
O limite da janela de contexto indicado para o router modelo é o limite do menor modelo subjacente. Outros modelos subjacentes são compatíveis com janelas de contexto maiores, o que significa que uma chamada de API com um contexto maior só terá sucesso se o prompt for encaminhado para o modelo correto. Para rever janelas de contexto para os modelos subjacentes, consulte Azure OpenAI nos modelos Foundry da Microsoft.
Para encurtar a janela de contexto, pode fazer uma das seguintes:
- Resume o prompt antes de o passar ao modelo
- Divida o comando em partes mais relevantes
- Use incorporações de documentos e faça com que o modelo de chat recupere as secções relevantes. Para mais informações, consulte O que é Pesquisa de IA do Azure?
Escalões de quotas
Os limites do router modelo escalam com o nível de utilização da tua subscrição. Para obter informações sobre como funcionam os escalões, consulte Escalões de quota.
| Escalão de serviço | GlobalStandard RPM | GlobalStandard TPM | DataZoneStandard RPM | DataZoneStandard TPM |
|---|---|---|---|---|
| Nível 1 | 1,000 | 1,000,000 | 300 | 300,000 |
| Nível 2 | 2,000 | 2,000,000 | 670 | 670.000 |
| Nível 3 | 4,000 | 4,000,000 | 1,000 | 1,000,000 |
| Nível 4 | 7,000 | 7,000,000 | 2,000 | 2,000,000 |
| Nível 5 | 10,000 | 10,000,000 | 3,000 | 3,000,000 |
| Nível 6 | 15,000 | 15 000 000 | 4,000 | 4,000,000 |
Para outras informações sobre limites de tarifa, consulte Quotas e limites.
O router de modelos aceita entradas de imagem para chats com Vision (todos os modelos subjacentes podem aceitar entrada de imagem), mas a decisão de encaminhamento baseia-se apenas na entrada de texto.
O router modelo não processa entrada de áudio.
Resolução de problemas
| Problema | Resolução |
|---|---|
| Falhas na implementação | Verifica se o teu recurso Foundry está numa região suportada. |
| Modelos Claude não realizam a função de encaminhamento | Certifique-se de que os modelos Claude são implementados separadamente antes de ativar o router do modelo. |
| Erro de limite de contexto ultrapassado | Reduza o tamanho do prompt ou use o subconjunto do modelo para selecionar modelos com janelas de contexto maiores. |
| Seleção inesperada de modelos | Revise a configuração do modo de roteamento (Balanceado, Custo, Qualidade) e a configuração do subconjunto do modelo. |
Para resolução detalhada de problemas de implementação, veja Como usar o router modelo.
Informação de faturação
O uso do modelo de router é cobrado com base nas solicitações de entrada à tarifa indicada na página de preços.
Pode monitorizar os custos da implementação do seu router modelo no portal do Azure.