Router modello per Microsoft Foundry

Il "Model Router" è un modello linguistico addestrato che instrada in modo intelligente le richieste in tempo reale al modello linguistico più appropriato (LLM). Si distribuisce un modello router come qualsiasi altro modello Foundry. Di conseguenza, offre prestazioni elevate, risparmiando sui costi, riducendo le latenze e aumentando la velocità di risposta, mantenendo al tempo stesso una qualità paragonabile, tutto in pacchetto come una singola distribuzione del modello.

Il router modello opera sia come distribuzione modello pronta all'uso sia come livello di ottimizzazione. In un flusso di lavoro tradizionale in salita si confrontano i singoli modelli e si compila la logica di routing mentre si cerca un migliore equilibrio tra qualità, costo e latenza. Il router modello accorcia quel percorso di navigazione tra i modelli gestendo la selezione del modello per ogni richiesta dietro un'unica distribuzione. La valutazione rimane importante: confronta l'instradatore del modello con la baseline attuale per confermare che il routing gestito migliori i risultati che contano per il tuo carico di lavoro. Per indicazioni, vedere Valutare il router modello per il carico di lavoro.

Per provare rapidamente il router del modello, seguire Come usare il router del modello. Dopo aver distribuito il router modello, inviare una richiesta alla distribuzione. Il router del modello seleziona un modello sottostante per ogni richiesta in base alle impostazioni di routing. Per approfondimenti sulla pipeline di instradamento, la formazione e la logica decisionale, consultare Come funziona il router del modello.

Nota

Non è necessario distribuire separatamente i file LLM supportati per l'uso con il router del modello, ad eccezione dei modelli Claude. Per usare il router modello con i modelli Claude, distribuirli innanzitutto dal catalogo modelli. Le distribuzioni sono richiamate dal router modello se selezionate per il routing.

Come funziona un modello di router

Come modello linguistico sottoposto a training, il router modello analizza le richieste in tempo reale in base alla complessità, al ragionamento, al tipo di attività e ad altri attributi. Non archivia le richieste. Instrada solo i modelli idonei in base ai tipi di accesso e distribuzione, rispettando i limiti della zona dati.

Importante

La finestra di contesto effettiva è limitata dal modello sottostante più piccolo. Per i contesti più grandi, usare il subset del modello per selezionare i modelli che supportano i requisiti.

  • In modalità bilanciata (impostazione predefinita), considera tutti i modelli sottostanti all'interno di un intervallo di qualità ridotto (ad esempio, 1% a 2% rispetto al modello di massima qualità per tale richiesta) e sceglie il modello più conveniente.
  • In modalità Costo, considera una banda di qualità maggiore (ad esempio, da 5% a 6% rispetto al modello di alta qualità per tale richiesta) e sceglie il modello più conveniente.
  • In modalità Qualità seleziona il modello di qualità più alta per la richiesta, ignorando il costo.

Perché usare il router modello?

Il router modello ottimizza i costi e le latenze mantenendo al contempo una qualità paragonabile. I modelli più piccoli e più economici vengono usati quando sono sufficienti per l'attività, ma i modelli più grandi e più costosi sono disponibili per attività più complesse. Inoltre, i modelli di ragionamento sono disponibili per le attività che richiedono un ragionamento complesso e i modelli non di ragionamento vengono usati in caso contrario. Il router modello offre una singola esperienza di distribuzione e chat che combina le migliori funzionalità di tutti i modelli di chat sottostanti.

La versione corrente( 2025-11-18 più recente) include le funzionalità seguenti:

  1. Supporta le distribuzioni Standard Globali e Standard della Zona Dati.
  2. Instradamento tra i modelli di OpenAI, DeepSeek, Meta, xAI e Anthropic. Per il pool di routing corrente, vedere Modelli supportati.
  3. Distribuzione rapida o Distribuzione personalizzata con modalità di routing e opzioni per il subset del modello.
  4. Modalità di routing: ottimizza la logica di routing per le proprie esigenze. Opzioni supportate: Quality, Cost, Balanced (impostazione predefinita).
  5. Subset del modello: selezionare i modelli preferiti per creare il subset del modello per il routing.
  6. Supporto per scenari agentici con strumenti nei modelli OpenAI, open source (OSS) e Anthropic idonei in Foundry Agent Service.

Versionamento

Il router Model usa versioni contrassegnate dalla data. La versione corrente è 2025-11-18 (più recente), che viene mantenuta attivamente. I nuovi modelli e funzionalità sottostanti vengono aggiunti a questa versione nel corso del tempo senza modificare l'identificatore della versione.

Le versioni precedenti (2025-08-07, 2025-05-19) sono bloccate e non ricevono nuove aggiunte al modello.

Versione Condizione Descrizione
2025-11-18 Attivo (più recente) Riceve aggiornamenti continui del modello e delle funzionalità
2025-08-07 Congelato Set fisso di modelli; nessuna nuova addizione
2025-05-19 Congelato Set fisso di modelli; nessuna nuova addizione

Tip

Non è necessario attendere un nuovo numero di versione per accedere ai modelli appena supportati. La 2025-11-18 versione viene aggiornata quando diventano disponibili nuovi modelli.

Se si seleziona Aggiornamento automatico nel passaggio di distribuzione (vedere Aggiornamenti del modello), la distribuzione del router del modello viene aggiornata automaticamente quando diventano disponibili nuove versioni. In questo caso, anche il set di modelli sottostanti cambia, che potrebbe influire sulle prestazioni complessive del modello e dei costi.

Modelli supportati

Nota

Non è necessario distribuire separatamente i modelli linguistici di grandi dimensioni supportati per l'uso con il router modello, ad eccezione dei modelli Claude. Per usare il router modello con i modelli Claude, distribuirli innanzitutto dal catalogo modelli. Il router modello richiama le distribuzioni se sono selezionate per il routing.

Versione del router modello 2025-11-18 (ultima versione)

Formato Modello Versione
OpenAI gpt-5.6-sol 2026-07-09
OpenAI gpt-5.6-terra 2026-07-09
OpenAI gpt-5.6-luna 2026-07-09
OpenAI gpt-5.5 2026-04-24
OpenAI gpt-5.4 2026-03-05
OpenAI gpt-5.4-mini 2026-03-17
OpenAI gpt-5.4-nano 2026-03-17
OpenAI gpt-5.2 2025-12-11
OpenAI gpt-5 2025-08-07
OpenAI gpt-5-mini 2025-08-07
OpenAI gpt-5-nano 2025-08-07
OpenAI o4-mini 2025-04-16
OpenAI gpt-4.1 2025-04-14
OpenAI gpt-4.1-mini 2025-04-14
OpenAI gpt-4.1-nano 2025-04-14
OpenAI gpt-4o 2024-11-20
OpenAI gpt-4o-mini 2024-07-18
OpenAI gpt-oss-120b 1
Anthropic claude-opus-4-8 1
Anthropic claude-opus-4-7 1
Anthropic claude-opus-4-6 1
Anthropic claude-sonnet-4-5 20250929
Anthropic claude-haiku-4-5 20251001
xAI grok-4-1-fast-reasoning 1
xAI grok-4 1
DeepSeek DeepSeek-V3.2 1
Meta Llama-4-Maverick-17B-128E-Instruct-FP8 1

Regioni supportate

Il router modello supporta le distribuzioni Standard globali in tutte le aree seguenti. Un segno di spunta (✅) indica che il tipo di distribuzione è disponibile. Un trattino (-) indica che non è disponibile.

Regione Standard globale Zona Dati Standard
Australia East
Brazil South -
Canada orientale -
Central US
East US
Stati Uniti orientali 2
France Central
Germania centro-occidentale
Italia settentrionale
Japan East
Japan West
Korea Central
Stati Uniti centro-settentrionali
Poland Central
Sudafrica settentrionale -
Stati Uniti centro-meridionali
South India
Sud-est asiatico
Spain Central
Svezia centrale
Switzerland North
Svizzera occidentale -
UK South -
Regno Unito occidentale -
Stati Uniti centro-occidentali -
West Europe
West US
Stati Uniti occidentali 3

Nota

I modelli disponibili per l'instradatore di modelli in ciascuna area geografica sono limitati ai modelli di base supportati disponibili in quella regione. Questa espansione a livello di area consente di usare il router del modello per instradare le richieste tra i modelli supportati disponibili in ogni area elencata.

Modalità di routing

Con la versione più recente, se si sceglie una distribuzione personalizzata, è possibile selezionare la modalità di routing per ottimizzare la qualità o i costi mantenendo al tempo stesso un livello di prestazioni di base. L'impostazione di una modalità di routing è facoltativa e, se non ne viene impostata una, per impostazione predefinita la distribuzione viene impostata sulla modalità bilanciata.

Modalità di routing disponibili:

Modalità Descrizione
Bilanciato (impostazione predefinita) Considera i costi e la qualità in modo dinamico. Perfetto per scenari per utilizzo generico
Qualità Assegna priorità per la massima accuratezza. Ideale per motivi complessi o output critici
Costo Assegna priorità per un maggiore risparmio sui costi. Ideale per carichi di lavoro con volumi elevati e sensibili al budget

Gestire le implementazioni dei router modello

Se l'organizzazione usa Criteri di Azure per controllare quali modelli possono essere distribuiti, il router del modello rispetta gli stessi criteri di distribuzione del modello Foundry predefiniti che regolano le distribuzioni di modelli standard. Il criterio si applica al sottoinsieme di modelli che uno sviluppatore può includere in una distribuzione di un router di modelli ed è applicato in modo coerente nel portale Foundry, nell'API REST, in interfaccia della riga di comando di Azure e nei modelli ARM. Per i passaggi per l'assegnazione dell'amministratore IT e l'esperienza degli sviluppatori, vedere Govern model router deployments with Criteri di Azure.

Sottoinsieme del modello

La versione più recente del modello di router supporta sottoinsiemi di modelli: è possibile specificare quali modelli sottostanti includere nelle decisioni di instradamento. In questo modo è possibile controllare maggiormente i costi, la conformità e le caratteristiche delle prestazioni.

Quando i nuovi modelli di base diventano disponibili, non vengono inclusi nella selezione, a meno che non vengano aggiunti esplicitamente all'elenco di inclusione della distribuzione.

Failover automatico

Il router modello ora include il failover automatico integrato. Quando si usa la distribuzione predefinita per indirizzare a tutti i modelli supportati, il router del modello reindirizza in modo trasparente la richiesta al modello più appropriato successivo, quindi i problemi temporanei con qualsiasi singolo modello non interrompono l'applicazione. Il failover è abilitato per impostazione predefinita. Non è necessaria alcuna configurazione aggiuntiva.

Per le configurazioni di distribuzione personalizzate:

  • La modalità di routing selezionata (Bilanciato, Costo o Qualità) continua a essere applicata durante il failover.
  • Il subset del modello configurato funziona anche come set di fallback per impedire che le richieste vengano elaborate da modelli non approvati. Assicurarsi quindi di selezionare subset di modelli con almeno due modelli per trarre vantaggio dalla funzionalità di fallback.

Memorizzazione di prompt nella cache

Il router modello supporta la memorizzazione nella cache dei prompt perché le richieste vengono elaborate dai modelli sottostanti che lo supportano. Quando il router del modello delega una richiesta a un modello che supporta la memorizzazione nella cache dei prompt, i token memorizzati nella cache vengono usati automaticamente. Non è necessaria alcuna configurazione aggiuntiva.

Il comportamento della cache dipende dal modello sottostante selezionato dal router per una determinata richiesta. Poiché le decisioni di routing possono variare, i vantaggi della memorizzazione nella cache si applicano solo quando lo stesso modello gestisce le richieste consecutive con prefissi di prompt sovrapposti.

Per informazioni dettagliate sul funzionamento della memorizzazione nella cache dei prompt e sui modelli che lo supportano, vedere Memorizzazione nella cache dei prompt.

Limitazioni

Per superare i limiti relativi alla finestra di contesto e ai parametri, usare la funzionalità Subset model per selezionare i modelli per il routing che supportano le proprietà desiderate.

Nota

Il limite della finestra di contesto elencato per il router modello è quello del modello sottostante più piccolo. Altri modelli sottostanti sono compatibili con finestre di contesto più grandi, il che significa che una chiamata API con un contesto più ampio avrà esito positivo solo se la richiesta viene instradata al modello corretto. Per esaminare le finestre di contesto per i modelli sottostanti, vedere Azure OpenAI nei modelli Microsoft Foundry.

Per abbreviare la finestra di contesto, è possibile eseguire una delle operazioni seguenti:

  • Riepilogare il prompt prima di passarlo al modello
  • Suddividere la richiesta in parti più rilevanti
  • Usare gli incorporamenti dei documenti e fare in modo che il modello di chat recuperi sezioni pertinenti. Per altre informazioni, vedere Che è Azure AI Search?

Livelli di quota

I limiti del router del modello variano in base al livello di utilizzo del tuo abbonamento. Per informazioni sul funzionamento dei livelli, vedere Livelli di quota.

Livello GlobalStandard RPM GlobalStandard TPM DataZoneStandard RPM DataZoneStandard TPM
Livello 1 1,000 1,000,000 300 300,000
Livello 2 2.000 2,000,000 670 670.000
Livello 3 4,000 4.000.000 1,000 1,000,000
Livello 4 7.000 7,000,000 2.000 2,000,000
Livello 5 10,000 10,000,000 3,000 3,000,000
Livello 6 15,000 15.000.000 4,000 4.000.000

Per altre informazioni sul limite di velocità, vedere Quote e limiti.

Il router modello accetta input di immagine per le chat abilitate per la visione artificiale (tutti i modelli sottostanti possono accettare l'input dell'immagine), ma la decisione di routing si basa solo sull'input di testo.

Il router del modello non elabora l'input audio.

Risoluzione dei problemi

Problema Risoluzione
La distribuzione non riesce Verificare che la risorsa Foundry si trovi in un'area supportata.
Modelli Claude che non eseguono la pianificazione percorso Assicurarsi che i modelli Claude vengano distribuiti separatamente prima di poterli abilitare nel router del modello.
Errore di superamento del contesto Ridurre le dimensioni delle richieste o usare il subset del modello per selezionare i modelli con finestre di contesto più grandi.
Selezione imprevista del modello Esaminare l'impostazione della modalità di routing (Bilanciato, Costo, Qualità) e la configurazione del subset del modello.

Per informazioni dettagliate sulla risoluzione dei problemi di distribuzione, vedere Come usare il router del modello.

Informazioni di fatturazione

L'utilizzo del router del modello viene addebitato per le richieste di input alla tariffa elencata nella pagina dei prezzi.

È possibile monitorare i costi della distribuzione del router del modello nel portale di Azure.

Passaggio successivo