Modellrouter für Microsoft Foundry

Modellrouter ist ein trainiertes Sprachmodell, das Ihre Eingabeaufforderungen intelligent in Echtzeit an das am besten geeignete große Sprachmodell (LLM) leitet. Sie stellen einen Modellierungs-Router wie jedes andere Foundry Modell bereit. So bietet es eine hohe Leistung und spart Kosten, reduziert Latenzen und erhöht die Reaktionsfähigkeit, während eine vergleichbare Qualität beibehalten wird, die alle als einzelne Modellbereitstellung verpackt sind.

Der Modellrouter dient sowohl als direkt einsetzbare Modellbereitstellung als auch als Optimierungsschicht. In einem herkömmlichen Bergsteigen-Workflow vergleichen Sie einzelne Modelle und erstellen Routinglogik, während Sie nach einer besseren Balance zwischen Qualität, Kosten und Latenz suchen. Der Modellrouter verkürzt den Weg zur Modellauswahl, indem er die Auswahl des Modells für jede einzelne Anfrage innerhalb einer einzigen Bereitstellung verwaltet. Die Auswertung bleibt wichtig: Vergleichen Sie den Modellrouter mit Ihrem aktuellen Basisplan, um zu bestätigen, dass das verwaltete Routing die Ergebnisse verbessert, die für Ihre Workload wichtig sind. Anleitungen finden Sie unter Bewerten des Modellrouters für Ihre Workload.

Um den Modellrouter schnell zu testen, folgen Sie der Verwendung des Modellrouters. Senden Sie nach der Bereitstellung des Modellrouters eine Anforderung an die Bereitstellung. Modellrouter wählt ein zugrunde liegendes Modell für jede Anforderung basierend auf Ihren Routingeinstellungen aus. Einen umfassenden Einblick in die Routingpipeline, Schulungen und Entscheidungslogik finden Sie unter "Funktionsweise des Modellrouters".

Hinweis

Sie müssen die unterstützten LLMs nicht separat für die Verwendung mit Modellrouter bereitstellen, mit Ausnahme der Claude-Modelle. Um Modellrouter mit Ihren Claude-Modellen zu verwenden, stellen Sie sie zuerst aus dem Modellkatalog bereit. Die Bereitstellungen werden vom Modellrouter aufgerufen, wenn sie für das Routing ausgewählt sind.

Funktionsweise des Modellrouters

Als trainiertes Sprachmodell analysiert der Modellrouter Ihre Eingabeaufforderungen in Echtzeit basierend auf Komplexität, Begründung, Aufgabentyp und anderen Attributen. Ihre Eingabeaufforderungen werden nicht gespeichert. Er leitet nur an berechtigte Modelle basierend auf Ihren Zugriffs- und Bereitstellungstypen weiter, wobei die Grenzen der Datenzone berücksichtigt werden.

Wichtig

Das effektive Kontextfenster ist durch das kleinste zugrunde liegende Modell beschränkt. Verwenden Sie für größere Kontexte Modellteilmenge, um Modelle auszuwählen, die Ihre Anforderungen unterstützen.

  • Im Ausgewogenen Modus (Standard) berücksichtigt er alle zugrunde liegenden Modelle innerhalb eines kleinen Qualitätsbereichs (z. B. 1% bis 2% im Vergleich zum Modell der höchsten Qualität für diese Aufforderung) und wählt das kostengünstigste Modell aus.
  • Im Kostenmodus betrachtet es ein größeres Qualitätsband (z. B. 5% bis 6% im Vergleich zum Modell der höchsten Qualität für diese Aufforderung) und wählt das kostengünstigste Modell aus.
  • Im Qualitätsmodus wählt er das Modell mit der höchsten Qualitätsbewertung für den Prompt aus, ungeachtet der Kosten.

Warum Modellrouter verwenden?

Modellrouter optimiert Kosten und Latenzen bei gleichzeitiger Beibehaltung vergleichbarer Qualität. Kleinere und günstigere Modelle werden verwendet, wenn sie für den Vorgang ausreichen, aber größere und teurere Modelle stehen für komplexere Aufgaben zur Verfügung. Außerdem sind Schlussfolgerungsmodelle für Aufgaben verfügbar, die komplexe Schlussfolgerung erfordern, und andernfalls werden Nicht-Schlussfolgerungsmodelle verwendet. Der Modellrouter bietet eine einzige Bereitstellungs- und Chaterfahrung, die die besten Funktionen aus allen zugrunde liegenden Chatmodellen kombiniert.

Die aktuelle Version (neueste Version 2025-11-18 ) enthält die folgenden Funktionen:

  1. Unterstützen Sie globale Standard- und Data Zone Standard-Bereitstellungen.
  2. Routing über Modelle von OpenAI, DeepSeek, Meta, xAI und Anthropic. Informationen zum aktuellen Routingpool finden Sie unter "Unterstützte Modelle".
  3. Schnelle Bereitstellung oder benutzerdefinierte Bereitstellung mit den Optionen für Routingmodus und Modelluntermenge.
  4. Routingmodus: Optimieren Sie die Routinglogik für Ihre Anforderungen. Unterstützte Optionen: Quality, , CostBalanced(Standard).
  5. Modelluntermenge: Wählen Sie Ihre bevorzugten Modelle aus, um ihre Modelluntermenge für das Routing zu erstellen.
  6. Support für Agent-Szenarien mit Tools in qualifizierten OpenAI-, Open-Source- (OSS)- und Anthropic-Modellen im Foundry Agent Service.

Versionsverwaltung

Der Modellrouter verwendet datumsstempelte Versionen. Die aktuelle Version ist 2025-11-18 (neueste), die aktiv verwaltet wird – neue zugrunde liegende Modelle und Features werden dieser Version im Laufe der Zeit hinzugefügt, ohne den Versionsbezeichner zu ändern.

Ältere Versionen (2025-08-07, 2025-05-19) sind fixiert und erhalten keine neuen Modellzufügungen.

Version Status Beschreibung
2025-11-18 Aktiv (neueste Version) Empfängt laufende Modell- und Funktionsupdates
2025-08-07 Gefroren Feste Gruppe von Modellen; keine neuen Ergänzungen
2025-05-19 Gefroren Feste Gruppe von Modellen; keine neuen Ergänzungen

Tip

Sie müssen nicht auf eine neue Versionsnummer warten, um auf neu unterstützte Modelle zuzugreifen. Die 2025-11-18 Version wird aktualisiert, wenn neue Modelle verfügbar werden.

Wenn Sie im Bereitstellungsschritt die Option "Automatisches Update " auswählen (siehe Modellupdates), wird die Bereitstellung des Modellrouters automatisch aktualisiert, wenn neue Versionen verfügbar werden. In diesem Fall ändert sich auch der Satz zugrunde liegender Modelle, was sich auf die Gesamtleistung des Modells und der Kosten auswirken kann.

Unterstützte Modelle

Hinweis

Sie müssen die unterstützten großen Sprachmodelle nicht separat für die Verwendung mit Modellrouter bereitstellen, mit Ausnahme der Claude-Modelle. Um Modellrouter mit Ihren Claude-Modellen zu verwenden, stellen Sie sie zuerst aus dem Modellkatalog bereit. Der Modellrouter verwendet die Bereitstellungen, wenn Sie sie für das Routing auswählen.

Modellrouterversion 2025-11-18 (neueste Version)

Format Modell Version
OpenAI gpt-5.6-sol 2026-07-09
OpenAI gpt-5.6-terra 2026-07-09
OpenAI gpt-5.6-luna 2026-07-09
OpenAI gpt-5.5 2026-04-24
OpenAI gpt-5.4 2026-03-05
OpenAI gpt-5.4-mini 2026-03-17
OpenAI gpt-5.4-nano 2026-03-17
OpenAI gpt-5.2 2025-12-11
OpenAI gpt-5 2025-08-07
OpenAI gpt-5-mini 2025-08-07
OpenAI gpt-5-nano 2025-08-07
OpenAI o4-mini 2025-04-16
OpenAI gpt-4.1 2025-04-14
OpenAI gpt-4.1-mini 2025-04-14
OpenAI gpt-4.1-nano 2025-04-14
OpenAI gpt-4o 2024-11-20
OpenAI gpt-4o-mini 2024-07-18
OpenAI gpt-oss-120b 1
Anthropic claude-opus-4-8 1
Anthropic claude-opus-4-7 1
Anthropic claude-opus-4-6 1
Anthropic claude-sonnet-4-5 20250929
Anthropic claude-haiku-4-5 20251001
xAI grok-4-1-fast-reasoning 1
xAI grok-4 1
DeepSeek DeepSeek-V3.2 1
Meta Llama-4-Maverick-17B-128E-Instruct-FP8 1

Unterstützte Regionen

Der Modell-Router unterstützt Global-Standard-Bereitstellungen in allen folgenden Regionen. Ein Häkchen (✅) gibt an, dass der Bereitstellungstyp verfügbar ist. Ein Bindestrich (-) gibt an, dass er nicht verfügbar ist.

Region Globaler Standard Datenzonenstandard
Australia East
Brasilien Süd -
Canada East -
Central US
East US
Ost-USA 2
France Central
Deutschland West Central
Italy North
Japan East
Japan West
Korea Central
Nord-Mittel-USA
Poland Central
Südafrika Nord -
Süd-Mittel-USA
South India
Südostasien
Spain Central
Schweden Zentral
Switzerland North
Westschweiz -
UK South -
Westen des Vereinigten Königreichs -
Zentralwesten der USA -
West Europe
West US
Westliches USA 3

Hinweis

Die in jeder Region im Modellrouter verfügbaren Modelle sind auf die in dieser Region unterstützten zugrunde liegenden Modelle beschränkt. Mit dieser regionalen Erweiterung können Sie Modellrouter verwenden, um Anforderungen über die verfügbaren unterstützten Modelle in jeder aufgeführten Region zu leiten.

Routingmodus

Wenn Sie die benutzerdefinierte Bereitstellung auswählen, können Sie mit der neuesten Version den Routingmodus auswählen, um die Qualität oder die Kosten zu optimieren und gleichzeitig ein grundlegendes Leistungsniveau aufrechtzuerhalten. Das Festlegen eines Routingmodus ist optional, und wenn Sie keinen Modus festlegen, wird die Bereitstellung standardmäßig im Modus "Ausgewogener Modus" festgelegt.

Verfügbare Routingmodi:

Modus Beschreibung
Ausgeglichen (Standard) Berücksichtigt sowohl Kosten als auch Qualität dynamisch. Perfekt für allgemeine Szenarien
Qualität Priorisiert für maximale Genauigkeit. Am besten geeignet für komplexes Denken oder kritische Ergebnisse
Kosten Prioritisiert Kosteneinsparungen. Ideal für Workloads mit hohem Volumen bei eingeschränktem Budget

Verwalten von Modellrouterbereitstellungen

Wenn Ihre Organisation Azure Policy verwendet, um zu steuern, welche Modelle bereitgestellt werden können, berücksichtigt der Modellrouter die gleiche integrierte Foundry-Modellbereitstellungsrichtlinie, die Standardmodellbereitstellungen steuert. Die Richtlinie gilt für die Modelluntermenge, die ein Entwickler in eine Modellrouterbereitstellung aufnehmen kann, und es wird konsistent über das Foundry-Portal, die REST-API, Azure CLI und ARM-Vorlagen erzwungen. Die Schritte für die Zuweisung von IT-Administratoren und die Entwicklerumgebung finden Sie unter Govern-Modellrouterbereitstellungen mit Azure Policy.

Modelluntermenge

Die neueste Version des Modellrouters unterstützt Modelluntermengen: Sie können angeben, welche zugrunde liegenden Modelle in Routingentscheidungen einbezogen werden sollen. Dadurch erhalten Sie mehr Kontrolle über Kosten-, Compliance- und Leistungsmerkmale.

Wenn neue Basismodelle bereitgestellt werden, sind sie nicht in Ihrer Auswahl enthalten, es sei denn, Sie fügen sie explizit zur Einschlussliste Ihrer Bereitstellung hinzu.

Automatisches Failover

Der Modell-Router enthält jetzt ein integriertes automatisches Failover. Wenn Sie die Standardbereitstellung zum Weiterleiten an alle unterstützten Modelle verwenden, leitet der Modellrouter die Anforderung transparent an das nächste am besten geeignete Modell um, sodass vorübergehende Probleme mit jedem einzelnen Modell Ihre Anwendung nicht stören. Failover ist standardmäßig aktiviert – es ist keine zusätzliche Konfiguration erforderlich.

Für benutzerdefinierte Bereitstellungskonfigurationen:

  • Der ausgewählte Routingmodus (Ausgeglichen, Kosten oder Qualität) wird während des Failovers weiterhin angewendet.
  • Ihre konfigurierte Modelluntermenge funktioniert auch als Fallbacksatz, um zu verhindern, dass Ihre Eingabeaufforderungen von nicht genehmigten Modellen verarbeitet werden. Achten Sie daher darauf, Modelluntermengen mit mindestens zwei Modellen auszuwählen, um von der Fallbackfunktion zu profitieren.

Promptzwischenspeicherung

Der Modellrouter unterstützt die Prompt-Zwischenspeicherung, da Anforderungen von den zugrunde liegenden Modellen verarbeitet werden, die diese Funktion unterstützen. Wenn der Modellrouter eine Anforderung an ein Modell delegiert, das das Zwischenspeichern unterstützt, werden zwischengespeicherte Token automatisch verwendet – es ist keine zusätzliche Konfiguration erforderlich.

Das Cacheverhalten hängt davon ab, welches zugrunde liegende Modell der Router für eine bestimmte Anforderung auswählt. Da Routingentscheidungen variieren können, gelten Zwischenspeicherungsvorteile nur, wenn dasselbe Modell aufeinander folgende Anforderungen mit überlappenden Eingabeaufforderungspräfixen verarbeitet.

Ausführliche Informationen dazu, wie das Zwischenspeichern von Aufforderungen funktioniert und welche Modelle dies unterstützen, finden Sie unter "Zwischenspeichern von Aufforderungen".

Einschränkungen

Um die Grenzwerte für Kontextfenster und Parameter zu überwinden, verwenden Sie das Modell-Teilmengenfeature, um Ihre Modelle für das Routing auszuwählen, die Ihre gewünschten Eigenschaften unterstützen.

Hinweis

Das für den Modellrouter aufgeführte Kontextfensterlimit ist die Grenze des kleinsten zugrunde liegenden Modells. Andere zugrunde liegende Modelle sind mit größeren Kontextfenstern kompatibel, was bedeutet, dass ein API-Aufruf mit einem größeren Kontext nur erfolgreich ausgeführt wird, wenn die Eingabeaufforderung an das richtige Modell weitergeleitet wird. Informationen zum Überprüfen von Kontextfenstern für die zugrunde liegenden Modelle finden Sie unter Azure OpenAI in Microsoft Foundry-Modellen.

Zum Kürzen des Kontextfensters können Sie eine der folgenden Aktionen ausführen:

  • Fassen Sie die Eingabeaufforderung zusammen, bevor Sie sie an das Modell übergeben.
  • Kürzen der Eingabeaufforderung in relevantere Teile
  • Verwenden Sie Dokumenteinbettungen, und lassen Sie das Chatmodell relevante Abschnitte abrufen. Weitere Informationen finden Sie unter What is Azure KI-Suche?

Kontingentstufen

Die Limits des Modell-Routers richten sich nach der Nutzungsstufe Ihres Abonnements. Informationen dazu, wie Kontingentstufen funktionieren, finden Sie unter Kontingentstufen.

Tier GlobalStandard-RPM GlobalStandard-TPM DataZoneStandard-RPM DataZoneStandard-TPM
Ebene 1 1,000 1,000,000 300 300,000
Ebene 2 2.000 2,000,000 670 670.000
Ebene 3 4,000 4.000.000 1,000 1,000,000
Ebene 4 7,000 7,000,000 2.000 2,000,000
Ebene 5 10.000 10,000,000 3,000 3,000,000
Ebene 6 15,000 15.000.000 4,000 4.000.000

Weitere Informationen zum Zinslimit finden Sie unter "Kontingente und Grenzwerte".

Modellrouter akzeptiert Bildeingaben für visionfähige Chats (alle zugrunde liegenden Modelle können Bildeingaben akzeptieren), die Routingentscheidung basiert jedoch nur auf der Texteingabe.

Der Modellrouter verarbeitet keine Audioeingabe.

Problembehandlung

Angelegenheit Auflösung
Bereitstellung schlägt fehl Überprüfen Sie, ob sich Die Foundry-Ressource in einer unterstützten Region befindet.
keine Weiterleitung von Claude-Modellen Stellen Sie sicher, dass Claude-Modelle separat bereitgestellt werden, bevor Sie den Modellrouter aktivieren.
Fehler „Kontext überschritten“ Verringern Sie die Größe der Eingabeaufforderung, oder verwenden Sie modelluntermenge, um Modelle mit größeren Kontextfenstern auszuwählen.
Unerwartete Modellauswahl Überprüfen Sie die Einstellung für den Routingmodus (Ausgewogen, Kosten, Qualität) und die Teilkonfiguration des Modells.

Ausführliche Problembehandlung bei der Bereitstellung finden Sie unter Verwenden des Modellrouters.

Abrechnungsinformationen

Die Nutzung des Modellrouters wird für Eingabeaufforderungen zum in der Preisseite angegebenen Preis berechnet.

Sie können die Kosten Ihrer Modellrouterbereitstellung im Azure Portal überwachen.

Nächster Schritt