Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Modellrouter ist ein trainiertes Sprachmodell, das Ihre Eingabeaufforderungen intelligent in Echtzeit an das am besten geeignete große Sprachmodell (LLM) leitet. Sie stellen einen Modellierungs-Router wie jedes andere Foundry Modell bereit. So bietet es eine hohe Leistung und spart Kosten, reduziert Latenzen und erhöht die Reaktionsfähigkeit, während eine vergleichbare Qualität beibehalten wird, die alle als einzelne Modellbereitstellung verpackt sind.
Der Modellrouter dient sowohl als direkt einsetzbare Modellbereitstellung als auch als Optimierungsschicht. In einem herkömmlichen Bergsteigen-Workflow vergleichen Sie einzelne Modelle und erstellen Routinglogik, während Sie nach einer besseren Balance zwischen Qualität, Kosten und Latenz suchen. Der Modellrouter verkürzt den Weg zur Modellauswahl, indem er die Auswahl des Modells für jede einzelne Anfrage innerhalb einer einzigen Bereitstellung verwaltet. Die Auswertung bleibt wichtig: Vergleichen Sie den Modellrouter mit Ihrem aktuellen Basisplan, um zu bestätigen, dass das verwaltete Routing die Ergebnisse verbessert, die für Ihre Workload wichtig sind. Anleitungen finden Sie unter Bewerten des Modellrouters für Ihre Workload.
Um den Modellrouter schnell zu testen, folgen Sie der Verwendung des Modellrouters. Senden Sie nach der Bereitstellung des Modellrouters eine Anforderung an die Bereitstellung. Modellrouter wählt ein zugrunde liegendes Modell für jede Anforderung basierend auf Ihren Routingeinstellungen aus. Einen umfassenden Einblick in die Routingpipeline, Schulungen und Entscheidungslogik finden Sie unter "Funktionsweise des Modellrouters".
Hinweis
Sie müssen die unterstützten LLMs nicht separat für die Verwendung mit Modellrouter bereitstellen, mit Ausnahme der Claude-Modelle. Um Modellrouter mit Ihren Claude-Modellen zu verwenden, stellen Sie sie zuerst aus dem Modellkatalog bereit. Die Bereitstellungen werden vom Modellrouter aufgerufen, wenn sie für das Routing ausgewählt sind.
Funktionsweise des Modellrouters
Als trainiertes Sprachmodell analysiert der Modellrouter Ihre Eingabeaufforderungen in Echtzeit basierend auf Komplexität, Begründung, Aufgabentyp und anderen Attributen. Ihre Eingabeaufforderungen werden nicht gespeichert. Er leitet nur an berechtigte Modelle basierend auf Ihren Zugriffs- und Bereitstellungstypen weiter, wobei die Grenzen der Datenzone berücksichtigt werden.
Wichtig
Das effektive Kontextfenster ist durch das kleinste zugrunde liegende Modell beschränkt. Verwenden Sie für größere Kontexte Modellteilmenge, um Modelle auszuwählen, die Ihre Anforderungen unterstützen.
- Im Ausgewogenen Modus (Standard) berücksichtigt er alle zugrunde liegenden Modelle innerhalb eines kleinen Qualitätsbereichs (z. B. 1% bis 2% im Vergleich zum Modell der höchsten Qualität für diese Aufforderung) und wählt das kostengünstigste Modell aus.
- Im Kostenmodus betrachtet es ein größeres Qualitätsband (z. B. 5% bis 6% im Vergleich zum Modell der höchsten Qualität für diese Aufforderung) und wählt das kostengünstigste Modell aus.
- Im Qualitätsmodus wählt er das Modell mit der höchsten Qualitätsbewertung für den Prompt aus, ungeachtet der Kosten.
Warum Modellrouter verwenden?
Modellrouter optimiert Kosten und Latenzen bei gleichzeitiger Beibehaltung vergleichbarer Qualität. Kleinere und günstigere Modelle werden verwendet, wenn sie für den Vorgang ausreichen, aber größere und teurere Modelle stehen für komplexere Aufgaben zur Verfügung. Außerdem sind Schlussfolgerungsmodelle für Aufgaben verfügbar, die komplexe Schlussfolgerung erfordern, und andernfalls werden Nicht-Schlussfolgerungsmodelle verwendet. Der Modellrouter bietet eine einzige Bereitstellungs- und Chaterfahrung, die die besten Funktionen aus allen zugrunde liegenden Chatmodellen kombiniert.
Die aktuelle Version (neueste Version 2025-11-18 ) enthält die folgenden Funktionen:
- Unterstützen Sie globale Standard- und Data Zone Standard-Bereitstellungen.
- Routing über Modelle von OpenAI, DeepSeek, Meta, xAI und Anthropic. Informationen zum aktuellen Routingpool finden Sie unter "Unterstützte Modelle".
- Schnelle Bereitstellung oder benutzerdefinierte Bereitstellung mit den Optionen für Routingmodus und Modelluntermenge.
-
Routingmodus: Optimieren Sie die Routinglogik für Ihre Anforderungen. Unterstützte Optionen:
Quality, ,CostBalanced(Standard). - Modelluntermenge: Wählen Sie Ihre bevorzugten Modelle aus, um ihre Modelluntermenge für das Routing zu erstellen.
- Support für Agent-Szenarien mit Tools in qualifizierten OpenAI-, Open-Source- (OSS)- und Anthropic-Modellen im Foundry Agent Service.
Versionsverwaltung
Der Modellrouter verwendet datumsstempelte Versionen. Die aktuelle Version ist 2025-11-18 (neueste), die aktiv verwaltet wird – neue zugrunde liegende Modelle und Features werden dieser Version im Laufe der Zeit hinzugefügt, ohne den Versionsbezeichner zu ändern.
Ältere Versionen (2025-08-07, 2025-05-19) sind fixiert und erhalten keine neuen Modellzufügungen.
| Version | Status | Beschreibung |
|---|---|---|
2025-11-18 |
Aktiv (neueste Version) | Empfängt laufende Modell- und Funktionsupdates |
2025-08-07 |
Gefroren | Feste Gruppe von Modellen; keine neuen Ergänzungen |
2025-05-19 |
Gefroren | Feste Gruppe von Modellen; keine neuen Ergänzungen |
Tip
Sie müssen nicht auf eine neue Versionsnummer warten, um auf neu unterstützte Modelle zuzugreifen. Die 2025-11-18 Version wird aktualisiert, wenn neue Modelle verfügbar werden.
Wenn Sie im Bereitstellungsschritt die Option "Automatisches Update " auswählen (siehe Modellupdates), wird die Bereitstellung des Modellrouters automatisch aktualisiert, wenn neue Versionen verfügbar werden. In diesem Fall ändert sich auch der Satz zugrunde liegender Modelle, was sich auf die Gesamtleistung des Modells und der Kosten auswirken kann.
Unterstützte Modelle
Hinweis
Sie müssen die unterstützten großen Sprachmodelle nicht separat für die Verwendung mit Modellrouter bereitstellen, mit Ausnahme der Claude-Modelle. Um Modellrouter mit Ihren Claude-Modellen zu verwenden, stellen Sie sie zuerst aus dem Modellkatalog bereit. Der Modellrouter verwendet die Bereitstellungen, wenn Sie sie für das Routing auswählen.
Modellrouterversion 2025-11-18 (neueste Version)
| Format | Modell | Version |
|---|---|---|
| OpenAI | gpt-5.6-sol |
2026-07-09 |
| OpenAI | gpt-5.6-terra |
2026-07-09 |
| OpenAI | gpt-5.6-luna |
2026-07-09 |
| OpenAI | gpt-5.5 |
2026-04-24 |
| OpenAI | gpt-5.4 |
2026-03-05 |
| OpenAI | gpt-5.4-mini |
2026-03-17 |
| OpenAI | gpt-5.4-nano |
2026-03-17 |
| OpenAI | gpt-5.2 |
2025-12-11 |
| OpenAI | gpt-5 |
2025-08-07 |
| OpenAI | gpt-5-mini |
2025-08-07 |
| OpenAI | gpt-5-nano |
2025-08-07 |
| OpenAI | o4-mini |
2025-04-16 |
| OpenAI | gpt-4.1 |
2025-04-14 |
| OpenAI | gpt-4.1-mini |
2025-04-14 |
| OpenAI | gpt-4.1-nano |
2025-04-14 |
| OpenAI | gpt-4o |
2024-11-20 |
| OpenAI | gpt-4o-mini |
2024-07-18 |
| OpenAI | gpt-oss-120b |
1 |
| Anthropic | claude-opus-4-8 |
1 |
| Anthropic | claude-opus-4-7 |
1 |
| Anthropic | claude-opus-4-6 |
1 |
| Anthropic | claude-sonnet-4-5 |
20250929 |
| Anthropic | claude-haiku-4-5 |
20251001 |
| xAI | grok-4-1-fast-reasoning |
1 |
| xAI | grok-4 |
1 |
| DeepSeek | DeepSeek-V3.2 |
1 |
| Meta | Llama-4-Maverick-17B-128E-Instruct-FP8 |
1 |
Unterstützte Regionen
Der Modell-Router unterstützt Global-Standard-Bereitstellungen in allen folgenden Regionen. Ein Häkchen (✅) gibt an, dass der Bereitstellungstyp verfügbar ist. Ein Bindestrich (-) gibt an, dass er nicht verfügbar ist.
| Region | Globaler Standard | Datenzonenstandard |
|---|---|---|
| Australia East | ✅ | ✅ |
| Brasilien Süd | ✅ | - |
| Canada East | ✅ | - |
| Central US | ✅ | ✅ |
| East US | ✅ | ✅ |
| Ost-USA 2 | ✅ | ✅ |
| France Central | ✅ | ✅ |
| Deutschland West Central | ✅ | ✅ |
| Italy North | ✅ | ✅ |
| Japan East | ✅ | ✅ |
| Japan West | ✅ | ✅ |
| Korea Central | ✅ | ✅ |
| Nord-Mittel-USA | ✅ | ✅ |
| Poland Central | ✅ | ✅ |
| Südafrika Nord | ✅ | - |
| Süd-Mittel-USA | ✅ | ✅ |
| South India | ✅ | ✅ |
| Südostasien | ✅ | ✅ |
| Spain Central | ✅ | ✅ |
| Schweden Zentral | ✅ | ✅ |
| Switzerland North | ✅ | ✅ |
| Westschweiz | ✅ | - |
| UK South | ✅ | - |
| Westen des Vereinigten Königreichs | ✅ | - |
| Zentralwesten der USA | ✅ | - |
| West Europe | ✅ | ✅ |
| West US | ✅ | ✅ |
| Westliches USA 3 | ✅ | ✅ |
Hinweis
Die in jeder Region im Modellrouter verfügbaren Modelle sind auf die in dieser Region unterstützten zugrunde liegenden Modelle beschränkt. Mit dieser regionalen Erweiterung können Sie Modellrouter verwenden, um Anforderungen über die verfügbaren unterstützten Modelle in jeder aufgeführten Region zu leiten.
Routingmodus
Wenn Sie die benutzerdefinierte Bereitstellung auswählen, können Sie mit der neuesten Version den Routingmodus auswählen, um die Qualität oder die Kosten zu optimieren und gleichzeitig ein grundlegendes Leistungsniveau aufrechtzuerhalten. Das Festlegen eines Routingmodus ist optional, und wenn Sie keinen Modus festlegen, wird die Bereitstellung standardmäßig im Modus "Ausgewogener Modus" festgelegt.
Verfügbare Routingmodi:
| Modus | Beschreibung |
|---|---|
| Ausgeglichen (Standard) | Berücksichtigt sowohl Kosten als auch Qualität dynamisch. Perfekt für allgemeine Szenarien |
| Qualität | Priorisiert für maximale Genauigkeit. Am besten geeignet für komplexes Denken oder kritische Ergebnisse |
| Kosten | Prioritisiert Kosteneinsparungen. Ideal für Workloads mit hohem Volumen bei eingeschränktem Budget |
Verwalten von Modellrouterbereitstellungen
Wenn Ihre Organisation Azure Policy verwendet, um zu steuern, welche Modelle bereitgestellt werden können, berücksichtigt der Modellrouter die gleiche integrierte Foundry-Modellbereitstellungsrichtlinie, die Standardmodellbereitstellungen steuert. Die Richtlinie gilt für die Modelluntermenge, die ein Entwickler in eine Modellrouterbereitstellung aufnehmen kann, und es wird konsistent über das Foundry-Portal, die REST-API, Azure CLI und ARM-Vorlagen erzwungen. Die Schritte für die Zuweisung von IT-Administratoren und die Entwicklerumgebung finden Sie unter Govern-Modellrouterbereitstellungen mit Azure Policy.
Modelluntermenge
Die neueste Version des Modellrouters unterstützt Modelluntermengen: Sie können angeben, welche zugrunde liegenden Modelle in Routingentscheidungen einbezogen werden sollen. Dadurch erhalten Sie mehr Kontrolle über Kosten-, Compliance- und Leistungsmerkmale.
Wenn neue Basismodelle bereitgestellt werden, sind sie nicht in Ihrer Auswahl enthalten, es sei denn, Sie fügen sie explizit zur Einschlussliste Ihrer Bereitstellung hinzu.
Automatisches Failover
Der Modell-Router enthält jetzt ein integriertes automatisches Failover. Wenn Sie die Standardbereitstellung zum Weiterleiten an alle unterstützten Modelle verwenden, leitet der Modellrouter die Anforderung transparent an das nächste am besten geeignete Modell um, sodass vorübergehende Probleme mit jedem einzelnen Modell Ihre Anwendung nicht stören. Failover ist standardmäßig aktiviert – es ist keine zusätzliche Konfiguration erforderlich.
Für benutzerdefinierte Bereitstellungskonfigurationen:
- Der ausgewählte Routingmodus (Ausgeglichen, Kosten oder Qualität) wird während des Failovers weiterhin angewendet.
- Ihre konfigurierte Modelluntermenge funktioniert auch als Fallbacksatz, um zu verhindern, dass Ihre Eingabeaufforderungen von nicht genehmigten Modellen verarbeitet werden. Achten Sie daher darauf, Modelluntermengen mit mindestens zwei Modellen auszuwählen, um von der Fallbackfunktion zu profitieren.
Promptzwischenspeicherung
Der Modellrouter unterstützt die Prompt-Zwischenspeicherung, da Anforderungen von den zugrunde liegenden Modellen verarbeitet werden, die diese Funktion unterstützen. Wenn der Modellrouter eine Anforderung an ein Modell delegiert, das das Zwischenspeichern unterstützt, werden zwischengespeicherte Token automatisch verwendet – es ist keine zusätzliche Konfiguration erforderlich.
Das Cacheverhalten hängt davon ab, welches zugrunde liegende Modell der Router für eine bestimmte Anforderung auswählt. Da Routingentscheidungen variieren können, gelten Zwischenspeicherungsvorteile nur, wenn dasselbe Modell aufeinander folgende Anforderungen mit überlappenden Eingabeaufforderungspräfixen verarbeitet.
Ausführliche Informationen dazu, wie das Zwischenspeichern von Aufforderungen funktioniert und welche Modelle dies unterstützen, finden Sie unter "Zwischenspeichern von Aufforderungen".
Einschränkungen
Um die Grenzwerte für Kontextfenster und Parameter zu überwinden, verwenden Sie das Modell-Teilmengenfeature, um Ihre Modelle für das Routing auszuwählen, die Ihre gewünschten Eigenschaften unterstützen.
Hinweis
Das für den Modellrouter aufgeführte Kontextfensterlimit ist die Grenze des kleinsten zugrunde liegenden Modells. Andere zugrunde liegende Modelle sind mit größeren Kontextfenstern kompatibel, was bedeutet, dass ein API-Aufruf mit einem größeren Kontext nur erfolgreich ausgeführt wird, wenn die Eingabeaufforderung an das richtige Modell weitergeleitet wird. Informationen zum Überprüfen von Kontextfenstern für die zugrunde liegenden Modelle finden Sie unter Azure OpenAI in Microsoft Foundry-Modellen.
Zum Kürzen des Kontextfensters können Sie eine der folgenden Aktionen ausführen:
- Fassen Sie die Eingabeaufforderung zusammen, bevor Sie sie an das Modell übergeben.
- Kürzen der Eingabeaufforderung in relevantere Teile
- Verwenden Sie Dokumenteinbettungen, und lassen Sie das Chatmodell relevante Abschnitte abrufen. Weitere Informationen finden Sie unter What is Azure KI-Suche?
Kontingentstufen
Die Limits des Modell-Routers richten sich nach der Nutzungsstufe Ihres Abonnements. Informationen dazu, wie Kontingentstufen funktionieren, finden Sie unter Kontingentstufen.
| Tier | GlobalStandard-RPM | GlobalStandard-TPM | DataZoneStandard-RPM | DataZoneStandard-TPM |
|---|---|---|---|---|
| Ebene 1 | 1,000 | 1,000,000 | 300 | 300,000 |
| Ebene 2 | 2.000 | 2,000,000 | 670 | 670.000 |
| Ebene 3 | 4,000 | 4.000.000 | 1,000 | 1,000,000 |
| Ebene 4 | 7,000 | 7,000,000 | 2.000 | 2,000,000 |
| Ebene 5 | 10.000 | 10,000,000 | 3,000 | 3,000,000 |
| Ebene 6 | 15,000 | 15.000.000 | 4,000 | 4.000.000 |
Weitere Informationen zum Zinslimit finden Sie unter "Kontingente und Grenzwerte".
Modellrouter akzeptiert Bildeingaben für visionfähige Chats (alle zugrunde liegenden Modelle können Bildeingaben akzeptieren), die Routingentscheidung basiert jedoch nur auf der Texteingabe.
Der Modellrouter verarbeitet keine Audioeingabe.
Problembehandlung
| Angelegenheit | Auflösung |
|---|---|
| Bereitstellung schlägt fehl | Überprüfen Sie, ob sich Die Foundry-Ressource in einer unterstützten Region befindet. |
| keine Weiterleitung von Claude-Modellen | Stellen Sie sicher, dass Claude-Modelle separat bereitgestellt werden, bevor Sie den Modellrouter aktivieren. |
| Fehler „Kontext überschritten“ | Verringern Sie die Größe der Eingabeaufforderung, oder verwenden Sie modelluntermenge, um Modelle mit größeren Kontextfenstern auszuwählen. |
| Unerwartete Modellauswahl | Überprüfen Sie die Einstellung für den Routingmodus (Ausgewogen, Kosten, Qualität) und die Teilkonfiguration des Modells. |
Ausführliche Problembehandlung bei der Bereitstellung finden Sie unter Verwenden des Modellrouters.
Abrechnungsinformationen
Die Nutzung des Modellrouters wird für Eingabeaufforderungen zum in der Preisseite angegebenen Preis berechnet.
Sie können die Kosten Ihrer Modellrouterbereitstellung im Azure Portal überwachen.