Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Zurzeit wird folgendes angezeigt:Neue Version des Foundry-Portals - Wechseln zur Version für das klassische Foundry-Portal
Bevor Sie eine provisionierte Bereitstellung erstellen, schätzen Sie ab, wie viele provisionierte Durchsatzeinheiten (PTUs) für Ihre Workload erforderlich sind. Dieser Artikel stellt die benötigten Durchsatzparameter pro Modell bereit und zeigt, wie Sie den PTU-Bedarf mithilfe von Dimensionierungsformeln oder des Foundry-Kapazitätsrechners berechnen.
Wenn Sie mit dem bereitgestellten Durchsatz noch nicht vertraut sind, lesen Sie zunächst Was ist bereitgestellter Durchsatz für Foundry Models?. Wenn Sie bereit sind, Ihre Bereitstellung zu erstellen, lesen Sie Schnellstart: Erstellen einer Bereitstellung mit bereitgestelltem Durchsatz.
Voraussetzungen
- Vertrautheit mit den Konzepten in Was ist der bereitgestellte Durchsatz für Foundry Models?.
- Eine Schätzung Ihrer Workloadmerkmale: erwartete Spitzenanforderungen pro Minute (RPM), durchschnittliche Eingabeaufforderungsgröße in Token und durchschnittliche Antwortgröße in Token.
Geschätzte PTUs erforderlich
Zur Schätzung der Anzahl der für eine Arbeitsauslastung erforderlichen PTUs stehen zwei Ansätze zur Verfügung:
- Verwenden Sie die Größenformeln, um die Berechnung vollständig zu kontrollieren.
- Nutzen Sie den Foundry-Kapazitätsrechner für eine schrittweise Abschätzung.
Beide Ansätze verwenden werte pro Modell aus den Bereitstellungsparametertabellen , um Schätzungen zu generieren. Vergleichen Sie für die genauesten Ergebnisse eine Bereitstellung mit repräsentativem Datenverkehr, anstatt sich ausschließlich auf geschätzte Eingaben zu verlassen.
Note
Bei älteren Modellen (vor GPT-4o) wirkt sich die Anforderungs-/Anruf-Shape-Verteilung auf den Kapazitätsverbrauch aus: Eine kleine Anzahl großer Anrufe kann wesentlich mehr Kapazität verbrauchen als viele kleine Anrufe mit derselben durchschnittlichen Tokenanzahl. Für GPT-4o und spätere Modelle ist TPM pro PTU für Input- und Output-Token separat festgelegt, sodass dieser Staffelungseffekt nicht gilt.
Manuelles Abschätzen
Sie können die PTUs, die Ihre Workload erfordert, anhand der modellspezifischen Werte aus den Tabellen zu den Bereitstellungsparametern und Informationen über Ihr erwartetes Datenverkehrsaufkommen wie folgt schätzen:
| Eingabe | Description |
|---|---|
| Modell | Das Modell, das Sie bereitstellen möchten, z. B. gpt-5.2. Bestimmt, welche Eingabe-TPM-Werte pro PTU und Ausgabe-zu-Eingabe-Verhältnis aus den Bereitstellungsparametertabellen verwendet werden sollen. |
| Bereitstellungstyp | Der bereitgestellte Bereitstellungstyp: „Global bereitgestellt“, „Für Datenzonen bereitgestellt“ oder „Regional bereitgestellt“. |
| Höchstdrehzahl | Die erwartete Spitzenanzahl von Anrufen pro Minute, die an das Modell gesendet werden. |
| Durchschnittliche Eingabeaufforderungsgröße | Die durchschnittliche Anzahl von Eingabetoken pro Anforderung. |
| Durchschnittliche Antwortgröße | Die durchschnittliche Anzahl der Ausgabetoken pro Anforderung. |
| Cache-Rate | Der Prozentsatz der Eingabetoken, die aus dem Eingabeaufforderungscache bereitgestellt werden. Verwenden Sie 0, wenn kein Caching verwendet wird. Zwischengespeicherte Token werden von der Auslastungsberechnung 100% abgezogen und verbrauchen keine PTU-Kapazität. |
Normalisiertes TPM
Die manuelle Berechnung von PTUs konvertiert das erwartete Tokenvolume in eine einzelne Zahl, die als normalisiertes TPM bezeichnet wird. Die Anzahl der erforderlichen PTUs wird dann bestimmt, indem das normalisierte TPM durch den Eingabe-TPM-Wert des Modells pro PTU-Wert dividiert wird.
Formeln:
- Input TPM = Peak RPM × durchschnittliche Eingabeaufforderungsgröße (Token)
- Output TPM = Peak RPM × durchschnittliche Antwortgröße (Token)
- Normalisiertes TPM = (Eingabe-TPM × (1 − Cache-Rate)) + ((Verhältnis von Ausgabe zu Eingabe) × Ausgabe-TPM)
- erforderliche PTUs = normalisierte TPM ÷ Eingabe-TPM pro PTU
Durchgerechnetes Beispiel:
Angenommen, Ihre Anwendung sendet Anfragen mit einer Spitzenrate von 1.000 Anfragen pro Minute, einer durchschnittlichen Promptgröße von 200 Token und einer durchschnittlichen Antwortgröße von 20 Token und verwendet dabei das Modell gpt-5.2 mit einer Bereitstellung mit bereitgestelltem Durchsatz in der Data Zone. Aus der Tabelle weist gpt-5.2 ein Eingabe-TPM pro PTU von 3.400 und ein Ausgabe-zu-Eingabe-Verhältnis von 8 auf.
- Eingabe-TPM = 1.000 × 200 = 200.000
- Ausgabe-TPM = 1.000 × 20 = 20.000
- Normalisiertes TPM (kein Cache) = 200.000 + (8 × 20.000) = 360.000
- PTUs erforderlich = 360.000 ÷ 3.400 = 105,88 (110 PTUs, aufgerundet auf das nächste Vielfache von 5 PTUs, entsprechend dem Skalierungsinkrement für „Data Zone Provisioned“ für gpt-5.2.)
Wenn 50% von Eingabetoken aus dem Eingabeaufforderungscache bereitgestellt werden:
- Effektives Eingabe-TPM = 200.000 × (1 − 0,50) = 100.000
- Normalisiertes TPM = 100.000 + (8 × 20.000) = 260.000
- PTUs erforderlich = 260.000 ÷ 3.400 = 76.47 (80 PTUs aufgerundet auf die nächsten 5 PTUs, die dem in der Datenzone bereitgestellten Skalierungsmaßstab für gpt-5.2 entsprechen.)
Zusammenfassend sind die für die Form dieses Beispielaufrufs mit und ohne Zwischenspeicherung erforderlichen PTUs wie folgt:
| Spitzenanrufe pro Minute (RPM) | Aufforderungsgröße (Token) | Antwortgröße (Token) | Cacherate | Eingabe-TPM | Ausgabe-TPM | Normalisiertes TPM | Geschätzte PTUs | PTUs (aufgerundet)1 |
|---|---|---|---|---|---|---|---|---|
| 1.000 | 200 | 20 | 0 % | 200,000 | 20,000 | 360.000 | 105.88 | 110 |
| 1.000 | 200 | 20 | 50 % | 100,000 | 20,000 | 260.000 | 76.47 | 80 |
1 Auf das nächste Vielfache von 5 PTUs aufgerundet, entsprechend dem Skalierungsinkrement von „in einer Datenzone bereitgestellt“ für gpt-5.2.
Verwenden des Kapazitätsrechners
Verwenden Sie den Kapazitätsrechner im Gießereiportal, um bestimmte Workload-Shapes zu vergrößern. Suchen Sie den Rechner auf der Seite Kontingent und geben Sie die folgenden Parameter entsprechend dem Workload ein:
| Eingabe | Description |
|---|---|
| Modell | Das Modell, das Sie verwenden möchten. |
| Version | Die Version des Modells, das Sie verwenden möchten. |
| Spitzenanrufe pro Min. | Die Anzahl der Anrufe pro Minute, die an das Modell gesendet werden soll. |
| Token im Prompt-Aufruf | Die Anzahl der Tokens im Prompt für jeden Aufruf des Modells. Anrufe mit größeren Eingabeaufforderungen verbrauchen mehr PTU-Kapazität. Der Rechner geht von einer einzelnen Promptgröße aus – bei Workloads mit stark schwankender Promptgröße sollten Sie eine Bereitstellung anhand Ihres tatsächlichen Datenverkehrs testen, um eine genauere Schätzung zu erhalten. |
| Token in Modellantwort | Die Anzahl der pro Aufruf generierten Token, auch als Generierungsgröße bezeichnet. Anrufe mit größeren Generationgrößen verbrauchen mehr PTU-Kapazität. Wie bei Eingabeaufforderungstoken geht der Rechner von einem einzelnen Wert aus. |
| Cache-Rate | Anteil der Eingabetoken, die aus dem Prompt-Cache bereitgestellt werden. |
Nachdem Sie die erforderlichen Details ausgefüllt haben, wählen Sie "Berechnen" aus. Die Ausgabe zeigt:
- Die geschätzte PTU-Anzahl, die für die Workload erforderlich ist. Dieser Wert wird auf den nächsten PTU-Skalierungsschritt für den ausgewählten Bereitstellungstyp oder auf die minimale PTU-Anzahl des Bereitstellungstyps aufgerundet, je nachdem, welcher größer ist.
- Die rohe (nicht gerundete) geschätzte PTU-Anzahl.
Auswirkungen von Eingabe- und Ausgabetoken auf den Durchsatz
Der Durchsatz (gemessen als Token pro Minute oder TPM), den eine Bereitstellung pro PTU erhält, hängt vom Modell und der Mischung aus Eingabe- und Ausgabetoken in einer bestimmten Minute ab. Das Generieren von Ausgabetoken erfordert mehr Verarbeitungskapazität als die Nutzung von Eingabetoken.
Für GPT-4.1-Modelle und höher bestimmt das System ein Ausgabe-zu-Eingabe-Verhältnis , das dem globalen Standardpreisverhältnis zwischen Eingabe- und Ausgabetoken entspricht, mit Ausnahmen für einige Modelle. Beispiel:
- Für gpt-5 zählt ein Ausgabetoken für Ihr Nutzungslimit als acht Eingabetoken, was dem Verhältnis des globalen Standardpreises des Modells entspricht.
- Für gpt-4.1 zählt ein Ausgabetoken als vier Eingabetoken.
- Ältere Modelle verwenden unterschiedliche Verhältnisse.
Für alle Bereitstellungen werden zwischengespeicherte Token bei der Auslastungsberechnung zu 100 % abgezogen; das heißt, dass wiederholte Prompt-Token keine PTU-Kapazität verbrauchen. Weitere Informationen finden Sie unter Prompt-Caching.
Modelle mit einem nicht standardmäßigen Ausgabe-zu-Eingabe-Verhältnis
Einige Modelle verwenden ein Output-to-Input-Verhältnis, das sich von ihrem globalen Standardpreisverhältnis unterscheidet. Bei Llama-3.3-70B-Instruct zählt beispielsweise ein Ausgabetoken als vier Eingabetoken für Ihr Nutzungslimit, was vom standardmäßigen Preisverhältnis dieses Modells abweicht. Sehen Sie sich die Preise für Llama-Modelle für die vollständige Aufschlüsselung der Eingabe- und Ausgabepreise an.
Bereitstellungsparameter und Durchsatzwerte nach Modell
Die Tabellen in diesem Abschnitt enthalten die Durchsatz- und Bereitstellungsparameter für jedes unterstützte Modell. Informationen dazu, was die Parameter in jeder Zeile bedeuten, finden Sie im Anhang.
Neueste Azure OpenAI-Modelle
Note
Die Latenzvorgaben in der folgenden Tabelle berücksichtigen lange Kontexte nicht, d. h. Anfragen, die den Schwellenwert überschreiten:
-
128k Prompt-Token für
gpt-5.4,gpt-4.1,gpt-4.1-miniundgpt-4.1-nano -
272k-Aufforderungstoken für
gpt-5.6-luna,gpt-5.6-solundgpt-5.6-terra
Das System leitet diese Anfragen, sofern verfügbar, an Spillover-Bereitstellungen weiter. Andernfalls geben die Anfragen einen Fehler zurück.
| Thema |
gpt-5.6-luna, 2026-07-09 |
gpt-5.6-terra, 2026-07-09 |
gpt-5.6-sol, 2026-07-09 |
gpt-5.5, 2026-04-24 |
gpt-5.4, 2026-03-05 |
gpt-5.4-mini, 2026-03-17 |
gpt-5.3-codex, 2026-02-24 |
gpt-5.2, 2025-12-11 |
gpt-5.2-codex, 2026-01-14 |
gpt-5.1, 2025-11-13 |
gpt-5.1-codex, 2025-11-13 |
gpt-5, 2025-08-07 |
gpt-5-mini, 2025-08-07 |
gpt-4.1, 2025-04-14 |
gpt-4.1-mini, 2025-04-14 |
gpt-4.1-nano, 2025-04-14 |
o3, 2025-04-16 |
o4-mini, 2025-04-16 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Globale & in einer Datenzone bereitgestellte Mindestbereitstellung | 15 | 15 | 15 | 15 | 15 | 15 | 15 | 15 | 15 | 15 | 15 | 15 | 15 | 15 | 15 | 15 | 15 | 15 |
| Globales & in einer Datenzone bereitgestelltes Skalierungsinkrement | 5 | 5 | 5 | 5 | 5 | 5 | 5 | 5 | 5 | 5 | 5 | 5 | 5 | 5 | 5 | 5 | 5 | 5 |
| Regionale Bereitstellung mit minimalem Einsatz | 50 | 50 | 50 | 50 | 50 | 25 | 50 | 50 | 50 | 50 | 50 | 50 | 25 | 50 | 25 | 25 | 50 | 25 |
| Regionale bereitgestellte Skalierungsschritte | 50 | 50 | 50 | 50 | 50 | 25 | 50 | 50 | 50 | 50 | 50 | 50 | 25 | 50 | 25 | 25 | 50 | 25 |
| Eingabe-TPM pro PTU | 30,000 | 3,000 | 1,200 | 1,200 | 2,400 | 7,900 | 3,400 | 3,400 | 3,400 | 4,750 | 4,750 | 4,750 | 23.750 | 3,000 | 14,900 | 59.400 | 3,000 | 5,400 |
| Ausgabe-zu-Eingabe-Verhältnis | 6 | 6 | 6 | 6 | 6 | 6 | 8 | 8 | 8 | 8 | 8 | 8 | 8 | 4 | 4 | 4 | 4 | 4 |
| Latenzzielwert1 | 99 % > 100 TPS | 99 % > 70 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 100 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 80 TPS | 99 % > 80 TPS | 99 % > 90 TPS | 99 % > 100 TPS | 99 % > 80 TPS | 99 % > 90 TPS |
1 Berechnet als p50-Anforderungslatenz pro 5 Minuten. TPS = Token pro Sekunde.
Vorherige Azure OpenAI-Modelle
| Thema | gpt-4o | gpt-4o-mini | o3-mini | o1 |
|---|---|---|---|---|
| Globale & in einer Datenzone bereitgestellte Mindestbereitstellung | 15 | 15 | 15 | 15 |
| Globales & in einer Datenzone bereitgestelltes Skalierungsinkrement | 5 | 5 | 5 | 5 |
| Regionale Bereitstellung mit minimalem Einsatz | 50 | 25 | 25 | 25 |
| Regionale bereitgestellte Skalierungsschritte | 50 | 25 | 25 | 50 |
| Eingabe-TPM pro PTU | 2,500 | 37,000 | 2,500 | 230 |
| Ausgabe-zu-Eingabe-Verhältnis | 4 | 4 | 4 | 4 |
| Latenzzielwert1 | 99 % > 25 TPS | 99 % > 33 TPS | 99 % > 66 TPS | 99 % > 25 TPS |
1 Berechnet als durchschnittliche Anforderungslatenz pro Minute über den Monat hinweg. TPS = Token pro Sekunde.
Von Azure verkaufte Gießereimodelle
In diesem Abschnitt werden weitere von Azure verkaufte Foundry Models aufgeführt, nicht einschließlich der in den vorherigen Tabellen aufgeführten Azure OpenAI in Foundry Models.
| Thema | Llama-3.3-70B-Instruct |
|---|---|
| Global und in der Datenzone bereitgestellte Mindestbereitstellung | 100 |
| Global und in der Datenzone bereitgestellter Skalierungsschritt | 100 |
| Regionale Bereitstellung mit minimalem Einsatz | NA |
| Regionale bereitgestellte Skalierungsschritte | NA |
| Eingabe-TPM pro PTU | 8,450 |
| Ausgabe-zu-Eingabe-Verhältnis | 41 |
| Latenzzielwert2 | 99 % > 50 TPS |
1 Für Llama-3.3-70B-Instruct wird ein Ausgabetoken als vier Eingabetoken auf Ihr Nutzungslimit angerechnet. Dieses Verhältnis unterscheidet sich vom globalen Standardpreisverhältnis zwischen Eingabe- und Ausgabetoken. Siehe Modelle mit einem nicht standardmäßigen Ausgabe-zu-Eingabe-Verhältnis und llama-Modellpreisen.
2 Berechnet als durchschnittliche Anforderungslatenz pro Minute über den Monat hinweg. TPS = Token pro Sekunde.
Feuerwerk bei den Microsoft Foundry-Modellen
Die folgenden Fireworks in Microsoft Foundry-Modelle unterstützen sowohl den bereitgestellten Durchsatz für den globalen als auch für den US-Datenspeicherstandort.
| Thema | DeepSeek v3.1 | DeepSeek v3.2 | DeepSeek V4 Flash 0731 | DeepSeek V4 Pro | Gemma 4 26B A4B IT | Gemma 4 31B IT | GLM-4.7 | GLM 5 | GLM-5.1 | GLM 5.2 | gpt-oss-20b | gpt-oss-120b | Inkling | Kimi K2 Instruct 0905 | Kimi K2 Thinking | Kimi K2.5 | Kimi K2.6 | Kimi K2.7 Code | MiniMax M2.5 | MiniMax M3 | Ministral 3 3B Instruct 2512 | Nemotron 3.5 Blitz | Nemotron Super 120B | Nemotron 3 Ultra NVFP4 | PaddleOCR VL 1.6 | Qwen 3 14B | Qwen 3 32B | Qwen 3.5 4B | Qwen 3.5 9B | Qwen 3.5 27B | Qwen 3.5 35B A3B | Qwen 3.5 112B A10B | Qwen 3.5 397B | Qwen 3.6 27B | Qwen 3.6 35B A3B |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Minimale Bereitstellung | 200 | 300 | 100 | 400 | 200 | 200 | 200 | 300 | 400 | 400 | 80 | 40 | 400 | 200 | 200 | 200 | 200 | 200 | 400 | 400 | 40 | 50 | 100 | 200 | 40 | 80 | 80 | 80 | 40 | 550 | 40 | 100 | 100 | 40 | 40 |
| Skaleninkrement | 100 | 150 | 50 | 200 | 100 | 100 | 100 | 150 | 200 | 200 | 40 | 20 | 200 | 100 | 100 | 100 | 100 | 100 | 200 | 200 | 20 | 25 | 50 | 100 | 20 | 40 | 40 | 40 | 20 | 275 | 20 | 50 | 50 | 20 | 20 |
| Eingabe-TPM pro PTU | 2.100 | 3,000 | 2,800 | 200 | 5,400 | 2.200 | 6.000 | 600 | 900 | 300 | 25,000 | 13,500 | 3,850 | 2,500 | 1,400 | 1,060 | 4,000 | 2.000 | 5.300 | 5.300 | 25,400 | 60.350 | 4,850 | 1,100 | 341,500 | 4,800 | 5.000 | 35,500 | 10.700 | 2,730 | 17,800 | 5.600 | 4.250 | 7,700 | 31,000 |
| Latenzzielwert1 | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS | 99 % > 50 TPS |
1 Berechnet als durchschnittliche Anforderungslatenz pro Minute über den Monat hinweg. TPS = Token pro Sekunde.
Anhang
Jede Zeile in den Tabellen entspricht einem der folgenden Parameter:
| Parameter | Description |
|---|---|
| Globale & in einer Datenzone bereitgestellte Mindestbereitstellung | Die kleinste Anzahl von PTUs, die Sie für die Bereitstellungstypen "Global Provisioned" oder "Data Zone Provisioned" bereitstellen können. Beispielsweise erfordert gpt-5.2 mindestens eine Bereitstellung von 15 PTUs. |
| Globales & in einer Datenzone bereitgestelltes Skalierungsinkrement | Die PTU-Schrittweite, mit der Sie eine global bereitgestellte oder für Datenzonen bereitgestellte Bereitstellung erhöhen oder verringern können. Wenn Sie mit dem gpt-5.2-Beispiel fortfahren, bedeutet eine Erhöhung von 5, dass Bereitstellungen auf 15, 20, 25 usw. angepasst werden können. |
| Regionale bereitgestellte Mindestbereitstellung | Die kleinste Anzahl von PTUs, die Sie für eine regional bereitgestellte Bereitstellung einsetzen können. Beispielsweise erfordert gpt-5.2 eine mindestens regionale Bereitstellung von 50 PTUs. |
| Regionale bereitgestellte Skalierungsschritte | Die PTU-Inkrementierung für regionale Bereitstellungen. Wenn Sie mit dem gpt-5.2-Beispiel fortfahren, bedeutet eine Erhöhung von 50, dass Bereitstellungen auf 50, 100, 150 usw. angepasst werden können. |
| Eingabe-TPM pro PTU | Die maximalen Eingabetoken pro Minute (TPM), die von einem PTU unterstützt werden. Verwenden Sie diesen Wert beim Schätzen von PTUs. |
| Ausgabe-zu-Eingabe-Verhältnis | Die Gewichtung, die beim Schätzen der PTU-Anforderungen auf Ausgabetoken angewendet wird. Dieser Wert spiegelt das globale Standardpreisverhältnis des Modells zwischen Ausgabe- und Eingabetoken mit Ausnahmen für einige Modelle wider. Beispielsweise bedeutet ein Verhältnis von 8, dass ein Ausgabetoken als acht Eingabetoken in Richtung des TPM-Grenzwerts des Modells zählt. Siehe Azure OpenAI-Preise, Llama-Modellpreise und DeepSeek-Modellpreise für aktuelle Preise. |
| Zielwert der Latenz | Die erwartete Anforderungslatenz auf der angegebenen PTU-Auslastungsebene. Ausgedrückt als Perzentilschwelle – zum Beispiel bedeutet „99% > 50 TPS“, dass 99 % der Anfragen mit einer Rate von mehr als 50 Token pro Sekunde verarbeitet werden. |