Die PTU-Dimensionierung für einen Workload bestimmen

Zurzeit wird folgendes angezeigt:Neue Version des Foundry-Portals - Wechseln zur Version für das klassische Foundry-Portal

Bevor Sie eine provisionierte Bereitstellung erstellen, schätzen Sie ab, wie viele provisionierte Durchsatzeinheiten (PTUs) für Ihre Workload erforderlich sind. Dieser Artikel stellt die benötigten Durchsatzparameter pro Modell bereit und zeigt, wie Sie den PTU-Bedarf mithilfe von Dimensionierungsformeln oder des Foundry-Kapazitätsrechners berechnen.

Wenn Sie mit dem bereitgestellten Durchsatz noch nicht vertraut sind, lesen Sie zunächst Was ist bereitgestellter Durchsatz für Foundry Models?. Wenn Sie bereit sind, Ihre Bereitstellung zu erstellen, lesen Sie Schnellstart: Erstellen einer Bereitstellung mit bereitgestelltem Durchsatz.

Voraussetzungen

Geschätzte PTUs erforderlich

Zur Schätzung der Anzahl der für eine Arbeitsauslastung erforderlichen PTUs stehen zwei Ansätze zur Verfügung:

Beide Ansätze verwenden werte pro Modell aus den Bereitstellungsparametertabellen , um Schätzungen zu generieren. Vergleichen Sie für die genauesten Ergebnisse eine Bereitstellung mit repräsentativem Datenverkehr, anstatt sich ausschließlich auf geschätzte Eingaben zu verlassen.

Note

Bei älteren Modellen (vor GPT-4o) wirkt sich die Anforderungs-/Anruf-Shape-Verteilung auf den Kapazitätsverbrauch aus: Eine kleine Anzahl großer Anrufe kann wesentlich mehr Kapazität verbrauchen als viele kleine Anrufe mit derselben durchschnittlichen Tokenanzahl. Für GPT-4o und spätere Modelle ist TPM pro PTU für Input- und Output-Token separat festgelegt, sodass dieser Staffelungseffekt nicht gilt.

Manuelles Abschätzen

Sie können die PTUs, die Ihre Workload erfordert, anhand der modellspezifischen Werte aus den Tabellen zu den Bereitstellungsparametern und Informationen über Ihr erwartetes Datenverkehrsaufkommen wie folgt schätzen:

Eingabe Description
Modell Das Modell, das Sie bereitstellen möchten, z. B. gpt-5.2. Bestimmt, welche Eingabe-TPM-Werte pro PTU und Ausgabe-zu-Eingabe-Verhältnis aus den Bereitstellungsparametertabellen verwendet werden sollen.
Bereitstellungstyp Der bereitgestellte Bereitstellungstyp: „Global bereitgestellt“, „Für Datenzonen bereitgestellt“ oder „Regional bereitgestellt“.
Höchstdrehzahl Die erwartete Spitzenanzahl von Anrufen pro Minute, die an das Modell gesendet werden.
Durchschnittliche Eingabeaufforderungsgröße Die durchschnittliche Anzahl von Eingabetoken pro Anforderung.
Durchschnittliche Antwortgröße Die durchschnittliche Anzahl der Ausgabetoken pro Anforderung.
Cache-Rate Der Prozentsatz der Eingabetoken, die aus dem Eingabeaufforderungscache bereitgestellt werden. Verwenden Sie 0, wenn kein Caching verwendet wird. Zwischengespeicherte Token werden von der Auslastungsberechnung 100% abgezogen und verbrauchen keine PTU-Kapazität.

Normalisiertes TPM

Die manuelle Berechnung von PTUs konvertiert das erwartete Tokenvolume in eine einzelne Zahl, die als normalisiertes TPM bezeichnet wird. Die Anzahl der erforderlichen PTUs wird dann bestimmt, indem das normalisierte TPM durch den Eingabe-TPM-Wert des Modells pro PTU-Wert dividiert wird.

Formeln:

  • Input TPM = Peak RPM × durchschnittliche Eingabeaufforderungsgröße (Token)
  • Output TPM = Peak RPM × durchschnittliche Antwortgröße (Token)
  • Normalisiertes TPM = (Eingabe-TPM × (1 − Cache-Rate)) + ((Verhältnis von Ausgabe zu Eingabe) × Ausgabe-TPM)
  • erforderliche PTUs = normalisierte TPM ÷ Eingabe-TPM pro PTU

Durchgerechnetes Beispiel:

Angenommen, Ihre Anwendung sendet Anfragen mit einer Spitzenrate von 1.000 Anfragen pro Minute, einer durchschnittlichen Promptgröße von 200 Token und einer durchschnittlichen Antwortgröße von 20 Token und verwendet dabei das Modell gpt-5.2 mit einer Bereitstellung mit bereitgestelltem Durchsatz in der Data Zone. Aus der Tabelle weist gpt-5.2 ein Eingabe-TPM pro PTU von 3.400 und ein Ausgabe-zu-Eingabe-Verhältnis von 8 auf.

  • Eingabe-TPM = 1.000 × 200 = 200.000
  • Ausgabe-TPM = 1.000 × 20 = 20.000
  • Normalisiertes TPM (kein Cache) = 200.000 + (8 × 20.000) = 360.000
  • PTUs erforderlich = 360.000 ÷ 3.400 = 105,88 (110 PTUs, aufgerundet auf das nächste Vielfache von 5 PTUs, entsprechend dem Skalierungsinkrement für „Data Zone Provisioned“ für gpt-5.2.)

Wenn 50% von Eingabetoken aus dem Eingabeaufforderungscache bereitgestellt werden:

  • Effektives Eingabe-TPM = 200.000 × (1 − 0,50) = 100.000
  • Normalisiertes TPM = 100.000 + (8 × 20.000) = 260.000
  • PTUs erforderlich = 260.000 ÷ 3.400 = 76.47 (80 PTUs aufgerundet auf die nächsten 5 PTUs, die dem in der Datenzone bereitgestellten Skalierungsmaßstab für gpt-5.2 entsprechen.)

Zusammenfassend sind die für die Form dieses Beispielaufrufs mit und ohne Zwischenspeicherung erforderlichen PTUs wie folgt:

Spitzenanrufe pro Minute (RPM) Aufforderungsgröße (Token) Antwortgröße (Token) Cacherate Eingabe-TPM Ausgabe-TPM Normalisiertes TPM Geschätzte PTUs PTUs (aufgerundet)1
1.000 200 20 0 % 200,000 20,000 360.000 105.88 110
1.000 200 20 50 % 100,000 20,000 260.000 76.47 80

1 Auf das nächste Vielfache von 5 PTUs aufgerundet, entsprechend dem Skalierungsinkrement von „in einer Datenzone bereitgestellt“ für gpt-5.2.

Verwenden des Kapazitätsrechners

Verwenden Sie den Kapazitätsrechner im Gießereiportal, um bestimmte Workload-Shapes zu vergrößern. Suchen Sie den Rechner auf der Seite Kontingent und geben Sie die folgenden Parameter entsprechend dem Workload ein:

Eingabe Description
Modell Das Modell, das Sie verwenden möchten.
Version Die Version des Modells, das Sie verwenden möchten.
Spitzenanrufe pro Min. Die Anzahl der Anrufe pro Minute, die an das Modell gesendet werden soll.
Token im Prompt-Aufruf Die Anzahl der Tokens im Prompt für jeden Aufruf des Modells. Anrufe mit größeren Eingabeaufforderungen verbrauchen mehr PTU-Kapazität. Der Rechner geht von einer einzelnen Promptgröße aus – bei Workloads mit stark schwankender Promptgröße sollten Sie eine Bereitstellung anhand Ihres tatsächlichen Datenverkehrs testen, um eine genauere Schätzung zu erhalten.
Token in Modellantwort Die Anzahl der pro Aufruf generierten Token, auch als Generierungsgröße bezeichnet. Anrufe mit größeren Generationgrößen verbrauchen mehr PTU-Kapazität. Wie bei Eingabeaufforderungstoken geht der Rechner von einem einzelnen Wert aus.
Cache-Rate Anteil der Eingabetoken, die aus dem Prompt-Cache bereitgestellt werden.

Nachdem Sie die erforderlichen Details ausgefüllt haben, wählen Sie "Berechnen" aus. Die Ausgabe zeigt:

  • Die geschätzte PTU-Anzahl, die für die Workload erforderlich ist. Dieser Wert wird auf den nächsten PTU-Skalierungsschritt für den ausgewählten Bereitstellungstyp oder auf die minimale PTU-Anzahl des Bereitstellungstyps aufgerundet, je nachdem, welcher größer ist.
  • Die rohe (nicht gerundete) geschätzte PTU-Anzahl.

Auswirkungen von Eingabe- und Ausgabetoken auf den Durchsatz

Der Durchsatz (gemessen als Token pro Minute oder TPM), den eine Bereitstellung pro PTU erhält, hängt vom Modell und der Mischung aus Eingabe- und Ausgabetoken in einer bestimmten Minute ab. Das Generieren von Ausgabetoken erfordert mehr Verarbeitungskapazität als die Nutzung von Eingabetoken.

Für GPT-4.1-Modelle und höher bestimmt das System ein Ausgabe-zu-Eingabe-Verhältnis , das dem globalen Standardpreisverhältnis zwischen Eingabe- und Ausgabetoken entspricht, mit Ausnahmen für einige Modelle. Beispiel:

  • Für gpt-5 zählt ein Ausgabetoken für Ihr Nutzungslimit als acht Eingabetoken, was dem Verhältnis des globalen Standardpreises des Modells entspricht.
  • Für gpt-4.1 zählt ein Ausgabetoken als vier Eingabetoken.
  • Ältere Modelle verwenden unterschiedliche Verhältnisse.

Für alle Bereitstellungen werden zwischengespeicherte Token bei der Auslastungsberechnung zu 100 % abgezogen; das heißt, dass wiederholte Prompt-Token keine PTU-Kapazität verbrauchen. Weitere Informationen finden Sie unter Prompt-Caching.

Modelle mit einem nicht standardmäßigen Ausgabe-zu-Eingabe-Verhältnis

Einige Modelle verwenden ein Output-to-Input-Verhältnis, das sich von ihrem globalen Standardpreisverhältnis unterscheidet. Bei Llama-3.3-70B-Instruct zählt beispielsweise ein Ausgabetoken als vier Eingabetoken für Ihr Nutzungslimit, was vom standardmäßigen Preisverhältnis dieses Modells abweicht. Sehen Sie sich die Preise für Llama-Modelle für die vollständige Aufschlüsselung der Eingabe- und Ausgabepreise an.

Bereitstellungsparameter und Durchsatzwerte nach Modell

Die Tabellen in diesem Abschnitt enthalten die Durchsatz- und Bereitstellungsparameter für jedes unterstützte Modell. Informationen dazu, was die Parameter in jeder Zeile bedeuten, finden Sie im Anhang.

Neueste Azure OpenAI-Modelle

Note

Die Latenzvorgaben in der folgenden Tabelle berücksichtigen lange Kontexte nicht, d. h. Anfragen, die den Schwellenwert überschreiten:

  • 128k Prompt-Token für gpt-5.4, gpt-4.1, gpt-4.1-mini und gpt-4.1-nano
  • 272k-Aufforderungstoken für gpt-5.6-luna, gpt-5.6-solund gpt-5.6-terra

Das System leitet diese Anfragen, sofern verfügbar, an Spillover-Bereitstellungen weiter. Andernfalls geben die Anfragen einen Fehler zurück.

Thema gpt-5.6-luna,
2026-07-09
gpt-5.6-terra,
2026-07-09
gpt-5.6-sol,
2026-07-09
gpt-5.5,
2026-04-24
gpt-5.4,
2026-03-05
gpt-5.4-mini,
2026-03-17
gpt-5.3-codex,
2026-02-24
gpt-5.2,
2025-12-11
gpt-5.2-codex,
2026-01-14
gpt-5.1,
2025-11-13
gpt-5.1-codex,
2025-11-13
gpt-5,
2025-08-07
gpt-5-mini,
2025-08-07
gpt-4.1,
2025-04-14
gpt-4.1-mini,
2025-04-14
gpt-4.1-nano,
2025-04-14
o3,
2025-04-16
o4-mini,
2025-04-16
Globale & in einer Datenzone bereitgestellte Mindestbereitstellung 15 15 15 15 15 15 15 15 15 15 15 15 15 15 15 15 15 15
Globales & in einer Datenzone bereitgestelltes Skalierungsinkrement 5 5 5 5 5 5 5 5 5 5 5 5 5 5 5 5 5 5
Regionale Bereitstellung mit minimalem Einsatz 50 50 50 50 50 25 50 50 50 50 50 50 25 50 25 25 50 25
Regionale bereitgestellte Skalierungsschritte 50 50 50 50 50 25 50 50 50 50 50 50 25 50 25 25 50 25
Eingabe-TPM pro PTU 30,000 3,000 1,200 1,200 2,400 7,900 3,400 3,400 3,400 4,750 4,750 4,750 23.750 3,000 14,900 59.400 3,000 5,400
Ausgabe-zu-Eingabe-Verhältnis 6 6 6 6 6 6 8 8 8 8 8 8 8 4 4 4 4 4
Latenzzielwert1 99 % > 100 TPS 99 % > 70 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 100 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 80 TPS 99 % > 80 TPS 99 % > 90 TPS 99 % > 100 TPS 99 % > 80 TPS 99 % > 90 TPS

1 Berechnet als p50-Anforderungslatenz pro 5 Minuten. TPS = Token pro Sekunde.

Vorherige Azure OpenAI-Modelle

Thema gpt-4o gpt-4o-mini o3-mini o1
Globale & in einer Datenzone bereitgestellte Mindestbereitstellung 15 15 15 15
Globales & in einer Datenzone bereitgestelltes Skalierungsinkrement 5 5 5 5
Regionale Bereitstellung mit minimalem Einsatz 50 25 25 25
Regionale bereitgestellte Skalierungsschritte 50 25 25 50
Eingabe-TPM pro PTU 2,500 37,000 2,500 230
Ausgabe-zu-Eingabe-Verhältnis 4 4 4 4
Latenzzielwert1 99 % > 25 TPS 99 % > 33 TPS 99 % > 66 TPS 99 % > 25 TPS

1 Berechnet als durchschnittliche Anforderungslatenz pro Minute über den Monat hinweg. TPS = Token pro Sekunde.

Von Azure verkaufte Gießereimodelle

In diesem Abschnitt werden weitere von Azure verkaufte Foundry Models aufgeführt, nicht einschließlich der in den vorherigen Tabellen aufgeführten Azure OpenAI in Foundry Models.

Thema Llama-3.3-70B-Instruct
Global und in der Datenzone bereitgestellte Mindestbereitstellung 100
Global und in der Datenzone bereitgestellter Skalierungsschritt 100
Regionale Bereitstellung mit minimalem Einsatz NA
Regionale bereitgestellte Skalierungsschritte NA
Eingabe-TPM pro PTU 8,450
Ausgabe-zu-Eingabe-Verhältnis 41
Latenzzielwert2 99 % > 50 TPS

1 Für Llama-3.3-70B-Instruct wird ein Ausgabetoken als vier Eingabetoken auf Ihr Nutzungslimit angerechnet. Dieses Verhältnis unterscheidet sich vom globalen Standardpreisverhältnis zwischen Eingabe- und Ausgabetoken. Siehe Modelle mit einem nicht standardmäßigen Ausgabe-zu-Eingabe-Verhältnis und llama-Modellpreisen.

2 Berechnet als durchschnittliche Anforderungslatenz pro Minute über den Monat hinweg. TPS = Token pro Sekunde.

Feuerwerk bei den Microsoft Foundry-Modellen

Die folgenden Fireworks in Microsoft Foundry-Modelle unterstützen sowohl den bereitgestellten Durchsatz für den globalen als auch für den US-Datenspeicherstandort.

Thema DeepSeek v3.1 DeepSeek v3.2 DeepSeek V4 Flash 0731 DeepSeek V4 Pro Gemma 4 26B A4B IT Gemma 4 31B IT GLM-4.7 GLM 5 GLM-5.1 GLM 5.2 gpt-oss-20b gpt-oss-120b Inkling Kimi K2 Instruct 0905 Kimi K2 Thinking Kimi K2.5 Kimi K2.6 Kimi K2.7 Code MiniMax M2.5 MiniMax M3 Ministral 3 3B Instruct 2512 Nemotron 3.5 Blitz Nemotron Super 120B Nemotron 3 Ultra NVFP4 PaddleOCR VL 1.6 Qwen 3 14B Qwen 3 32B Qwen 3.5 4B Qwen 3.5 9B Qwen 3.5 27B Qwen 3.5 35B A3B Qwen 3.5 112B A10B Qwen 3.5 397B Qwen 3.6 27B Qwen 3.6 35B A3B
Minimale Bereitstellung 200 300 100 400 200 200 200 300 400 400 80 40 400 200 200 200 200 200 400 400 40 50 100 200 40 80 80 80 40 550 40 100 100 40 40
Skaleninkrement 100 150 50 200 100 100 100 150 200 200 40 20 200 100 100 100 100 100 200 200 20 25 50 100 20 40 40 40 20 275 20 50 50 20 20
Eingabe-TPM pro PTU 2.100 3,000 2,800 200 5,400 2.200 6.000 600 900 300 25,000 13,500 3,850 2,500 1,400 1,060 4,000 2.000 5.300 5.300 25,400 60.350 4,850 1,100 341,500 4,800 5.000 35,500 10.700 2,730 17,800 5.600 4.250 7,700 31,000
Latenzzielwert1 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS 99 % > 50 TPS

1 Berechnet als durchschnittliche Anforderungslatenz pro Minute über den Monat hinweg. TPS = Token pro Sekunde.

Anhang

Jede Zeile in den Tabellen entspricht einem der folgenden Parameter:

Parameter Description
Globale & in einer Datenzone bereitgestellte Mindestbereitstellung Die kleinste Anzahl von PTUs, die Sie für die Bereitstellungstypen "Global Provisioned" oder "Data Zone Provisioned" bereitstellen können. Beispielsweise erfordert gpt-5.2 mindestens eine Bereitstellung von 15 PTUs.
Globales & in einer Datenzone bereitgestelltes Skalierungsinkrement Die PTU-Schrittweite, mit der Sie eine global bereitgestellte oder für Datenzonen bereitgestellte Bereitstellung erhöhen oder verringern können. Wenn Sie mit dem gpt-5.2-Beispiel fortfahren, bedeutet eine Erhöhung von 5, dass Bereitstellungen auf 15, 20, 25 usw. angepasst werden können.
Regionale bereitgestellte Mindestbereitstellung Die kleinste Anzahl von PTUs, die Sie für eine regional bereitgestellte Bereitstellung einsetzen können. Beispielsweise erfordert gpt-5.2 eine mindestens regionale Bereitstellung von 50 PTUs.
Regionale bereitgestellte Skalierungsschritte Die PTU-Inkrementierung für regionale Bereitstellungen. Wenn Sie mit dem gpt-5.2-Beispiel fortfahren, bedeutet eine Erhöhung von 50, dass Bereitstellungen auf 50, 100, 150 usw. angepasst werden können.
Eingabe-TPM pro PTU Die maximalen Eingabetoken pro Minute (TPM), die von einem PTU unterstützt werden. Verwenden Sie diesen Wert beim Schätzen von PTUs.
Ausgabe-zu-Eingabe-Verhältnis Die Gewichtung, die beim Schätzen der PTU-Anforderungen auf Ausgabetoken angewendet wird. Dieser Wert spiegelt das globale Standardpreisverhältnis des Modells zwischen Ausgabe- und Eingabetoken mit Ausnahmen für einige Modelle wider. Beispielsweise bedeutet ein Verhältnis von 8, dass ein Ausgabetoken als acht Eingabetoken in Richtung des TPM-Grenzwerts des Modells zählt. Siehe Azure OpenAI-Preise, Llama-Modellpreise und DeepSeek-Modellpreise für aktuelle Preise.
Zielwert der Latenz Die erwartete Anforderungslatenz auf der angegebenen PTU-Auslastungsebene. Ausgedrückt als Perzentilschwelle – zum Beispiel bedeutet „99% > 50 TPS“, dass 99 % der Anfragen mit einer Rate von mehr als 50 Token pro Sekunde verarbeitet werden.