Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Zurzeit wird folgendes angezeigt:Foundry (klassische) Portalversion - Wechseln zur Version für das neue Foundry-Portal
In dieser Schnellstartanleitung erstellen Sie eine bereitgestellte Durchsatzbereitstellung in Microsoft Foundry, führen Sie einen Rückschlussaufruf aus, um zu bestätigen, dass sie funktioniert, und zeigen Sie die Metrik der Auslastung an.
Eine Bereitstellung mit bereitgestelltem Durchsatz bietet Ihrer Anwendung dedizierten Verarbeitungsdurchsatz für Modelle, mit vorhersagbarer Latenz. Die Abrechnung erfolgt pro bereitgestellter Durchsatzeinheit (PTU) pro Stunde. Für langfristige Workloads bieten Azure Reservations Preisnachlässe gegenüber der stündlichen Abrechnung. Eine vollständige konzeptionelle Einführung finden Sie unter Was ist der bereitgestellte Durchsatz für Foundry Models?.
Voraussetzungen
- Ein Azure-Abonnement mit einer gültigen Zahlungsmethode. Wenn Sie noch kein Azure-Abonnement haben, erstellen Sie zunächst ein kostenpflichtiges Azure-Konto.
- Azure Contributor- oder Cognitive Services Contributor-Rolle für das Abonnement oder die Ressourcengruppe, in der Sie die Bereitstellung erstellen möchten.
- Ein Microsoft Foundry-Projekt in der Region, in der Sie ein PTU-Kontingent haben. Ein Foundry-Projekt wird unter einer Foundry-Ressource verwaltet.
- Installieren Sie optional für die Bereitstellung mit der Azure CLI die Azure CLI.
Überprüfen der Verfügbarkeit von Modell und Region
Vergewissern Sie sich vor dem Erstellen einer Bereitstellung, dass Ihr Modell den bereitgestellten Durchsatz in Ihrer Zielregion unterstützt.
- Wechseln Sie zur Verfügbarkeitstabelle für Modell und Region , um festzustellen, ob Ihr Modell die Bereitstellung des Durchsatzes in Ihrer Zielregion unterstützt.
- Filtern Sie nach Ihrer Region, und überprüfen Sie, ob das Modell in einem bereitgestellten Bereitstellungstyp angezeigt wird.
Beachten Sie auch die minimale PTU-Anzahl des Modells, da Sie diese Informationen benötigen, wenn Sie die Bereitstellung konfigurieren. Die Mindestwerte variieren je nach Modell und werden in Bereitstellungsparametern und Durchsatzwerten nach Modell aufgeführt.
PTU-Kontingent überprüfen
Bevor Sie dieser Schnellstartanleitung folgen, überprüfen Sie, ob Sie über ein Kontingent für Ihre Zielregion und den Bereitstellungstyp verfügen. So überprüfen Sie Ihr Kontingent:
-
Melden Sie sich bei Microsoft Foundry an. Stellen Sie sicher, dass der Umschalter "Neue Gießerei " deaktiviert ist. Diese Schritte beziehen sich auf Foundry (klassisch).
Wählen Sie das Abonnement und die Foundry-Ressource in der Region aus, in der Sie ein PTU-Kontingent haben.
Wechseln Sie zu Verwaltungscenter>Kontingent>Bereitgestellte Durchsatzeinheit, um Ihr verfügbares Kontingent anzuzeigen. Wenn Sie kein Kontingent haben, wählen Sie "Anforderungskontingent" aus, und füllen Sie das Formular aus. Die Kontingentgenehmigung kann mehrere Tage dauern, und Sie erhalten eine E-Mail-Benachrichtigung, wenn die Anforderung genehmigt wurde.
Tip
Sie können auch diesem direkten Link zum Kontingentanforderungsformular folgen.
Eine provisionierte Bereitstellung erstellen
In diesem Abschnitt erstellen Sie eine Bereitstellung mit reservierter Kapazität über das Foundry-Portal oder die Azure CLI.
Verwenden Sie das Foundry-Portal für die Bereitstellung
Wählen Sie im Foundry-Portal im linken Navigationsmenü die Option "Modelle + Endpunkte>Modellbereitstellungen" aus.
Wählen Sie Modell bereitstellen>Basismodell bereitstellen aus.
Suchen Sie im angezeigten Menü nach dem Modell, das Sie bereitstellen möchten, z. B.
gpt-5.1, und wählen Sie es aus.Wählen Sie im Dropdownmenü "Bereitstellungstyp " einen bereitgestellten Bereitstellungstyp aus: Global Provisioned Throughput, Data Zone Provisioned Throughput oder Regional Provisioned Throughput.
Füllen Sie die Bereitstellungsfelder aus:
Feld Description Bereitstellungsname Ein von Ihnen ausgewählter Name. Verwenden Sie diesen Namen in Ihrem Code, um das Modell aufzurufen. Modell Das bereitzustellende Modell, z. B. gpt-5.1.Modellversion Die Version des Modells. Bereitgestellte Durchsatzeinheiten Die Anzahl der zuzuordnenden PTUs. Muss die Mindestanforderung des Modells erfüllen, z. B. 50.Wählen Sie "Preise bestätigen " aus, um den Stundensatz für die Bereitstellung zu überprüfen. Die Abrechnung beginnt sofort, sobald die Bereitstellung erstellt wurde, auch wenn keine Anfragen eingehen. Sie beenden die Abrechnung, indem Sie Ihr Deployment löschen. Wenn Sie sich nicht über die Kosten sicher sind, wählen Sie "Kündigen " aus, und überprüfen Sie die PTU-Abrechnung und -Kostenverwaltung , bevor Sie fortfahren.
Bestätigen und Erstellen Sie die Bereitstellung.
(Optional) Verwenden der Azure CLI für die Bereitstellung
Alternativ können Sie Ihre Bereitstellung mithilfe der Azure CLI erstellen.
Erstellen Sie eine bereitgestellte Bereitstellung für GPT-5.1 mit einer PTU-Anzahl von 50 PTUs.
az cognitiveservices account deployment create \ --name <myResourceName> \ --resource-group <myResourceGroupName> \ --deployment-name <myDeploymentName> \ --model-name GPT-5.1 \ --model-version "2025-11-13" \ --model-format OpenAI \ --sku-capacity 50 \ --sku-name GlobalProvisionedManagedErsetzen Sie
<myResourceName>, ,<myResourceGroupName><myDeploymentName>durch Ihre Werte.--sku-nameGibt den Bereitstellungstyp an:GlobalProvisionedManaged,DataZoneProvisionedManaged, oderProvisionedManaged.--sku-capacityist die Anzahl der PTUs. Hier ist er auf 50 festgelegt.
Referenz: az Bereitstellung eines Kontos für kognitive Dienste
Vergewissern Sie sich, dass die Bereitstellung erfolgreich abgeschlossen wurde:
az cognitiveservices account deployment show \ --deployment-name <myDeploymentName> \ --name <myResourceName> \ --resource-group <myResourceGroupName> \ --query "properties.provisioningState" -o tsvDie Ausgabe sollte
Succeededanzeigen. Das Modell kann nach Abschluss der Bereitstellung verwendet werden.
REST, ARM-Vorlage, Bicep und Terraform können auch zum Erstellen von Bereitstellungen verwendet werden. Siehe Bereitstellungen automatisieren und ersetzen Sie sku.name durch GlobalProvisionedManaged, DataZoneProvisionedManaged oder ProvisionedManaged.
Inferenzaufruf durchführen
Der Rückschlusscode für eine bereitgestellte Bereitstellung ist identisch mit jedem anderen Bereitstellungstyp. Verwenden Sie Ihren Bereitstellungsnamen (nicht den Modellnamen) als model Parameterwert.
Der Code in diesem Abschnitt verwendet die API-Schlüsselauthentifizierung. Sie können auch die Authentifizierung mit Entra-ID verwenden. Weitere Informationen zur Verwendung der Entra ID-Authentifizierung bei einem Inferenzaufruf finden Sie unter How to generate text responses with Microsoft Foundry Models.
Legen Sie vor dem Ausführen des Beispiels die folgende Umgebungsvariable fest:
-
AZURE_OPENAI_API_KEY: Ihr Ressourcen-API-Schlüssel.
Important
Kodieren Sie keine Anmeldedaten fest in Ihre Anwendung ein. Verwenden Sie für Produktionsworkloads einen sicheren Anmeldeinformationsspeicher wie Azure Key Vault. Weitere Informationen finden Sie unter Security-Features für Azure KI Services.
Installieren Sie das OpenAI SDK:
pip install openaiKonfigurieren Sie den OpenAI-Client, geben Sie Ihre Bereitstellung an, und generieren Sie Antworten. Ersetzen Sie
<myResourceName>durch den Namen Ihrer Foundry-Ressource.import os from openai import OpenAI client = OpenAI( api_key=os.getenv("AZURE_OPENAI_API_KEY"), base_url="https://<myResourceName>.openai.azure.com/openai/v1/", ) response = client.responses.create( model="<myDeploymentName>", # Your deployment name, not the model name input="What is provisioned throughput?", max_output_tokens=100, ) print(response.output_text)
Anzeigen der Bereitstellungsauslastung
Nachdem Sie Aufrufe getätigt haben, vergewissern Sie sich im Azure-Portal anhand der Auslastung, dass der Datenverkehr Ihre Bereitstellung erreicht.
- Melden Sie sich im Azure-Portal an.
- Navigieren Sie zu Ihrer Foundry-Ressource, und wählen Sie " Metriken " in der linken Navigation aus.
- Wählen Sie die Metrik Provisioned-managed utilization V2 aus.
- Wenn Sie mehr als eine Bereitstellung in der Ressource haben, filtern Sie nach dem Bereitstellungsnamen, um die Auslastung pro Bereitstellung anzuzeigen.
Eine Auslastungsanzeige in der Nähe von 0% unmittelbar nach dem Testanruf normal ist – die Metrik wird in einem Überwachungsfenster aktualisiert.
Eine vollständige Erläuterung, wie die Auslastung berechnet wird und was zu tun ist, wenn sie 100%erreicht, finden Sie unter "Betreiben von bereitgestellten Bereitstellungen in der Produktion".
Erwägen Sie, einen Überlauf einzurichten.
Spillover leitet überzählige Anforderungen aus Ihrer bereitgestellten Bereitstellung automatisch an eine Standardbereitstellung in derselben Foundry-Ressource weiter. Wenn Ihr bereitgestelltes Deployment vollständig ausgelastet ist und einen 429-Code zurückgibt, leitet Spillover diese zusätzlichen Anfragen an das Standard-Deployment weiter, statt sie fehlschlagen zu lassen, und trägt so dazu bei, Unterbrechungen bei Lastspitzen zu reduzieren. Weitere Informationen zum Aktivieren von Spillover und zum Überwachen von Spilloveranforderungen finden Sie unter Verwalten des Datenverkehrs mit Spillover für bereitgestellte Bereitstellungen.
Erwägen Sie den Kauf einer Reservierung
Ihr Deployment wird zum Stundensatz abgerechnet. Wenn Sie planen, es länger als ein paar Tage laufen zu lassen, senkt der Kauf einer Azure-Reservierung Ihre effektiven $/PTU/hr-Kosten gegenüber der stündlichen Abrechnung.
Wenn Sie nach dem Erstellen der Bereitstellung eine Reservierung erwerben möchten, vergewissern Sie sich, dass Sie über die Rolle Ownerrolle oder Reservierungskäuferrolle verfügen für ein Azure-Abonnement. Die zum Kauf von Reservierungen erforderliche Rolle unterscheidet sich von der Rolle, die zum Erstellen von Bereitstellungen erforderlich ist. Siehe Bereitgestellte Durchsatzreservierungen für Rollenanforderungen.
Important
Erstellen und bestätigen Sie Ihre Bereitstellung immer, bevor Sie eine Reservierung erwerben. Die Reservierung muss mit dem Typ Ihrer Bereitstellung (Global, Data Zone oder Regional) und dem Abonnementumfang übereinstimmen. Für Datenzonen- und regionale Bereitstellungen muss die Reservierungsregion ebenfalls übereinstimmen. Bei globalen Bereitstellungen kann eine einzelne globale Reservierung globale PTU-Bereitstellungen in mehreren Regionen abdecken. Wenn Sie eine Reservierung für eine Kapazität eingehen, deren Verfügbarkeit Sie nicht bestätigt haben, kann dies zu einer finanziellen Verpflichtung führen, die Sie nicht nutzen können.
Hinweise zur Dimensionierung, zu den Kaufschritten und zur Verwaltung finden Sie unter Azure-Reservierungen für bereitgestellten Durchsatz.
Bereinigen von Ressourcen
Durch das Löschen der Foundry-Ressource werden die Bereitstellungen nicht automatisch gelöscht. Löschen Sie immer alle Bereitstellungen vor dem Löschen der Ressource, da die Gebühren für Bereitstellungen für eine gelöschte Ressource fortgesetzt werden, bis die Ressource gelöscht wird. siehe Resourcen bereinigen.
Note
Durch das Löschen einer Bereitstellung wird keine Azure Reservierung abgebrochen. Wenn Sie einen gekauft haben, stornieren oder austauschen Sie sie separat auf der Seite Reservations im Azure Portal. Eine Stornierung kann zu einer Vorzeitigen Kündigungsgebühr führen.
Führen Sie die folgenden Schritte aus, um die stündliche Abrechnung zu beenden, indem Sie die Bereitstellung löschen.
Löschen Sie die Bereitstellung im Foundry-Portal.
- Navigieren Sie im Foundry-Portal zu Ihren Bereitstellungen.
- Wählen Sie die Bereitstellung aus, wählen Sie dann Löschen aus und bestätigen Sie diese Auswahl.
(Optional) Löschen der Bereitstellung mit dem Azure CLI
az cognitiveservices account deployment delete \
--deployment-name <myDeploymentName> \
--name <myResourceName> \
--resource-group <myResourceGroupName>
Referenz: az cognitiveservices account deployment delete