Guida rapida: Creare una distribuzione con larghezza di banda predefinita (classica)

Attualmente in visione:Versione - Passa alla versione per il nuovo portale Foundry

In questa guida rapida, creerai una distribuzione con throughput predefinito in Microsoft Foundry, effettuerai una chiamata di inferenza per verificarne il corretto funzionamento e visualizzerai le metriche di utilizzo.

Un'implementazione con larghezza di banda garantita offre alla tua applicazione una larghezza di banda dedicata per l'elaborazione dei modelli con una latenza prevedibile. La fatturazione viene effettuata in base alle unità di throughput fornite (PTU) all'ora. Per i carichi di lavoro a lungo termine, Azure prenotazioni offrono sconti finanziari rispetto alla fatturazione oraria. Per un'introduzione concettuale completa, consultare Che cos'è il throughput garantito per i modelli Foundry?.

Prerequisites

  • Una sottoscrizione di Azure con un metodo di pagamento valido. Se non hai una sottoscrizione Azure, crea un account Azure a pagamento per iniziare.
  • Ruolo "Azure Contributor" o "Cognitive Services Contributor" sull'abbonamento o sul gruppo di risorse in cui si intende creare la distribuzione.
  • Un progetto Microsoft Foundry nella regione in cui si ha una quota PTU. Un progetto Foundry è gestito all'interno di una risorsa Foundry.
  • Facoltativamente, per la distribuzione con interfaccia della riga di comando di Azure, avere interfaccia della riga di comando di Azure installato.

Controllare la disponibilità del modello e dell'area

Prima di creare una distribuzione, assicurati che il tuo modello supporti la larghezza di banda assegnata nell'area di destinazione.

  1. Vai alla tabella di disponibilità dei modelli e delle regioni per verificare se il tuo modello supporta l'implementazione con throughput garantito nell'area di destinazione.
  2. Filtrare per regione e verificare che il modello sia visualizzato in un tipo di distribuzione Provisioned.

Si noti anche il numero minimo di PTU del modello, perché sono necessarie queste informazioni quando si configura la distribuzione. I minimi variano in base al modello e sono elencati in Parametri di distribuzione e valori di velocità effettiva in base al modello.

Controlla la quota PTU

Prima di seguire questa guida introduttiva, verificare di avere una quota per l'area di destinazione e il tipo di distribuzione. Per controllare la quota:

  1. Accedere a Microsoft Foundry. Assicurarsi che l'interruttore New Foundry sia disattivato. Questi passaggi fanno riferimento a Foundry (versione classica).

  2. Seleziona l'abbonamento e la risorsa Foundry nell'area in cui disponi di una quota PTU.

  3. Vai su Centro di gestione>Quota>Unità di throughput assegnate per visualizzare la tua quota disponibile. Se la quota non è disponibile, selezionare Richiedi quota e completare il modulo. L'approvazione della quota può richiedere diversi giorni e si riceve una notifica tramite posta elettronica quando la richiesta viene approvata.

    Tip

    È anche possibile seguire questo collegamento diretto al modulo di richiesta di quota.

Creare una distribuzione preconfigurata

In questa sezione, si crea una distribuzione con provisioning utilizzando il portale Foundry o la CLI di Azure.

Usare il portale foundry per la distribuzione

  1. Nel portale Foundry, nel menu di navigazione a sinistra, selezionare Modelli + endpoint>Distribuzioni del modello.

  2. Selezionare Distribuisci modello>Distribuisci modello di base.

  3. Nel menu visualizzato cercare il modello da distribuire, ad esempio gpt-5.1e selezionarlo.

  4. Nel menu a tendina Tipo di distribuzione, selezionare un tipo di distribuzione configurato: "Larghezza di banda con provisioning globale", "Larghezza di banda con provisioning della zona dati" , o "Larghezza di banda con provisioning regionale" .

  5. Compilare i campi di distribuzione:

    Campo Description
    Nome implementazione Nome scelto. Usa questo nome nel tuo codice per chiamare il modello.
    Modello Modello da distribuire, ad esempio gpt-5.1.
    Versione del modello La versione del modello.
    Unità di throughput assegnate Numero di PTU da allocare. Deve soddisfare il valore minimo del modello, 50ad esempio .
  6. Selezionare Confirm Pricing (Conferma prezzi ) per esaminare la tariffa oraria per la distribuzione. La fatturazione inizia non appena viene creata la distribuzione, anche quando non viene inviata alcuna richiesta. Per interrompere la fatturazione, è sufficiente eliminare la propria distribuzione. Se non si è certi dei costi, selezionare Annulla ed esaminare la gestione dei costi e della fatturazione PTU prima di continuare.

  7. Conferma e crea la distribuzione.

(Facoltativo) Usare il interfaccia della riga di comando di Azure per la distribuzione

In alternativa, è possibile creare la distribuzione usando il interfaccia della riga di comando di Azure.

  1. Crea un'implementazione con provisioning per GPT-5.1 con un numero di PTU pari a 50.

    az cognitiveservices account deployment create \
    --name <myResourceName> \
    --resource-group <myResourceGroupName> \
    --deployment-name <myDeploymentName> \
    --model-name GPT-5.1 \
    --model-version "2025-11-13" \
    --model-format OpenAI \
    --sku-capacity 50 \
    --sku-name GlobalProvisionedManaged
    
    • Sostituire <myResourceName>, <myResourceGroupName>, <myDeploymentName> con i valori.

    • --sku-name specifica il tipo di distribuzione: GlobalProvisionedManaged, DataZoneProvisionedManagedo ProvisionedManaged.

    • --sku-capacity è il numero di PTU. Qui è impostato su 50.

    Riferimento: az cognitiveservices account deployment

  2. Verificare che la distribuzione sia stata completata correttamente:

    az cognitiveservices account deployment show \
        --deployment-name <myDeploymentName> \
        --name <myResourceName> \
        --resource-group <myResourceGroupName> \
        --query "properties.provisioningState" -o tsv
    

    L'output dovrebbe mostrare Succeeded. Il modello è pronto per l'uso al termine del provisioning.

    Riferimento: az cognitiveservices account deployment show

È anche possibile usare REST, modello di Resource Manager, Bicep e Terraform per creare distribuzioni. Vedere Automatizzare le distribuzioni e sostituire sku.name con GlobalProvisionedManaged, DataZoneProvisionedManagedo ProvisionedManaged.

Effettuare una chiamata di inferenza

Il codice di inferenza per una distribuzione con provisioning è uguale a quello di qualsiasi altro tipo di distribuzione. Usare il nome della distribuzione (non il nome del modello) come valore del model parametro.

Il codice in questa sezione usa l'autenticazione della chiave API. È anche possibile usare l'autenticazione Entra ID. Per informazioni dettagliate sull'uso dell'autenticazione Entra ID quando si effettua una chiamata di inferenza, vedere Come generare risposte di testo con Microsoft Modelli Foundry.

Prima di eseguire l'esempio, impostare la variabile di ambiente seguente:

  • AZURE_OPENAI_API_KEY: la chiave API della risorsa.

Importante

Non codificare le credenziali direttamente nell'applicazione. Per i carichi di lavoro di produzione, usare un archivio credenziali sicuro, ad esempio Azure Key Vault. Vedere Funzionalità di sicurezza per Servizi di Azure AI.

  1. Installare OpenAI SDK:

    pip install openai
    
  2. Configurare il client OpenAI, specificare la distribuzione e generare risposte. Sostituisci <myResourceName> con il nome della risorsa Foundry.

    import os
    from openai import OpenAI
    
    client = OpenAI(
        api_key=os.getenv("AZURE_OPENAI_API_KEY"),
        base_url="https://<myResourceName>.openai.azure.com/openai/v1/",
    )
    
    response = client.responses.create(
        model="<myDeploymentName>",  # Your deployment name, not the model name
        input="What is provisioned throughput?",
        max_output_tokens=100,
    )
    
    print(response.output_text)
    

Visualizza l'utilizzo della distribuzione

Dopo aver effettuato chiamate, verificare che il traffico raggiunga la distribuzione controllandone l'utilizzo nel portale di Azure.

  1. Accedi al portale di Azure.
  2. Passa alla risorsa Foundry e seleziona Metriche nella barra di navigazione a sinistra.
  3. Selezionare la metrica Utilizzo gestito e provisionato V2.
  4. Se nella risorsa sono presenti più distribuzioni, filtrare in base al nome della distribuzione per visualizzare l'utilizzo per distribuzione.

Una lettura di utilizzo vicina a 0% immediatamente dopo la chiamata di test è normale, ovvero gli aggiornamenti delle metriche in una finestra di monitoraggio.

Schermata di Azure Metrics che mostra il grafico Provisioned-managed Utilization V2 filtrato in base al nome della distribuzione.

Per una spiegazione completa del modo in cui viene calcolato l'utilizzo e delle operazioni da eseguire quando raggiunge 100%, vedere Gestire le distribuzioni con provisioning nell'ambiente di produzione.

Valuta la possibilità di configurare lo spillover

Spillover reindirizza automaticamente le richieste in eccesso dalla tua distribuzione configurata a una distribuzione standard nella stessa risorsa Foundry. Quando la distribuzione con provisioning è completamente occupata e restituisce un codice 429, lo spillover reindirizza le richieste in eccesso alla distribuzione standard anziché generarle un errore, contribuendo così a ridurre le interruzioni durante i picchi di traffico. Per ulteriori informazioni sull'attivazione dello spillover e sul monitoraggio delle richieste di spillover, consultare Gestione del traffico con lo spillover per le distribuzioni configurate.

Prendere in considerazione l'acquisto di una prenotazione

Il tuo servizio viene fatturato in base alla tariffa oraria. Se prevedi di mantenerlo in esecuzione per più di qualche giorno, l'acquisto di una Azure Reservation riduce il costo effettivo in $/PTU/ora rispetto alla fatturazione oraria.

Se intendi acquistare una prenotazione dopo aver creato la tua distribuzione, verifica di disporre del ruolo di proprietario o del ruolo di acquirente della prenotazione in un abbonamento Azure. Il ruolo necessario per acquistare prenotazioni è diverso dal ruolo necessario per creare distribuzioni. Per i requisiti relativi ai ruoli, consultare Riservazioni di throughput provisionato.

Importante

Creare e confermare sempre la distribuzione prima di acquistare una prenotazione. La prenotazione deve corrispondere al tipo di distribuzione (globale, zona dati o area geografica) e all'ambito della sottoscrizione. Per le distribuzioni Data Zone e regionali, anche l'area geografica della prenotazione deve corrispondere. Per le distribuzioni globali, una singola prenotazione globale può coprire le distribuzioni PTU globali in più aree. Impegnarsi in una prenotazione di capacità di cui non hai confermato la disponibilità può comportare un impegno finanziario di cui non puoi usufruire.

Per indicazioni sul dimensionamento, sulla procedura di acquisto e sulla gestione, consultare Riserve di Azure per la larghezza di banda con provisioning.

Pulire le risorse

L'eliminazione della risorsa Foundry non elimina automaticamente le relative distribuzioni. Eliminare sempre tutte le distribuzioni prima di eliminare la risorsa, perché i costi per le distribuzioni in una risorsa eliminata continuano fino a quando la risorsa non viene eliminata. Vedere Pulire le risorse.

Note

L'eliminazione di una distribuzione non annulla una prenotazione Azure. Se ne è stato acquistato uno, annullarlo o scambiarlo separatamente nella pagina Reservations nel portale di Azure. L'annullamento potrebbe comportare una tariffa di terminazione anticipata.

Segui questi passaggi per interrompere la fatturazione oraria eliminando la distribuzione.

Elimina la distribuzione nel portale Foundry

  1. Nel portale Foundry, accedi alle tue distribuzioni.
  2. Selezionare la distribuzione, quindi selezionare Elimina e confermare.

(Facoltativo) Eliminare la distribuzione con il interfaccia della riga di comando di Azure

az cognitiveservices account deployment delete \
    --deployment-name <myDeploymentName> \
    --name <myResourceName> \
    --resource-group <myResourceGroupName>

Riferimento: az cognitiveservices account deployment delete

Passo successivo