Qu’est-ce que le débit approvisionné pour les modèles Foundry ?

Affichage actuel :Nouvelle version - Passer à la version du portail Foundry classique

Le débit provisionné est un type de déploiement dans Microsoft Foundry qui fournit un débit de traitement de modèle dédié pour votre déploiement. Contrairement aux déploiements standard, où la capacité d’inférence est partagée entre les clients et le débit peut varier avec la demande, un déploiement provisionné contient une quantité fixe de capacité de traitement exclusivement pour l’utilisation de votre déploiement, que les demandes soient effectuées ou non.

Cet article présente les concepts fondamentaux du débit provisionné : qu’est-ce qu’il est, quand l’utiliser, comment la capacité est mesurée et facturée, et ce qu’il faut savoir sur le quota et la capacité avant de déployer.

Catégories de déploiement comparées

Les déploiements standard, les déploiements par lots, le traitement prioritaire et le débit approvisionné sont des façons de déployer des modèles dans Microsoft Foundry. Le bon choix dépend de vos exigences en matière de latence, de modèles de trafic et de tolérance aux coûts.

Type de déploiement Billing Contrat de niveau de service de latence (SLA) Type de charge de travail et besoins
Standard Paiement par jeton None Charges de travail équilibrées : développement, test et production avec un trafic variable ou imprévisible
Traitement de priorité Facturation au jeton (tarif du niveau de priorité) Cible de latence définie par modèle Charges de travail de production sensibles à la latence nécessitant une faible latence cohérente sans engagement à long terme
approvisionné Par PTU par heure (ou avec des réservations Azure) Cible de latence définie par modèle Charges de travail de production stratégiques à grande échelle nécessitant un débit garanti et une latence cohérente
Batch Paiement par jeton (taux de traitement par lot réduit) None Traitement en bloc des charges de travail sans exigences de latence. Les résultats sont retournés de manière asynchrone.

Quand utiliser le débit provisionné

Le débit provisionné est le bon choix lorsque votre application a :

  • Modèles de trafic prévisibles : vous disposez d’une estimation raisonnable des demandes par minute et des volumes de jetons.
  • Exigences sensibles à la latence : vos utilisateurs ou systèmes en aval ont besoin de réponses cohérentes et à faible latence.
  • Volume de production : cas d’utilisation à haut débit où la facturation par jeton devient coûteuse.
  • Scénarios interactifs ou en temps réel : applications de conversation, copilotes ou agents où les temps de réponse variables dégradent l’expérience utilisateur.

Les déploiements standard restent plus adaptés au développement, au test, à l’utilisation à faible volume ou au trafic hautement variable, ce qui rend difficile la taille d’un déploiement à l’avance.

Unités de débit provisionnées

Les unités de débit provisionnée sont l’unité de mesure du débit provisionné. Une PTU représente une quantité fixe de capacité de traitement du modèle. Lorsque vous créez un déploiement provisionné, vous indiquez combien de PTU allouer. Foundry réserve cette quantité de calcul et la conserve pour votre déploiement.

Caractéristiques clés des PTU :

  • Indépendant du modèle : le même quota PTU peut être utilisé pour déployer n’importe quel modèle pris en charge. Vous n’achetez pas de PTU pour un modèle spécifique.
  • Spécifique à la région : le quota PTU est accordé par abonnement, par région et par type de déploiement. Le quota en USA Est n’est pas reporté vers l’Europe Ouest.
  • Le débit varie selon le modèle : le nombre de jetons par minute (TPM) fourni par un nombre donné de PTUs dépend du modèle. Un modèle plus lourd nécessite davantage de PTU pour traiter le même TPM qu’un modèle plus léger. Pour connaître les ratios PTU/TPM par modèle, consultez les paramètres de débit par modèle.
  • Les tailles de déploiement minimales s’appliquent : chaque modèle a un nombre minimal de PTU requis pour créer un déploiement. Les minimums varient selon le modèle et sont répertoriés dans les paramètres de déploiement et les valeurs de débit par modèle.

Quota et capacité

Le quota et la capacité en PTU sont des concepts liés mais distincts, qui influent toutes deux sur la possibilité de créer un déploiement. Cette section explique ce que chacun d’eux est, comment demander un quota supplémentaire et vérifier si la capacité est disponible dans votre région.

Qu’est-ce que le quota PTU ?

Le quota de PTU correspond au nombre maximal de PTU que vous pouvez déployer par abonnement, par région et par type de déploiement. Le quota est une limite de stratégie appliquée par Azure et n’a aucun coût associé. Le quota est limité au niveau de l’offre (Provisionné global, Provisionné de zone de données et Provisionné régional sont des pools de quotas distincts) et au niveau de la région (par exemple, le quota dans la région USA Est ne s’applique pas à l’Europe Ouest).

Une quantité de quota par défaut est affectée aux abonnements éligibles dans plusieurs régions.

Qu’est-ce que la capacité ?

La capacité correspond au nombre réel de PTU pour chaque version de modèle pouvant être déployé. La capacité est allouée au moment du déploiement et conservée pour la durée de vie du déploiement.

Important

Le quota PTU ne garantit pas que la capacité est disponible. Si la capacité de la région est insuffisante pour le nombre de PTU demandés, le déploiement échoue. Vérifiez toujours la disponibilité de la capacité avant de planifier un déploiement ou d’acheter une réservation.

Étant donné que la capacité est une ressource à variation dynamique et limitée :

  • La disponibilité de la capacité change tout au long de la journée en fonction de la demande des clients dans toutes les régions et tous les modèles.
  • La suppression ou la réduction de la taille d’un déploiement restitue sa capacité au pool régional. Il n’existe aucune garantie que la même capacité est disponible si vous recréez ou mettez à l’échelle le déploiement ultérieurement.

Comment obtenir un quota

Une quantité par défaut de quota global, de zone de données et de quota provisionné régional est affectée aux abonnements éligibles dans plusieurs régions. Vous pouvez demander plus de quota ou de capacité en envoyant le formulaire de demande de quota. Le formulaire est également disponible dans le portail Foundry sur la page Quota .

L’approbation peut prendre plusieurs jours en fonction de la disponibilité du quota et vous recevez une notification par e-mail lorsque la demande est approuvée.

Comment vérifier la capacité disponible

Pour vérifier la disponibilité de la capacité en temps réel :

  • Utilisez l’expérience de déploiement du portail Foundry, qui vous indique si la capacité est disponible lorsque vous essayez de créer un déploiement et répertorie les autres régions avec une capacité disponible si votre région cible n’a pas suffisamment.
  • Utilisez l’API de capacité de modèle pour interroger par programmation le nombre maximal de PTU déployables pour un modèle et une région donnés.

Si votre région cible n’a pas de capacité disponible :

  • Envoyez le formulaire de demande de quota pour demander plus de quota ou de capacité.
  • Essayez de déployer avec moins de PTUs.
  • Réessayez ultérieurement, à mesure que la disponibilité de la capacité change dynamiquement tout au long de la journée.

Pour obtenir des instructions pas à pas sur la création de déploiements provisionnés et la gestion des contraintes de capacité, consultez Prise en main des déploiements provisionnés.

Dimensionnement du PTU

Avant de créer un déploiement provisionné, estimez le nombre de PTU nécessaires à votre charge de travail. Trois facteurs déterminent le calcul :

  • Forme de requête : vos demandes attendues par minute (RPM), la taille moyenne des invites (jetons d’entrée) et la taille moyenne de réponse (jetons de sortie).
  • Ratio sortie-entrée : les jetons de sortie nécessitent plus de capacité de traitement que les jetons d’entrée. Chaque modèle a un ratio qui exprime le nombre de jetons d’entrée qu’un jeton de sortie équivaut à des fins de capacité. Pour les modèles Azure OpenAI GPT-4.1 et ultérieurs, ce ratio correspond au rapport tarifaire standard global du modèle entre les jetons de sortie et d’entrée. Pour plus d’informations sur ce ratio, consultez Paramètres de déploiement et valeurs de débit par modèle.
  • Taux de mise en cache : La fraction des jetons d’entrée provenant du cache de prompt. Les jetons mis en cache ne consomment pas de capacité PTU. Par conséquent, un taux de cache plus élevé réduit les unités de mise en cache requises.

Le calcul de dimensionnement utilise ces facteurs pour convertir vos volumes de jetons attendus en une valeur unique de TPM normalisée, puis la divise par la valeur TPM d’entrée par PTU du modèle afin d’obtenir le nombre de PTU requis.

Vous pouvez dimensionner manuellement, à l’aide des formules et des valeurs par modèle, ou utiliser la calculatrice de capacité dans le portail Foundry pour une estimation guidée.

Pour connaître la méthodologie de dimensionnement complète, notamment les formules, les exemples travaillés et la référence de la calculatrice de capacité, consultez Déterminer le dimensionnement de PTU pour une charge de travail.

Types de déploiement du débit provisionné

Le débit provisionné est disponible sous la forme de trois types de déploiement. Ils fournissent toutes une capacité dédiée et une latence prévisible une fois déployées. La différence est l’endroit où votre trafic d’inférence est traité :

Type de déploiement sku-name dans CLI Routage des données Idéal pour
Global Provisioned GlobalProvisionedManaged Acheminé via les régions Azure dans le monde entier Disponibilité la plus élevée ; lorsque la région de routage n’est pas contrainte
Zone de données provisionnée DataZoneProvisionedManaged Reste dans une zone géographique (États-Unis ou UE) Résidence des données à l’échelle de la zone avec une disponibilité supérieure à celle du niveau régional
Provisionnement régional ProvisionedManaged Reste dans la région de Azure spécifique du déploiement Exigences strictes de stockage des données dans une seule région

Pour obtenir une comparaison complète de tous les types de déploiement Foundry, notamment standard, batch et provisionné, consultez Types de déploiement pour Microsoft modèles Foundry.

Modèles pris en charge

Pour obtenir la liste complète des modèles Foundry qui prennent en charge le débit approvisionné, y compris les types de déploiement pris en charge par chaque modèle et la disponibilité régionale, consultez Disponibilité des modèles Foundry vendus directement par Azure.

Retombées

Le débordement est une configuration facultative qui permet de gérer les variations du trafic sur les déploiements provisionnés en acheminant automatiquement les requêtes excédentaires vers un déploiement standard correspondant au sein de la même ressource Foundry. Lorsqu’un déploiement provisionné est entièrement utilisé et renvoie des réponses dont le code n’est pas 200 (par exemple, un 429 lorsque les PTU sont épuisés), le débordement redirige ces requêtes vers le déploiement standard, ce qui contribue à réduire les interruptions lors des pics de trafic.

Tous les modèles Azure OpenAI dans Foundry qui prennent en charge le débit provisionné prennent également en charge le débordement. Les modèles foundry d'autres fournisseurs (Azure DeepSeek, Meta Llama) ne prennent actuellement pas en charge le déversement.

Le débordement peut être configuré pour toutes les requêtes d’un déploiement ou contrôlé requête par requête à l’aide de l’en-tête de requête x-ms-spillover-deployment. Pour les étapes de configuration, consultez Gérer le trafic avec débordement pour les déploiements provisionnés.

Facturation horaire et réservations de Azure

Les déploiements provisionnés prennent en charge deux modes de facturation : la facturation horaire pour une utilisation flexible et à court terme, et Azure Reservations pour des charges de travail de production continues à un tarif réduit.

Facturation horaire

Tous les types de déploiement provisionnés sont facturés à un tarif horaire ($/PTU/hr) en fonction du nombre de processeurs déployés, quel que soit le nombre de jetons consommés. Le compteur démarre lorsque le déploiement est créé et s’arrête lorsqu’il est supprimé.

La facturation horaire est pratique pour les scénarios à court terme, comme l’évaluation d’un nouveau modèle ou le scale-up temporaire d’un événement tel qu’un hackathon. Toutefois, ne prévoyez pas d’augmenter et de réduire la capacité des déploiements provisionnés en fonction du trafic dans le but de conserver une facturation horaire, pour les raisons suivantes :

  • La capacité pourrait ne pas être disponible lorsque vous devez remonter en capacité.

  • La facturation horaire continue en cas de forte utilisation dépasse généralement le tarif des réservations.

Pour obtenir des conseils complets sur la facturation horaire et la mise à l’échelle des déploiements provisionnés, consultez facturation horaire.

Réservations Azure

Les réservations Azure constituent une remise financière appliquée au compteur de facturation PTU (le compteur d’utilisation horaire sur lequel Azure facture), et non à des déploiements individuels. En échange d’un engagement de 1 mois ou de 1 an, vous recevez un tarif réduit en vigueur $/PTU/hr. Voici quelques points clés à noter sur les réservations :

  • Les réservations sont achetées par type de déploiement (Global, Data Zone ou Regional) et peuvent être étendues pour couvrir un ou plusieurs abonnements ou groupes de ressources.

  • Les réservations et les déploiements sont faiblement couplés, ce qui signifie que vous créez des déploiements et des réservations indépendamment.

  • Les réservations ne garantissent pas la capacité. Commencez par créer des déploiements pour confirmer que la capacité est disponible, puis achetez la réservation pour verrouiller le taux réduit.

Pour obtenir des conseils complets sur le dimensionnement, l’achat et la gestion des réservations, consultez Azure Réservations pour le débit provisionné.

Comment suivre les coûts et la facturation des PTU

Utilisez Microsoft Cost Management pour suivre et analyser vos coûts d’utilisation et de réservation PTU :

Ce que vous voulez faire Article
Découvrez quel pourcentage de vos PTUs réservés est effectivement utilisé dans l’ensemble de vos déploiements Afficher l'utilisation des réservations Azure
Passer en revue l’historique des achats et toute activité de remboursement Afficher les transactions d’achat et de remboursement de Réservation Azure
Comprendre l’impact amorti des coûts de vos réservations pour une visibilité plus claire de la facturation par déploiement Afficher les coûts des avantages amortis
Distribuer les coûts de réservation entre les équipes ou les projets pour l’attribution de coûts internes Rétrofacturer les coûts de réservation Azure
Configurer le renouvellement automatique pour empêcher l’expiration de la réservation et maintenir le taux réduit Renouveler automatiquement les réservations Azure