Types de déploiement pour Modèles Foundry de Microsoft

Lorsque vous déployez un modèle dans Microsoft Foundry, vous choisissez un type de déploiement qui détermine :

  • Où vos données sont traitées (global, zone de données ou région unique)
  • Mode de paiement (paiement par jeton ou capacité réservée)
  • Caractéristiques des performances (variance de latence, limites de débit)

Ces types de déploiement s’appliquent à l’option de déploiement d’API serverless . Les modèles open source et personnalisés qui utilisent le calcul managé n’utilisent pas ces types. Pour savoir comment les options diffèrent, consultez Vue d’ensemble du déploiement pour Microsoft modèles Foundry.

Le service offre trois catégories principales : standard (paiement par jeton), provisionné (capacité réservée) et batch (traitement asynchrone réduit). Un type développeur est également disponible pour une évaluation de modèle affinée. Dans les catégories standard et approvisionnées, vous pouvez choisir un traitement global, une zone de données ou un traitement régional en fonction de vos exigences de conformité.

Conseil

Vous n’avez pas toujours besoin de créer un déploiement. Avec l’accès instantané (préversion), vous appelez les modèles pris en charge par nom et commencez à exécuter immédiatement l’inférence, sans déploiement requis.

Capture d’écran de la boîte de dialogue déploiement du portail Foundry montrant la zone de sélection de type de déploiement avec Global Standard sélectionné.

Important

Résidence des données pour tous les types de déploiement : Les données au repos restent dans la géographie Azure désignée. Toutefois, les données d’inférence sont traitées comme suit :

  • Global types : peut être traité dans n’importe quelle région Azure
  • Types de zone de données : le service traite uniquement les données dans la zone de données spécifiée par les Microsoft (ÉTATS-Unis, UE ou Asie-Pacifique (APAC)).
  • Types standard (région unique) : le service traite les données dans la région de déploiement.

En savoir plus sur la résidence des données.

Commencer par Global Standard

Pour la plupart des charges de travail, commencez par Global Standard. Il lance d’abord lorsqu’une nouvelle version de modèle a le prix le plus bas et offre la couverture la plus large de la région. Passez à un autre type de déploiement uniquement lorsque vous avez une raison spécifique, telle que la résidence des données, le débit réservé ou le traitement par lots asynchrone.

Les nouveaux types de déploiement deviennent disponibles dans un ordre défini : Global, Zone de données, puis région unique. Les types de déploiement à une seule région arrivent en dernier, n’ont aucune date de disponibilité garantie et dépendent de la capacité qui libère à mesure que les modèles plus anciens sont mis hors service. Pour obtenir l’ordre de lancement faisant autorité, consultez Lancement et disponibilité du modèle.

Comparaison des types de déploiement

Les modèles instantanés vous permettent d’exécuter l’inférence sans créer de déploiement. Ils ne sont donc pas des types de déploiement. Pour essayer un modèle instantanément, consultez l’accès instantané aux modèles.

Type de déploiement Code de référence SKU Informatique Facturation Idéal pour
Global Standard GlobalStandard N’importe quelle région Azure Paiement par jeton Charges de travail générales, quota le plus élevé
Global Provisioned GlobalProvisionedManaged N’importe quelle région Azure PTU réservé Débit élevé prévisible
Lot global GlobalBatch N’importe quelle région Azure Remise de 50%, 24 heures Travaux asynchrones volumineux
Standard de zone de données DataZoneStandard Dans la zone de données Paiement par jeton Conformité de la zone de données UE/US/APAC
Zone de données provisionnée DataZoneProvisionedManaged Dans la zone de données PTU réservé Zone de données + débit prévisible
Lot de traitement des zones de données DataZoneBatch Dans la zone de données Remise de 50% Grosses tâches asynchrones avec une zone de données
Standard Standard Région unique Paiement par jeton Conformité régionale, faible volume
Approvisionnement régional ProvisionedManaged Région unique PTU réservé Conformité régionale + débit
Développeur DeveloperTier N’importe quelle région Azure Paiement par jeton Évaluation de modèle affinée uniquement (durée de vie de 24 heures, aucun contrat SLA ou garantie de résidence des données)

Note

Tous les modèles ne prennent pas en charge tous les types de déploiement. Vérifiez Foundry Models vendu par Azure pour la disponibilité des modèles par type de déploiement et région.

Les garanties SLA varient en fonction du type de déploiement. Les types provisionnés fournissent un débit garanti et une variance de latence inférieure. Les types standard offrent un service de type meilleur effort. Les déploiements de développeurs n’incluent pas de contrat SLA. Pour plus d’informations, consultez le contrat SLA Azure pour Azure OpenAI Service.

Conseil

Pour obtenir des tarifs détaillés, consultez Azure OpenAI Service tarification.

Choisir le type de déploiement approprié

Utilisez le tableau suivant pour obtenir une recommandation rapide, puis affinez-la avec les critères suivants.

Requirement Niveau recommandé
Valeur par défaut : modèles les plus récents, prix le plus bas, régions les plus larges Standard global
Débit réservé et prévisible Global–Approvisionné
Conserver le traitement dans une zone de données Data Zone Standard ou Data Zone Provisioned
Résidence des données et débit réservé Zone de données provisionnée
Épingler le traitement à une seule région Provisionné standard ou régional (où pris en charge)
Travaux asynchrones volumineux à moindre coût Traitement par lots global ou zone de données (où pris en charge)
Évaluer un modèle affiné (temporaire, aucun contrat SLA) Développeur

Par exigence en matière de résidence des données

  • Aucune restriction : Utiliser Global Standard ou Global Provisioned
  • Zone de données UE, ÉTATS-Unis ou APAC : utiliser la zone de données Standard ou la zone de données approvisionnée dans une région de cette zone de données
  • Région unique uniquement : Utiliser le provisionnement standard ou régional

Pour connaître les régions exactes de chaque zone de données, consultez les déploiements de zone de données.

Par modèle de charge de travail

  • Démarrage rapide, prototypage ou tentative d’un nouveau modèle : utiliser l’accès instantané (préversion) ( aucun déploiement n’est nécessaire)
  • Trafic variable et en rafale : Utiliser Standard ou Global Standard (paiement par jeton)
  • Volume élevé cohérent : Utiliser des types provisionnés (capacité réservée)
  • Travaux de traitement par lots volumineux (non sensibles au temps) : utilisez un lot global ou un lot de zones de données (50% économies de coûts)
  • Évaluation de modèle affinée : Utiliser le développeur (sans contrat SLA, coût le plus bas)

En fonction de l’exigence de latence

  • Variance à faible latence requise : Utiliser des types provisionnés
  • Variance de latence acceptable : Utiliser des types Standard
  • Évaluation d’un modèle affiné : utilisez le développeur (aucun contrat SLA ; non destiné aux charges de travail sensibles à la latence).

Emplacements de traitement des données

Les déploiements standard et provisionnés offrent deux options de traitement des données : global, zone de données et région unique (Azure geography). La norme globale est un point de départ courant pour la plupart des charges de travail.

Déploiements globaux

Les déploiements globaux utilisent l'infrastructure globale de Azure pour acheminer dynamiquement le trafic vers les centres de données disponibles. Les déploiements globaux offrent les limites de débit initiales les plus élevées et la plus grande disponibilité du modèle.

Pour les charges de travail à volume élevé, vous pouvez rencontrer une variation de latence accrue. Si vous avez besoin d’une variation de latence plus faible à grande échelle, utilisez des types de déploiement approvisionnés.

Les déploiements globaux reçoivent d’abord de nouveaux modèles et fonctionnalités.

Déploiements de zone de données

Pour les types de déploiement global , le service peut traiter les invites et les réponses dans n’importe quelle zone géographique où le modèle est déployé. Pour les types de déploiement de zone de données, le service traite les invites et les réponses uniquement dans la zone de données spécifiée :

  • États-Unis : le service traite les données n’importe où aux États-Unis.
  • Union européenne : le service traite les données au sein de la limite de données de l’UE Azure.
  • Asie-Pacifique : le service traite les données dans la zone de données APAC.

La zone de données de l’UE suit la Azure limite de données de l’UE, qui peut inclure des pays et régions européens de libre-échange (AELE), comme la Norvège et la Suisse, en plus des États membres de l’UE. La zone de données APAC couvre plusieurs régions Asie-Pacifique. Microsoft pouvez ajouter des régions à une zone de données sans préavis pour améliorer la capacité et la disponibilité. Pour connaître la répartition actuelle par région, consultez la section « Disponibilité de la région de modèle par type de déploiement » des modèles Foundry vendus par Azure.

Note

Avec les types de déploiement Global Standard et Data Zone Standard, si la région primaire subit une interruption du service, tout le trafic initialement acheminé vers cette région est affecté. Pour en savoir plus, consultez le guide de haute disponibilité et de récupération d’urgence.

Standard global

  • Nom de la référence SKU dans le code : GlobalStandard

Les déploiements Globaux Standard utilisent l'infrastructure globale de Azure pour acheminer dynamiquement le trafic vers les centres de données disponibles. Ce type de déploiement fournit le quota par défaut le plus élevé et élimine la nécessité d’équilibrer la charge entre plusieurs ressources.

Les clients disposant d’un volume cohérent élevé peuvent rencontrer une plus grande variabilité de latence. Le seuil est défini par modèle. Pour en savoir plus, consultez la page Quotas. Pour les applications qui nécessitent une variation de latence inférieure à une utilisation importante de la charge de travail, envisagez de provisionner le débit.

Global Standard prend en charge le traitement des priorités pour accélérer les temps de réponse sur une base de paiement à l’utilisation. Pour plus d’informations, consultez Traitement prioritaire pour les modèles Foundry.

Global–Approvisionné

  • Nom de la référence SKU dans le code : GlobalProvisionedManaged

Les déploiements provisionnés globaux utilisent l'infrastructure globale de Azure pour router dynamiquement le trafic vers les centres de données disponibles. Ce type de déploiement fournit une capacité de traitement de modèle réservé pour un débit prévisible, combinant le routage global avec une capacité garantie.

Avec le débit approvisionné, vous achetez un nombre fixe d’unités de débit approvisionnées (PTU) qui garantissent un niveau spécifique de capacité de traitement. Ce type de déploiement offre une latence inférieure et plus cohérente que Global Standard. Pour en savoir plus, consultez les concepts de débit approvisionné.

Lot global

  • Nom de la référence SKU dans le code : GlobalBatch

Global Batch gère les tâches de traitement à grande échelle et à volume élevé. Vous pouvez traiter des groupes asynchrones de requêtes avec un quota distinct et un traitement cible de 24 heures, à 50% moins cher que Global Standard. Avec le traitement par lots, plutôt que d’envoyer une seule requête à la fois, vous envoyez un grand nombre de requêtes dans un seul fichier. Les requêtes Global Batch ont un quota de jetons mis en file d’attente distinct, ce qui évite toute interruption de vos charges de travail en ligne.

Cas d’usage courants :

  • Traitement des données à grande échelle : analysez les jeux de données en parallèle.
  • Génération de contenu : créez de grands volumes de texte, tels que des descriptions de produits ou des articles.
  • Révision et synthèse des documents : Traiter et résumer les documents longs.
  • Automatisation du support client : gérez simultanément de nombreuses requêtes.
  • Extraction et analyse des données : extrayez et analysez des informations à partir de grandes quantités de données non structurées.
  • Tâches de traitement en langage naturel (NLP) : effectuez une analyse des sentiments ou une traduction sur des jeux de données volumineux.

Note

Les déploiements par lots sacrifient la réactivité en temps réel pour réaliser des économies. Les requêtes Batch n’ont pas d’accord de niveau de service (SLA) en temps réel : ces dernières visent à s’achever dans les 24 heures, mais peuvent prendre plus de temps.

Standard de zone de données

  • Nom de la référence SKU dans le code : DataZoneStandard

Les déploiements Data Zone Standard routent dynamiquement le trafic vers les centres de données au sein de la zone de données définie par Microsoft (ÉTATS-Unis, UE ou APAC). Ce type de déploiement fournit des quotas par défaut plus élevés que les types de déploiement à une seule région tout en conservant les données dans la zone spécifiée.

Les clients disposant d’un volume cohérent élevé peuvent rencontrer une plus grande variabilité de latence. Le seuil est défini par modèle. Pour en savoir plus, consultez la page quotas et limites. Pour les charges de travail qui nécessitent une faible variabilité de la latence à grand volume, envisagez des types de déploiement provisionnés.

Data Zone Standard prend en charge le traitement de priorité pour accélérer les temps de réponse sur une base de paiement à l’utilisation. Pour plus d’informations, consultez Traitement prioritaire pour les modèles Foundry.

Zone de données provisionnée

  • Nom de la référence SKU dans le code : DataZoneProvisionedManaged

Les déploiements provisionnés de zone de données acheminent dynamiquement le trafic au sein de la zone de données spécifiée par Microsoft (ÉTATS-Unis, UE ou APAC) tout en fournissant une capacité de traitement de modèle réservé. Ce type de déploiement combine la conformité de zone de données avec un débit élevé et prévisible.

Lot de zones de données

  • Nom de la référence SKU dans le code : DataZoneBatch

Les déploiements Batch de zone de données fournissent les mêmes fonctionnalités que Global Batch, y compris 50 % d'économies de coûts et un délai de traitement de 24 heures. Le trafic est acheminé uniquement vers les centres de données au sein de la zone de données définie par Microsoft (ÉTATS-Unis, UE ou APAC).

Norme

  • Nom de la référence SKU dans le code : Standard

Les déploiements standard utilisent la facturation de paiement par jeton. Vous payez uniquement pour ce que vous consommez. Les modèles disponibles dans chaque région et leur débit peut être limité.

Les déploiements standards sont adaptés aux charges de travail de faible à moyenne taille avec des pics de charge élevés. Les clients disposant d’un volume cohérent élevé peuvent rencontrer une plus grande variabilité de latence.

Provisionné au niveau régional

  • Nom de la référence SKU dans le code : ProvisionedManaged

Les déploiements provisionnés régionaux vous permettent de spécifier la quantité de débit dont vous avez besoin dans un déploiement. Le service alloue ensuite la capacité de traitement du modèle nécessaire et garantit qu’elle est prête pour vous. Le débit est défini en termes d’unités de débit provisionnées (PTU), qui est un moyen normalisé de représenter le débit de votre déploiement. Chaque paire de versions de modèle nécessite différentes quantités de PTU à déployer et fournit différentes quantités de performance par PTU. Les exigences minimales de PTU varient selon le modèle. Pour connaître les valeurs minimales actuelles et la capacité disponible, consultez les concepts de débit approvisionné.

Développeur (pour les modèles affinés)

  • Nom de la référence SKU dans le code : DeveloperTier

Le type de déploiement développeur est conçu pour une évaluation de modèle affinée uniquement. Il fournit des tests rentables des modèles personnalisés, mais n’inclut pas de garanties de résidence des données ou un contrat SLA. Les déploiements de développeurs ont une durée de vie fixe de 24 heures et sont automatiquement supprimés après expiration. Pour en savoir plus sur l’utilisation du type de déploiement développeur, consultez le guide de réglage précis.

Résolution des problèmes de déploiement

Problèmes courants lors de la création ou de l’utilisation de déploiements :

Problème Cause Résolution
Type de déploiement indisponible Le modèle ne prend pas en charge le type sélectionné Vérifier la disponibilité du modèle par type de déploiement
Quota dépassé Limite d’abonnement atteinte pour les jetons par minute Demander une augmentation du quota dans Azure portail ou utiliser une autre région
Région indisponible Modèle non déployé dans la région sélectionnée Sélectionner une région dans la liste de disponibilité du modèle
Capacité provisionnée indisponible Aucune capacité PTU dans la région Essayez une autre région ou utilisez Global Provisioned pour une disponibilité plus large

Pour connaître les limites de quota par type de déploiement, consultez Quotas et limites des modèles Foundry.

Restreindre les types de déploiement avec Azure Policy

Azure Policy permet d’appliquer des normes organisationnelles et d’évaluer la conformité à grande échelle. Grâce à son tableau de bord de conformité, vous pouvez évaluer l’état global de l’environnement et explorer la granularité par ressource et par stratégie. Azure Policy prend également en charge la correction en bloc pour les ressources existantes et la correction automatique pour les nouvelles ressources. En savoir plus sur Azure Policy et les contrôles intégrés spécifiques pour Foundry Tools.

Utilisez la stratégie suivante pour désactiver l’accès à un type de déploiement Foundry spécifique. Remplacez GlobalStandard par le nom de la référence SKU pour le type de déploiement que vous souhaitez restreindre.

{
    "mode": "All",
    "policyRule": {
        "if": {
            "allOf": [
                {
                    "field": "type",
                    "equals": "Microsoft.CognitiveServices/accounts/deployments"
                },
                {
                    "field": "Microsoft.CognitiveServices/accounts/deployments/sku.name",
                    "equals": "GlobalStandard"
                }
            ]
        }
    }
}