Utilisez cette architecture comme référence pour créer et déployer des solutions d’IA conversationnelle sécurisées et évolutives sur Azure à l’aide de Foundry, Azure OpenAI et d’autres services connexes. Il met l’accent sur la mise en réseau privée, la redondance de zone et les contrôles de sécurité stricts pour garantir la conformité et la préparation de l’entreprise.
Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Cet article fournit des modèles architecturaux et des architectures de référence de référence pour vous aider à concevoir, déployer et régir des charges de travail IA sur Azure. Il couvre les principaux composants, interactions et meilleures pratiques pour la création de systèmes IA sécurisés, évolutifs et bien régis.
Utilisez ce modèle d’architecture comme base de référence lors de la conception de charges de travail IA. Commencez par les principaux composants et interactions indiqués dans le modèle, puis adaptez-les pour répondre aux objectifs de votre entreprise, aux contraintes techniques et à la posture des risques.
Par exemple, une organisation souhaite créer une application assistant IA d’entreprise qui permet aux employés de poser des questions sur les documents internes et les données opérationnelles. Lorsqu’un utilisateur pose une question, l’application détermine les données nécessaires, récupère le contexte pertinent et appelle le modèle approprié pour générer une réponse fondée. Pour cela, un pipeline de données est nécessaire pour nettoyer, enrichir et indexer des documents internes afin que l’assistant puisse récupérer un contexte sûr et à jour. Comme avec n’importe quelle application, utilisez des pratiques Well-Architected pour maintenir l’application fiable, sécurisée et optimisée pour les coûts.
Bien que cet assistant IA représente un scénario métier spécifique, le modèle d’architecture qu’il suit est suffisamment générique pour s’adapter à de nombreux cas d’usage ia avec des caractéristiques similaires.
Cet article vous guide tout au long de ce modèle générique qui établit une connaissance de base des composants principaux, de leurs fonctions et des interactions dans une charge de travail IA. Avec cette base, vous pouvez prendre des décisions de conception éclairées pour créer des solutions IA robustes lorsque vous personnalisez l’architecture en fonction de votre cas d’usage spécifique.
Architecture de charge de travail IA de haut niveau
Ce diagramme montre les composants clés que vous pourriez avoir dans votre conception de charge de travail IA.
| Composant | Description |
|---|---|
| Traitement et analytique des données | Rassemblez des données brutes à partir de différentes sources, nettoyez-les, transformez-les et organisez-les en jeux de données prêts pour l’entraînement du modèle, le réglage et la mise à l’échelle. Cette couche n’interagit pas directement avec les utilisateurs, mais permet des interactions ia précises et efficaces en aval. |
| Entraînement du modèle et réglage précis | Entraîner des modèles sur vos données, suivre les versions et surveiller les performances via un processus reproductible. Utilisez les pratiques MLOps pour continuer à s'améliorer à mesure que les nouvelles données arrivent et maintenir l’alignement avec les besoins de l’entreprise. |
| Applications IA intelligentes | C’est là que les utilisateurs interagissent avec votre IA. Il combine les modèles préentraînés avec la logique d’application pour trouver les informations appropriées, créer des invites, créer des interfaces et apprendre à partir de commentaires. |
| Pratiques et processus d’IA | Gardez votre solution IA fiable en incorporant des principes DevOps, un contrôle de version et des pipelines automatisés dans des flux de travail MLOps. Déployez de manière itérative avec des protections et vérifiez en permanence la précision, les performances et le biais. |
| Services et outils de plateforme | Services cloud de base qui sécurisent vos ressources, contrôlent les coûts et surveillent l’intégrité du système du développement au déploiement. Utilisez des pipelines CI/CD pour une automatisation fiable et des outils spécialisés pour analyser les sorties IA pour la conformité. |
Composition de la charge de travail
Cette section décrit deux charges de travail principales : la charge de travail intelligente de l’application et la charge de travail d’entraînement et de réglage précis. Chaque charge de travail a ses propres considérations de conception pour la durée de vie et l’état, la portée et les dépendances, la scalabilité et la disponibilité, ainsi que la sécurité et l’IA responsable.
Toutes les charges de travail IA ne nécessitent pas d’entraînement et de réglage des composants. Si vous utilisez uniquement des modèles préentraînés sans formation personnalisée, concentrez-vous sur la charge de travail d’application intelligente. Toutefois, si votre cas d’usage implique la création de modèles personnalisés ou l’amélioration continue de ces modèles avec de nouvelles données, la charge de travail d’entraînement et d’optimisation de la charge de travail devient essentielle. Les deux charges de travail sont modulaires. Vous pouvez donc implémenter les composants pertinents pour votre cas d’usage spécifique tout en suivant les meilleures pratiques décrites dans les considérations de conception.
| Caractéristique de conception | Description |
|---|---|
| Durée de vie et état |
La durée de vie fait référence à la durée attendue de l’existence et de l’actif d’une ressource dans la charge de travail. L’état fait référence aux données ou informations qu’une ressource gère au fil du temps. |
| Portée et dépendances |
Reach fait référence à la mesure dans laquelle une ressource doit être accessible ou distribuée. Les dépendances font référence aux relations et à la dépendance à d’autres ressources. |
| Extensibilité et disponibilité |
L’extensibilité est la capacité d’une ressource à gérer une charge ou une demande accrues. La disponibilité est la capacité d’une ressource à rester opérationnelle et accessible. |
| Sécurité et IA responsable |
La sécurité fait référence aux mesures qui protègent les données et garantissent la conformité aux réglementations. L’IA responsable fait référence aux pratiques qui garantissent l’IA éthique, notamment l’équité, la transparence et la responsabilité. |
Ce diagramme montre les composants clés de la charge de travail d’application intelligente à inclure dans votre conception.
| Composant | Description |
|---|---|
| Couche Client | La couche cliente permet aux utilisateurs et aux systèmes externes de se connecter à l’IA. Cette couche prend vos demandes et retourne les réponses générées par l’IA, tout en vous assurant que l’expérience est simple et facile à utiliser. |
| Couche d'intelligence - API | L’API de couche Intelligence relie les clients et les fonctionnalités d’intelligence du système via des API bien définies. Il est chargé de diriger les demandes vers le processus d’orchestration ou d’agent approprié, en veillant à ce que les interactions entre les utilisateurs et les services soient lisses et cohérentes. Cette couche gère également la façon dont les données sont accessibles, met en place des mesures de sécurité et définit des limites pour empêcher le système d’être surchargé. Si une application a simplement besoin d’une prédiction simple, cette couche peut ignorer les étapes d’orchestration complexes et envoyer la requête directement au moteur d’inférence pour une réponse rapide. |
| Couche d'intelligence - orchestration et processus de calcul de l'agent | L’orchestration et la couche de calcul de l’agent sont responsables de la coordination de la façon dont différents composants d’IA fonctionnent ensemble pour effectuer chaque tâche. Selon ce qui est requis, il peut exécuter des tâches une après l’autre ou laisser plusieurs agents travailler en même temps, puis fusionner leurs résultats. Il détermine l’intention de l’utilisateur, vérifie les réponses pour s’assurer qu’elles sont sécurisées, s’intègre à la couche de connaissances pour obtenir des informations et utilise des outils pour combiner tout et vous donner la meilleure réponse. |
| Couche d'intelligence - Gestion des interactions | La couche de gestion des conversations est la mémoire et le gestionnaire de conversation du système. Il permet à l’IA de discuter naturellement en rappelant les messages précédents, en gardant le suivi des sujets en cours et en stockant des parties importantes de la discussion, afin que les conversations puissent circuler en douceur même pendant de longues sessions. Il s’occupe également de la façon dont les données de conversation sont conservées ou supprimées, en veillant à ce que vos informations soient gérées de manière responsable. |
| Couche d’inférence - bases ou modèles prédictifs | La couche d’inférence est l’endroit où un modèle formé effectue des prédictions, génère du contenu ou prend des décisions en fonction des informations qu’il reçoit. Le processus commence par charger votre modèle IA, préparer les données, exécuter les prédictions, puis mettre en forme les résultats afin qu’ils soient disponibles immédiatement (en temps réel) ou ultérieur sur (traitement par lots). |
| Couche de connaissances | La couche de connaissances est l’emplacement où le système obtient les informations et le contexte dont il a besoin pour répondre avec précision aux questions. Il garantit que les données sont accessibles en toute sécurité, à l’aide de permissions et d’autorisations. La couche de connaissances aide l’IA à suivre l’approche RAG en recherchant des index ou des bases de données vectorielles pour trouver uniquement le contenu approprié. Il permet à l’IA d’accéder à différentes sources de données internes et externes de manière cohérente, qu’il s’agisse de protocoles MCP ou REST. |
| Couche des Outils | La couche Outils est l’endroit où les actions métier et les fonctionnalités externes sont rendues accessibles. La couche intelligence peut déclencher ces actions ou se connecter à d’autres systèmes en appelant des outils ou des agents de manière standardisée, qu’il s’agisse de MCP, A2A ou OpenAPI/REST. Ces fonctionnalités sont présentées en tant qu’options actionnables, prêtes à être utilisées par la couche d’intelligence, et elles peuvent être gérées directement par la charge de travail ou par des services externes. |
Considérations relatives à la conception
Lorsque vous concevez votre architecture de charge de travail d’application intelligente, tenez compte des caractéristiques de conception suivantes pour prendre des décisions éclairées sur la conception et les interactions des composants.
Durée de vie et état
L’API Intelligence, l’orchestration, l’inférence et les couches de connaissances sont tous les services de longue durée qui s’exécutent pendant toute la durée de vie de votre charge de travail. Investir dans la disponibilité, la surveillance et l’excellence opérationnelle pour chaque service.
Chaque couche évolue à un rythme différent, vous avez donc besoin d’une coordination délibérée du déploiement. L’API Intelligence évolue lentement pour rester stable et maintenir la compatibilité descendante. Les couches d’orchestration et d’agent évoluent plus rapidement à mesure que vous ajoutez de nouvelles fonctionnalités. La couche d’inférence est mise à jour lorsque vous déployez de nouveaux modèles. La couche de connaissances évolue en continu à mesure que les données changent.
Les composants sans état peuvent être alloués ou désalloués à la demande, tandis que les composants avec état gèrent les données qui persistent entre les interactions.
L’API Intelligence, l’orchestration et les couches d’inférence sont sans état, ce qui facilite leur mise à l’échelle en ajoutant d’autres instances. La couche d’orchestration peut contenir un état éphémère pendant l’exécution, mais ne le persiste pas au-delà de la gestion des requêtes. L’état éphémère réduit la complexité opérationnelle, mais limite les options de reprise après échec, il est donc important de concevoir avec soin pour les nouvelles tentatives et l'idempotence.
Les données de session de gestion des conversations peuvent durer de minutes à jours. Les sessions plus longues permettent des conversations plus riches, mais coûtent plus cher et augmentent les risques de confidentialité. La couche de connaissances stocke des données dans des index et des bases de données qui évoluent à mesure que vous ajoutez, mettez à jour ou supprimez des informations.
Compromis. Les décisions concernant la gestion de la durée de vie et de l’état ont un impact direct sur les coûts, la fiabilité et les performances. Les composants avec état de longue durée nécessitent un investissement plus important dans la mise à l’échelle et la résilience, tandis que les composants éphémères sans état sont plus rentables, mais peuvent introduire une latence des démarrages froids ou de la récupération d’état externe.
Portée et dépendances
L’API Intelligence est le seul point de terminaison exposé publiquement dans l’architecture, tout reste interne. Vous pouvez le déployer dans plusieurs régions pour maintenir les utilisateurs proches d’un point de terminaison et améliorer la résilience.
La couche d’orchestration se trouve au centre, fonctionne au sein de votre réseau et coordonne tout, comme l’état de la conversation, les appels de modèle, la récupération des connaissances et l’appel d’outils. Les défaillances ici bloquent l’ensemble du système, ce qui le rend hautement disponible.
La couche d’inférence s’exécute en interne sans dépendances externes. Déployez-le près de l’orchestrateur pour maintenir la latence faible.
Les couches de connaissances et d’outils sont internes, mais peuvent dépendre de systèmes externes. Ces dépendances externes peuvent introduire des retards ou des problèmes de disponibilité qui affectent la qualité de la réponse.
Compromis. Le déploiement multirégion améliore les performances et la résilience, mais augmente les coûts. Le déploiement à une seule région est plus rentable, mais peut entraîner une latence plus élevée pour les utilisateurs éloignés de la région.
Extensibilité et disponibilité
Votre application intelligente a deux modèles de mise à l’échelle. Couches sans état telles que l’API, l’orchestration et l’échelle d’inférence en ajoutant d’autres instances. Couches de données telles que la gestion des conversations et la mise à l'échelle des connaissances en répartissant les données entre plusieurs magasins via des mécanismes tels que les réplicas de lecture, le partitionnement et la fragmentation.
L’API Intelligence est mise à l’échelle pour gérer davantage de demandes. Déployez-le dans plusieurs zones ou régions pour une meilleure disponibilité et pour maintenir les utilisateurs proches d’un point de terminaison.
L’orchestration et le calcul de l’agent se trouvent au centre de votre système, donc les défaillances ici bloquent tout. Ajoutez d’autres instances, utilisez l’équilibrage de charge et disposez d’un basculement prêt pour que le système continue à s’exécuter lorsque des instances individuelles échouent.
La couche d’inférence est mise à l’échelle en fonction de ce dont vos modèles ont besoin. Ajoutez d’autres instances avec des GPU à mesure que la demande augmente. Utilisez l’infrastructure en tant que code (IaC) pour recréer rapidement des environnements pendant la récupération.
La gestion des conversations est mise à l’échelle avec le nombre d’utilisateurs simultanés. Utilisez des copies et des sauvegardes pour conserver les données de session disponibles.
La couche de connaissances est mise à l’échelle en fonction de la quantité de données que vous avez et de la fréquence à laquelle elle est interrogée. Utilisez un réglage efficace de l’indexation et de la base de données pour accélérer les réponses. Configurez des copies dans plusieurs emplacements pour assurer la disponibilité.
Compromis. Les composants sans état peuvent évoluer rapidement, mais cela peut amener une latence lors du démarrage à froid. Les composants de données offrent une durabilité, mais nécessitent davantage de planification pour la mise à l’échelle. Équilibrez ces facteurs en fonction des besoins de charge et d’entreprise attendus.
Sécurité et IA responsable
Chaque couche de votre application intelligente comporte différents risques et a besoin de ses propres contrôles. Les outils peuvent déclencher des actions réelles, la connaissance définit ce que votre IA sait, et l’inférence produit les résultats que les utilisateurs voient. Limitez l’accès à chaque couche, surveillez ce qui se passe et assurez-vous de pouvoir expliquer comment les décisions sont prises.
La couche Outils présente le risque le plus élevé, car les actions peuvent avoir des conséquences réelles potentiellement irréversibles. Pour les opérations à haut risque, ajoutez des étapes d’approbation humaine. Utilisez une authentification stricte, un accès à des privilèges minimum et une application de la confidentialité des données pour empêcher les actions non autorisées et l’exposition des informations d’identification personnelle. Évaluez chaque outil avant de l’intégrer afin que la gouvernance dépasse la limite de votre charge de travail.
La couche de connaissances a besoin de données de haute qualité et non biaisées pour produire des sorties dignes de confiance. Sécurisez l’accès aux données avec une authentification, une autorisation et une conformité appropriées aux exigences de résidence des données. L’accès en lecture seule et l’isolation réseau empêchent l’altération. Enregistrez les sources récupérées pour chaque réponse par le biais de pistes d’audit, ce processus vous permet d’expliquer les décisions et d’examiner les problèmes plus tard.
La couche d’inférence ne doit être accessible qu’aux rôles d’opérations et à l’identité de la couche d’orchestration. Surveillez les sorties par le biais d’un service de validation qui vérifie la toxicité et d’autres problèmes de sécurité. Validez les modèles avant le déploiement pour intercepter les biais et gardez les mécanismes de restauration prêts si des problèmes apparaissent en production.
Architectures de référence pour les charges de travail IA
Ces exemples de référence servent d’architecture recommandée pour les charges de travail IA.
-
Architecture de référence des conversations Microsoft Foundry de base
-
Architecture de référence de base pour le chat Microsoft Foundry dans une zone d’atterrissage Azure
Cette architecture s’appuie sur la conception Microsoft Foundry Chat et la place dans une zone d’atterrissage sécurisée Azure. Il réunit des composants clés ( Foundry Agent Service, Azure OpenAI et App Service) à l’intérieur d’un environnement privé isolé du réseau. Tous les services se connectent via des points de terminaison privés et sont protégés par Pare-feu Azure, avec redondance de zone pour la haute disponibilité.
-
Analytique de bout en bout avec Microsoft Fabric
Utilisez cette architecture comme référence lors de la conception d’une plateforme de données unifiée qui simplifie le cycle de vie complet de l’analytique.
Étape suivante
Passez en revue les meilleures pratiques pour la conception de scénarios d’application intelligents.