Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Note
Recherche Azure AI est disponible via le portail Azure, les API REST et les SDK Azure. Il sous-tend également Foundry IQ, la couche de connaissances managée qui transforme le contenu d’entreprise en bases de connaissances réutilisables et prenant en charge les autorisations pour les agents dans le portail Microsoft Foundry.
Note
Certaines fonctionnalités de récupération agentique sont généralement disponibles dans l’API REST 2026-04-01 via l’accès par programmation. Le portail Azure et le portail Microsoft Foundry continuent de fournir un accès en préversion uniquement à toutes les fonctionnalités de récupération agentique. Pour obtenir des conseils sur la migration, notamment une répartition des éléments généralement disponibles et ceux qui restent en version préliminaire, consultez Migrer le code de récupération agentique vers la dernière version.
Si vous choisissez d’utiliser une API REST en préversion, vous pouvez accéder aux fonctionnalités de récupération agentiques qui ne sont pas encore en disponibilité générale. Les fonctionnalités en préversion sont fournies sans contrat de niveau de service et ne sont pas recommandées pour les charges de travail de production. Pour plus d’informations, consultez Conditions d'utilisation supplémentaires pour les versions préliminaires de Microsoft Azure.
Important
Ces fonctionnalités font partie de l’API REST 2026-08-01-preview. La préversion 2026-08-01 vous est concédée sous licence dans le cadre de votre abonnement Azure et est soumise aux conditions applicables aux « préversions » dans les Microsoft Conditions d’utilisation du produit, l’addenda sur la protection des données des produits et des services Microsoft (« DPA ») et les conditions d’utilisation supplémentaires pour les préversions Microsoft Azure.
La préversion 2026-08-01 prend en charge les connexions à d’autres services Microsoft et à des services tiers. L’utilisation de ces services est soumise à leurs conditions respectives et peut entraîner le traitement ou le stockage des données en dehors de la limite de conformité Azure, ainsi que des données entrant dans la limite de conformité Azure.
Il est de votre responsabilité de gérer si vos données circulent en dehors des limites géographiques et de conformité de votre organisation, ainsi que des implications connexes, et que les autorisations, les limites et les approbations appropriées sont provisionnés.
Vous êtes responsable de l’examen et du test des applications que vous créez dans le contexte de vos cas d’usage spécifiques et de prendre toutes les décisions et personnalisations appropriées. Cela inclut l’implémentation de vos propres atténuations d’IA responsables, telles que les métaprompts, les filtres de contenu ou d’autres systèmes de sécurité, et la garantie que vos applications répondent aux normes de qualité, de fiabilité, de sécurité et de fiabilité appropriées. Pour plus d’informations, consultez la note de transparence Recherche Azure AI.
Dans Recherche Azure AI, la récupération agentique est un pipeline multi-requêtes conçu pour traiter des questions complexes posées par des utilisateurs ou des agents dans des applications de chat et de copilote. Il est destiné aux modèles de génération augmentée de récupération (RAG) et aux flux de travail agent-à-agent.
Voici ce que fait la recherche agentique :
Peut utiliser un modèle de langage volumineux (LLM) pour décomposer une requête complexe en sous-requêtes plus petites et ciblées pour une meilleure couverture sur le contenu propriétaire et externe. Les sous-requêtes peuvent inclure l’historique des conversations pour un contexte supplémentaire.
Exécute des sous-requêtes en parallèle. Chaque sous-requête est reclassée sémantiquement pour promouvoir les correspondances les plus pertinentes.
Combine les meilleurs résultats dans une réponse unifiée qu’un LLM peut utiliser pour générer des réponses ancrées.
Peut retourner des références sources et un journal d’activité en même temps que le contenu fusionné. Vous pouvez donc utiliser uniquement les données de base ou les transmettre à un LLM pour obtenir une réponse complète.
Ce pipeline hautes performances vous aide à générer des données de base de haute qualité ou des réponses pour votre application de conversation, avec la possibilité de répondre rapidement à des questions complexes.
Pourquoi utiliser la récupération agentique ?
La recherche agentique prend en charge les expériences gérées comme personnalisées pour les agents et les applications. Dans le portail Microsoft Foundry, il alimente Foundry IQ en tant que couche de connaissances managée pour les agents. Vous pouvez également créer des solutions de récupération agentiques personnalisées à l’aide du portail Azure, de l’API REST du service de recherche ou d’une Kit de développement logiciel (SDK) Azure prise en charge.
Utilisez la récupération agentique lorsque vous souhaitez fournir des agents et des applications avec le contenu le plus pertinent pour répondre à des questions plus difficiles, tirer sur le contexte de conversation, votre contenu propriétaire et les sources externes.
La récupération agentique ajoute une latence par rapport à un pipeline à requête unique, mais elle gère la complexité des requêtes qu’une seule requête ne peut pas. Par exemple, il peut gérer :
Questions comportant plusieurs demandes, telles que « trouvez-moi un hôtel près de la plage, avec une navette depuis l’aéroport, et situé à distance de marche de restaurants végétariens ».
Questions qui dépendent du contexte antérieur dans la conversation.
Requêtes bénéficiant d'une réécriture, à l'aide de cartes de synonymes et de paraphrases générées par un LLM afin d'élargir la couverture de votre contenu.
Fautes d’orthographe.
Architecture et workflow
Le processus de récupération agentique fonctionne comme suit :
Initiation du flux de travail : Votre application appelle une base de connaissances avec une action de récupération qui fournit une requête et un historique des conversations.
Planification de requêtes : Avec un effort de raisonnement de récupération de niveau
lowetmedium, la base de connaissances envoie votre requête et l’historique de la conversation à un LLM, qui génère des sous-requêtes ciblées. Avec un effort deminimal, cette étape est omise et les requêtes sont envoyées directement aux sources de connaissances. L’effort de raisonnement est défini par défaut surlowet se configure dans la base de connaissances.Exécution de requête : La base de connaissances envoie les sous-requêtes à vos sources de connaissances. Toutes les sous-requêtes s’exécutent simultanément et peuvent être des mots clés, des vecteurs ou des recherches hybrides. Chaque sous-requête subit une reclassement sémantique pour trouver les correspondances les plus pertinentes. Les références sont extraites et conservées à des fins de citation.
Synthèse des résultats : Le système combine tous les résultats dans une réponse unifiée. Le contenu fusionné est toujours retourné. Les références sources et un journal d’activité d’exécution sont facultatifs.
Components
Pour tous les scénarios de récupération agentique, une base de connaissances et au moins une source de connaissances sont requises. D’autres composants sont facultatifs et dépendent de votre configuration.
| Composant | Service | Rôle |
|---|---|---|
| Base de connaissances | Recherche Azure AI | Orchestre le pipeline et gère les sources de connaissances ainsi que les paramètres de requête. |
| Source de connaissances | Recherche Azure AI | Définit le contenu utilisé dans le pipeline. Peut être indexé (soutenu par un index de recherche sur votre service) ou distant (contenu récupéré au moment de la requête à partir d’une plateforme externe). |
| Index de recherche | Recherche Azure AI | Stocke le contenu pouvant faire l’objet d’une recherche (texte et vecteurs) avec une configuration sémantique. Détermine quels types de requêtes s’exécutent et quelles optimisations s’appliquent. Obligatoire uniquement pour les sources de connaissances indexées. |
| Classeur sémantique | Recherche Azure AI | Utilisé en interne par le pipeline de récupération agentique pour reclasser les résultats pour la pertinence (reclassement L2). |
| LLM | Azure OpenAI | Planifie les requêtes et sélectionne les sources de connaissances. Utilisé uniquement avec les niveaux d'effort de raisonnement de récupération low et medium. Ignoré au niveau d'effort minimal. |
Exigences d’intégration
Votre application pilote le pipeline en appelant la base de connaissances et en gérant la réponse. Le pipeline retourne des données de base que vous pouvez transmettre à un LLM pour la génération de réponses ou l’utiliser directement dans votre interface de conversation. Pour plus d’informations sur l’implémentation, consultez Tutoriel : Créer une solution de récupération agentique de bout en bout.
Disponibilité et tarification
La récupération agentique est disponible dans certaines régions. Les sources de connaissances et les bases de connaissances ont également des limites maximales qui varient selon le niveau tarifaire et l’effort de raisonnement de récupération.
Facturation
La récupération via agent entraîne des frais issus de deux services :
Recherche Azure AI facture les jetons de récupération consommés pendant l’exécution de la sous-requête et le classement sémantique. Le plan gratuit (par défaut) fournit une allocation de jeton mensuelle. Le plan standard active les tarifs de paiement à l’utilisation une fois que l’allocation gratuite est consommée. Pour plus d’informations, consultez Activer ou désactiver la facturation de récupération agentique.
Azure OpenAI facture les jetons d’entrée et de sortie utilisés dans la planification des requêtes basées sur LLM et answer synthesis. La tarification se fait toujours par paiement à l'utilisation et est basée sur le modèle attribué à la base de connaissances. Les frais apparaissent sur votre facture OpenAI Azure. Pour connaître les tarifs, consultez Azure tarification OpenAI.
Le tableau suivant compare la facturation entre le pipeline classique à requête unique et le pipeline à récupération multi-requête agentique. Dans le pipeline classique, le composant facturable est un ranker sémantique.
| Aspect | Pipeline classique | Récupération agentique |
|---|---|---|
| Unité | Basé sur des requêtes | Basé sur un jeton |
| Coût par unité | Coût uniforme par requête | Coût variable par jeton (dépend de l’effort de raisonnement) |
| Estimation des coûts | Estimer le nombre de requêtes | Estimer l’utilisation des jetons |
| Allocation gratuite | Allocation de requête gratuite mensuelle | Allocation mensuelle de jetons gratuits |
Exemple : Estimer les coûts
Cet exemple illustre le processus d’estimation des coûts pour la planification des requêtes et l’exécution des requêtes, mais pas la synthèse des réponses. Vos coûts pourraient être inférieurs. Pour connaître les tarifs actuels, consultez Recherche Azure AI tarification et Azure tarification OpenAI.
Pour estimer les coûts du plan de requête en tant que paiement à l’utilisation dans Azure OpenAI, supposons que gpt-4o-mini :
- 15 cents pour 1 million de jetons d’entrée.
- 60 cents pour 1 million de jetons de sortie.
- 2 000 jetons d'entrée pour la taille moyenne d'une conversation.
- 350 jetons pour la taille moyenne du plan de sortie.
Coûts de facturation estimés pour l’exécution des requêtes
Pour estimer le nombre de jetons de récupération agentiques, commencez par une idée de ce à quoi ressemble un document moyen dans votre index. Par exemple, vous pouvez estimer les points suivants :
- 10 000 blocs, où chaque bloc est un à deux paragraphes d’un fichier PDF.
- 500 jetons par bloc.
- Chaque sous-requête reclasse jusqu’à 50 segments.
- En moyenne, il existe trois sous-requêtes par plan de requête.
Calcul du prix d’exécution
Supposons que nous effectuons 2 000 récupérations agentiques avec trois sous-requêtes par plan. Cela nous donne environ 6 000 requêtes totales.
Réattribuer un classement à 50 segments par sous-requête, soit 300 000 segments au total.
Le segment moyen est de 500 jetons, donc le nombre total de jetons pour le réordonnancement est de 150 millions.
Compte tenu d’un prix hypothétique de 0,022 par jeton, 3,30 $ est le coût total de reclassement en dollars américains.
Passage aux coûts du plan de requête : 2 000 jetons d’entrée multipliés par 2 000 récupérations agentiques égales à 4 millions de jetons d’entrée pour un total de 60 cents.
Estimer les coûts de production basés sur une moyenne de 350 jetons. Si nous multiplions 350 par 2 000 récupérations agentiques, nous obtenons 700 000 jetons de sortie au total pour un total de 42 cents.
En rassemblant toutes ces informations, vous paieriez environ 3,30 $ pour la récupération agentique dans Recherche Azure AI, 60 cents pour les jetons d'entrée dans Azure OpenAI et 42 cents pour les jetons de sortie dans Azure OpenAI, pour un total de 1,02 $ pour la planification des requêtes. Le coût combiné de l’exécution complète est de 4,32 $.
Conseils pour contrôler les coûts
Passez en revue le journal d’activité dans la réponse pour savoir quelles requêtes ont été émises sur les sources et les paramètres utilisés. Vous pouvez réexécuter ces requêtes sur vos index et utiliser un tokeniseur public pour estimer les jetons et comparer à l’utilisation signalée par l’API. Toutefois, la reconstruction précise d’une requête ou d’une réponse n’est pas garantie. Les facteurs incluent le type de source de connaissances, comme les données web publiques ou une source de connaissances à distance SharePoint basée sur une identité utilisateur, ce qui peut affecter la reproduction de requêtes.
Réduire le nombre de sources de connaissances (index) ; la consolidation du contenu peut réduire la dispersion et le volume de jetons.
Réduisez l’effort de raisonnement pour réduire l’utilisation de LLM pendant la planification des requêtes et l’expansion des requêtes (recherche itérative).
Organisez le contenu afin que les informations les plus pertinentes soient trouvées avec moins de sources et de documents (par exemple, des résumés ou des tableaux organisés).
Comment commencer
Pour créer une solution de récupération agentique, vous pouvez utiliser le portail Azure, le portail Microsoft Foundry (nouveau), les API REST ou un package Kit de développement logiciel (SDK) Azure équivalent.
- Guides de démarrage rapide
- Guides pratiques
- Tutoriels
- Exemples de code
- Références d’API REST
- Démonstrations
- Quickstart : Récupération agentique dans le portail Azure
- Quickstart : Récupération agentique (C#, Java, JavaScript, Python, TypeScript, REST)