Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Le traitement de documents non structurés (tels que les contrats et les déclarations de travail) ou les documents structurés (tels que les factures et les formulaires d’assurance) est essentiel pour les flux de travail de traitement de documents intelligents (IDP) et les scénarios de génération augmentée par récupération (RAG). L’extraction fiable des données à grande échelle nécessite plus d’extraction de texte.
Pour une automatisation de haute qualité, vous devez souvent savoir ce qui a été extrait, où il provient, s’il correspond à votre intention et la fiabilité de l’extraction.
La plupart des entreprises sont confrontées aux défis suivants lors de la gestion de différents documents à grande échelle :
- Vous devez automatiser les flux de travail, mais uniquement lorsque l’extraction atteint un seuil de précision requis pour l’application métier. Vous devez savoir à quel point l’analyseur est confiant/précis dans ses résultats.
- Vous devez valider les sources de données extraites pour la référence vraie. Lorsque vous voyez des scores de confiance inférieurs à prévus, validez rapidement les résultats en examinant l’emplacement spécifique dans le document.
- Dans l’idéal, vous devez rechercher des moyens d’améliorer la qualité des résultats de l’analyseur (en fournissant quelques exemples étiquetés) lorsqu’il fait une erreur ou rencontre un nouveau format avec des scores de confiance inférieurs à ceux attendus.
Azure Content Understanding dans Foundry Tools fournit des fonctionnalités critiques pour le post-traitement de votre sortie extraite.
| Caractéristique | Objectif | Valeur |
|---|---|---|
| Score de confiance | Quantifie la certitude de l’analyseur dans chaque prédiction par le biais de scores de confiance. | Active STP (traitement direct) |
| Ancrage | Fournit des références/citations pour chaque sortie extraite vers le contenu du document d’origine | Garantit la traçabilité, la conformité et la confiance des utilisateurs |
| Exemples étiquetés | Fournit des exemples de documents corrigés qui montrent les valeurs, les dispositions, la terminologie et les conventions de domaine pertinentes de l’analyseur. L’apprentissage étiqueté est disponible dans les API en disponibilité générale et en préversion ; l’entraînement optimisé et aucune donnée étiquetée au runtime ne sont des fonctionnalités d’aperçu. | S’adapte rapidement aux nouveaux formats ou aux cas de périphérie |
Note
Dans les 2025-11-01 API et 2026-06-01-preview les disponibilités en disponibilité générale, les scores de confiance et la mise en base sont disponibles pour tous les types de champs de document (extract, classifyet generate les méthodes).
En savoir plus sur ces fonctionnalités ci-dessous.
Scoring de confiance : Automatiser avec le contrôle
Chaque champ peut inclure un score de confiance compris entre 0 et 1 qui indique le degré de certitude de l'analyseur quant au résultat. Utilisez cette valeur pour automatiser les résultats à haut niveau de confiance et acheminer les résultats à faible confiance pour l’examen humain.
Activez les scores de confiance pour tous les champs (ou champs spécifiques) à l’aide de la estimateFieldSourceAndConfidence propriété. En savoir plus sur la configuration des scores de confiance pour les analyseurs.
Pourquoi les scores de confiance comptent
Les scores de confiance vous permettent de concevoir des flux de travail tels que :
- Approbation automatique des extractions lorsque la confiance dépasse un seuil défini pour automatiser intelligemment les tâches de traitement des documents.
- Optimisation de l’allocation des ressources en réduisant les coûts opérationnels et en utilisant l’examen de la boucle humaine pour les aspects critiques.
- Rejeter ou marquer des extractions en dessous d’un certain seuil pour une intervention manuelle, ce qui améliore la précision de la prise de décision.
Example
Vous traitez les factures d’utilitaire analysées pour extraire l’adresse de facturation et le montant dûs. Pour un document :
- Adresse de facturation : « 1234 Market St., San Francisco, CA » → Confiance : 0,96
- Montant dû : « 128,74 $ » → Confiance : 0,52
Dans ce cas, votre pipeline d’automatisation peut publier l’adresse de facturation directement à votre application en aval tout en acheminant le montant en raison dune personne à des fins de vérification. En utilisant des scores de confiance, vous réduisez l’effort manuel tout en conservant la précision.
Ancrage : tracer chaque résultat à sa source
La base garantit que chaque champ, chaque réponse ou chaque classification inclut une référence à son emplacement d’origine dans le document. Cela inclut les informations d'origine (numéro de page et coordonnées spatiales) et les plages (décalage et longueur).
Pourquoi la mise en place des questions
Dans les flux de travail d’entreprise, la précision n’est pas suffisante ; vous avez également besoin de traçabilité. Lorsqu’un modèle extrait un nom de client ou une clause d’arrêt, vous devez être en mesure de valider l’origine de ces informations. L’ancrage est essentiel pour :
- Maintien de la traçabilité et de la localisation claires pour les clauses extraites, les numéros financiers, les tables et les ID d’assurance.
- Garantir la transparence avec les vérifications de conformité internes.
- Prise en charge efficace de la validation de la boucle humaine en identifiant la page, la section et le contenu qui ont fourni la valeur du champ.
Example
Vous souhaitez extraire la clause de résiliation d’un contrat. Le modèle retourne :
- Texte extrait : « L’une ou l’autre partie peut mettre fin à cet accord avec un préavis de 60 jours ».
"spans": [
{
"offset": 343,
"length": 102
}
]
-
Source : Page 3, coordonnées
({x1},{y1},{x2},{y2},{x3},{y3},{x4},{y4})
Les étendues indiquent la position logique de l’élément à l’aide du décalage et de la longueur des caractères. La source donne sa position visuelle avec le numéro de page et les coordonnées de zone englobante.
Avec ces données de base, votre équipe juridique peut vérifier l’extraction en sautant directement au paragraphe source dans le PDF. Cela élimine les estimations et génère une confiance dans la sortie de l’application.
Améliorer l’apprentissage de l’analyseur avec des exemples étiquetés
L’API 2025-11-01 GA et l’API 2026-06-01-preview prennent en charge l’apprentissage d’analyseurs de documents personnalisés avec des exemples de documents étiquetés. Les deux versions utilisent le même flux de travail d’étiquetage dans Content Understanding Studio.
Important
L’apprentissage prend uniquement en charge les analyseurs de documents et ne prend actuellement pas en charge les champs qui utilisent la generate méthode.
Si le contexte de tous les champs est clairement présent dans le document de test, un appel d’extraction de capture zéro peut être suffisant. Commencez par suivre les meilleures pratiques pour les définitions de schéma. Si vous voyez toujours des valeurs de champ incorrectes ou des scores de confiance en dessous de votre seuil de traitement direct, utilisez des échantillons étiquetés pour améliorer l’analyseur.
Les exemples de documents étiquetés fournissent le contexte de domaine. En corrigeant les valeurs de champ dans des documents représentatifs, vous affichez l’analyseur les dispositions, la terminologie, les modèles de valeur et les conventions pertinents pour votre scénario.
Les échantillons étiquetés fonctionnent pour améliorer la qualité de l’extraction :
- Pour les jeux de données avec des variantes de modèle minimales, ajoutez un exemple étiqueté unique.
- Pour des variantes plus complexes, ajoutez un exemple représentatif pour chaque modèle ou format.
- Pour les documents qui génèrent des scores de confiance faibles, une extraction incomplète ou des valeurs incorrectes.
- Évaluez la qualité d’extraction avant et après l’entraînement pour confirmer que les échantillons améliorent les résultats.
Pour ajouter un exemple étiqueté, accédez à une page de résultats d’extraction de document dans le portail Foundry et sélectionnez l’onglet Données d’étiquette . Chargez un exemple, puis sélectionnez Étiquette automatique. L’étiquetage automatique exécute l’analyseur existant et pré-remplit les résultats que vous pouvez modifier.
Modifiez les valeurs de champ incorrectes ou manquantes. Après avoir enregistré l’exemple, les champs corrigés affichent la balise corrigée .
Note
Vous ajoutez des exemples étiquetés dans Content Understanding Studio. Après avoir ajouté des exemples, régénérez l’analyseur afin que l’analyseur puisse utiliser les exemples.
Par exemple, si les factures d’un nouveau fournisseur produisent un score de confiance faible ou une valeur d’échéance de montant incorrecte, ajoutez une facture représentative et corrigez ses valeurs étiquetées. Le document lui-même fournit le contexte sur les conventions de disposition et de facture de ce fournisseur.
L’analyseur généralise ensuite le modèle pour extraire la valeur à partir de modèles de documents similaires.
Améliorations apportées à l’API en préversion
Important
La version 2026-06-01-preview de l’API est en préversion publique. Les préversions sont fournies sans contrat de niveau de service et ne sont pas recommandées pour les charges de travail de production. Pour plus d’informations, consultez les Conditions supplémentaires d’utilisation pour les préversions de Microsoft Azure et l'Addendum sur la protection des données des produits et services Microsoft (« DPA »).
L’API 2026-06-01-preview utilise le même exemple de flux de travail étiqueté, mais améliore la façon dont l’entraînement utilise les documents. Lorsque vous régénérez l’analyseur, l’entraînement distille les modèles et le contexte de domaine pertinents à partir des échantillons étiquetés dans l’analyseur intégré.
L’approche de formation en préversion :
- Réduit la consommation de jetons lorsque l’analyseur s’exécute par rapport à l’approche d’entraînement en disponibilité générale.
- N’inclut pas ou ne conserve pas les exemples de documents étiquetés dans l’analyseur généré.
- N’exige pas que l’analyseur généré accède aux exemples de documents étiquetés au moment de l’analyse.
Les exemples de documents étiquetés restent dans le compte de stockage associé à votre projet Content Understanding Studio uniquement à des fins de conception. Pour plus d’informations, consultez Données, confidentialité et sécurité pour Content Understanding.
Limites
Les exemples étiquetés ne corrigent pas les problèmes de reconnaissance de texte. Par exemple, si la lettre l est reconnue comme chiffre 1, l’étiquetage de la valeur comme lettre l n’améliore pas la qualité d’extraction.
Flux de travail complet
Lorsque vous créez un pipeline intelligent d’automatisation des documents, ces fonctionnalités vous aident à extraire les données de manière fiable à grande échelle. Par exemple, si vous traitez des contrats d’approvisionnement, vous pouvez extraire :
- Nom du fournisseur
- Dates de début et de fin
- Clause d’annulation
Pour garantir la qualité et la confiance pour la compréhension des documents à l’échelle de l’entreprise :
- Ancrage offre à votre équipe une traçabilité complète pour chaque champ.
- Les scores de confiance vous aident à automatiser, car l’examen humain est nécessaire uniquement lorsque la confiance est faible.
- Les exemples étiquetés fournissent des exemples qui aident l’analyseur à s’adapter au contexte de domaine, aux nouveaux modèles de contrat ou aux cas de périphérie.