Compréhension du contenu pour la classification/segmentation

Content Understanding vous permet d’implémenter la classification et le fractionnement dans le cadre de la demande d’opération d’analyseur. Vous pouvez effectuer une classification de contenu et une extraction de contenu dans le cadre d’un seul appel d’API.

Le concept global de analyzer inclut désormais les concepts de contentCategories et enableSegment pour classer et fractionner les données d’entrée que vous traitez dans votre application. Cette fonctionnalité d’analyseur peut effectuer la classification d’un fichier d’entrée dans son ensemble. Il peut également identifier plusieurs documents ou plusieurs instances d’un document unique dans un fichier d’entrée.

À compter de la version en disponibilité générale, la classification des documents et la conception de segmentation vidéo sont unifiées, ce qui permet une approche cohérente pour traiter les données d’entrée, quelle que soit sa modalité. Dans la documentation, la « classification Content Understanding » fait référence aux opérations d’analyse requises pour classifier et fractionner les données d’entrée (contentCategories et enableSegment).

Cas d’usage métier

La classification Content Understanding vous permet de traiter des documents et des vidéos complexes dans différents formats et modèles :

  • Factures : catégorisez les factures de plusieurs fournisseurs pour traiter chaque catégorie avec un analyseur Compréhension de contenu différent, si nécessaire.
  • Documents fiscaux : catégoriser plusieurs documents fiscaux en différents types de formulaires fiscaux, tels que 1040 et 1099.
  • Contrats : catégoriser les contrats longs et non structurés pour simplifier les opérations afin de comprendre différents types d’accords et leurs implications juridiques spécifiques.
  • Vidéo sportive : segmentez automatiquement les scènes pour diviser la vidéo en blocs logiques tels que les publicités et le contenu sportif réel.

Fonctionnalités de classification/segmentation

Content Understanding peut analyser des documents uniques ou multi-fichiers pour déterminer si un fichier d’entrée peut être classé dans une catégorie définie. Les scénarios suivants sont pris en charge :

Scénarios du document :

  • Classifier uniquement : classifie le fichier d’entrée dans son ensemble. Par exemple, un seul fichier qui contient un type de document, tel qu’un formulaire de demande de prêt.
  • Classifiez et analysez : classifie et analyse le fichier d’entrée en acheminant l’entrée vers l’analyseur d’extraction souhaité.
  • Classifier et segmenter : classifie et segmente un fichier d’entrée unique qui peut avoir plusieurs types ou instances de documents concaténés. Par exemple, un package de demande de prêt qui contient un formulaire de demande de prêt, un bulletin de paiement et un relevé bancaire. Un autre exemple est une collection de factures numérisées dans un fichier unique.
  • Classifier, segmenter et analyser : une fois les segments classés, routez chaque segment vers l’analyseur d’extraction souhaité pour une extraction de champ supplémentaire.
  • Classifieur hiérarchique : une analyse supplémentaire facultative en fonction de la catégorie peut également être un analyseur de classifieur.

Scénarios vidéo :

  • Segment uniquement : Fractionner la vidéo en segments en fonction des caractéristiques de contenu définies dans le description champ de contentCategories. Par exemple, le fractionnement d’une diffusion sportive en parties de jeu, de publicités et de segments de commentaires.
  • Segmenter et analyser : fractionner la vidéo en segments et acheminer chaque segment vers un analyseur pour l’extraction de champ.

Note

L’unité minimale pour la classification des documents est une page unique. La classification intrapage n’est pas prise en charge.

Créer des catégories de classification

La classification de la compréhension du contenu ne nécessite pas de jeu de données d’entraînement. Vous pouvez définir jusqu’à 200 noms de catégorie et descriptions dans l’opération d’analyse. Par défaut, l’ensemble du fichier est traité comme un objet de contenu unique, ce qui signifie que le fichier est associé à une seule catégorie.

À partir de la version GA, vous devez inclure la catégorie other dans contentCategories pour garantir que le contenu peut rester non associé à l’une des catégories que vous avez définies. Si la other catégorie n’est pas incluse, tous les fichiers sont classés dans l’une de vos catégories définies. Chacun des noms de catégorie que contentCategories vous définissez peut également inclure un description pour fournir des informations supplémentaires sur la catégorie que vous définissez.

Fractionnement du fichier d’entrée

Lorsque vous avez plusieurs documents dans un fichier, le classifieur peut identifier les différents types de documents contenus dans le fichier d’entrée avec une capacité de fractionnement. La réponse du classifieur contient les plages de pages pour chacun des types de documents identifiés contenus dans un fichier. Cette réponse peut inclure plusieurs instances du même type de document.

Lorsque vous exécutez l’opération analyze , elle inclut une propriété qui vous donne un enableSegment contrôle granulaire sur le comportement de fractionnement. Vous pouvez également spécifier les numéros de page pour analyser uniquement certaines pages du document d’entrée :

  • Pour traiter l’intégralité du fichier d’entrée comme plusieurs documents combinés pour la classification des documents, définissez enableSegment à true. Lorsque vous le faites, le service retourne automatiquement des catégories pour les segments du fichier d’entrée.
  • Pour traiter l’intégralité du fichier d’entrée en tant que document unique, définissez enableSegment sur false.

Par défaut, les segments commencent aux limites de page. La version de l’API 2026-06-01-preview ajoute une segmentation en page, qui peut fractionner une seule page en plusieurs segments lorsqu’elle contient du contenu à partir de différents types de documents. La segmentation dans la page est contrôlée par un champ distinct allowInPageSegments . Vous pouvez donc choisir de fractionner les sous-pages sans modifier le comportement existant enableSegment . Pour plus d’informations, consultez Améliorations de classification (préversion 2026-06-01).

Note

Pour les vidéos, seule la segmentation est prise en charge. Vous devez définir un seul contentCategories avec enableSegment défini sur true. Utilisez le description champ pour spécifier des critères pour fractionner la vidéo en segments.

Analyse facultative

Pour un flux complet de bout en bout, vous pouvez lier des catégories de classifieur avec des analyseurs personnalisés existants et des analyseurs prédéfinis. Pour chaque objet de contenu classé en catégories avec des analyseurs liés, le service appelle automatiquement l’analyse sur l’objet de contenu à l’aide de l’analyseur correspondant.

Par exemple, vous pouvez utiliser cette liaison pour créer des classifieurs qui identifient et analysent uniquement les factures à partir d’un fichier PDF qui contient plusieurs types de formulaires. Définissez analyzerId sur un analyseur prédéfini ou un analyseur personnalisé pour diriger et réaliser l'extraction de champs à partir des documents ou des pages classifiés.

Vous pouvez également omettre de définir n’importe quel analyzerId paramètre pour catégoriser, mais pas d’effectuer une analyse de contenu sur le fichier ou segment classé.

Dans la couche supérieure, vous pouvez également définir omitContent sur true afin d'omettre l’objet de contenu d’origine et de renvoyer uniquement les objets de contenu issus de l’analyse effectuée sur les segments ou fichiers classifiés.

Classifieur hiérarchique

L’opération d’analyseur prend en charge la division et la classification hiérarchiques. Dans l’opération de l’analyseur de base, définissez analyzerId sur chaque catégorie de contenu sur un analyseur personnalisé qui effectue une classification ou un fractionnement supplémentaires. Cette approche prend en charge des scénarios tels que les factures, les contrats et les reçus, où chaque catégorie peut pointer vers une autre opération d’analyseur analyzerId qui classifie différents sous-types de documents.

Les entrées de document prennent en charge cinq niveaux d’imbrication et les entrées vidéo prennent en charge deux.

Améliorations de classification (préversion 2026-06-01)

Les sections précédentes décrivent le comportement en disponibilité générale. Cette section décrit les fonctionnalités en préversion uniquement qui nécessitent une version 2026-06-01-previewd’API.

La version de l’API 2026-06-01-preview comprend deux améliorations apportées à la classification et au fractionnement des documents. Pour utiliser ces améliorations, ciblez la version préliminaire de l’API lorsque vous envoyez une demande d’analyse.

Important

Ces fonctionnalités sont en préversion publique. Les fonctionnalités en préversion sont fournies sans contrat de niveau de service et ne sont pas recommandées pour les charges de travail de production.

Extraction de fonctionnalités basées sur la disposition (préversion)

Dans l’API 2026-06-01-preview , le classifieur ajoute des signaux de classification enrichis, tels que des fonctionnalités de document basées sur la disposition , des marqueurs de section, des en-têtes de tableau, des descriptions de figure, etc.

L’échantillonnage prenant en charge la disposition améliore la précision de classification dans les scénarios où le contenu distinctif est hautement non structuré ou réparti sur une page. Par exemple:

  • Pages éparses dans du texte, par exemple des images de rayon X ou des rapports de diagnostic analysés.
  • Pages lourdes de figure, où une description de figure porte la plupart du signal de classification.
  • Pages où les en-têtes de section clés ou les en-têtes de tableau apparaissent au milieu de la page.

Aucune modification de configuration n’est requise. Lorsque vous appelez l’API en préversion, le classifieur utilise automatiquement les fonctionnalités basées sur la disposition.

Segmentation dans la page (préversion)

L’API 2026-06-01-preview ajoute une segmentation en page , qui peut fractionner une seule page en plusieurs segments lorsque la page contient du contenu appartenant à différents types de documents.

La segmentation dans la page est utile pour les scénarios tels que :

  • Dossiers médicaux où une seule page combine des types de contenu, par exemple une section démographique des patients suivie d’une commande de référence sur la même page.
  • Packages fiscaux où plusieurs planifications ou formulaires sont empilés sur la même page, par exemple les planifications K-1.
  • Paquets multi-formulaires où les formulaires consécutifs ne démarrent pas toujours sur une nouvelle page.

Pour activer la segmentation dans la page, définissez allowInPageSegmentstrue la valeur lorsque vous créez ou mettez à jour un analyseur personnalisé (vous ne pouvez pas définir ce champ dans une demande d’analyse). La réponse de l’analyseur inclut des plages de pages par segment, la catégorie de chaque segment, un score de confiance et une expression source qui identifie la position englobante du segment sur la page.

L’exemple suivant montre le segments tableau d’une réponse d’analyse, où une seule page est divisée en segment de carte de crédit et un segment de carte d’identité :

"segments": [
    {
        "span": {
            "offset": 0,
            "length": 301
        },
        "segmentId": "segment1",
        "startPageNumber": 1,
        "endPageNumber": 1,
        "category": "Credit_card",
        "confidence": 0.98,
        "source": "D(1,1.32,1.49,3.13,1.49,3.13,3.86,1.32,3.86)"
    },
    {
        "span": {
            "offset": 301,
            "length": 798
        },
        "segmentId": "segment2",
        "startPageNumber": 1,
        "endPageNumber": 1,
        "category": "Identity_card",
        "confidence": 0.99,
        "source": "D(1,1.16,4.95,3.82,4.95,3.82,8.52,1.16,8.52)"
    }
]
Champs d’API

Les champs d’API suivants prennent en charge la segmentation dans la page :

Champ Type Description
ContentAnalyzerConfig.allowInPageSegments boolean Définissez quand vous créez ou mettez à jour un analyseur personnalisé. Quand true, les segments peuvent couvrir une partie d’une page au lieu de pages complètes.
DocumentContentSegment.segmentId string Identificateur stable pour le segment, tel que segment1.
DocumentContentSegment.span Span offset et length du segment au sein du texte de contenu parent au format Markdown.
DocumentContentSegment.confidence float32 Valeur en [0–1]. Score de confiance pour la segmentation et la classification des catégories.
DocumentContentSegment.source SourceExpression Position englobante du segment sur la page, sous forme d’expression polygone du formulaire D(pageNumber, x1, y1, x2, y2, x3, y3, x4, y4). Transmettez cette valeur en tant que range sous-analyseur.

Limites du classifieur

Pour plus d’informations sur les formats de document d’entrée pris en charge et les limites de classifieur, consultez Quotas et limites de service.

Meilleures pratiques

Pour améliorer la qualité de classification et de fractionnement, utilisez un nom et une description de catégorie appropriés pour que le modèle puisse comprendre les catégories avec un certain contexte. Pour plus d’informations sur les noms et descriptions des catégories, consultez Meilleures pratiques.

Principaux avantages

  • Précision et fiabilité : assurez-vous une classification précise des documents pour réduire les erreurs et améliorer l’efficacité.
  • Scalabilité : effectuer un scale-out transparent du traitement des documents pour répondre aux besoins de l’entreprise.
  • Personnalisable : adaptez le classifieur de document pour qu’il corresponde à des flux de travail spécifiques.

Langues et régions prises en charge

Pour obtenir la liste des langues et régions prises en charge, consultez Prise en charge de la langue et de la région.

Sécurité et confidentialité des données

Si vous utilisez Content Understanding, passez en revue les stratégies Microsoft sur les données client. Pour plus d’informations, consultez Données, protection et confidentialité.