Comprensión del contenido clasificación/segmentación

Content Understanding permite implementar la clasificación y la división como parte de la solicitud de operación del analizador. Puede realizar la clasificación de contenido y la extracción de contenido como parte de una sola llamada API.

El concepto global de analyzer ahora incluye el concepto de contentCategories y enableSegment para clasificar y dividir los datos de entrada que procesa dentro de su aplicación. Esta característica del analizador puede realizar la clasificación de un archivo de entrada en su conjunto. También puede identificar varios documentos o varias instancias de un único documento dentro de un archivo de entrada.

A partir de la versión de disponibilidad general, el diseño de clasificación de documentos y segmentación de vídeo se unifican, lo que permite un enfoque coherente para procesar los datos de entrada independientemente de su modalidad. En la documentación, la "clasificación de Comprensión del Contenido" se refiere a las operaciones de análisis necesarias para clasificar y separar los datos de entrada (contentCategories y enableSegment).

Casos de uso empresarial

La clasificación de Content Understanding le permite procesar documentos y vídeos complejos en varios formatos y plantillas:

  • Facturas: clasifique las facturas de varios proveedores para procesar cada categoría con un analizador de Content Understanding diferente, si es necesario.
  • Documentos fiscales: clasifique varios documentos fiscales en diferentes tipos de formularios fiscales, como 1040 y 1099.
  • Contratos: clasifique contratos largos y no estructurados para simplificar las operaciones para comprender los distintos tipos de acuerdos y sus implicaciones legales específicas.
  • Vídeo deportivo: segmente automáticamente las escenas para dividir el vídeo en fragmentos lógicos, como anuncios y el contenido deportivo real.

Funcionalidades de clasificación y segmentación

Content Understanding puede analizar documentos de uno o varios archivos para identificar si un archivo de entrada se puede clasificar en una categoría definida. Se admiten los siguientes escenarios:

Escenarios de documento:

  • Clasificar solo: clasifica el archivo de entrada como un todo. Por ejemplo, un único archivo que contiene un tipo de documento, como un formulario de solicitud de préstamo.
  • Clasificar y analizar: clasifica y analiza el archivo de entrada mediante el enrutamiento de la entrada al analizador de extracción deseado.
  • Clasificar y segmentar: clasifica y segmenta un único archivo de entrada que podría tener varios tipos o instancias de documentos concatenados. Por ejemplo, un paquete de solicitud de préstamo que contiene un formulario de solicitud de préstamo, un recibo de pago y un extracto bancario. Otro ejemplo es una colección de facturas escaneadas en un único archivo.
  • Clasificar, segmentar y analizar: una vez clasificados los segmentos, enrute cada segmento al analizador de extracción deseado para una extracción de campos adicional.
  • Clasificador jerárquico: el análisis adicional opcional en función de la categoría también puede ser un analizador clasificador.

Escenarios de vídeo:

  • Solo segmento: divida el vídeo en segmentos en función de las características de contenido definidas en el description campo de contentCategories. Por ejemplo, dividir una difusión deportiva en segmentos de juego, comerciales y comentarios.
  • Segmentar y analizar: Dividir el vídeo en segmentos y encaminar cada segmento a un analizador para la extracción de campos.

Nota:

La unidad mínima para la clasificación de documentos es una sola página. No se admite la clasificación dentro de páginas.

Creación de categorías de clasificación

La clasificación de Content Understanding no requiere un conjunto de datos de entrenamiento. Puede definir hasta 200 nombres y descripciones de categorías dentro de la operación de análisis. De forma predeterminada, todo el archivo se trata como un único objeto de contenido, lo que significa que el archivo está asociado a una sola categoría.

A partir de la versión de disponibilidad general, debe incluir la categoría other dentro de contentCategories para asegurarse de que el contenido puede permanecer sin coincidir con ninguna de sus categorías definidas. Si no se incluye la other categoría, todos los archivos se clasifican en una de las categorías definidas. Cada uno de los nombres de categoría que defina dentro de contentCategories también puede incluir un description para proporcionar más información sobre la categoría que está definiendo.

División de archivos de entrada

Cuando tiene más de un documento en un archivo, el clasificador puede identificar los distintos tipos de documento contenidos en el archivo de entrada con la funcionalidad de división. La respuesta del clasificador contiene los intervalos de páginas de cada uno de los tipos de documento identificados que se encuentran dentro de un archivo. Esta respuesta puede incluir varias instancias del mismo tipo de documento.

Al ejecutar la analyze operación, incluye una enableSegment propiedad que proporciona control pormenorizado sobre el comportamiento de división. También puede especificar los números de página para analizar solo determinadas páginas del documento de entrada:

  • Para tratar todo el archivo de entrada como varios documentos combinados para la clasificación, establezca enableSegment en true. Al hacerlo, el servicio devuelve categorías para los segmentos del archivo de entrada automáticamente.
  • Para tratar todo el archivo de entrada como un único documento, establezca enableSegment en false.

De forma predeterminada, los segmentos comienzan en los límites de la página. La 2026-06-01-preview versión de la API agrega segmentación en página, que puede dividir una sola página en varios segmentos cuando contiene contenido de diferentes tipos de documento. La segmentación en página se controla mediante un campo independiente allowInPageSegments , por lo que puede optar por dividir subpáginas sin cambiar el comportamiento existente enableSegment . Para obtener más información, consulte Mejoras de clasificación (versión preliminar 2026-06-01).

Nota:

En el caso de los vídeos, solo se admite la segmentación. Debe definir un único contentCategories con enableSegment configurado en true. Use el description campo para especificar criterios para dividir el vídeo en segmentos.

Análisis opcional

Para obtener un flujo completo de un extremo a otro, puede vincular categorías de clasificadores con analizadores personalizados existentes y analizadores creados previamente. Para cada objeto de contenido clasificado en categorías con analizadores vinculados, el servicio invoca automáticamente el análisis en el objeto de contenido mediante el analizador correspondiente.

Por ejemplo, puede usar esta vinculación para crear clasificadores que identifiquen y analicen solo las facturas de un PDF que contenga varios tipos de formularios. Use analyzerId en un analizador predefinido o un analizador personalizado para enviar y extraer campos de los documentos o páginas clasificadas.

También puede omitir la configuración de cualquier analyzerId para clasificar, pero no realizar ningún análisis de contenido en el archivo o segmento categorizado.

En la capa superior, también puede establecer omitContent en true para omitir el objeto de contenido original y devolver solo los objetos de contenido del análisis realizado sobre los segmentos o archivos clasificados.

Clasificador jerárquico

La operación del analizador admite la división jerárquica y la clasificación. En la operación del analizador base, establezca analyzerId en cada categoría de contenido en un analizador personalizado que realice una clasificación o división adicionales. Este enfoque admite escenarios como facturas, contratos y recibos, donde cada categoría puede apuntar a otra operación de analyzerId analizador que clasifica diferentes subtipos de documento.

Las entradas de documento admiten cinco niveles de anidamiento y las entradas de vídeo admiten dos.

Mejoras de clasificación (versión preliminar 2026-06-01)

En las secciones anteriores se describe el comportamiento de la disponibilidad general. En esta sección se describen las funcionalidades de solo versión preliminar que requieren la versión 2026-06-01-previewde API .

La 2026-06-01-preview versión de la API incluye dos mejoras en la clasificación y división de documentos. Para usar estas mejoras, tenga como destino la versión preliminar de la API al enviar una solicitud de análisis.

Importante

Estas características están en versión preliminar pública. Las funcionalidades de versión preliminar se proporcionan sin un contrato de nivel de servicio y no se recomiendan para cargas de trabajo de producción.

Extracción de características basada en diseño (versión preliminar)

En la 2026-06-01-preview API, el clasificador agrega señales de clasificación enriquecidas, como características de documento basadas en diseño: marcadores de sección, encabezados de tabla, descripciones de la figura, etc.

El muestreo compatible con el diseño mejora la precisión de la clasificación en escenarios en los que el contenido distintivo no está estructurado o se distribuye en una página. Por ejemplo:

  • Páginas dispersas en texto, por ejemplo, imágenes de rayos X o informes de diagnóstico escaneados.
  • Páginas pesadas de la figura, donde una descripción de la figura lleva la mayor parte de la señal de clasificación.
  • Páginas en las que aparecen encabezados de sección clave o encabezados de tabla en el centro de la página.

No se requiere ningún cambio de configuración. Cuando se llama a la API de vista previa, el clasificador usa automáticamente las características basadas en el diseño.

Segmentación en página (versión preliminar)

La 2026-06-01-preview API agrega segmentación en página , que puede dividir una sola página en varios segmentos cuando la página contiene contenido que pertenece a diferentes tipos de documento.

La segmentación en página es útil para escenarios como:

  • Registros médicos en los que una sola página combina tipos de contenido, por ejemplo, una sección demográfica de pacientes seguida de un orden de referencia en la misma página.
  • Paquetes fiscales en los que se apilan varias programaciones o formularios en la misma página, por ejemplo, programaciones K-1.
  • Paquetes de varios formularios en los que los formularios consecutivos no siempre se inician en una página nueva.

Para habilitar la segmentación en página, establezca allowInPageSegments en true al crear o actualizar un analizador personalizado (no se puede establecer este campo en una solicitud de análisis). La respuesta del analizador incluye intervalos de páginas por segmento, la categoría de cada segmento, una puntuación de confianza y una expresión de origen que identifica la posición de límite del segmento en la página.

En el ejemplo siguiente se muestra la segments matriz en una respuesta de análisis, donde una sola página se divide en un segmento de tarjeta de crédito y un segmento de tarjeta de identidad:

"segments": [
    {
        "span": {
            "offset": 0,
            "length": 301
        },
        "segmentId": "segment1",
        "startPageNumber": 1,
        "endPageNumber": 1,
        "category": "Credit_card",
        "confidence": 0.98,
        "source": "D(1,1.32,1.49,3.13,1.49,3.13,3.86,1.32,3.86)"
    },
    {
        "span": {
            "offset": 301,
            "length": 798
        },
        "segmentId": "segment2",
        "startPageNumber": 1,
        "endPageNumber": 1,
        "category": "Identity_card",
        "confidence": 0.99,
        "source": "D(1,1.16,4.95,3.82,4.95,3.82,8.52,1.16,8.52)"
    }
]
Campos de API

Los siguientes campos de API admiten la segmentación en página:

Campo Tipo Description
ContentAnalyzerConfig.allowInPageSegments boolean Establezca al crear o actualizar un analizador personalizado. Cuando true, los segmentos pueden cubrir una parte de una página en lugar de páginas completas.
DocumentContentSegment.segmentId string Identificador estable del segmento, como segment1.
DocumentContentSegment.span Span offset y length del segmento dentro del texto de contenido primario en formato Markdown.
DocumentContentSegment.confidence float32 Valor en [0–1]. Puntuación de confianza para la segmentación y la clasificación de categorías.
DocumentContentSegment.source SourceExpression Posición delimitador del segmento en la página, como una expresión de polígono del formulario D(pageNumber, x1, y1, x2, y2, x3, y3, x4, y4). Pase este valor como range a un sub analizador.

Límites del clasificador

Para obtener información sobre los formatos de documento de entrada admitidos y los límites del clasificador, consulte Límites y cuotas de servicio.

procedimientos recomendados

Para mejorar la clasificación y la calidad de división, use un buen nombre de categoría y una descripción para que el modelo pueda comprender las categorías con algún contexto. Para obtener más información sobre los nombres y descripciones de categorías, consulte Procedimientos recomendados.

Ventajas clave

  • Precisión y confiabilidad: asegúrese de una clasificación precisa de documentos para reducir los errores y aumentar la eficacia.
  • Escalabilidad: Escale el procesamiento de documentos para satisfacer las demandas empresariales.
  • Personalizable: adapte el clasificador de documentos para ajustarse a flujos de trabajo específicos.

Idiomas y regiones admitidos

Para obtener una lista de los idiomas y regiones admitidos, consulte Compatibilidad con idiomas y regiones.

Seguridad y privacidad de datos

Si usa Content Understanding, revise las directivas de Microsoft sobre los datos de los clientes. Para obtener más información, consulte Datos, protección y privacidad.