Compreensão de Conteúdo, classificação/segmentação

O Content Understanding permite-lhe implementar classificação e divisão como parte do pedido de operação do analisador. Pode realizar a classificação e extração de conteúdo como parte de uma única chamada à API.

O conceito global de analyzer agora inclui o conceito de contentCategories e enableSegment para classificar e dividir os dados de entrada que processa dentro da sua aplicação. Esta funcionalidade do analisador pode realizar a classificação de um ficheiro de entrada como um todo. Ele também pode identificar vários documentos ou várias instâncias de um único documento dentro de um arquivo de entrada.

A partir da versão GA, a classificação de documentos e o desenho da segmentação de vídeo são unificados, permitindo uma abordagem coerente ao processamento dos dados de entrada independentemente da sua modalidade. Na documentação, "Classificação por Compreensão de Conteúdo" refere-se às operações de análise necessárias para classificar e dividir dados de entrada (contentCategories e enableSegment).

Casos de uso de negócios

A classificação para compreender conteúdos permite-lhe processar documentos e vídeos complexos em vários formatos e modelos:

  • Faturas: categorize faturas de vários fornecedores para processar cada categoria com um analisador de Compreensão de Conteúdo diferente, se necessário.
  • Documentos fiscais: categorize vários documentos fiscais em diferentes tipos de formulários fiscais, como 1040 e 1099.
  • Contratos: Categorize contratos longos e não estruturados para agilizar as operações e entender os diferentes tipos de acordos e suas implicações legais específicas.
  • Vídeo desportivo: Segmente automaticamente as cenas para dividir o vídeo em blocos lógicos, como anúncios e o conteúdo desportivo real.

Capacidades de classificação/segmentação

O Content Understanding pode analisar documentos de ficheiro único ou múltiplo para identificar se um ficheiro de entrada pode ser classificado numa categoria definida. Os seguintes cenários são suportados:

Cenários de documento:

  • Classificar apenas: Classifica o ficheiro de entrada como um todo. Por exemplo, um único ficheiro que contenha um tipo de documento, como um formulário de pedido de empréstimo.
  • Classificar e analisar: Classifica e analisa o ficheiro de entrada encaminhando a entrada para o analisador de extração desejado.
  • Classificar e segmentar: Classifica e segmenta um único ficheiro de entrada que pode conter múltiplos tipos ou instâncias de documentos concatenados. Por exemplo, um pacote de pedido de empréstimo que contém um formulário de pedido de empréstimo, recibo de vencimento e extrato bancário. Outro exemplo é uma coleção de faturas digitalizadas num único ficheiro.
  • Classificar, segmentar e analisar: Uma vez classificados os segmentos, encaminhe cada segmento para o analisador de extração desejado para extração posterior do campo.
  • Classificador hierárquico: Análises adicionais opcionais, dependendo da categoria, podem também ser um analisador de classificadores.

Cenários em vídeo:

  • Apenas segmentos: Dividir o vídeo em segmentos com base nas características de conteúdo definidas no description campo de contentCategories. Por exemplo, dividir uma transmissão desportiva em jogos, anúncios e segmentos de comentário.
  • Segmentar e analisar: Dividir o vídeo em segmentos e encaminhar cada segmento para um analisador para extração em campo.

Observação

A unidade mínima para classificação de documentos é uma única página. A classificação intra-página não é suportada.

Criar categorias de classificação

A classificação de compreensão de conteúdos não requer um conjunto de dados de treino. Pode definir até 200 nomes e descrições de categorias dentro da operação de análise. Por defeito, todo o ficheiro é tratado como um único objeto de conteúdo, o que significa que o ficheiro está associado a uma única categoria.

A partir da versão GA, precisa de incluir a categoria other dentro do contentCategories para garantir que o conteúdo permaneça sem correspondência a qualquer uma das suas categorias definidas. Se a other categoria não estiver incluída, todos os ficheiros são classificados numa das suas categorias definidas. Cada um dos nomes das categorias que define contentCategories pode também incluir um description para dar mais informações sobre a categoria que está a definir.

Divisão de ficheiros de entrada

Quando você tem mais de um documento em um arquivo, o classificador pode identificar os diferentes tipos de documento contidos no arquivo de entrada com capacidade de divisão. A resposta do classificador contém os intervalos de páginas para cada um dos tipos de documentos identificados contidos em um arquivo. Esta resposta pode incluir múltiplas instâncias do mesmo tipo de documento.

Quando executa a analyze operação, inclui uma enableSegment propriedade que lhe dá controlo granular sobre o comportamento de divisão. Você também pode especificar os números de página para analisar apenas determinadas páginas do documento de entrada:

  • Para tratar todo o ficheiro de entrada como múltiplos documentos combinados para classificação, defina enableSegment para true. Quando o fazes, o serviço devolve automaticamente categorias para os segmentos dentro do ficheiro de entrada.
  • Para tratar todo o ficheiro de entrada como um único documento, defina enableSegment para false.

Por defeito, os segmentos começam nos limites das páginas. A 2026-06-01-preview versão API adiciona segmentação na página, que pode dividir uma única página em múltiplos segmentos quando contém conteúdo de diferentes tipos de documentos. A segmentação dentro da página é controlada por um campo separado allowInPageSegments , por isso pode optar por sub-divisões de página sem alterar o comportamento existente enableSegment . Para mais informações, consulte Melhorias de classificação (pré-visualização de 2026-06-01).

Observação

Para vídeos, só é suportada a segmentação. Deve definir um único contentCategories com enableSegment definido como true. Use o description campo para especificar critérios para dividir o vídeo em segmentos.

Análise opcional

Para um fluxo completo de ponta a ponta, pode ligar categorias de classificadores com analisadores personalizados existentes e analisadores pré-definidos. Para cada objeto de conteúdo classificado em categorias com analisadores vinculados, o serviço invoca automaticamente a análise no objeto de conteúdo usando o analisador correspondente.

Por exemplo, pode usar esta ligação para criar classificadores que identificam e analisam apenas faturas de um PDF que contém vários tipos de formulários. Configure analyzerId para um analisador predefinido ou um analisador personalizado para encaminhamento e extração de campos a partir dos documentos ou páginas classificados.

Também pode omitir definir qualquer analyzerId para categorizar, mas não realizar qualquer análise de conteúdo no ficheiro ou segmento categorizado.

Na camada superior, também pode definir omitContent para true omitir o objeto de conteúdo original e devolver apenas os objetos de conteúdo da análise realizada nos segmentos ou ficheiros classificados.

Classificador hierárquico

A operação do analisador suporta a divisão hierárquica e a classificação. Na operação do analisador base, define-se analyzerId para cada categoria de conteúdo um analisador personalizado que realiza classificação ou divisão adicional. Esta abordagem suporta cenários como faturas, contratos e recibos, onde cada categoria analyzerId pode apontar para outra operação de analisador que classifica diferentes subtipos de documentos.

As entradas de documentos suportam cinco níveis de aninhamento, e as entradas de vídeo suportam dois.

Melhorias de classificação (pré-visualização de 01-06-2026)

As secções anteriores descrevem o comportamento da GA. Esta secção descreve capacidades apenas de pré-visualização que requerem a versão 2026-06-01-previewda API .

A 2026-06-01-preview versão da API inclui duas melhorias na classificação e divisão de documentos. Para utilizar estas melhorias, aponte a versão de pré-visualização da API quando submeter um pedido de análise.

Importante

Estas funcionalidades estão em pré-visualização pública. As capacidades de pré-visualização são fornecidas sem um acordo de nível de serviço e não são recomendadas para cargas de trabalho em produção.

Extração de funcionalidades baseada em layout (pré-visualização)

Na 2026-06-01-preview API, o classificador adiciona sinais de classificação ricos, como características de documentos baseadas em layout – marcadores de secção, cabeçalhos de tabelas, descrições de figuras e mais.

A amostragem consciente do layout melhora a precisão da classificação em cenários onde o conteúdo distintivo é altamente desestruturado ou espalhado por uma página. Por exemplo:

  • Páginas que têm pouco texto, por exemplo, imagens de raios-X ou relatórios de diagnóstico digitalizados.
  • Páginas com muitos números, onde a descrição da figura transporta a maior parte do sinal de classificação.
  • Páginas onde cabeçalhos de secção chave ou cabeçalhos de tabela aparecem no meio da página.

Não é necessária qualquer alteração de configuração. Quando chama a API de pré-visualização, o classificador usa automaticamente as funcionalidades baseadas no layout.

Segmentação dentro da página (pré-visualização)

A 2026-06-01-preview API adiciona segmentação dentro da página , que pode dividir uma única página em múltiplos segmentos quando a página contém conteúdo pertencente a diferentes tipos de documentos.

A segmentação dentro da página é útil para cenários como:

  • Registos médicos onde uma única página mistura tipos de conteúdo, por exemplo, uma secção de demografia dos pacientes seguida de uma ordem de encaminhamento na mesma página.
  • Pacotes fiscais onde vários anexos ou formulários estão empilhados na mesma página, por exemplo, anexos K-1.
  • Pacotes multi-formulários onde formulários consecutivos nem sempre começam numa nova página.

Para permitir a segmentação dentro da página, defina allowInPageSegments para true quando cria ou atualiza um analisador personalizado (não pode definir este campo num pedido de análise). A resposta do analisador inclui intervalos de página por segmento, a categoria de cada segmento, uma pontuação de confiança e uma expressão de origem que identifica a posição delimitadora do segmento na página.

O exemplo seguinte mostra o segments array numa resposta de análise, onde uma única página é dividida num segmento de cartão de crédito e num segmento de cartão de identidade:

"segments": [
    {
        "span": {
            "offset": 0,
            "length": 301
        },
        "segmentId": "segment1",
        "startPageNumber": 1,
        "endPageNumber": 1,
        "category": "Credit_card",
        "confidence": 0.98,
        "source": "D(1,1.32,1.49,3.13,1.49,3.13,3.86,1.32,3.86)"
    },
    {
        "span": {
            "offset": 301,
            "length": 798
        },
        "segmentId": "segment2",
        "startPageNumber": 1,
        "endPageNumber": 1,
        "category": "Identity_card",
        "confidence": 0.99,
        "source": "D(1,1.16,4.95,3.82,4.95,3.82,8.52,1.16,8.52)"
    }
]
Campos API

Os seguintes campos API suportam segmentação dentro da página:

Campo Tipo Description
ContentAnalyzerConfig.allowInPageSegments boolean Define quando crias ou atualizas um analisador personalizado. Quando true, os segmentos podem cobrir uma porção de uma página em vez de páginas completas.
DocumentContentSegment.segmentId string Identificador estável para o segmento, como segment1.
DocumentContentSegment.span Span offset e length do segmento dentro do texto do conteúdo principal em formato Markdown.
DocumentContentSegment.confidence float32 Valor em [0–1]. Pontuação de confiança para segmentação e classificação por categoria.
DocumentContentSegment.source SourceExpression Posição delimitadora do segmento na página, como uma expressão poligonal da forma D(pageNumber, x1, y1, x2, y2, x3, y3, x4, y4). Passe este valor como a range para um sub-analisador.

Limites do classificador

Para obter informações sobre formatos de documentos de entrada suportados e limites de classificadores, consulte Cotas e limites de serviço.

Melhores práticas

Para melhorar a classificação e a qualidade de divisão, use um bom nome e descrição de categoria para que o modelo possa entender as categorias com algum contexto. Para obter mais informações sobre nomes e descrições de categorias, consulte Práticas recomendadas.

Principais benefícios

  • Precisão e confiabilidade: Garanta uma classificação precisa dos documentos para reduzir erros e aumentar a eficiência.
  • Escalabilidade: amplie o processamento de documentos para atender às necessidades empresariais.
  • Personalizável: adapte o classificador de documentos para se adequar a fluxos de trabalho específicos.

Idiomas e regiões suportados

Para obter uma lista de idiomas e regiões suportados, consulte Suporte a idiomas e regiões.

Privacidade e segurança dos dados

Se usar o Content Understanding, reveja as políticas da Microsoft sobre dados de clientes. Para obter mais informações, consulte Dados, proteção e privacidade.