Valide a qualidade do analisador de documentos com confiança, fundamentação e amostras rotuladas

O processamento de documentos não estruturados (como contratos e declarações de trabalho) ou documentos estruturados (como faturas e formulários de seguro) é fundamental para fluxos de trabalho de processamento inteligente de documentos (IDP) e cenários de geração aumentada por recuperação (RAG). Extrair dados de forma fiável em escala requer mais do que apenas extração de texto.

Para uma automação de alta qualidade, muitas vezes é necessário saber o que foi extraído, de onde veio, se corresponde à sua intenção e quão fiável é a extração.

A maioria das empresas enfrenta os seguintes desafios ao lidar com vários documentos em grande escala:

  • É necessário automatizar fluxos de trabalho, mas apenas quando a extração atingir um limiar de precisão exigido para a aplicação empresarial. Precisas de saber quão confiante/preciso é o analisador nos seus resultados.
  • Necessidade de validar as fontes de dados extraídos para referência verdadeira. Ao observar pontuações de confiança inferiores ao esperado, valide rapidamente os resultados revisando a localização específica no documento.
  • Idealmente, exigir formas de melhorar a qualidade dos resultados do analisador (fornecendo alguns exemplos rotulados) quando este comete algum erro ou encontra um novo formato com pontuações de confiança abaixo do esperado.

O Azure Content Understanding no Foundry Tools fornece funcionalidades críticas para o pós-processamento da sua saída extraída.

Característica Propósito Valor
Pontuação de confiança Quantifica a certeza do analisador em cada previsão através de pontuações de confiança. Ativa o STP (Processamento Direto)
Aterramento Fornece referências/citações para cada saída extraída do conteúdo original do documento Garante rastreabilidade, conformidade e confiança do usuário
Amostras rotuladas Fornece documentos de exemplo corrigidos que mostram ao analisador valores, layouts, terminologia e convenções de domínio relevantes. O treino rotulado está disponível nas APIs GA e de pré-visualização; Treino otimizado e sem dados rotulados em tempo de execução são capacidades de pré-visualização. Adapta-se rapidamente a novos formatos ou casos extremos

Observação

No 2025-11-01 GA e 2026-06-01-preview nas APIs, as pontuações de confiança e grounding estão disponíveis para todos os tipos de campos de documentos (extract, classify, e generate métodos).

Saiba mais sobre esses recursos abaixo.

Pontuação de confiança: Automação com controle

Cada campo pode incluir uma pontuação de confiança entre 0 e 1 que indica quão certo o analisador está sobre o resultado. Use este valor para automatizar resultados de alta confiança e encaminhar resultados de baixa confiança para revisão humana.

Permita as pontuações de confiança para todos os campos (ou campos específicos) usando a estimateFieldSourceAndConfidence propriedade. Saiba mais sobre como configurar pontuações de confiança para analisadores.

Por que as pontuações de confiança são importantes

As pontuações de confiança permitem-lhe desenhar fluxos de trabalho como:

  • Aprovação automática de extrações quando a confiança está acima de um limite definido para automatizar de forma inteligente as tarefas de processamento de documentos.
  • Reduzir os custos operacionais e otimizar a alocação de recursos, utilizando revisão orientada por humanos para aspetos críticos.
  • Rejeitar ou sinalizar extrações abaixo de um determinado limiar para intervenção manual, aumentando a precisão da tomada de decisão.

Example

Está a processar faturas de serviços públicos digitalizadas para extrair o endereço de faturação e o montante em dívida. Para um documento:

  • Endereço de faturamento: "1234 Market St., San Francisco, CA" → Confiança: 0.96
  • Valor devido: "$128.74" → Confiança: 0.52

Nesse caso, a sua linha de automação pode lançar o endereço de faturação diretamente na sua aplicação de destino enquanto encaminha o valor devido a uma pessoa para verificação. Ao usar pontuações de confiança, você reduz o esforço manual enquanto mantém a precisão.

Aterramento: rastreie cada resultado até sua origem

O grounding garante que cada campo, resposta ou classificação inclua uma referência à sua localização original no documento. Isto inclui informação de origem (número da página e coordenadas espaciais) e intervalos (deslocamento e comprimento).

Por que o aterramento é importante

Nos fluxos de trabalho empresariais, a precisão não é suficiente; Também precisas de rastreabilidade. Quando um modelo extrai um nome de cliente ou uma cláusula de rescisão, você deve ser capaz de validar de onde essas informações vieram. O aterramento é fundamental para:

  • Manter uma rastreabilidade e localização claras para cláusulas extraídas, números financeiros, tabelas e IDs de seguro.
  • Garantir transparência com verificações internas de conformidade.
  • Apoiar a validação eficiente do humano no ciclo, identificando a página, secção e conteúdo que forneceram o valor do campo.

Example

Você deseja extrair a cláusula de rescisão de um contrato. O modelo retorna:

  • Texto extraído: "Qualquer das partes pode rescindir este contrato com 60 dias de antecedência."
"spans": [
  {
    "offset": 343,
    "length": 102
  }
]
  • Fonte: Página 3, coordenadas ({x1},{y1},{x2},{y2},{x3},{y3},{x4},{y4})

Os intervalos indicam a posição lógica do elemento usando o deslocamento e o comprimento do caractere. A fonte indica a sua posição visual com o número da página e as coordenadas da caixa delimitadora.

Com esses dados de fundamentação, sua equipe jurídica pode verificar a extração saltando diretamente para o parágrafo de origem no PDF. Isso elimina suposições e cria confiança na saída do aplicativo.

Melhorar o treino do analisador com exemplos rotulados

Tanto a 2025-11-01 API GA como a 2026-06-01-preview API suportam o treino de analisadores de documentos personalizados com documentos de exemplo rotulados. Ambas as versões utilizam o mesmo fluxo de trabalho de rotulagem no Content Understanding Studio.

Importante

A formação suporta apenas analisadores de documentos, e atualmente não suporta campos que utilizem o generate método.

Se o contexto para todos os campos estiver claramente presente no documento de teste, uma chamada de extração zero-shot pode ser suficiente. Comece por seguir as melhores práticas para definições de esquemas. Se ainda observar valores de campo incorretos ou pontuações de confiança abaixo do seu limiar de processamento direto, use amostras rotuladas para melhorar o analisador.

Os documentos de exemplo rotulados fornecem o contexto do domínio. Ao corrigir valores de campo em documentos representativos, mostra ao analisador os layouts, terminologia, padrões de valores e convenções relevantes para o seu cenário.

As amostras rotuladas trabalham para melhorar a qualidade da extração:

  • Para conjuntos de dados com variações mínimas de templates, adicione uma única amostra rotulada.
  • Para variações mais complexas, adicione uma amostra representativa para cada modelo ou formato.
  • Para documentos que geram baixas pontuações de confiança, extração incompleta ou valores incorretos.
  • Avalie a qualidade da extração antes e depois do treino para confirmar que as amostras melhoram os resultados.

Para adicionar uma amostra rotulada, vá à página de resultados de extração de documentos no portal Foundry e selecione o separador Dados de Rótulos . Carrega uma amostra e depois seleciona Etiqueta Automática. O Auto Label executa o analisador existente e preenche previamente os resultados que pode editar.

Captura de ecrã da etiquetagem automática de uma amostra de fatura.

Editar quaisquer valores de campo incorretos ou em falta. Depois de guardar a amostra, os campos corrigidos mostram a etiqueta corrigida .

Captura de ecrã de etiquetas corrigidas.

Observação

Você adiciona os exemplos rotulados no Content Understanding Studio. Depois de adicionar amostras, reconstrua o analisador para que ele possa usar as amostras.

Por exemplo, se faturas de um novo fornecedor produzirem uma pontuação de confiança baixa ou valor de valor devido incorreto, adicione uma fatura representativa e corrija os seus valores rotulados. O próprio documento fornece o contexto sobre o layout e as convenções de faturação desse fornecedor.

O analisador generaliza então o padrão para extrair o valor de modelos de documentos semelhantes.

Melhorias na API de Pré-visualização

Importante

A versão 2026-06-01-preview da API está em pré-visualização pública. As pré-visualizações são fornecidas sem um acordo de nível de serviço e não são recomendadas para cargas de trabalho em produção. Para mais informações, consulte Termos Suplementares de Utilização para Versões de Pré-visualização do Microsoft Azure e o Adendo de Proteção de Dados para Produtos e Serviços Microsoft ("DPA").

A 2026-06-01-preview API utiliza o mesmo fluxo de trabalho de exemplo rotulado, mas melhora a forma como o treino utiliza os documentos. Quando reconstróis o analisador, o treino destila os padrões relevantes e o contexto do domínio das amostras rotuladas para o analisador incorporado.

A abordagem de treino de pré-visualização:

  • Reduz o consumo de tokens quando o analisador corre, em comparação com a abordagem de treino GA.
  • Não inclui nem mantém os documentos de exemplo rotulados no analisador incorporado.
  • Não requer que o analisador integrado aceda aos documentos de exemplo rotulados no momento da análise.

Os documentos de exemplo rotulados permanecem na conta de armazenamento associada ao seu projeto Content Understanding Studio apenas para fins de design. Para mais informações, consulte Dados, privacidade e segurança para Compreensão de Conteúdos.

Limitações

Amostras rotuladas não corrigem problemas de reconhecimento de texto. Por exemplo, se a letra l for reconhecida como o dígito 1, rotular o valor como letra l não melhora a qualidade da extração.

Um fluxo de trabalho completo

Quando constrói um pipeline inteligente de automação documental, estas capacidades ajudam-no a extrair dados de forma fiável em larga escala. Por exemplo, se processar contratos de aquisição, pode extrair:

  • Nome do fornecedor
  • Datas de início e fim
  • Cláusula de cancelamento

Para garantir qualidade e confiança na compreensão de documentos em escala empresarial:

  • Rastreabilidade proporciona à sua equipa total visibilidade em todos os campos.
  • As pontuações de confiança ajudam a automatizar, porque a revisão humana só é necessária quando a confiança é baixa.
  • Exemplos rotulados fornecem exemplos que ajudam o analisador a adaptar-se ao contexto do domínio, novos modelos de contratos ou casos limite.

Próximos passos