Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
O Content Understanding oferece recursos sofisticados de análise de documentos. As organizações podem usar esses recursos para converter conteúdo não estruturado em dados acionáveis e organizados. A Compreensão de Conteúdo pode usar analisadores personalizáveis para extrair informações, campos e relações essenciais de uma variedade diversificada de documentos e formulários.
Note
- Como parte de Azure recursos de Compreensão de Conteúdo, o Azure Document Intelligence fornece alta precisão e extração determinística confiável de documentos estruturados.
- Content Understanding também oferece analisadores baseados em LLM para conteúdo complexo, não estruturado e multimodal.
- Juntos, eles facilitam a preparação de dados para agentes inteligentes e aplicativos que podem ler, analisar e responder a conteúdo do mundo real com precisão e velocidade.
- Para comparar os dois serviços e determinar qual melhor se ajusta ao seu cenário, consulte Conseque a ferramenta de IA de Azure correta para processamento de documentos.
Casos de uso de negócios
Os analisadores de documentos podem processar documentos complexos em vários formatos e modelos:
- Gerenciamento do ciclo de vida do contrato: Extraia campos de chave, cláusulas e obrigações de vários tipos de contrato.
- Pedidos de empréstimos e hipotecas: Automatize o processamento para habilitar a manipulação mais rápida por bancos, credores e entidades governamentais.
- Serviços financeiros: Analise documentos complexos, como relatórios financeiros e relatórios de gerenciamento de ativos.
- Gerenciamento de despesas: Analise recibos e faturas de vários varejistas para validar despesas em diferentes formatos e modelos.
- Análise da apólice de seguro: Analise os detalhes da apólice de seguro e desenvolva uma compreensão completa da cobertura da apólice e de suas lacunas usando raciocínio em várias etapas, cálculos e validações.
Principais benefícios
O Content Understanding oferece recursos avançados de análise de documentos projetados para lidar com cenários corporativos e de negócios críticos, como RAG (geração aumentada por recuperação) e automação de processos robóticos. Entre os principais benefícios estão:
- Habilitação de pesquisa inteligente: Transforme documentos não estruturados em ativos de dados estruturados e pesquisáveis para melhorar a capacidade de descoberta de informações e a acessibilidade em toda a sua organização.
- Extração de dados fundamentados: mantenha a rastreabilidade e a localização claras dos dados extraídos para facilitar processos eficientes de revisão humana no loop e garantir a transparência e a conformidade.
- Automação controlada por confiança: Use a pontuação de confiança interna para automatizar de forma inteligente as tarefas de processamento de documentos para ajudá-lo a otimizar a alocação de recursos, reduzir os custos operacionais e melhorar a precisão da tomada de decisões.
- Personalização flexível: Adapte facilmente os analisadores de documentos para alinhar com processos e fluxos de trabalho específicos de negócios. A personalização permite a extração e a classificação precisas adaptadas aos requisitos específicos da sua organização.
- Precisão e confiabilidade aprimoradas: Obtenha extração e classificação precisas de dados comerciais críticos para reduzir erros e melhorar a eficiência operacional em fluxos de trabalho automatizados.
-
Agentes prontos: Processe sua entrada diversificada e forneça a saída em um formato padrão que esteja pronto para o fluxo de trabalho de um agente. As saídas podem dar ao seu aplicativo uma compreensão da intenção do usuário, com dados amparados por um esquema
strongly-typedque facilita a rápida obtenção de dados em um formato pronto para seu código.
Recursos do analisador de documentos
Extração de conteúdo
A extração de conteúdo forma a base dos recursos de análise de documentos do Content Understanding. Esse processo transforma documentos não estruturados em dados estruturados e legíveis pelo computador. A extração de conteúdo captura precisamente o texto impresso e manuscrito enquanto preserva a estrutura do documento por meio da análise avançada de layout:
- Análise de conteúdo
- Texto: processa conteúdo multilíngue, incluindo texto impresso por computador e manuscrito de centenas de idiomas.
- Marcas de seleção: identifica e extrai indicadores de seleção, como caixas de seleção, botões e marcadores semelhantes.
- Detecção de código de barras: verifica e decodifica informações de mais de uma dúzia de tipos de códigos de barras lineares e bidimensionais.
- Fórmulas matemáticas: captura e preserva expressões matemáticas complexas no formato LaTeX.
- Elementos de imagem: localiza e extrai imagens, figuras, diagramas e gráficos junto com suas legendas e anotações relacionadas.
- Elementos de hiperlink: detecta hiperlinks inseridos no documento.
- Elementos de anotação: associa o conteúdo a suas anotações, como tachado, sublinhado e realce.
- Elementos de figura: detecta e extrai elementos de figura para uma saída estruturada.
- Detecção de assinatura: detecta assinaturas e retorna sua localização, juntamente com qualquer texto reconhecido dentro da região de assinatura.
- Metadados do documento: extrai metadados inseridos, como autor, data de criação e título, de tipos de arquivo com suporte.
- Análise de estrutura
- Parágrafos: detecta e categoriza segmentos de texto com base no contexto e na função do documento.
- Dados tabulares: reconhece e extrai estruturas de tabela, incluindo formatos complexos com células de abrangência e layouts de várias páginas.
- Seções hierárquicas: mapeia a organização de conteúdo por meio de cabeçalhos de seção e relações de conteúdo aninhadas.
- RAG (geração aumentada de recuperação)
- Soluções RAG: A extração de conteúdo forma a base dos sistemas RAG eficazes ao transformar dados brutos multimodais em formatos estruturados e pesquisáveis, que são otimizados para recuperação. Saiba mais sobre como criar soluções de RAG em Geração aumentada de recuperação.
Modo de extração
Use extractionMode para escolher como analisar o conteúdo do documento. Use a extração com reconhecimento de layout para documentos estruturados, em que tabelas, seções e ordem de leitura importam. Utilize uma extração de texto puro mais rápida para gerar Markdown limpo para cenários de RAG e ingestão de documentos.
Extração de campo
Com a extração de campo, você pode extrair, classificar e gerar dados estruturados de vários documentos e formulários personalizados para atender às suas necessidades. O processo de transformação de conteúdo não estruturado em informações organizadas e acionáveis simplifica o gerenciamento de dados, melhora a pesquisa e dá suporte a fluxos de trabalho automatizados.
Por exemplo, você pode extrair detalhes do cliente, endereços de cobrança e encargos itemizados de faturas. Você também pode identificar partes contratuais, datas de renovação e termos de pagamento em contratos legais.
Para maximizar a eficiência, use modelos de analisador predefinidos, como modelos personalizados para faturas. Você também pode criar analisadores personalizados desde o início para aprimorar a precisão por meio da rotulagem de um maior número de documentos de exemplo.
A API de confiança e embasamento é uma funcionalidade opcional disponível para todos os tipos de campos de documento, independentemente de usarem o método extract, classify ou generate. Para habilitar a confiança e a base para extrair o campo, defina estimateFieldSourceAndConfidence = true na configuração do analisador ou estimateSourceAndConfidence = true em um campo específico.
Os valores de campo tipados com suporte, como datas e números, são automaticamente normalizados em um formato canônico. A normalização não é configurável. O valor retornado do campo é o valor normalizado.
Use escores de confiança e embasamento na fonte para encaminhar extrações de baixa confiança ou com embasamento insuficiente na fonte para revisão humana. Continue os resultados fundamentados e de alta confiança por meio de fluxos de trabalho automatizados downstream.
Métodos de extração de campo
O Content Understanding fornece métodos versáteis para extração de campo, o que permite o processamento preciso e personalizado do conteúdo do documento:
- Extração: extraia dados específicos, como datas de transação de recibos ou itens de linha de faturas, para captura de informações precisas e focadas.
- Classificar: categorize o conteúdo do documento em categorias predefinidas, como classificar o sentimento em transcrições de chamadas do cliente ou classificar itens de recibo de hotel.
- Gerar: produza novos insights ou resumos de seus documentos, incluindo resumos de documentos e visões gerais de capítulo para aprimorar a acessibilidade e a compreensão do conteúdo.
Modo agêntico (prévia)
Para cenários em que a resposta não está diretamente presente em um campo e deve ser criada a partir de evidências em um documento, use o modo agente. O modo agêntico raciocina sobre um documento para oferecer suporte a cálculos de várias etapas, à validação em relação a um conjunto de condições e à análise de tabelas ou figuras complexas. Ele está disponível com a versão 2026-06-01-previewda API e a visualização inicial dá suporte a um arquivo de entrada por solicitação de análise.
Requisitos de entrada
Para obter mais informações sobre formatos de documento de entrada com suporte, consulte cotas e limites de serviço.
Idiomas e regiões com suporte
Para obter uma lista de idiomas e regiões com suporte, consulte o suporte a idiomas e regiões.
Dados, privacidade e segurança
Se você usar o Content Understanding, examine as políticas da Microsoft sobre os dados do cliente. Para obter mais informações, consulte Dados, privacidade e segurança.
Conteúdo relacionado
- Tente processar o conteúdo do documento usando o Content Understanding Studio.
- Confira o início rápido do Content Understanding Studio.
- Saiba como analisar o conteúdo do documento usando modelos de analisador.
- Examine os exemplos de código com a pesquisa de documentos visuais.