Processamento inteligente de documentos

O Processamento Inteligente de Documentos (IDP) converte conteúdos não estruturados — como PDFs, ficheiros DOCX, imagens e apresentações — em dados estruturados e enriquecidos que alimentam agentes, aplicações e análises a jusante.

O Azure Databricks dá-te duas formas de executar o IDP, ambas baseadas nas mesmas Funções de IA desenvolvidas em investigação:

  • Agent Bricks UI: Uma experiência visual sem código para analisar, extrair e classificar documentos. Use-o para testar documentos de exemplo, refinar um esquema ou etiquetas e validar visualmente os resultados antes de escalar.
  • Funções de IA SQL: Execute funções inteligentes de processamento de documentos diretamente no Lakehouse. Use-os para processar documentos em escala, combinar etapas entre si e criar pipelines governados, prontos para produção, no Lakeflow Pipelines.

Capacidades inteligentes de processamento documental

Capacidade Agent Bricks UI Função SQL
Converta PDFs, DOCX, imagens e PPTs em texto estruturado, tabelas e descrições de figuras. Análise Sintática de Documentos ai_parse_document
Extrai campos estruturados de documentos ou texto simples usando um esquema que definas. Extração de Informação ai_extract
Atribuir categorias pré-definidas a documentos ou textos, suportando até 500+ rótulos. Classificação ai_classify
Transforme documentos analisados em blocos semânticos prontos para geração aumentada por recuperação (RAG) e indexação de AI Search. ai_prep_search (Beta)

Casos comuns de utilização

IDP no Azure Databricks alimenta uma vasta gama de aplicações subsequentes:

  • Geração aumentada por recuperação (RAG): Analisar e estruturar documentos para melhorar a segmentação, a qualidade da recuperação e a fundamentação para aplicações LLM.
  • Extração de conhecimento e análise: Extrair campos-chave e metadados para permitir pesquisa, relatórios e inteligência de negócio sobre dados documentais.
  • Fluxos de trabalho orientados por agentes: Encaminhar, classificar e enriquecer documentos para apoiar a tomada automática de decisões e a execução de tarefas.
  • Compreensão e classificação de documentos: Organizar grandes corpora de documentos por tipo, tema ou conteúdo para processamento a jusante.

Como funciona

O Azure Databricks permite o processamento inteligente de documentos como um fluxo de trabalho unificado de ponta a ponta no Lakehouse. A ingestão, análise sintática, enriquecimento e análise a jusante são construídos numa única plataforma, pelo que cada etapa funciona em conjunto sem necessidade de integração complexa ou movimentação de dados.

  1. Ingerir e orquestrar

    Utilize pipelines do Lakeflow para ingerir documentos em bruto (como PDFs, imagens e ficheiros DOCX) e orquestrar os pipelines. Como a ingestão e a orquestração estão integradas nativamente com o Lakehouse, os documentos fluem diretamente para o processamento a jusante sem infraestrutura adicional.

  2. Análise de documentos (Camada de bronze)

    Aplique ai_parse_document para converter ficheiros brutos em representações estruturadas. Isto cria uma camada bronze padronizada que capta texto, tabelas/descrições de imagens e estrutura do documento, formando uma base consistente para todos os casos de uso posteriores.

  3. Extrair e classificar

    Utilizar ai_extract e ai_classify para enriquecer documentos analisados com campos estruturados e metadados. Estas funções operam diretamente sobre os resultados analisados, permitindo-lhe extrair informações-chave, classificar documentos e encaminhá-los através de fluxos de trabalho sem passos adicionais de transformação.

  4. Preparar-se para a recuperação (RAG)

    Aplicar ai_prep_search (Beta) para transformar documentos analisados em blocos semânticos enriquecidos com contexto ao nível do documento, como títulos, cabeçalhos de secção e referências de página. A saída está formatada para a indexação do AI Search, fornecendo uma base consistente para cargas de trabalho de RAG e de recuperação.

  5. Analisar e operacionalizar

    Aproveite funções adicionais de IA ou outras ferramentas (dashboards de IA/BI, Apps, AI Search) para análises a jusante, recuperação (RAG) e fluxos de trabalho orientados por agentes. Como todos os dados permanecem no Lakehouse, os dados estruturados dos documentos podem ser usados imediatamente para pesquisa, dashboards e aplicações.