Visão geral de PII baseada em documentos

A detecção de Informações de Identificação Pessoal (PII) baseada em documentos no Linguagem de IA do Azure ajuda você a detectar e ocultar dados confidenciais diretamente em arquivos de documento nativos, incluindo arquivos do Microsoft Word e PDF, sem precisar criar seu próprio pipeline de extração e reconstrução de texto.

Esse recurso usa um fluxo de trabalho de API assíncrona e retorna uma saída redigida que preserva a estrutura e a formatação do documento. Você pode usá-la quando a fidelidade de documentos é importante para revisão de conformidade, compartilhamento, análise e fluxos de trabalho de IA downstream.

Captura de tela do fluxo de trabalho técnico para detecção de PII baseada em documento no Linguagem de IA do Azure.

Demonstração de vídeo

Neste vídeo, apresentamos o serviço de detecção de PII e mostramos como ele detecta e redigi dados confidenciais diretamente de documentos nativos, preservando a estrutura e a formatação de arquivos. Também abordamos casos de uso comuns, formatos com suporte e como começar a usar a PII baseada em documento no Linguagem de IA do Azure:

Legendas fechadas estão disponíveis para este vídeo.

Visão rápida

A PII baseada em documento fornece os seguintes recursos:

  • Redação de documentos nativos para arquivos .pdf, .docxe .txt .
  • Layout preservado em documentos de saída, incluindo fonte, espaçamento e cor.
  • Um único fluxo de trabalho de API assíncrona para extração, detecção e redação.
  • Saídas prontas para uso corporativo: um documento editado e um resultado JSON estruturado.
  • Políticas de mascaramento configuráveis para mascaramento de caracteres, rotulagem de entidade e cenários de substituição sintética.

Adições de funcionalidades GA (2026-05-01)

A versão de disponibilidade geral apresenta os seguintes recursos e aprimoramentos operacionais. Essas adições expandem as estratégias de redação da plataforma, aprimoram a flexibilidade de configuração e melhoram o suporte para cenários especializados de processamento de documentos:

  • Qualidade de saída de redação aprimorada, preservando a fonte, a cor e a formatação do documento.
  • Suporte à redação baseada em desfoque para cenários de documentos com imagens.
  • Opções expandidas de política de mascaramento, incluindo mascaramento de rótulos de entidade e substituição sintética.
  • Controles de limite de confiança para determinar quais entidades detectadas serão redigidas.
  • Controles opcionais para desabilitar a validação de entidade estrita para fluxos de trabalho sensíveis à latência.
  • Suporte a sinônimos de entidades para mapear vocabulário específico do cliente para tipos padrão de entidades de PII.
  • Suporte à política de exclusão de valor para termos que devem permanecer sem redação em determinados fluxos de trabalho.

Comparação entre recursos GA e de versão prévia

A tabela a seguir fornece uma matriz de funcionalidade detalhada comparando os conjuntos de recursos da versão de disponibilidade geral (2026-05-01) e a versão prévia da API (2026-05-15-preview). Use essa comparação para entender quais recursos estão disponíveis em cada versão e tomar decisões informadas sobre a seleção de versão da API com base em seus requisitos de recursos específicos:

Característica GA (2026-05-01) Versão prévia (2026-05-15-preview)
Qualidade de saída atualizada: preservação de fonte, cor e formato
Redação de imagem com desfoque.
Suporte a PDF (incluindo suporte a PDF digital)
suporte a Microsoft Word .docx
Redação com marcador preto.
Política de mascaramento para anonimização/substituição por dados sintéticos
Política de mascaramento de rótulo de entidade (por exemplo, [Endereço])
Limite de pontuação de confiança
Desabilitar validação de entidade
Sinônimos de entidade (vocabulário de contexto)
Política de exclusão de valores

Por que usar a PII baseada em documento?

Muitos pipelines personalizados exigem várias etapas para extrair texto, executar a detecção e reconstruir a saída do documento. A PII baseada em documento simplifica esse fluxo com um único padrão de API assíncrona e artefatos de saída projetados para sistemas de processamento de documentos.

A PII baseada em documento é especialmente útil quando você precisa:

  • Redação de informações pessoais identificáveis (PII) em arquivos .pdf, .docx e .txt.
  • Preservar o layout do documento para processos de negócios subsequentes.
  • Gerar saída JSON estruturada para auditoria e integração.

A PII baseada em documento usa as mesmas categorias de PII predefinidas que a PII de texto, incluindo entidades como endereços, números de telefone e números de cartão de crédito.

O que a PII baseada em documento retorna

Quando um trabalho é bem-sucedido, você recebe:

  • Um documento redigido no contêiner de armazenamento de destino.
  • Um arquivo de resultado JSON com entidades detectadas, categorias, pontuações de confiança e metadados de processamento.
  • Resultados de redação que preservam a fidelidade visual do documento para processos de revisão e auditoria subsequentes.

Como funciona a PII baseada em documento

A PII baseada em documento usa um fluxo de trabalho assíncrono:

  1. Envie um trabalho com locais de armazenamento de origem e de destino.
  2. Consulte o status do trabalho usando o local da operação.
  3. Recupere os artefatos de saída do seu local de armazenamento de destino.

Diagrama mostrando a chamada à API assíncrona para detecção de PII baseada em documento.

Para obter detalhes de implementação e exemplos de solicitação, consulte Detectar e redigir informações de identificação pessoal em documentos nativos.

Como a PII baseada em documento difere de outros tipos de recursos de PII

Todos os tipos de recursos de PII usam categorias de entidade predefinidas, mas otimizam para diferentes tipos de entrada:

  • As informações de identificação pessoal baseadas em documentos são otimizadas para fluxos de trabalho de redação de arquivos nativos e para a fidelidade dos arquivos de saída.
  • Text PII é otimizado para entrada direta baseada em strings e integração com aplicativos.
  • Informações pessoais identificáveis (PII) em conversas são otimizadas para entrada conversacional baseada em turnos e orientada a transcrições.

Casos de uso comuns

A PII baseada em documento foi projetada para fluxos de trabalho corporativos e do setor regulamentado, em que as equipes precisam anonimizar arquivos antes do armazenamento, análise, compartilhamento externo ou processamento de IA downstream.

Exemplos típicos incluem:

  • Registros judiciais e documentação legal.
  • Formulários governamentais e registros internos.
  • Documentos financeiros.
  • Fluxos de trabalho internos da documentação da empresa.

Formatos e limites com suporte

A PII baseada em documento aceita formatos de arquivo nativos diretamente, sem a necessidade de pré-processamento de texto. A tabela a seguir lista os formatos com suporte:

Tipo de arquivo Extensão de arquivo Descrição
Texto .txt Um documento de texto não formatado.
Adobe PDF .pdf Um documento formatado em formato portátil de documento.
Microsoft Word .docx Um arquivo de documento Microsoft Word.

As seguintes restrições de entrada se aplicam:

Atributo Limite
Total de documentos por solicitação <= 40
Tamanho total do conteúdo por solicitação <= 10 MB

Consulte o suporte ao idioma , cotas e limites para detalhes atuais de cobertura de idioma e limite de serviço.

Preços

A remoção de PII baseada em documento usa os preços da Linguagem de IA do Azure. Para obter detalhes de preços atuais, consulte preços do Linguagem de IA do Azure.

Experimente-o no portal do Microsoft Foundry

A detecção de PII em documentos agora inclui um ambiente de testes inicial no portal Microsoft Foundry. O playground carrega um documento de exemplo preparado por padrão, para que você possa avaliar o recurso imediatamente sem fornecer seu próprio arquivo.

Quando você seleciona Detectar, o playground envia o documento por meio do pipeline de PII baseado em documento de arquivo nativo assíncrono, o mesmo fluxo de trabalho descrito em Como funciona a PII baseada em documento. Após a conclusão do trabalho, o playground mostra a saída redigida lado a lado com o documento de origem e apresenta categorias de entidade, pontuações de confiança e resultados de fidelidade de arquivo para que você possa avaliar a precisão da redação e o quão bem a saída preserva a formatação original do documento.

Para obter instruções passo a passo, consulte Usar o playground de PII de documento no Microsoft Foundry.

Próximas etapas

Use as seguintes referências para continuar a implementação: