Visão geral da Informação Pessoal Identificável baseada em documentos

A deteção de PII baseada em documentos no Linguagem da IA do Azure Personally Identifiable Information (PII) ajuda-o a detetar e redigir dados sensíveis diretamente em ficheiros nativos de documentos, incluindo ficheiros Microsoft Word e PDF, sem criar o seu próprio pipeline de extração e reconstrução de texto.

Esta funcionalidade utiliza um fluxo de trabalho API assíncrono e devolve saídas redigidas que preservam a estrutura e formatação do documento. Pode utilizá-lo quando a fidelidade dos documentos for importante para a revisão de conformidade, partilha, análise e fluxos de trabalho de IA a jusante.

Captura de ecrã do fluxo de trabalho técnico para deteção de PII baseada em documentos no Linguagem da IA do Azure.

Demonstração em vídeo

Neste vídeo, apresentamos o serviço de deteção de PII e mostramos como deteta e redige dados sensíveis diretamente de documentos nativos, preservando a estrutura e formatação dos ficheiros. Também abordamos casos de uso comuns, formatos suportados e como começar com PII baseadas em documentos no Linguagem da IA do Azure:

Estão disponíveis legendas ocultas para este vídeo.

De relance

As PII baseadas em documentos fornecem as seguintes capacidades:

  • Expurgo nativo de documentos em ficheiros .pdf, .docx e .txt.
  • Layout preservado nos documentos de saída, incluindo fonte, espaçamento e cores.
  • Um único fluxo de trabalho assíncrono de API para extração, deteção e redação.
  • Resultados prontos para empresas: um documento censurado e um resultado JSON estruturado.
  • Políticas de mascaramento configuráveis para mascaramento de personagens, rotulagem de entidades e cenários de substituição sintética.

GA (2026-05-01) Adições de funcionalidades

A versão de disponibilidade geral introduz as seguintes capacidades e melhorias operacionais. Estas adições expandem as estratégias de redação da plataforma, aumentam a flexibilidade da configuração e reforçam o suporte para cenários especializados de processamento documental:

  • Melhoria da qualidade da saída de redação, mantendo a fonte, cor e formatação do documento.
  • Suporte de redação baseado em desfoque para cenários de documentos baseados em imagens.
  • Opções expandidas da política de mascaramento, incluindo mascaramento de etiquetas de entidades e substituição sintética.
  • Controlos de limiar de confiança para determinar quais as entidades detetadas que estão censuradas.
  • Controlos opcionais para desativar a validação rigorosa de entidades para fluxos de trabalho sensíveis à latência.
  • Suporte a sinónimos de entidades para mapear vocabulário específico do cliente para tipos padrão de entidades PII.
  • Suporte a política de exclusão de valores para termos que devem permanecer não censurados em fluxos de trabalho selecionados.

Comparação de funcionalidades de GA e pré-visualização

A tabela seguinte fornece uma matriz detalhada de capacidades que compara os conjuntos de funcionalidades da versão de disponibilidade geral (2026-05-01) e da versão de pré-visualização da API (2026-05-15-preview). Use esta comparação para compreender quais as funcionalidades disponíveis em cada versão e para tomar decisões informadas sobre a seleção de versões da API com base nos seus requisitos específicos de funcionalidades:

Feature GA (01-05-2026) Pré-visualização (2026-05-15-preview)
Qualidade de saída atualizada: Preservação da fonte, cor e formato
Redação de imagem com desfoque
Suporte a PDF (incluindo suporte digital para PDF)
Suporte para Microsoft Word .docx
Ocultação com marcador preto
Política de anonimização/mascaramento por substituição sintética
Política de mascaramento de etiquetas de entidade (por exemplo, [Endereço])
Limiar de pontuação de confiança
Desativar validação de entidades
Sinónimos de entidades (vocabulário de contexto)
Política de exclusão de valores

Porque usar PII baseada em documentos?

Muitos fluxos de trabalho personalizados requerem múltiplas etapas para extrair texto, executar deteção e reconstruir o resultado do documento. As PII baseadas em documentos simplificam este fluxo com um único padrão API assíncrono e artefactos de saída concebidos para sistemas de processamento de documentos.

As PII baseadas em documentos são especialmente úteis quando precisa:

  • Rediga as PII nos ficheiros.pdf, .docxe .txt .
  • Preservar o layout dos documentos para processos de negócio a jusante.
  • Gerar uma saída JSON estruturada para auditoria e integração.

As PII baseadas em documentos utilizam as mesmas categorias pré-definidas de PII que as PII de texto, incluindo entidades como endereços, números de telefone e números de cartões de crédito.

O que a PII baseada em documentos devolve

Quando uma tarefa é concluída com sucesso, recebe:

  • Um documento redigido no seu local de armazenamento alvo.
  • Um ficheiro de resultados JSON com entidades detetadas, categorias, pontuações de confiança e metadados de processamento.
  • Resultados de redação que podem preservar a fidelidade visual do documento para processos posteriores de revisão e auditoria.

Como funciona a identificação de informações pessoais com base em documentos

As PII baseadas em documentos utilizam um fluxo de trabalho assíncrono:

  1. Submete um trabalho com as localizações de armazenamento de origem e destino.
  2. Consulta o estado do trabalho usando o local da operação.
  3. Recupere artefatos de saída do local alvo de armazenamento.

Diagrama que mostra a chamada API assíncrona para deteção de PII baseada em documentos.

Para detalhes de implementação e exemplos de pedidos, consulte Detetar e redigir Informação Pessoalmente Identificável em documentos nativos.

Como as PII baseadas em documentos diferem de outros tipos de funcionalidades PII

Todos os tipos de características PII usam categorias de entidades pré-definidas, mas otimizam para diferentes tipos de entrada:

  • As PII baseadas em documentos são otimizadas para fluxos de trabalho nativos de redação de ficheiros e fidelidade de saída de ficheiros.
  • O Text PII está otimizado para entrada direta baseada em strings e integração com aplicações.
  • O Conversation PII está otimizado para entrada conversacional baseada em turnos e orientada a transcrições.

Casos de uso comuns

As PII baseadas em documentos são concebidas para fluxos de trabalho empresariais e da indústria regulada, onde as equipas precisam de anonimizar ficheiros antes do armazenamento, análise, partilha externa ou processamento subsequente de IA.

Exemplos típicos incluem:

  • Registos judiciais e documentação legal.
  • Formulários governamentais e registos internos.
  • Documentos financeiros.
  • Fluxos de trabalho internos de documentação empresarial.

Formatos suportados e limites

As PII baseadas em documentos aceitam formatos nativos de ficheiro diretamente, sem necessidade de pré-processamento de texto. A tabela seguinte lista os formatos suportados:

Tipo de ficheiro Extensão do ficheiro Descrição
Texto .txt Um documento de texto sem formatação.
Adobe PDF .pdf Um documento portátil formatado por ficheiro de documento.
Microsoft Word .docx Um ficheiro de documento do Microsoft Word.

Aplicam-se as seguintes restrições de entrada:

Atributo Limite
Total de documentos por pedido <= 40
Tamanho total do conteúdo por pedido <= 10 MB

Consulte apoio linguístico, quotas e limites para cobertura linguística atual e detalhes dos limites de serviço.

Preços

A ocultação de informações pessoalmente identificáveis (PII) baseada em documentos utiliza os preços do Linguagem da IA do Azure. Para detalhes de preços atuais, consulte preços do Linguagem da IA do Azure.

Experimente no portal Microsoft Foundry

A deteção de informações de identificação pessoal (PII) em documentos inclui agora uma experiência inicial no playground do portal do Microsoft Foundry. O ambiente de teste carrega, por defeito, um documento de exemplo, para que possa avaliar a funcionalidade imediatamente sem ter de fornecer o seu próprio ficheiro.

Quando seleciona Detetar, o playground submete o documento através do pipeline de PII baseado em ficheiros nativos assíncronos existente — o mesmo fluxo de trabalho descrito em Como funciona o PII baseado em documentos. Após a conclusão do trabalho, o playground mostra a saída censurada lado a lado com o documento de origem e apresenta categorias de entidades, pontuações de confiança e resultados de fidelidade do ficheiro, para que possa avaliar tanto a precisão da redação como a forma como o resultado preserva a formatação original do documento.

Para obter instruções passo a passo, consulte Utilizar o playground de PII de documentos no Microsoft Foundry.

Próximos passos

Use as seguintes referências para continuar a implementação: