Reduzir falsos positivos usando SITs e classificadores avançados

A identificação e classificação precisas de dados são a base da segurança robusta dos dados. Ele permite que as empresas implantem políticas de proteção de dados com confiança em seu patrimônio digital. O Microsoft Purview dá suporte a essa etapa crítica com tipos de informações confidenciais (SITs) e tecnologias avançadas de classificação, como Correspondência Exata de Dados (EDM),classificadores treináveis e impressão digital de documento.

No entanto, para controlar o volume de falsos positivos, você precisa configurar e aplicar essas ferramentas nos contextos e cenários certos. Um falso positivo significa que o sistema sinaliza incorretamente algo como uma correspondência, mesmo que não seja. Falsos positivos:

  • Aumentar a fadiga de alertas: sobrecarrega as equipes de segurança e conformidade, aumentando a probabilidade de riscos genuínos escaparem.
  • Drenar tempo e recursos: A verificação de falsos positivos leva ao aumento dos custos operacionais, especialmente para empresas que lidam com grandes volumes de dados.
  • Criar obstruções desnecessárias: restrições de acesso aplicadas incorretamente em conteúdo que não é confidencial levam a atritos nos fluxos de trabalho e na produtividade.
  • Reduzir a confiança do usuário: reduz a adoção geral do produto.

Portanto, é importante ter uma compreensão clara da utilidade e relevância dos SITs e dos classificadores avançados para a diversidade de cenários de negócios em uma empresa.

Sobre este guia

Este guia inclui os seguintes artigos:

Antes de começar

Este guia destina-se a administradores com conhecimento das tecnologias de classificação e Prevenção Contra Perda de Dados do Microsoft Purview (DLP). Se você não estiver familiarizado com essas soluções, consulte os seguintes artigos para saber mais:

Visão geral das tecnologias de classificação

Tecnologia de classificação Caso de uso típico Por quê?
SITs Identificação de tipos de dados confidenciais comuns que são amplamente reconhecidos e seguem padrões padronizados. Por exemplo, números de card de crédito, SSNs. Implantável rapidamente com configuração mínima, juntamente com suporte integrado.
Correspondência exata de dados Cenários que exigem correspondência precisa de dados de uma fonte de dados conhecida. Por exemplo, detectar números específicos de contas de clientes, IDs de funcionários ou IDs de pacientes. Minimiza falsos positivos sinalizando apenas dados que correspondam exatamente às entradas na tabela de dados de referência carregada.
Classificador treinável Identificar dados complexos e contextuais, documentos com estrutura variada e formato imprevisível onde os padrões tradicionais não se aplicam. Por exemplo, documentos jurídicos com cláusulas e formatos variados. Fornece uma abordagem personalizável e inteligente para tipos de dados complexos.
Impressão digital de documento Casos de uso em que o modelo e a formatação do documento são consistentes em toda a organização. Por exemplo, contratos comerciais, faturas, RFPs ou formulários padrão contendo dados confidenciais. Fornece proteção direcionada para documentos críticos e estruturados.

Visão geral de implantação

O modelo de implantação divide a abordagem em quatro etapas, cada uma com foco em uma tecnologia de classificação diferente:

Etapa Tecnologia de classificação Descrição
Etapa 1: Configurar a detecção de dados confidenciais baseada em padrão Tipos de informações confidenciais (SITs) Escolha, personalize e refine os SITs para detecção precisa baseada em padrões.
Etapa 2: Implementar a correspondência exata de dados para uma correspondência precisa EDM (Correspondência Exata de Dados) Use dados de referência com hash para identificação precisa de dados confidenciais conhecidos.
Etapa 3: Usar classificadores treináveis para conteúdo complexo Classificadores de treinamento Use classificadores controlados por IA para conteúdo complexo que não segue padrões padrão.
Etapa 4: aplicar a impressão digital de documento para modelos Impressão digital de documento Detecte modelos de documentos específicos e documentos de formato fixo.

Blueprint de implantação do Microsoft Purview

Captura de tela de Reduzir falsos positivos usando SITs e classificadores avançados - Blueprint.

Estratégias de classificação de dados baseadas em cenários

A tabela a seguir fornece diretrizes de implantação com exemplos das técnicas de classificação de dados recomendadas para diferentes cenários.

Cenário Método preferencial Métodos alternativos Técnicas para reduzir falsos positivos
Detectar PII/PHI para indivíduos conhecidos (clientes ou pacientes) EDM para dados da extração do aplicativo LoB SITs personalizados, incluindo ID de funcionário + SITs PII comuns (por exemplo, SSN) Se você usar SITs regulares, considere exigir a presença de Todos os Nomes Completos e limitar as regras a documentos com mais do que uma determinada contagem mínima de correspondências.
Detectar PII/PHI para funcionários ou contratados Eletroerosão eletrônica para dados do extrato do sistema de RH SITs personalizados, incluindo ID do funcionário + Entidades Nomeadas (por exemplo, todos os nomes completos) + SITs PII comuns Se você usar SITs regulares, considere exigir a presença de Todos os Nomes Completos e limitar as regras a documentos com mais do que uma determinada contagem mínima de correspondências.
Detectar formulários com dados pessoais Impressão digital de formulário + SITs padrão ou impressão digital + SITs personalizados SITs personalizados + OCR (para formulários digitalizados) Use EDM em vez de SITs personalizados se não estiver usando impressão digital.
Contratos, documentos legais ou outros formulários comerciais Classificadores treináveis personalizados (+ OCR) Classificadores treináveis integrados + OCR Identifique documentos em sua organização que o TC interno identifica corretamente, copie-os para um repositório e use-os para treinar um TC personalizado.
Contratos importantes ou outros documentos Classificador treinável + rótulo de confidencialidade Classificador treinável + SIT personalizado (por exemplo, regex para detectar valores monetários acima de US$ 100 mil) Combine vários TCs em uma única regra, por exemplo, "Contratos" e "Documentos sobre o Projeto X".
PII ou PHI geral de indivíduos desconhecidos SITs internos, se disponíveis, ou SITs personalizados Rotulagem manual Copie e edite um SIT existente para ajustar seus requisitos de palavra-chave. Adicione requisitos para entidades nomeadas, como Todos os Nomes Completos.
Carteiras de identidade digitalizadas (ou similares) SITs + OCR internos ou personalizados SIT personalizado com listas de palavras-chave + OCR Adicione requisitos para Entidades Nomeadas (nomes ou endereços) se for esperado que sejam escritos em uma linha.
Dados de projeto Rotulagem baseada em localização (por exemplo, etiqueta padrão para biblioteca) Rotulagem manual ou classificadores treináveis personalizados Depois que a rotulagem baseada em localização identificar documentos relevantes suficientes, use-os para treinar um TC personalizado.

Otimizar a configuração de política de DLP

Ao usar classificadores em suas políticas de Prevenção contra Perda de Dados (DLP), ajuste a contagem de instâncias para reduzir falsos positivos. Mantenha o limite mínimo para a contagem de instâncias em um valor mais alto quando ocorrências pequenas ou triviais de dados confidenciais não exigirem ação. No entanto, quando seu contexto de negócios exige segurança de dados reforçada, use uma contagem de instâncias menor para bloquear até mesmo uma única ocorrência. Adapte a contagem de instâncias ao nível de confidencialidade dos dados.

O Content Explorer é seu hub central para descobrir conteúdo confidencial em seu acervo de dados. Ele fornece visibilidade exaustiva dos tipos e locais de dados confidenciais. Ao ajustar os limites de instância e definir os níveis de confiança apropriados para detecção, você pode garantir que os alertas sejam disparados somente quando o contexto estiver alinhado com sua postura de risco organizacional.

Próxima etapa