Saiba mais sobre os tipos de informações confidenciais com base na correspondência exata de dados

Os tipos de informações confidenciais (SITs) são usados para ajudar a identificar dados confidenciais para que você possa impedir que eles sejam compartilhados inadvertidamente ou inadequadamente. Eles também são usados para ajudar a localizar dados relevantes na Descoberta Eletrônica e para aplicar ações de governança a determinados tipos de informações. Você define um SIT personalizado com base em:

  • padrões
  • evidências de palavra-chave, como funcionário, número do seguro social ou ID
  • proximidade de um caractere da evidência em um padrão específico
  • níveis de confiança

Mas e se você quiser um SIT personalizado que use valores de dados exatos ou quase exatos, em vez de um que encontre correspondências com base em padrões genéricos? Com a classificação baseada em Correspondência Exata de Dados (EDM), você pode criar um tipo de informação confidencial personalizado projetado para:

  • ser dinâmica e facilmente atualizada
  • resultam em menos falsos positivos
  • trabalhar com dados confidenciais estruturados
  • lidar com informações confidenciais com mais segurança, sem compartilhá-las com ninguém, incluindo a Microsoft
  • ser usado com vários serviços de nuvem da Microsoft

A classificação baseada em EDM permite que você crie SITs personalizados que se referem a valores exatos em um banco de dados de informações confidenciais. O banco de dados pode ser atualizado diariamente e pode conter até 100 milhões de linhas de dados. Assim, à medida que funcionários, pacientes e clientes vêm e vão, e à medida que os registros mudam, seus tipos de informações confidenciais personalizadas permanecem atuais e aplicáveis. E você pode usar a classificação baseada em EDM com políticas, como políticas de Prevenção Contra Perda de Dados do Microsoft Purview ou políticas de arquivo do Microsoft Cloud App Security.

O diagrama a seguir mostra o funcionamento fundamental da classificação EDM:

Classificação baseada em EDM.

Observação

Proteção de Informações do Microsoft Purview dá suporte aos seguintes idiomas que usam conjuntos de caracteres de byte duplo:

  • Chinês (simplificado)
  • Chinês (tradicional)
  • Coreano
  • Japonês

Este suporte está disponível para tipos de informações confidenciais. Para obter mais informações, consulte Suporte à proteção de informações para conjuntos de caracteres de byte duplo: Notas de versão (versão prévia).

O que há de diferente em um SIT de EDM

Ao trabalhar com SITs de EDM, é útil entender alguns conceitos exclusivos deles.

Esquema

Um esquema é um arquivo XML. O Microsoft Purview usa o esquema para determinar se seus dados contêm ou não cadeias de caracteres que correspondem àquelas que seus tipos de informações confidenciais foram projetados para detectar.

O arquivo XML de esquema define:

  • O nome do esquema, posteriormente conhecido como Armazenamento de Dados.
  • Os nomes de campo contidos na tabela de fonte de informações confidenciais. Há um mapeamento 1:1 de nomes de campos de esquema para os nomes de coluna na tabela de fonte de informações confidenciais.
  • Quais campos de evidência corroborativa exigem o modo de correspondência de vários tokens.
  • Quais campos de dados são pesquisáveis.
  • Se há ou não suporte para correspondências configuráveis para cada campo. Uma correspondência configurável é aquela com parâmetros que modificam uma pesquisa, como ignorar delimitadores e maiúsculas e minúsculas em valores pesquisados.

Tabela de fonte de informações confidenciais

A tabela de fonte de informações confidenciais contém os valores que o EDM SIT procura. A tabela é composta de colunas e linhas. Os cabeçalhos de coluna são os nomes de campo, as linhas são instâncias de itens e cada célula em uma linha contém os valores dessa instância de item para esse campo.

Aqui está um exemplo simples de uma tabela de fonte de informações confidenciais.

Nome Sobrenome Date of Birth
Isaías Langer 05-05-1960
Ana Arqueiro 11-24-1971
Oscar Enfermaria 02-12-1998

Pacote de regras

Cada tipo de informação confidencial tem um pacote de regras. Você usa o pacote de regras em um EDM SIT para definir os vários componentes do seu EDM SIT. A tabela a seguir fornece uma descrição de cada componente.

Componente Descrição
Match Especifica o elemento principal (campo de dados) a ser usado na pesquisa exata. Pode ser uma expressão regular com ou sem uma validação de soma de verificação, uma lista de palavras-chave, um dicionário de palavras-chave ou uma função.
Classificação Especifica a correspondência de tipo de informação confidencial que dispara uma pesquisa EDM.
Elementos de suporte Elementos que, quando encontrados, fornecem evidências que ajudam a aumentar a confiança da correspondência. Por exemplo, a ocorrência de um sobrenome próximo a um número de seguro social real. Um elemento de suporte pode ser uma expressão regular com ou sem uma validação de soma de verificação, uma lista de palavras-chave, um dicionário de palavras-chave ou uma correspondência de cadeia de caracteres de um ou vários tokens.
Nível de confiança
(Alto, Médio, Baixo)
Indicação da quantidade de evidências de apoio detectadas além do elemento primário. Quanto mais evidências de suporte um item contiver, maior será a confiança de que um item correspondido contém as informações confidenciais que você está procurando. Para obter mais informações sobre níveis de confiança, consulte Partes fundamentais de um tipo de informação confidencial.
Proximidade O número de caracteres entre o elemento principal e o elemento de suporte.

Você fornece seu próprio esquema e dados

O Microsoft Purview vem com muitos SITs internos que são predefinidos. Esses SITs vêm com esquemas, padrões REGEX, palavras-chave e níveis de confiança. No entanto, com os SITs do EDM, você é responsável por definir o esquema, bem como os campos primário e secundário que identificam itens confidenciais. Como o esquema e os valores de dados primários e secundários são altamente confidenciais, você os criptografa por meio de uma função de hash que inclui um valor salt gerado aleatoriamente ou fornecido automaticamente. Somente os valores com hash são carregados no serviço, para que seus dados confidenciais nunca fiquem à vista.

Elementos de suporte primários e secundários

Ao criar um EDM SIT, você define um campo de elemento primário no pacote de regras. Em seguida, o EDM pesquisa todo o seu conteúdo para o elemento principal. Para que o EDM possa detectá-los, os elementos primários devem ser detectáveis por meio de um SIT existente.

Observação

Para obter uma lista completa dos SITs disponíveis, consulte Definições de entidade de tipo de informação confidencial

Você precisa encontrar um SIT integrado que detecte as informações confidenciais que você deseja que seu EDM SIT detecte. Por exemplo, se o esquema SIT do EDM tiver o número do seguro social dos EUA como elemento principal, ao criar o esquema do EDM, você o associará ao SIT do Número do Seguro Social (SSN) dos EUA . Os elementos primários devem seguir um padrão definido para serem detectados.

Quando o elemento primário é encontrado em um item digitalizado, o EDM procura elementos secundários (também chamados de elementos de suporte ). Ao contrário dos elementos primários, os elementos secundários têm a opção de seguir um padrão. Se os elementos secundários contiverem vários tokens, esses elementos precisarão ser associados a um SIT que possa detectar esse conteúdo ou que possa ser configurado para correspondência de vários tokens. Em todos os casos, os elementos secundários devem estar dentro de uma certa proximidade com o elemento primário para que uma correspondência seja detectada.

Como funciona a correspondência

O EDM funciona comparando cadeias de caracteres em seus documentos e emails com valores na tabela de fonte de informações confidenciais. Ele usa essa comparação para determinar se os valores no conteúdo verificado estão presentes na tabela. A determinação é feita comparando hashes criptográficos unidirecionais.

Dica

Você pode usar os SITs EDM e os SITs predefinidos nos quais eles se baseiam, juntos nas regras DLP para melhorar a detecção de dados confidenciais. Use o EDM SIT com níveis de confiança mais altos e o SIT predefinido com níveis de confiança mais baixos. Por exemplo, use um SIT de EDM que procure o número do seguro social e outros dados de suporte com requisitos rígidos com alta confiança. Se configurado para correspondências de alta confiança, o EDM gera uma correspondência DLP quando apenas algumas instâncias são detectadas. Para disparar uma correspondência DLP quando um número maior de ocorrências for detectado, use um SIT interno, como o Número do Seguro Social dos EUA.

Como os elementos de suporte funcionam com EDM

Conforme discutido em O que há de diferente em um EDM SIT, os elementos de apoio são elementos que, quando encontrados, fornecem evidências que ajudam a aumentar a confiança da correspondência.

Com suporte para EDM SITs, você pode procurar e detectar elementos de suporte compostos por vários campos. As correspondências de elementos de suporte podem consistir em listas de palavras-chave, dicionários de palavras-chave, cadeias de caracteres alfanuméricas únicas ou cadeias de caracteres de vários tokens.

Vejamos um exemplo. Suponha que você deseja detectar os números da Previdência Social dos EUA. Para aumentar a confiança na partida, seus elementos de apoio incluem first name, last name, e date of birth (DoB). Portanto, sua tabela de origem é mais ou menos assim:

Número de Seguridade Social FirstName Sobrenome DoB
987-65-4320 Isaías Langer 05-05-1960
078-05-1120 Ana Arqueiro 11-24-1971
219-09-9999 Oscar Enfermaria 02-12-1998

Ao procurar elementos de suporte correspondentes em um arquivo protegido, seu EDM SIT verifica cada elemento de suporte (individualmente e em combinação) assim que o elemento principal é detectado.

Por exemplo, digamos que o primeiro número de seguro social seja detectado. Em seguida, a funcionalidade de correspondência exata de dados procura combinações de elementos de suporte em todas as colunas da tabela de origem:

  • Isaías
  • Langer
  • 05-05-1960
  • Isaiah Langer
  • Isaías 05-05-1960
  • Langer 05-05-1960
  • Isaías Langer 05-05-1960

Correspondência de vários tokens

A correspondência de vários tokens foi projetada para ser usada quando seu campo de evidência corroborativa contém valores de vários tokens, mas a correspondência desses valores a um SIT não é facilmente realizada. Por exemplo, quando você tem um Address campo contendo valores como 1 Microsoft Way, Redmond, WA ou 123 Main Street, New York, NY.

Esse recurso permite que o EDM compare os hashes de palavras consecutivas no conteúdo com os hashes dos campos de vários tokens em sua fonte de dados. Se forem idênticos, o EDM produzirá uma correspondência. Dessa forma, o EDM pode detectar campos de vários tokens, como nomes, endereços, condições médicas ou quaisquer outros campos de evidência corroborativa que possam conter mais de uma palavra, desde que estejam marcados como vários tokens em seu esquema EDM.

Por exemplo, se você selecionar a correspondência de vários tokens como a opção de correspondência, obterá dois benefícios adicionais:

  1. Suas políticas detectarão conteúdo que corresponde a vários campos nas colunas da tabela de origem.
  2. Sua tabela de origem pode incluir campos com valores de cadeia de caracteres que consistem em um número pré-configurado de palavras. A tabela a seguir mostra uma tabela de origem de exemplo:
Número de Seguridade Social Nome Endereço
987-65-4320 Isaiah Langer 1432 Lincoln Road
078-05-1120 Ana Bowman 8250 First Street
219-09-9999 Oscar Ward 424 205th Avenue

Com a correspondência de vários tokens, os campos Nome e Endereço são combinados como strings de elementos de suporte independentes e em combinação como campos individuais. Portanto, quando combinadas como cadeias de caracteres de vários tokens como elementos de suporte para o número da Previdência Social 987-65-4320, as correspondências são:

  • Isaiah Langer
  • 1432 Lincoln Road

Quando combinada em combinação, a correspondência é assim:

  • Isaías Langer + 1432 Lincoln Road

A correspondência de vários tokens também é compatível com conjuntos de caracteres de byte duplo, que geralmente não usam espaços para separar palavras.

Serviços compatíveis com o EDM

Serviço Localizações
Prevenção Contra Perda de Dados do Microsoft Purview - SharePoint
- OneDrive
- Teams Chat
- Exchange Online
- Dispositivos
Microsoft Defender for Cloud Apps - SharePoint
- OneDrive
Rotulagem automática (lado do serviço) - SharePoint
- OneDrive
- Exchange Online
Rotulagem automática (lado do cliente) - Word
- Excel
- PowerPoint
- Clientes de área de trabalho do Exchange
Chave gerenciada pelo cliente - SharePoint
- OneDrive
- Teams Chat
- Exchange Online
- Word
- Excel
- PowerPoint
- Clientes
de área de trabalho do Exchange - Dispositivos
Descoberta eletrônica - SharePoint
- OneDrive
- Teams Chat
- Exchange Online - Word

- Excel
- PowerPoint
- Clientes de área de trabalho do Exchange
Gerenciamento de riscos internos - SharePoint
- OneDrive
- Teams Chat
- Exchange Online - Word

- Excel
- PowerPoint
- Clientes de área de trabalho do Exchange

Confira também