Classificar os dados usando classificadores treineáveis
Os classificadores treináveis usam a IA para identificar e categorizar dados que não podem ser classificados com padrões ou palavras-chave predefinidos. Ao contrário dos tipos de informações confidenciais (SITs), que detectam dados estruturados, como números de card de crédito ou números de CPF, os classificadores treináveis analisam o conteúdo com base no significado e no contexto. Isso os torna úteis para detectar dados não estruturados, como contratos, relatórios financeiros ou registros de RH.
Por que usar classificadores treináveis?
Muitas organizações têm conteúdo confidencial que não segue um formato previsível. Os classificadores treináveis ajudam:
- Identifique dados complexos que os SITs não conseguem detectar.
- Reduza a dependência da classificação manual.
- Melhore a conformidade e a segurança reconhecendo automaticamente o conteúdo que deve ser protegido.
Tipos de classificadores treináveis
O Microsoft Purview fornece dois tipos de classificadores treináveis:
- Classificadores pré-treinados: classificadores internos que estão prontos para uso em tipos de conteúdo comuns, como currículos, código-fonte e linguagem ofensiva. A Microsoft atualiza regularmente esses classificadores para melhorar a precisão.
- Classificadores treináveis personalizados: as organizações podem treinar seus próprios classificadores usando exemplos do mundo real para detectar dados exclusivos de seus negócios. Os classificadores personalizados exigem treinamento manual e refinamento para melhorar a precisão ao longo do tempo.
Classificadores pré-treinados
Os classificadores pré-treinados ajudam as organizações a identificar tipos comuns de dados não estruturados sem a necessidade de configuração manual. Eles são projetados para detectar categorias de conteúdo que são difíceis de classificar com métodos tradicionais baseados em padrões.
A Microsoft fornece classificadores pré-treinados para tipos específicos de conteúdo, como:
- Linguagem ofensiva: detecta conteúdo ofensivo ou inadequado.
- Currículos: identifica currículos de candidatos a emprego para gerenciamento de dados de RH.
- Código-fonte: ajuda a rastrear e proteger códigos proprietários ou confidenciais.
Os classificadores pré-treinados são criados e refinados pela Microsoft usando IA e aprendizado de máquina. Eles são atualizados periodicamente para melhorar a precisão e se adaptar aos tipos de conteúdo em evolução.
Onde classificadores treináveis são usados
Os classificadores treináveis se integram a várias soluções do Microsoft Purview, permitindo que as organizações classifiquem e controlem os dados com eficiência:
- Políticas de rotulagem automática: aplique rótulos de confidencialidade automaticamente com base nos resultados do classificador.
- Políticas de retenção: identifique e retenha conteúdo importante ao descartar dados obsoletos.
- Prevenção contra perda de dados (DLP): Evite que informações confidenciais sejam compartilhadas fora da organização.
- Conformidade de comunicação: monitore mensagens quanto a violações de política, incluindo conteúdo inadequado.
Limitações dos classificadores treináveis
Embora os classificadores treináveis forneçam uma classificação poderosa orientada por IA, eles têm algumas limitações:
- Eles exigem um treinamento inicial e um processo de revisão para melhorar a precisão.
- Eles não funcionam em conteúdo criptografado.
- Eles só classificam o conteúdo em locais com suporte (como SharePoint, OneDrive e Exchange).
Comparar classificadores treináveis e tipos de informações confidenciais
| Recurso | Classificadores treináveis | Tipos de Informações Confidenciais (SITs) |
|---|---|---|
| Método de detecção | Análise baseada em IA | Com base em padrões (por exemplo, regex, palavras-chave) |
| A melhor opção para | Dados não estruturados | Dados estruturados |
| Requer treinamento? | Sim | Não (SITs internos) |
| Funciona com rotulagem automática, DLP e conformidade? | Sim | Sim |
| Detecta conteúdo criptografado? | Não | Não |