Saiba mais sobre codificação preditiva na Descoberta Eletrônica (Premium) (versão prévia)

Cuidado

A Microsoft desativou todas as experiências clássicas de descoberta eletrônica em 31 de agosto de 2025. Essa desativação inclui a Pesquisa de Conteúdo clássica, a Descoberta Eletrônica clássica (Standard) e a Descoberta Eletrônica clássica (Premium).

As diretrizes neste artigo se aplicam apenas a organizações hospedadas no Microsoft 365 operado pela 21Vianet (China). Se sua organização não for hospedada pela 21Vianet, use as orientações para a nova experiência de Descoberta Eletrônica no portal do Microsoft Purview.

O módulo de codificação preditiva na Descoberta Eletrônica (Premium) usa os recursos inteligentes de aprendizado de máquina para ajudá-lo a reduzir a quantidade de conteúdo a ser examinado. A codificação preditiva ajuda a reduzir e selecionar grandes volumes de conteúdo de caso para um conjunto relevante de itens que você pode priorizar para revisão. Isso é feito criando e treinando seus próprios modelos de codificação preditiva que ajudam você a priorizar a revisão dos itens mais relevantes em um conjunto de revisão.

O módulo de codificação preditiva foi projetado para simplificar a complexidade do gerenciamento de um modelo em um conjunto de revisão e fornecer uma abordagem iterativa para treinar seu modelo para que você possa começar mais rapidamente com os recursos de aprendizado de máquina na Descoberta Eletrônica (Premium). Para começar, você pode criar um modelo, rotular até 50 itens como relevantes ou não relevantes. O sistema usa esse treinamento para aplicar pontuações de previsão a todos os itens no conjunto de revisão. Isso permite filtrar itens com base na pontuação de previsão, o que permite examinar os itens mais relevantes (ou não relevantes) primeiro. Se você quiser treinar modelos com precisões e taxas de recall mais altas, poderá continuar rotulando itens em rodadas de treinamento subsequentes até que o modelo se estabilize.

O fluxo de trabalho de codificação preditiva

Confira uma visão geral e uma descrição do fluxo de trabalho de codificação preditiva de cada etapa. Para obter uma descrição mais detalhada dos conceitos e da terminologia do processo de codificação preditiva, consulte Referência de codificação preditiva.

Fluxo de trabalho de codificação preditiva.

  1. Crie um novo modelo de codificação preditiva no conjunto de revisão. A primeira etapa é criar um novo modelo de codificação preditiva no conjunto de revisão. Você deve ter pelo menos 2.000 itens no conjunto de revisão para criar um modelo. Depois de criar um modelo, o sistema determinará o número de itens a serem usados como um conjunto de controles. O conjunto de controles é usado durante o processo de treinamento para avaliar as pontuações de previsão que o modelo atribui aos itens com a rotulagem que você executa durante as rodadas de treinamento. O tamanho do conjunto de controles é baseado no número de itens no conjunto de revisão e nos valores de nível de confiança e margem de erro definidos ao criar o modelo. Os itens no conjunto de controles nunca são alterados e não são identificáveis para os usuários.

    Para obter mais informações, consulte Criar um modelo de codificação preditiva.

  2. Conclua a primeira rodada de treinamento rotulando os itens como relevantes ou não relevantes. A próxima etapa é treinar o modelo iniciando a primeira rodada de treinamento. Quando você inicia uma rodada de treinamento, o modelo seleciona aleatoriamente itens adicionais do conjunto de revisão, que é chamado de conjunto de treinamento. Esses itens (tanto do conjunto de controle quanto do conjunto de treinamento) são apresentados a você para que você possa rotular cada um como "relevante" ou "não relevante". A relevância é baseada no conteúdo do item e não em qualquer um dos metadados do documento. Depois de concluir o processo de rotulagem na rodada de treinamento, o modelo "aprenderá" com base em como você rotulou os itens no conjunto de treinamento. Com base nesse treinamento, o modelo processará os itens no conjunto de revisão e aplicará uma pontuação de previsão a cada um.

    Para obter mais informações, consulte Treinar um modelo de codificação preditiva.

  3. Aplique o filtro de pontuação de previsão aos itens no conjunto de revisão. Depois que a etapa de treinamento anterior for concluída, a próxima etapa é aplicar o filtro de pontuação de previsão aos itens na revisão para exibir os itens que o modelo determinou serem "mais relevantes" (como alternativa, você também pode usar um filtro de previsão para exibir itens que "não são relevantes"). Ao aplicar o filtro de previsão, você especifica um intervalo de pontuações de previsão a serem filtradas. O intervalo de pontuações de previsão fica entre 0 e 1, sendo 0 "não relevante" e 1 relevante. Em geral, itens com escores de predição entre 0 e 0,5 são considerados "não relevantes" e itens com escores de predição entre 0,5 e 1 são considerados relevantes.

    Para obter mais informações, consulte Aplicar um filtro de previsão a um conjunto de revisão.

  4. Execute mais rodadas de treinamento até que o modelo se estabilize. Você pode realizar rodadas adicionais de treinamento se quiser criar um modelo com maior precisão de previsão e maiores taxas de recuperação. A taxa de recall mede a proporção de itens que o modelo previu que eram relevantes entre os itens que são realmente relevantes (aqueles que você marcou como relevantes durante o treinamento). A pontuação da taxa de recall varia de 0 a 1. Uma pontuação mais próxima de 1 indica que o modelo identificará itens mais relevantes. Em uma nova rodada de treinamento, você rotula itens adicionais em um novo conjunto de treinamento. Depois de concluir essa rodada de treinamento, o modelo será atualizado com base no novo aprendizado da rodada mais recente de rotulagem de itens no conjunto de treinamento. O modelo processará os itens no conjunto de revisão novamente e aplicará novas pontuações de previsão. Você pode continuar executando rodadas de treinamento até que seu modelo se estabilize. Um modelo é considerado estabilizado quando a taxa de rotatividade após a última rodada de treinamento é inferior a 5%. A taxa de rotatividade é definida como a porcentagem de itens em um conjunto de revisão em que a pontuação de previsão mudou entre as rodadas de treinamento. O dashboard de codificação preditiva exibe informações e estatísticas que ajudam você a avaliar a estabilidade de um modelo.

  5. Aplique o filtro de pontuação de previsão "final" para examinar itens definidos para priorizar a revisão. Depois de concluir todas as rodadas de treinamento e estabilizar o modelo, a última etapa é aplicar a pontuação de previsão final ao conjunto de revisão para priorizar a revisão de itens relevantes e não relevantes. Essa é a mesma tarefa que você executou na etapa 3, mas neste ponto o modelo está estável e você não planeja executar mais rodadas de treinamento.