Algoritmo Naïve Bayes da Microsoft

Aplica-se a: SQL Server 2019 e versões anteriores do Analysis Services Azure Analysis Services Fabric/Power BI Premium

Importante

A mineração de dados foi preterida no SQL Server 2017 Analysis Services e agora descontinuada no SQL Server 2022 Analysis Services. A documentação não é atualizada para recursos preteridos e descontinuados. Para saber mais, consulte a compatibilidade com versões anteriores do Analysis Services.

O algoritmo Microsoft Naive Bayes é um algoritmo de classificação baseado nos teoremas de Bayes. Você pode usar o algoritmo para modelagem exploratória e preditiva. A palavra ingênua no nome Naïve Bayes vem do fato de que o algoritmo usa técnicas bayesianas, mas não leva em conta dependências que podem existir.

Esse algoritmo é menos intenso computacionalmente do que outros algoritmos de Microsoft e é útil para gerar rapidamente modelos de mineração para descobrir relações entre colunas de entrada e colunas previsíveis. Você pode usar esse algoritmo para exploração inicial de dados. Posteriormente, você pode aplicar os resultados para criar modelos de mineração com outros algoritmos que são mais computacionalmente intensos e mais precisos.

Example

Como uma estratégia promocional contínua, o departamento de marketing da empresa Adventure Works Cycle decide direcionar potenciais clientes ao enviar panfletos. Para reduzir os custos, eles querem enviar panfletos apenas para os clientes que provavelmente responderão.

A empresa armazena informações sobre dados demográficos e resposta a uma correspondência anterior em um banco de dados. Eles querem usar esses dados para ver como a demografia, como idade e localização, pode ajudar a prever a resposta a uma promoção, comparando potenciais clientes com clientes que têm características semelhantes e que compraram da empresa no passado. Especificamente, a empresa quer ver as diferenças entre os clientes que compraram uma bicicleta e aqueles que não compraram.

Usando o algoritmo Microsoft Naive Bayes, o departamento de marketing pode prever rapidamente um resultado para um perfil de cliente específico e, portanto, determinar quais clientes são mais propensos a responder aos folhetos. Usando o visualizador Microsoft Naive Bayes em SQL Server Data Tools, eles também podem investigar visualmente quais colunas de entrada contribuem para respostas positivas aos panfletos.

Como o algoritmo funciona

O algoritmo Microsoft Naive Bayes calcula a probabilidade de cada estado de cada coluna de entrada, considerando cada estado possível da coluna previsível.

Para entender como esse cálculo funciona, você pode usar o Visualizador de Microsoft Naive Bayes em SQL Server Data Tools para explorar visualmente como o algoritmo distribui estados, conforme mostrado no gráfico a seguir.

Captura de tela da distribuição de estados de Naive Bayes.

O Visualizador de Microsoft Naive Bayes lista cada coluna de entrada no conjunto de dados e mostra como os estados de cada coluna são distribuídos, considerando cada estado da coluna previsível. Use essa exibição do modelo para identificar as colunas de entrada que são importantes para diferenciar entre estados da coluna previsível.

Por exemplo, na linha de Distância de Deslocamento, a distribuição de valores de entrada é visivelmente diferente para compradores versus não compradores. Essa diferença indica que a entrada Distância de deslocamento = 0–1 milha é um potencial preditor.

O visualizador também fornece valores para as distribuições, para que você possa ver que para os clientes que se deslocam de uma a duas milhas para trabalhar, a probabilidade de comprar uma bicicleta é de 0,387 e a probabilidade de não comprarem uma bicicleta é de 0,287. Neste exemplo, o algoritmo usa as informações numéricas derivadas de características do cliente, como a distância de deslocamento, para prever se um cliente comprará uma bicicleta.

Para obter mais informações sobre como usar o Visualizador do Microsoft Naive Bayes, consulte Procurar um modelo usando o Visualizador do Microsoft Naive Bayes.

Dados necessários para modelos de Naive Bayes

Ao preparar dados para treinar um modelo naive Bayes, entenda os requisitos para o algoritmo, incluindo a quantidade de dados necessária e como ele usa os dados.

Os requisitos para um modelo naive Bayes são os seguintes:

  • Uma única coluna-chave. Cada modelo deve conter uma coluna numérica ou de texto que identifique exclusivamente cada registro. Chaves compostas não são permitidas.

  • Colunas de entrada. Em um modelo Naive Bayes, todas as colunas devem ser discretas ou os valores devem ser compartimentalizados. Para obter informações sobre como armazenar ou diferenciar colunas, consulte Métodos de Discretização (Mineração de Dados).

  • Variáveis independentes. Para um modelo naive Bayes, os atributos de entrada devem ser independentes uns dos outros. Esse requisito é particularmente importante quando você usa o modelo para previsão. Se você usar duas colunas de dados que já estão intimamente relacionadas, o efeito será multiplicar a influência dessas colunas, o que pode obscurecer outros fatores que influenciam o resultado.

    Por outro lado, a capacidade do algoritmo de identificar correlações entre variáveis é útil quando você está explorando um modelo ou conjunto de dados para identificar relações entre entradas.

  • Pelo menos uma coluna previsível. O atributo a ser previsto deve conter valores discretos ou discretizados.

    Você pode tratar os valores da coluna previsível como entradas. Essa prática pode ser útil quando você está explorando um novo conjunto de dados para encontrar relações entre as colunas.

Exibindo o modelo

Para explorar o modelo, use o Visualizador de Microsoft Naive Bayes. O visualizador mostra como os atributos de entrada se relacionam com o atributo previsível. O visualizador também fornece um perfil detalhado de cada cluster, uma lista dos atributos que distinguem cada cluster dos outros e as características de todo o conjunto de dados de treinamento. Para obter mais informações, consulte Procurar um modelo usando o Visualizador do Microsoft Naive Bayes.

Para obter mais detalhes, navegue pelo modelo no visualizador de árvore de conteúdo genérico Microsoft (mineração de dados). Para obter mais informações sobre o tipo de informações armazenadas no modelo, consulte Conteúdo do Modelo de Mineração para Modelos Naive Bayes (Analysis Services – Mineração de Dados).

Fazendo previsões

Depois de treinar o modelo, ele armazena os resultados como um conjunto de padrões que você pode explorar ou usar para fazer previsões. Você pode criar consultas para retornar previsões sobre como novos dados se relacionam com o atributo previsível ou recuperar estatísticas que descrevem as correlações encontradas pelo modelo.

Para obter informações sobre como criar consultas em um modelo de mineração de dados, consulte Consultas de mineração de dados. Para obter exemplos de como usar consultas com um modelo Naive Bayes, consulte exemplos de consulta de modelo naive bayes.

Observações

  • Dá suporte ao uso da PMML (Predictive Model Markup Language) para criar modelos de mineração.

  • Dá suporte ao detalhamento.

  • Não dá suporte à criação de dimensões de mineração de dados.

  • Dá suporte ao uso de modelos de mineração OLAP.

Consulte também

Algoritmos de mineração de dados (Analysis Services – Mineração de dados)
Seleção de Atributos (Mineração de Dados)
Exemplos de consulta de modelo naive Bayes
Conteúdo do Modelo de Mineração para Modelos Naive Bayes (Analysis Services - Mineração de Dados)
Referência técnica do algoritmo Microsoft Naive Bayes