Algoritmo de Naive Bayes da Microsoft

Aplica-se a: SQL Server 2019 e anteriores Analysis Services Azure Analysis Services Fabric/Power BI Premium

Importante

A mineração de dados foi preterida no SQL Server 2017 Analysis Services e agora descontinuada no SQL Server 2022 Analysis Services. A documentação não é atualizada para recursos preteridos e descontinuados. Para saber mais, consulte Compatibilidade com versões anteriores do Analysis Services.

O algoritmo Naive Bayes da Microsoft é um algoritmo de classificação baseado nos teoremas de Bayes. Pode usar o algoritmo tanto para modelação exploratória como preditiva. A palavra ingénuo no nome Naïve Bayes vem do facto de o algoritmo usar técnicas bayesianas mas não ter em conta dependências que possam existir.

Este algoritmo é menos intenso computacionalmente do que outros algoritmos da Microsoft e é útil para gerar rapidamente modelos de mineração e descobrir relações entre colunas de entrada e colunas previsíveis. Pode usar este algoritmo para a exploração inicial dos dados. Mais tarde, pode aplicar os resultados para criar modelos de mineração com outros algoritmos que sejam mais intensos computacionalmente e mais precisos.

Example

Como estratégia promocional contínua, o departamento de marketing da empresa Adventure Works Cycle decide direcionar potenciais clientes enviando panfletos. Para reduzir custos, querem enviar folhetos apenas para os clientes que provavelmente irão responder.

A empresa armazena informações sobre demografia e respostas a uma correspondência anterior numa base de dados. Querem usar estes dados para perceber como demografias como a idade e a localização podem ajudar a prever a resposta a uma promoção, comparando potenciais clientes com clientes que têm características semelhantes e que compraram à empresa no passado. Especificamente, a empresa quer ver as diferenças entre os clientes que compraram uma bicicleta e os que não compraram.

Ao utilizar o algoritmo Microsoft Naive Bayes, o departamento de marketing pode prever rapidamente um resultado para um determinado perfil de cliente e, assim, determinar quais os clientes mais propensos a responder aos folhetos. Ao utilizar o Microsoft Naive Bayes Viewer no SQL Server Data Tools, podem também investigar visualmente quais as colunas de entrada que contribuem para respostas positivas aos folhetos.

Como funciona o algoritmo

O algoritmo Naive Bayes da Microsoft calcula a probabilidade de cada estado de cada coluna de entrada, dado cada estado possível da coluna previsível.

Para compreender como funciona este cálculo, pode usar o Microsoft Naive Bayes Viewer no SQL Server Data Tools para explorar visualmente como o algoritmo distribui os estados, como mostrado no gráfico seguinte.

Captura de ecrã da distribuição Naive Bayes dos estados.

O Microsoft Naive Bayes Viewer lista cada coluna de entrada no conjunto de dados e mostra como os estados de cada coluna são distribuídos, dado cada estado da coluna previsível. Use esta vista do modelo para identificar as colunas de entrada importantes para diferenciar os estados da coluna previsível.

Por exemplo, na linha para a Distância de Deslocação, a distribuição dos valores de entrada é visivelmente diferente para compradores versus não compradores. Esta diferença indica que a Distância de Deslocação = 0-1 milha de entrada é um preditor de potencial.

O visualizador também fornece valores para as distribuições, por isso pode ver que, para clientes que fazem uma a duas milhas para o trabalho, a probabilidade de comprar uma bicicleta é 0,387, e a probabilidade de não comprarem bicicleta é 0,287. Neste exemplo, o algoritmo utiliza a informação numérica derivada das características do cliente, como a distância de deslocação, para prever se um cliente comprará uma bicicleta.

Para mais informações sobre o uso do Microsoft Naive Bayes Viewer, consulte Navegar por um Modelo Usando o Microsoft Naive Bayes Viewer.

Dados necessários para modelos de Naive Bayes

Ao preparar dados para treinar um modelo Naive Bayes, compreenda os requisitos do algoritmo, incluindo a quantidade de dados que precisa e como os utiliza.

Os requisitos para um modelo Naive Bayes são os seguintes:

  • Uma única coluna chave. Cada modelo deve conter uma coluna numérica ou de texto que identifique de forma única cada registo. Chaves compostas não são permitidas.

  • Colunas de entrada. Num modelo de Naive Bayes, todas as colunas têm de ser discretas ou os valores têm de ser discretizados. Para informações sobre como agrupar ou discretizar colunas, veja Métodos de Discretização (Mineração de Dados).

  • Variáveis independentes. Para um modelo Naive Bayes, os atributos de entrada devem ser independentes uns dos outros. Este requisito é particularmente importante quando se utiliza o modelo para previsão. Se usar duas colunas de dados que já estão intimamente relacionadas, o efeito é multiplicar a influência dessas colunas, o que pode obscurecer outros fatores que influenciam o resultado.

    Por outro lado, a capacidade do algoritmo de identificar correlações entre variáveis é útil quando se explora um modelo ou conjunto de dados para identificar relações entre entradas.

  • Pelo menos uma coluna previsível. O atributo previsível deve conter valores discretos ou discretizados.

    Podes tratar os valores da coluna previsível como entradas. Esta prática pode ser útil quando se explora um novo conjunto de dados para encontrar relações entre as colunas.

Visualização do modelo

Para explorar o modelo, utilize o Microsoft Naive Bayes Viewer. O visualizador mostra como os atributos de entrada se relacionam com o atributo previsível. O visualizador também fornece um perfil detalhado de cada cluster, uma lista dos atributos que distinguem cada cluster dos outros e as características de todo o conjunto de dados de treino. Para mais informações, consulte Navegar por um Modelo Usando o Microsoft Naive Bayes Viewer.

Para mais detalhes, consulte o modelo no Microsoft Generic Content Tree Viewer (Data Mining). Para mais informações sobre o tipo de informação armazenada no modelo, consulte Mining Model Content for Naive Bayes Models (Analysis Services - Data Mining).

Fazer previsões

Depois de treinar o modelo, ele armazena os resultados como um conjunto de padrões que pode explorar ou usar para fazer previsões. Pode criar consultas para devolver previsões sobre como os novos dados se relacionam com o atributo previsível, ou pode obter estatísticas que descrevam as correlações encontradas pelo modelo.

Para informações sobre como criar consultas contra um modelo de mineração de dados, consulte Consultas de Mineração de Dados. Para exemplos de como usar consultas com um modelo Naive Bayes, veja Exemplos de Consultas do Modelo Naive Bayes.

Observações

  • Suporta a utilização da Predictive Model Markup Language (PMML) para criar modelos de mineração.

  • Suporta perfuração.

  • Não suporta a criação de dimensões de mineração de dados.

  • Suporta a utilização de modelos de mineração OLAP.

Consulte também

Algoritmos de Mineração de Dados (Serviços de Análise - Mineração de Dados)
Seleção de Funcionalidades (Mineração de Dados)
Exemplos de Consultas do Modelo Naive Bayes
Mineração de Conteúdo de Modelos para Modelos Naive Bayes (Serviços de Análise - Mineração de Dados)
Referência Técnica do Algoritmo Naive Bayes da Microsoft