Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Aplica-se a:
SQL Server 2019 e anteriores Analysis Services
Azure Analysis Services
Fabric/Power BI Premium
Importante
A mineração de dados foi preterida no SQL Server 2017 Analysis Services e agora descontinuada no SQL Server 2022 Analysis Services. A documentação não é atualizada para recursos preteridos e descontinuados. Para saber mais, consulte Compatibilidade com versões anteriores do Analysis Services.
O Algoritmo das Árvores de Decisão da Microsoft é um algoritmo de classificação e regressão para uso na modelação preditiva de atributos discretos e contínuos.
Para atributos discretos, o algoritmo faz previsões com base nas relações entre colunas de entrada num conjunto de dados. O algoritmo usa os valores ou estados dessas colunas para prever os estados de uma coluna que designa como previsível. Especificamente, o algoritmo identifica as colunas de entrada que estão correlacionadas com a coluna previsível.
Por exemplo, num cenário para prever quais os clientes que provavelmente comprarão uma bicicleta, se nove em cada dez clientes mais jovens mas apenas dois em cada dez mais velhos compram uma bicicleta, o algoritmo infere que a idade é um bom preditor da compra da bicicleta. A árvore de decisão faz previsões baseadas nesta tendência para um determinado resultado.
Para atributos contínuos, o algoritmo utiliza regressão linear para determinar onde uma árvore de decisão se divide.
Se mais do que uma coluna estiver definida como previsível, ou se os dados de entrada conterem uma tabela aninhada definida como previsível, o algoritmo constrói uma árvore de decisão separada para cada coluna previsível.
Example
O departamento de marketing da empresa Adventure Works Cycles quer identificar as características dos clientes anteriores que possam indicar se esses clientes provavelmente comprarão um produto no futuro. A base de dados AdventureWorks2012 armazena informações demográficas que descrevem clientes anteriores. Ao utilizar o Algoritmo de Árvores de Decisão da Microsoft para analisar esta informação, o departamento de marketing pode construir um modelo que prevê se um determinado cliente irá comprar produtos, com base nos estados das colunas conhecidas sobre esse cliente, como dados demográficos ou padrões de compra anteriores.
Como funciona o algoritmo
O Algoritmo de Árvores de Decisão da Microsoft constrói um modelo de mineração de dados criando uma série de divisões na árvore. Estas divisões são representadas como nós. O algoritmo adiciona um nó ao modelo sempre que encontra uma coluna de entrada significativamente correlacionada com a coluna previsível. A forma como o algoritmo determina uma divisão é diferente dependendo se está a prever uma coluna contínua ou uma coluna discreta.
O Algoritmo das Árvores de Decisão da Microsoft utiliza a seleção de funcionalidades para orientar a seleção dos atributos mais úteis. Todos os algoritmos de mineração de dados do SQL Server utilizam a seleção de funcionalidades para melhorar o desempenho e a qualidade da análise e evitar que atributos pouco importantes consomam tempo de processador. Se usar demasiados atributos de entrada ou previsíveis ao desenhar um modelo de mineração de dados, o modelo pode demorar muito tempo a processar ou ficar sem memória. Os métodos usados para determinar se dividir a árvore incluem métricas padrão da indústria para entropia e redes bayesianas. Para mais informações sobre os métodos usados para selecionar atributos significativos e depois pontuar e classificar os atributos, consulte Seleção de Características (Mineração de Dados).
Um problema comum em modelos de mineração de dados é o modelo tornar-se demasiado sensível a pequenas diferenças nos dados de treino, o que se chama sobreajuste ou sobretreinamento. Um modelo sobreajustado não pode ser generalizado para outros conjuntos de dados. Para evitar o sobreajuste num determinado conjunto de dados, o Algoritmo de Árvores de Decisão da Microsoft utiliza técnicas para controlar o crescimento da árvore. Para uma explicação aprofundada de como funciona o Algoritmo das Árvores de Decisão da Microsoft, consulte Referência Técnica do Algoritmo das Árvores de Decisão da Microsoft.
Predição de colunas discretas
O Algoritmo das Árvores de Decisão da Microsoft constrói uma árvore para uma coluna discreta e previsível usando um histograma. O diagrama seguinte mostra um histograma que representa uma coluna previsível, Compradores de Bicicleta, contra uma coluna de entrada, Idade. O histograma mostra que a idade de uma pessoa ajuda a distinguir se essa pessoa compra uma bicicleta.
A correlação mostrada no diagrama faz com que o Algoritmo de Árvores de Decisão da Microsoft crie um novo nó no modelo.
À medida que o algoritmo adiciona novos nós a um modelo, cria uma estrutura em árvore. O nó superior da árvore descreve a divisão da coluna previsível para a população global de clientes. À medida que o modelo continua a crescer, o algoritmo considera todas as colunas.
Prever colunas contínuas
Quando o Algoritmo de Árvores de Decisão da Microsoft constrói uma árvore baseada numa coluna contínua e previsível, cada nó contém uma fórmula de regressão. Ocorre uma divisão num ponto de não linearidade na fórmula de regressão. Por exemplo, considere o seguinte diagrama.
Um modelo de regressão padrão tenta derivar uma única fórmula que represente a tendência e as relações para os dados como um todo. No entanto, uma única fórmula pode fazer um mau trabalho a captar a descontinuidade em dados complexos. Em vez disso, o Algoritmo das Árvores de Decisão da Microsoft procura segmentos da árvore que são maioritariamente lineares e cria fórmulas separadas para esses segmentos. Ao dividir os dados em diferentes segmentos, o modelo pode aproximar melhor os dados.
O diagrama seguinte representa o diagrama em árvore para o modelo no gráfico de dispersão anterior. Para prever o resultado, o modelo fornece duas fórmulas diferentes: uma para o ramo esquerdo com a fórmula y = 0,5x x 5, e outra para o ramo direito com a fórmula y = 0,25x + 8,75. O ponto onde as duas linhas se juntam no diagrama de dispersão é o ponto não linear no qual um nó de um modelo de árvore de decisão se divide.
Este modelo é simples, com apenas duas equações lineares, pelo que a divisão na árvore ocorre imediatamente após o nó Todos . No entanto, pode ocorrer uma divisão em qualquer nível da árvore. Numa árvore contendo múltiplos níveis e nós onde cada nó é caracterizado por um conjunto diferente de atributos, uma fórmula pode ser partilhada por vários nós ou aplicar-se apenas a um único nó.
Por exemplo, pode encontrar uma fórmula para um nó definido como "clientes com mais de uma certa idade e rendimento" e outra num nó que representa "clientes que fazem longas distâncias." Para ver a fórmula de um nó ou segmento individual, selecione o nó.
Dados necessários para modelos de árvore de decisão
Quando preparar dados para uso num modelo de árvore de decisão, compreenda os requisitos para o algoritmo em questão, incluindo a quantidade de dados necessária e como os utiliza.
Os requisitos para um modelo de árvore de decisão são os seguintes:
Uma única coluna chave. Cada modelo deve conter uma coluna numérica ou de texto que identifique de forma única cada registo. Chaves compostas não são permitidas.
Uma coluna previsível. O modelo requer pelo menos uma coluna previsível. Pode incluir múltiplos atributos previsíveis num modelo, e os atributos previsíveis podem ser de diferentes tipos, sejam numéricos ou discretos. Aumentar o número de atributos previsíveis pode aumentar o tempo de processamento.
Colunas de entrada. O modelo requer colunas de entrada, que podem ser discretas ou contínuas. Aumentar o número de atributos de entrada afeta o tempo de processamento.
Para informações detalhadas sobre os tipos de conteúdo suportados e os tipos de dados para modelos de árvore de decisão, consulte a secção Requisitos da Referência Técnica do Algoritmo das Árvores de Decisão da Microsoft.
Visualização de um modelo de árvore de decisão
Para explorar o modelo, utilize o Microsoft Tree Viewer. Se o seu modelo gerar várias árvores, pode selecionar uma árvore e ver uma divisão de como os casos são categorizados para cada atributo previsível. Também pode visualizar a interação das árvores usando o visualizador de rede de dependências. Para mais informações, consulte Navegar por um Modelo Usando o Microsoft Tree Viewer.
Para mais detalhes sobre qualquer ramo ou nó na árvore, pode também explorar o modelo usando o Microsoft Generic Content Tree Viewer. O conteúdo armazenado para o modelo inclui a distribuição para todos os valores em cada nó, probabilidades em cada nível da árvore e fórmulas de regressão para atributos contínuos. Para mais informações, consulte Conteúdo do Modelo de Mineração para Modelos de Árvore de Decisão (Serviços de Análise - Mineração de Dados).
Criação de previsões
Depois de processado o modelo, armazena os resultados como um conjunto de padrões e estatísticas. Use estes resultados para explorar relações ou fazer previsões.
Para exemplos de consultas a usar com um modelo de árvore de decisão, veja Exemplos de Consultas de Modelos de Árvores de Decisão.
Para informações gerais sobre como criar consultas contra modelos de mineração, consulte Consultas de Mineração de Dados.
Observações
Suporta a utilização da Predictive Model Markup Language (PMML) para criar modelos de mineração.
Suporta perfuração.
Suporta a utilização de modelos de mineração OLAP e a criação de dimensões de mineração de dados.
Consulte também
Algoritmos de Mineração de Dados (Serviços de Análise - Mineração de Dados)
Referência Técnica do Algoritmo das Árvores de Decisão da Microsoft
Exemplos de Consultas de Modelos em Árvores de Decisão
Mineração de Conteúdo de Modelos para Modelos de Árvore de Decisão (Serviços de Análise - Mineração de Dados)