Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Aplica-se a:
SQL Server 2019 e anteriores Analysis Services
Azure Analysis Services
Fabric/Power BI Premium
Importante
A mineração de dados foi preterida no SQL Server 2017 Analysis Services e agora descontinuada no SQL Server 2022 Analysis Services. A documentação não é atualizada para recursos preteridos e descontinuados. Para saber mais, consulte Compatibilidade com versões anteriores do Analysis Services.
Alguns algoritmos que criam modelos de mineração de dados em SQL Server SQL Server Analysis Services requerem tipos de conteúdo específicos para funcionar corretamente. Por exemplo, o algoritmo Naive Bayes da Microsoft não pode usar colunas contínuas como entrada nem prever valores contínuos. Além disso, algumas colunas contêm tantos valores que o algoritmo não consegue identificar facilmente padrões interessantes nos dados para criar um modelo.
Nestes casos, pode discretizar os dados nas colunas para permitir a utilização dos algoritmos para produzir um modelo de mineração. Discretização é o processo de colocar valores em baldes para que haja um número limitado de estados possíveis. Os próprios compartimentos são tratados como valores ordenados e independentes. Podes discretizar tanto colunas numéricas como colunas de cadeia.
Existem vários métodos disponíveis para discretizar dados. Se a sua solução de mineração de dados usar dados relacionais, pode controlar o número de baldes a usar para agrupar dados definindo o valor da DiscretizationBucketCount propriedade. O número padrão de buckets é 5.
Se a sua solução de mineração de dados usar dados de um cubo de Processamento Analítico Online (OLAP), o algoritmo de mineração calcula automaticamente o número de baldes a gerar usando a seguinte equação, onde n é o número de valores distintos de dados na coluna:
Number of Buckets = sqrt(n)
Se não quiser que o SQL Server Analysis Services calcule o número de buckets, use a DiscretizationBucketCount propriedade para especificar manualmente o número de buckets.
A tabela seguinte descreve os métodos que pode usar para discretizar dados no SQL Server Analysis Services.
| Método de discretização | Description |
|---|---|
| AUTOMÁTICO | O SQL Server Analysis Services determina qual o método de discretização a utilizar. |
| Clusters | O algoritmo divide os dados em grupos ao amostrar os dados de treino, inicializando um número de pontos aleatórios e depois executando várias iterações do algoritmo Microsoft Clustering usando o método de clusterização Expectation Maximization (EM). O método CLUSTERS é útil porque funciona em qualquer curva de distribuição. No entanto, requer mais tempo de processamento do que os outros métodos de discretização. Este método só pode ser usado com colunas numéricas. |
| EQUAL_AREAS | O algoritmo divide os dados em grupos que contêm um número igual de valores. Este método é melhor utilizado para curvas de distribuição normais, mas não funciona bem se a distribuição incluir um grande número de valores num grupo restrito nos dados contínuos. Por exemplo, se metade dos itens tiver um custo de 0, metade dos dados ocorre num único ponto da curva. Numa distribuição deste tipo, este método divide os dados numa tentativa de estabelecer discretização igual em múltiplas áreas. Este processo produz uma representação imprecisa dos dados. |
Observações
Use o método EQUAL_AREAS para discretizar cadeias.
O método CLUSTERS utiliza uma amostra aleatória de 1.000 registos para discretizar dados. Usa o método EQUAL_AREAS se não quiseres que o algoritmo amostre dados.
Ver também
Tipos de Conteúdo (Mineração de Dados)
Tipos de Conteúdo (DMX)
Algoritmos de Mineração de Dados (Serviços de Análise - Mineração de Dados)
Estruturas de Mineração (Serviços de Análise - Mineração de Dados)
Tipos de Dados (Mineração de Dados)
Colunas da Estrutura Mineira
Distribuições de Colunas (Mineração de Dados)