Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
Se aplica a:
SQL Server 2019 y versiones anteriores de Analysis Services
Azure Analysis Services
Fabric/Power BI Premium
Importante
La minería de datos estaba en desuso en SQL Server 2017 Analysis Services y ahora se descontinuó en SQL Server 2022 Analysis Services. La documentación no se actualiza para las características en desuso y descontinuadas. Para más información, consulte Compatibilidad con versiones anteriores de Analysis Services.
El algoritmo de árboles de decisión de Microsoft es un algoritmo de clasificación y regresión para su uso en el modelado predictivo de atributos discretos y continuos.
En el caso de los atributos discretos, el algoritmo realiza predicciones basadas en las relaciones entre las columnas de entrada de un conjunto de datos. El algoritmo usa los valores o estados de esas columnas para predecir los estados de una columna que designa como predecible. En concreto, el algoritmo identifica las columnas de entrada que están correlacionadas con la columna de predicción.
Por ejemplo, en un escenario para predecir qué clientes probablemente compren una bicicleta, si nueve de cada diez clientes más jóvenes, pero solo dos de cada diez clientes más antiguos compran una bicicleta, el algoritmo deduce que la edad es un buen indicador de la compra de bicicletas. El árbol de decisión realiza predicciones basadas en esta tendencia hacia un resultado determinado.
En el caso de los atributos continuos, el algoritmo usa la regresión lineal para determinar dónde se divide un árbol de decisión.
Si se establece más de una columna en predicción o si los datos de entrada contienen una tabla anidada establecida en predecible, el algoritmo crea un árbol de decisión independiente para cada columna predecible.
Example
El departamento de marketing de la empresa Adventure Works Cycles quiere identificar las características de los clientes anteriores que podrían indicar si es probable que esos clientes compren un producto en el futuro. La base de datos AdventureWorks2012 almacena información demográfica que describe a los clientes anteriores. Mediante el uso del algoritmo de árboles de decisión de Microsoft para analizar esta información, el departamento de marketing puede crear un modelo que prediga si un cliente determinado comprará productos, en función de los estados de las columnas conocidas sobre ese cliente, como datos demográficos o patrones de compra anteriores.
Funcionamiento del algoritmo
El algoritmo de árboles de decisión de Microsoft crea un modelo de minería de datos mediante la creación de una serie de divisiones en el árbol. Estas divisiones se representan como nodos. El algoritmo agrega un nodo al modelo cada vez que encuentra una columna de entrada que se correlaciona significativamente con la columna de predicción. La forma en que el algoritmo determina una división es diferente en función de si predice una columna continua o una columna discreta.
El algoritmo de árboles de decisión Microsoft usa la selección de características para guiar la selección de los atributos más útiles. Todos los algoritmos de minería de datos SQL Server usan la selección de características para mejorar la calidad del rendimiento y el análisis y evitar que los atributos no importantes usen el tiempo del procesador. Si usa demasiados atributos de entrada o predicción al diseñar un modelo de minería de datos, el modelo puede tardar mucho tiempo en procesarse o agotarse la memoria. Los métodos usados para determinar si se debe dividir el árbol incluyen métricas estándar del sector para las redes entropía y bayesianas. Para obtener más información sobre los métodos usados para seleccionar atributos significativos y, a continuación, puntuar y clasificar los atributos, vea Selección de características (minería de datos).
Un problema común en los modelos de minería de datos es que el modelo se vuelve demasiado sensible a las pequeñas diferencias en los datos de entrenamiento, lo que se denomina sobreajuste o sobreentrenado. Un modelo sobreajustado no se puede generalizar en otros conjuntos de datos. Para evitar el sobreajuste en un conjunto determinado de datos, el algoritmo de árboles de decisión de Microsoft usa técnicas para controlar el crecimiento del árbol. Para obtener una explicación detallada de cómo funciona el algoritmo de árboles de decisión de Microsoft, consulte Microsoft Referencia técnica del algoritmo de árboles de decisión.
Predicción de columnas discretas
El algoritmo de árboles de decisión de Microsoft crea un árbol para una columna de predicción discreta mediante un histograma. En el diagrama siguiente se muestra un histograma que traza una columna predecible, Bike Buyers, en una columna de entrada, Age. El histograma muestra que la edad de una persona ayuda a distinguir si esa persona compra una bicicleta.
La correlación que se muestra en el diagrama hace que el algoritmo de árboles de decisión de Microsoft cree un nuevo nodo en el modelo.
A medida que el algoritmo agrega nuevos nodos a un modelo, crea una estructura de árbol. El nodo superior del árbol describe el desglose de la columna de predicción para la población global de clientes. A medida que el modelo sigue creciendo, el algoritmo considera todas las columnas.
Predicción de columnas continuas
Cuando el algoritmo de árboles de decisión de Microsoft crea un árbol basado en una columna de predicción continua, cada nodo contiene una fórmula de regresión. Una división se produce en un punto de no linealidad en la fórmula de regresión. Por ejemplo, considere el siguiente diagrama.
Un modelo de regresión estándar intenta derivar una única fórmula que representa la tendencia y las relaciones de los datos en su conjunto. Sin embargo, una sola fórmula podría hacer un trabajo deficiente de capturar la discontinuidad en datos complejos. En su lugar, el algoritmo de árboles de decisión de Microsoft busca segmentos del árbol que son en gran medida lineales y crea fórmulas independientes para estos segmentos. Al dividir los datos en distintos segmentos, el modelo puede realizar un mejor trabajo de aproximación de los datos.
En el diagrama siguiente se representa el diagrama de árbol del modelo en el gráfico de dispersión anterior. Para predecir el resultado, el modelo proporciona dos fórmulas diferentes: una para la rama izquierda con la fórmula y = .5x x 5 y otra para la rama derecha con la fórmula y = .25x + 8.75. El punto en el que las dos líneas se unen en el gráfico de dispersión es el punto de no linealidad donde un nodo de un modelo de árbol de decisión se divide.
Este modelo es sencillo con solo dos ecuaciones lineales, por lo que la división en el árbol es inmediatamente después del nodo Todo . Sin embargo, una división puede producirse en cualquier nivel del árbol. En un árbol que contiene varios niveles y nodos en los que cada nodo se caracteriza por una colección diferente de atributos, una fórmula podría compartirse entre varios nodos o aplicar solo a un solo nodo.
Por ejemplo, podría obtener una fórmula para un nodo definido como "clientes mayores de una edad y ingresos determinados" y otro en un nodo que representa "clientes que viajan a larga distancia". Para ver la fórmula de un nodo o segmento individual, seleccione el nodo.
Datos necesarios para los modelos de árbol de decisión
Al preparar los datos para su uso en un modelo de árbol de decisión, comprenda los requisitos del algoritmo concreto, incluida la cantidad de datos que necesita y cómo usa los datos.
Los requisitos de un modelo de árbol de decisión son los siguientes:
Una única columna clave. Cada modelo debe contener una columna numérica o de texto que identifique de forma única cada registro. No se permiten claves compuestas.
Una columna predecible. El modelo requiere al menos una columna de predicción. Puede incluir varios atributos de predicción en un modelo y los atributos de predicción pueden ser de diferentes tipos, numéricos o discretos. Aumentar el número de atributos predecibles puede aumentar el tiempo de procesamiento.
Columnas de entrada. El modelo requiere columnas de entrada, que pueden ser discretas o continuas. Aumentar el número de atributos de entrada afecta al tiempo de procesamiento.
Para obtener información detallada sobre los tipos de contenido y los tipos de datos admitidos para los modelos de árbol de decisión, consulte la sección Requisitos de la referencia técnica del algoritmo de árboles de decisión de Microsoft.
Visualización de un modelo de árbol de decisión
Para explorar el modelo, use el Visor de árboles de Microsoft. Si el modelo genera varios árboles, puede seleccionar un árbol y ver un desglose de cómo se clasifican los casos para cada atributo de predicción. También puede ver la interacción de los árboles mediante el visor de red de dependencias. Para obtener más información, vea Examinar un modelo mediante el Visor de árboles de Microsoft.
Para obtener más información sobre cualquier rama o nodo del árbol, también puede examinar el modelo mediante el visor de árbol de contenido genérico de Microsoft. El contenido almacenado para el modelo incluye la distribución de todos los valores de cada nodo, probabilidades en cada nivel del árbol y fórmulas de regresión para atributos continuos. Para obtener más información, consulte Contenido del modelo de minería para modelos de árboles de decisión (Analysis Services - Minería de datos).
Creación de predicciones
Una vez procesado el modelo, almacena los resultados como un conjunto de patrones y estadísticas. Use estos resultados para explorar las relaciones o realizar predicciones.
Para obtener ejemplos de consultas que se usarán con un modelo de árbol de decisión, consulte Ejemplos de consultas de modelos de árboles de decisión.
Para obtener información general sobre cómo crear consultas en modelos de minería de datos, consulte Consultas de minería de datos.
Observaciones
Admite el uso del lenguaje de marcado de modelos predictivos (PMML) para crear modelos de minería de datos.
Admite la obtención de detalles.
Admite el uso de modelos de minería de datos OLAP y la creación de dimensiones de minería de datos.
Véase también
Algoritmos de minería de datos (Analysis Services - Minería de datos)
Referencia técnica del algoritmo de árboles de decisión de Microsoft
Ejemplos de consulta de modelos de árboles de decisión
Contenido del modelo de minería para modelos de árboles de decisión (Analysis Services - Minería de datos)