Indicateurs de modélisation (exploration de données)

S’applique à : SQL Server 2019 et versions antérieures d’Analysis Services Azure Analysis Services Fabric/Power BI Premium

Important

L’exploration de données a été déconseillée dans SQL Server 2017 Analysis Services et a maintenant été abandonnée dans SQL Server 2022 Analysis Services. La documentation n’est pas mise à jour pour les fonctionnalités déconseillées et abandonnées. Pour en savoir plus, consultez la compatibilité descendante des Analysis Services.

Dans SQL Server SQL Server Analysis Services, les indicateurs de modélisation fournissent à un algorithme d’exploration de données plus d’informations sur les données d’une table de cas. L’algorithme utilise ces informations pour créer un modèle d’exploration de données plus précis.

Vous définissez des indicateurs de modélisation au niveau de la structure d’exploration de données et d’autres au niveau de la colonne du modèle d’exploration de données. Par exemple, utilisez l’indicateur de modélisation NOT NULL avec les colonnes de structure d’exploration de données. L’algorithme que vous utilisez pour créer le modèle détermine les indicateurs de modélisation supplémentaires que vous pouvez définir sur les colonnes de modèle d’exploration de données.

Note

Les plug-ins tiers peuvent inclure des indicateurs de modélisation au-delà de ceux que SQL Server Analysis Services définit.

Liste des drapeaux de modélisation

SQL Server Analysis Services prend en charge les indicateurs de modélisation suivants. Pour plus d’informations sur les indicateurs pris en charge par des algorithmes spécifiques, consultez la référence technique de l’algorithme qui crée le modèle.

NOT NULL
Spécifie que la colonne d’attribut ne peut pas contenir de valeurs Null. Pendant l’entraînement du modèle, SQL Server Analysis Services retourne une erreur si elle rencontre une valeur Null dans cette colonne.

MODEL_EXISTENCE_ONLY
Traite la colonne comme ayant deux états : Manquant et Existant. Si la valeur est NULL, l’algorithme le traite comme manquant. L’indicateur MODEL_EXISTENCE_ONLY s’applique à l’attribut prédictible, et la plupart des algorithmes prennent en charge l’indicateur.

Lorsque vous définissez l’indicateur MODEL_EXISTENCE_ONLY sur True, le modèle représente les valeurs avec seulement deux états : Manquant et Existant. Il combine tous les états nonmissants en une seule valeur existante .

Une utilisation classique pour cet indicateur de modélisation est dans les attributs pour lesquels l’état NULL a une signification implicite, et la valeur explicite de l’état NOT NULL peut ne pas être aussi importante que le fait que la colonne ait une valeur. Par exemple, une colonne [DateContractSigned] peut être NULL si un contrat n’a jamais été signé et NOT NULL si le contrat a été signé. Par conséquent, si l’objectif du modèle est de prédire si un contrat sera signé, vous pouvez utiliser l’indicateur MODEL_EXISTENCE_ONLY pour ignorer la valeur de date exacte dans les cas NOT NULL et distinguer uniquement les cas où un contrat est manquant ou existant.

Note

Missing est un état spécial utilisé par l’algorithme et diffère de la valeur de texte « Missing » dans une colonne. Pour plus d’informations, consultez Valeurs manquantes (Analysis Services - Exploration de données).

REGRESSOR
L’indicateur REGRESSOR marque la colonne comme régresseur candidat pendant le traitement. Utilisez cet indicateur uniquement sur une colonne de modèle d’exploration de données qui a un type de données numérique continu. Pour plus d’informations, consultez Utilisations de l’indicateur de modélisation REGRESSOR.

Affichage et modification des indicateurs de modélisation

Affichez les indicateurs de modélisation d’une colonne de structure d’exploration de données ou d’une colonne de modèle dans les propriétés de la structure ou du modèle dans le Concepteur d’exploration de données.

Pour vérifier les indicateurs de modélisation de la structure d’exploration de données actuelle, interrogez l’ensemble de lignes du schéma d’exploration de données. La requête suivante retourne des indicateurs pour les colonnes de structure uniquement.

SELECT COLUMN_NAME, MODELING_FLAG  
FROM $system.DMSCHEMA_MINING_STRUCTURE_COLUMNS  
WHERE STRUCTURE_NAME = '<structure name>'  

Vous pouvez ajouter ou modifier les indicateurs de modélisation utilisés dans un modèle à l’aide du Concepteur d’exploration de données et modifier les propriétés des colonnes associées. Ces modifications nécessitent le retraitement de la structure ou du modèle.

Spécifiez des indicateurs de modélisation dans une nouvelle structure ou modèle d’exploration de données à l’aide de scripts DMX, AMO ou XMLA. DMX ne peut pas modifier les indicateurs de modélisation dans un modèle ou une structure d’exploration de données existant. Au lieu de cela, créez un modèle d’exploration de données avec ALTER MINING STRUCTURE ... ADD MINING MODEL.

Utilisations de l’indicateur de modélisation REGRESSOR

Lorsque vous définissez l’indicateur REGRESSOR de modélisation sur une colonne, vous indiquez que la colonne contient des régresseurs potentiels. L’algorithme détermine les régresseurs que le modèle utilise et ignore ceux qui ne modélisent pas l’attribut prédictible.

Lorsque vous générez un modèle à l’aide de l’Assistant Exploration de données, toutes les colonnes d’entrée continues sont marquées comme des régresseurs possibles. Par conséquent, même si vous ne définissez pas explicitement l’indicateur REGRESSOR sur une colonne, la colonne peut être utilisée comme régresseur dans le modèle.

Vous pouvez déterminer les régresseurs qui ont été réellement utilisés dans le modèle traité en effectuant une requête sur l’ensemble de lignes de schéma pour le modèle d’exploration de données, comme illustré dans l’exemple suivant :

SELECT COLUMN_NAME, MODELING_FLAG  
FROM $system.DMSCHEMA_MINING_COLUMNS  
WHERE MODEL_NAME = '<model name>'  

Remarque Après avoir modifié le type de contenu d’une colonne d’exploration de données de continu à discret, modifiez manuellement l’indicateur de la colonne et retraitez le modèle.

Régresseurs dans les modèles de régression linéaire

Les modèles de régression linéaire sont basés sur l’algorithme Microsoft Decision Trees. Même si vous n'utilisez pas l'algorithme Microsoft régression linéaire, tout modèle d'arbre de décision peut contenir un arbre ou des nœuds qui représente une régression sur un attribut continu.

Par conséquent, dans ces modèles, vous n’avez pas besoin de spécifier qu’une colonne continue représente un régresseur. L'algorithme Microsoft Decision Trees partitionne le jeu de données en régions avec des modèles significatifs, même si vous ne définissez pas l'indicateur REGRESSOR sur la colonne. La différence est que lorsque vous définissez le drapeau de modélisation, l’algorithme tente de trouver des équations de régression de la forme suivante afin de s’ajuster aux motifs présents dans les nœuds de l’arbre.

a*C1 + b*C2 + ...

L’algorithme calcule la somme des résidus. Si l’écart est trop grand, l’algorithme force un fractionnement dans l’arborescence.

Par exemple, supposons que vous prédiez le comportement d’achat du client à l’aide de Income en tant qu’attribut et définissez l’indicateur de modélisation REGRESSOR sur la colonne. L’algorithme tente d’abord d’ajuster les valeurs de revenu à une formule de régression standard. Si l’écart est trop grand, l’algorithme abandonne la formule et fractionne l’arborescence sur un autre attribut. L’algorithme tente ensuite d’ajuster un régresseur de revenu dans chaque branche.

Utilisez le paramètre FORCE_REGRESSOR pour exiger que l’algorithme utilise un régresseur particulier. Les algorithmes Decision Trees et Linear Regression prennent en charge ce paramètre.

Utilisez ces liens pour en savoir plus sur les drapeaux de modélisation.

Tâche Sujet
Modifier les indicateurs de modélisation dans le Concepteur d’exploration de données Afficher ou modifier des indicateurs de modélisation (exploration de données)
Spécifier un indicateur à l’algorithme pour recommander des régresseurs probables Spécifier une colonne à utiliser comme régresseur dans un modèle
Consultez les indicateurs de modélisation pris en charge par des algorithmes spécifiques (dans la section Indicateurs de modélisation pour chaque rubrique de référence d’algorithme) Algorithmes d’exploration de données (Analysis Services - Exploration de données)
En savoir plus sur les colonnes de structure d’exploration de données et les propriétés que vous pouvez définir dessus Colonnes de structure d’exploration de données
En savoir plus sur les colonnes du modèle d’exploration de données et les indicateurs de modélisation que vous pouvez appliquer au niveau du modèle Colonnes du modèle d’exploration de données
Consultez la syntaxe permettant d’utiliser des indicateurs de modélisation dans des instructions DMX Indicateurs de modélisation (DMX)
En savoir plus sur les valeurs manquantes et sur leur utilisation Valeurs manquantes (Analysis Services - Exploration de données)
En savoir plus sur la gestion des modèles et des structures et la définition des propriétés d’utilisation Déplacement d’objets d’exploration de données