Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Qu’est-ce que la détection d’anomalies multivariées ?
Détection d’anomalie univariée, implémentée par la fonction KQL series_decompose_anomalies(), surveille et détecte les anomalies dans une variable unique au fil du temps. La détection d’anomalies multivariées étend cette approche en détectant les anomalies dans la distribution conjointe de plusieurs variables au fil du temps, ce qui signifie qu’elle analyse la façon dont les variables se rapportent et les influencent en tant que groupe, plutôt que d’examiner chaque variable en isolation. La détection d’anomalies multivariées est utile pour surveiller l’intégrité des systèmes IoT complexes, détecter les fraudes dans les transactions financières et identifier des modèles inhabituels dans le trafic réseau.
Par exemple, considérez un système qui surveille les performances d’une flotte de véhicules. Le système collecte des données sur différentes métriques, telles que la vitesse, la consommation de carburant et la température du moteur. En analysant ces métriques ensemble, le système peut détecter les anomalies qui ne seraient pas apparentes en analysant chaque métrique individuellement. En soi, une augmentation de la consommation de carburant pourrait être due à diverses raisons acceptables. Toutefois, une augmentation soudaine de la consommation de carburant combinée à une diminution de la température du moteur peut indiquer un problème avec le moteur, même si chaque mesure est dans sa propre plage normale.
Comment détecter des anomalies multivariées dans Microsoft Fabric ?
La détection d’anomalies multivariées dans Fabric tire parti des puissants moteurs Spark et Eventhouse sur une couche de stockage persistante partagée. Les données initiales peuvent être ingérées dans un Eventhouse et exposées dans OneLake. Le modèle de détection d’anomalie peut ensuite être entraîné à l’aide du moteur Spark, et les prédictions d’anomalies sur de nouvelles données de streaming peuvent être effectuées en temps réel à l’aide du moteur Eventhouse. L’interconnexion de ces moteurs qui peuvent traiter les mêmes données dans le stockage partagé permet un flux transparent de données à partir de l’ingestion, via l’entraînement du modèle, à la prédiction des anomalies. Ce flux de travail est simple et puissant pour la surveillance en temps réel et la détection des anomalies dans des systèmes complexes.
Deux chemins d’accès de bout en bout sont disponibles et vous pouvez choisir en fonction de la complexité de votre scénario :
- Détection des anomalies native à Eventhouse sur les données en temps réel : exécutez la détection des anomalies directement sur des données en continu et des données historiques dans les tables Eventhouse, sans entraînement personnalisé ni configuration de modèle. Commencez par ce chemin lorsque les modèles intégrés répondent à vos besoins et que vous souhaitez obtenir le chemin le plus simple pour obtenir des insights.
- Détection multivariée personnalisée à l’aide d’un modèle entraîné dans un notebook : utilisez le package Python basé sur GAT décrit dans cet article pour entraîner un modèle personnalisé dans un notebook sur des données historiques, puis évaluer en temps réel de nouvelles données en streaming via Eventhouse et KQL. Choisissez ce chemin lorsque vous avez besoin d’un algorithme sur mesure ou d’un scénario spécialisé que les modèles natifs ne couvrent pas.
Détection native des anomalies dans Eventhouse
Eventhouse prend en charge la détection d’anomalies natives sur des tables actives, ce qui vous permet d’analyser les données de streaming et d’historique directement sans déplacer de données ni entraîner un modèle personnalisé. Utilisez cette option lorsque vous avez besoin d’un démarrage rapide avec des algorithmes intégrés ; choisissez le chemin d’accès multivarié personnalisé qui suit lorsque vous avez besoin d’un algorithme personnalisé ou d’une configuration spécialisée.
Composants de la solution
Cette solution s’appuie sur les composants suivants :
- Eventhouse : les données sont initialement ingérées dans un Eventhouse, qui est un moteur de traitement des données en temps réel qui peut gérer des flux de données à débit élevé.
- OneLake : Les données de l’Eventhouse sont exposées dans OneLake, qui est une couche de stockage persistante partagée qui fournit une vue unifiée des données.
- Package de détection d’anomalies multivarié : la solution utilise le package Python détecteur d’anomalies de série chronologique, implémentant un algorithme avancé basé sur un réseau d’attention au graphique (GAT) qui capture les corrélations entre différentes séries chronologiques et détecte les anomalies en temps réel. Le modèle GAT est formé sur des données historiques pour apprendre les relations entre différentes séries chronologiques. Le modèle entraîné peut être appliqué pour prédire les anomalies aux nouvelles données de diffusion en continu. Notez que cet algorithme est celui utilisé dans le service Détecteur d’anomalies IA en cours de mise hors service. Pour plus d’informations sur l’algorithme, consultez le blog et le document.
- Fabric notebooks : utilisé pour l'apprentissage hors connexion du modèle de détection d'anomalies sur les données historiques et pour stocker le modèle entraîné dans le registre des modèles MLflow de Fabric. Les notebooks prennent en charge KQL, T-SQL, Python et Spark dans le même espace de travail, ce qui permet l’exploration unifiée, les transformations, l’entraînement (pour les modèles personnalisés) et la validation des anomalies sur les mêmes données sauvegardées par Eventhouse.
- Ensemble de requêtes KQL : utilisé pour la prédiction en temps réel des anomalies sur les données entrantes.
- Point de terminaison d’analyse SQL : expose une surface T-SQL managée alignée sur le modèle de données Eventhouse. Vous pouvez interroger les anomalies détectées et les métriques associées à l’aide de T-SQL pour l’analytique en aval et l’intégration à des outils décisionnels ou de création de rapports sous Fabric gouvernance.
- Intégration des agents de données : les anomalies détectées dans Eventhouse peuvent être exploitées par les agents de données Fabric afin d’analyser des signaux en temps réel et historiques. La combinaison de la détection d’anomalies avec des agents de données permet l’analytique conversationnelle et les flux de travail automatisés sur les mêmes données Eventhouse.