Comment fonctionne Azure Data Explorer

Azure Data Explorer offre des performances inégalées pour l’ingestion et l’interrogation des données de télémétrie, journaux, événements, traces et données de série chronologique. Il propose des formats de stockage optimisés, des index et utilise des statistiques de données avancées pour une planification efficace des requêtes et une exécution de requête compilée juste-à-temps.

Stockage et calcul

Azure Data Explorer sépare le stockage et les ressources de calcul. Les données persistantes résident dans Stockage Blob Azure, tandis que les ressources de calcul peuvent stocker des données temporaires ou agir en tant que cache pour le stockage persistant.

Cette séparation offre les avantages suivants :

  • Mise à l’échelle indépendante des ressources de stockage et de calcul.
  • Accessibilité aux données identiques sur plusieurs clusters de calcul. Pour plus d’informations, consultez Partage de données.
  • Optimisation du SKU. Pour plus d’informations, consultez Sélectionner une référence SKU pour votre cluster.

Stockage des données

Azure Data Explorer partitionne toutes les données ingérées dans des étendues ou des partitions de données, qui sont des tranches horizontales de la table cible. Une étendue peut initialement ne contenir qu’un seul enregistrement. À mesure que les données s’accumulent dans la table, Azure Data Explorer fusionne automatiquement les étendues jusqu’à ce qu’elles atteignent des millions d’enregistrements. Chaque extension est encodée et indexée indépendamment d’autres étendues. Cette fonctionnalité contribue à une mise à l’échelle linéaire du débit d’ingestion.

Les étendues sont réparties uniformément entre les nœuds de cluster, où elles sont mises en cache à la fois sur le disque SSD local et en mémoire. Cette distribution améliore la capacité de préparation et d’exécution de requêtes hautement distribuées et parallèles.

Pour plus d’informations sur le stockage de données, consultez vue d’ensemble des étendues.

Remarque

Azure Data Explorer conserve également les métadonnées essentielles telles que les schémas de table et les objets de stratégie. Pour obtenir la liste des stratégies, consultez Vue d’ensemble des stratégies.

Cache de données

Azure Data Explorer utilise un système de cache de données à plusieurs niveaux pour conserver les données les plus pertinentes aussi près que possible du processeur. Ce système de cache s’appuie sur l’immuabilité des étendues et fonctionne entièrement avec les données compressées. Pour améliorer les performances des requêtes, les données restent compressées même dans la RAM et ne sont compressées que lorsqu’une requête en a besoin.

Pour plus d’informations sur la mise en cache, consultez Stratégie de cache.

Indexation de texte

Azure Data Explorer est conçu pour indexer efficacement les colonnes de texte libre (chaîne) et de type JSON (dynamique) lors de l’ingestion des données. Les index conservent un niveau de granularité qui permet l’évaluation des parties de la requête en fonction de l’index sans analyser les données.

L’optimisation continue des étendues en arrière-plan grâce à la fusion améliore la compression et l’indexation, ce qui garantit un stockage efficace et une faible latence des requêtes. Une fois que les étendues atteignent une certaine taille, seuls les index se fusionnent pour améliorer les performances des requêtes sans nuire à l’efficacité.

Pour plus d’informations sur l’étendue et la fusion d’index, consultez Stratégie de fusion.

Magasin de lignes

Azure Data Explorer offre une solution de stockage intermédiaire appelée stockage en lignes. Le stockage en lignes permet l’ingestion efficace de petits volumes de données et garantit que ces données sont immédiatement disponibles pour les requêtes. Lorsque vous activez l’ingestion en continu sur votre cluster, les données sont d’abord ingérées dans le stockage en lignes, puis déplacées vers des segments en stockage en colonnes.

Pour plus d’informations, consultez Ingestion par lots et de streaming.

Compression de colonne

Azure Data Explorer gère les données dans un état compressé, ce qui réduit la quantité de mémoire requise pour stocker et traiter les données. Ce comportement entraîne des performances de requête plus rapides et une utilisation plus efficace des ressources système.

Azure Data Explorer évite la compression verticale, ce qui implique le tri des données pour améliorer la compression, en raison de son coût processeur élevé dans les scénarios de données de texte libre ou semi-structuré. Au lieu de cela, vous pouvez spécifier l’ordre de tri de données préféré pour les scénarios avec des modèles de requête dominants. Ce compromis privilégie la disponibilité rapide des données pour les requêtes.

Pour plus d’informations sur la définition de l’ordre de tri des données, consultez la stratégie d’ordre des lignes.

Requête de données distribuées

Azure Data Explorer utilise la technologie de requête de données distribuées destinée à une analytique ad hoc rapide sur de grands jeux de données non structurés. Les principales fonctionnalités de cette technologie sont les suivantes :

  • Les données temporaires générées par une requête sont stockées dans la RAM agrégée.
  • Les étendues pertinentes sont indiquées dans un plan de requête, garantissant une isolation par instantané.
  • Les requêtes rapides et efficaces sont classées par ordre de priorité avec des délais d’attente par défaut courts.
  • Prise en charge native des requêtes entre clusters qui réduit l’échange de données entre clusters.
  • Les requêtes sont compilées juste-à-temps en code machine hautement efficace, à l’aide de statistiques de données de toutes les étendues et adaptées aux spécificités d’encodage de colonne.

Remarque

Azure Data Explorer est conçu pour fonctionner avec le Kusto Query Language (KQL), spécialement conçu pour Azure Data Explorer. En outre, T-SQL est pris en charge.