Obtenir des données à partir de stockage Azure

Dans cet article, vous allez découvrir comment importer des données à partir d’stockage Azure (conteneurs Azure Data Lake Storage Gen2, conteneurs Blob ou objets blob individuels) dans une table d’une base de données KQL. Vous pouvez ingérer des données en continu ou via une ingestion unique. Une fois l’ingestion terminée, les données sont disponibles pour la requête.

  • Ingestion continue (préversion) : l’ingestion continue configure un pipeline d’ingestion qui permet à un eventhouse d’écouter les événements stockage Azure. Le pipeline informe le centre d'événements de récupérer des informations lorsque des événements souscrits se produisent. Les événements sont BlobCreated et BlobRenamed.

  • Ingestion unique : utilisez cette méthode pour récupérer des données de le stockage Azure en une seule fois.

    Remarque

Conditions préalables

Prérequis pour l’ingestion continue

Dans Azure :

  • Registrer le fournisseur de ressources Event Grid avec votre abonnement Azure.
  • Attribuez les autorisations du rôle Lecteur de données Blob de stockage à l’identité de l’espace de travail.
  • Créez un conteneur d’objets blob pour contenir les fichiers de données.
    • Chargez un fichier de données. La structure de fichiers de données est utilisée pour définir le schéma de table. Pour plus d’informations, consultez formats de données pris en charge par Real-Time Intelligence.

      Remarque

      Vous devez charger un fichier de données :

      • Avant la configuration nécessaire pour définir le schéma de la table lors de l'installation.
      • Après la configuration pour déclencher l’ingestion continue, pour afficher un aperçu des données et vérifier la connexion.

      Remarque

      L’ingestion continue à partir de stockage Azure est également prise en charge lorsque le compte de stockage est configuré avec des points de terminaison privés (Private Link). Assurez-vous que l’espace de travail Fabric peut accéder au compte de stockage via le chemin d’accès réseau privé configuré.

Ajouter l’attribution de rôle d’identité d’espace de travail au compte de stockage

  1. À partir des paramètres de l’espace de travail dans Fabric, copiez votre ID d’identité d’espace de travail.

    Capture d’écran du paramètre d’espace de travail, avec l’ID de l’espace de travail mis en surbrillance.

  2. Dans le portail Azure, accédez à votre compte stockage Azure, puis sélectionnez Access Control (IAM)>Add>Add role assignment.

  3. Sélectionnez Lecteur de données de stockage Blob.

  4. Dans la boîte de dialogue Ajouter une attribution de rôle , sélectionnez + Sélectionner des membres.

  5. Collez l’ID d’identité de l’espace de travail, sélectionnez l’application, puis sélectionnez>Vérifier + affecter.

Créer un conteneur d’objets blob et charger un fichier de données

  1. Dans le compte de stockage, sélectionnez Conteneurs.

  2. Sélectionnez + Conteneur, entrez un nom pour le conteneur, puis sélectionnez Enregistrer.

  3. Entrez le conteneur, sélectionnez charger et charger le fichier de données préparé précédemment.

    Pour plus d’informations, consultez les formats pris en charge et les compressions prises en charge.

  4. Dans le menu contextuel, [...], sélectionnez Propriétés du conteneur et copiez l’URL à entrer pendant la configuration.

    Capture d’écran de la liste de conteneurs avec le menu contextuel ouvert et l’option Propriétés du conteneur mise en surbrillance.

Sélectionnez stockage Azure comme source de données

Ouvrez le flux Get Data et sélectionnez stockage Azure comme source.

  1. Dans votre espace de travail, ouvrez l’eventhouse, puis sélectionnez la base de données.

  2. Dans le ruban de base de données KQL, sélectionnez Obtenir des données.

  3. Sélectionnez la source de données dans la liste disponible. Dans cet exemple, vous ingérerez des données à partir de stockage Azure.

    Capture d'écran des vignettes de récupération de données avec l’option de stockage Azure mise en surbrillance.

Configurer

  1. Sélectionnez une table de destination. Pour ingérer des données dans une nouvelle table, sélectionnez + Nouvelle table et entrez un nom de table.

    Remarque

    Les noms de tables peuvent comporter jusqu’à 1 024 caractères, y compris des espaces, des caractères alphanumériques, des traits d’union et des traits de soulignement. Les caractères spéciaux ne sont pas pris en charge.

  2. Dans Configurer Stockage Blob Azure connexion, vérifiez que l’ingestion continue est activée. Elle est activée par défaut.

  3. Configurez la connexion en créant une connexion ou en utilisant une connexion existante.

    Pour créer une connexion :

    1. Sélectionnez Se connecter à un compte de stockage.

      Capture d’écran de l’onglet Configurer avec ingestion continue et connexion à un compte sélectionné.

    2. Utilisez les descriptions suivantes pour vous aider à renseigner les champs.

      Paramètre Description du champ
      Abonnement Abonnement au compte de stockage.
      Compte de stockage d’objets blob Nom du compte de stockage.
      Conteneur Conteneur de stockage contenant le fichier que vous souhaitez ingérer.
    3. Dans le champ Connexion , ouvrez la liste déroulante et sélectionnez + Nouvelle connexion, puis sélectionnez Enregistrer>fermer. Les paramètres de connexion sont préremplis.

    Remarque

    Lorsque vous créez une connexion, vous créez également un flux d’événements. Le nom est défini en tant que <storage_account_name>_eventstream. Ne supprimez pas le flux d’événements d’ingestion continu de l’espace de travail.

    Pour utiliser une connexion existante :

    1. Sélectionnez Sélectionner un compte de stockage existant.

      Capture d’écran de l’onglet Configurer avec ingestion continue et connexion à un compte existant sélectionné.

    2. Utilisez les descriptions suivantes pour vous aider à renseigner les champs.

      Paramètre Description du champ
      RTAStorageAccount Flux d’événements connecté à votre compte de stockage à partir de Fabric.
      Conteneur Conteneur de stockage contenant le fichier que vous souhaitez ingérer.
      Connexion Ce champ est prérempli avec le chaîne de connexion.
    3. Dans le champ Connection, ouvrez la liste déroulante et sélectionnez le chaîne de connexion existant dans la liste. Sélectionnez Ensuite Enregistrer>fermer.

  4. Si vous le souhaitez, développez les filtres de fichier et spécifiez les filtres suivants :

    Paramètre Description du champ
    Chemin d’accès au dossier Filtrez les données pour ingérer des fichiers avec un chemin d’accès de dossier spécifique.
    Extension de fichier Filtrez les données pour ingérer des fichiers avec une extension de fichier spécifique uniquement.
  5. Dans la section Paramètres Eventstream, sélectionnez les événements à surveiller dans lestypes d’événements>. Par défaut, le blob créé est sélectionné. Vous pouvez également sélectionner Blob renommé.

    Capture d’écran des paramètres avancés avec la liste déroulante Types d’événements développée.

  6. Sélectionnez Suivant pour afficher un aperçu des données.

Inspecter les données d’aperçu avant l’ingestion

L’onglet Inspecter s’ouvre avec un aperçu des données.

Pour terminer le processus d’ingestion, sélectionnez Terminer.

Capture d’écran de l’onglet Inspecter montrant un aperçu des données ingérées avant de sélectionner Terminer.

Remarque

Pour déclencher l’ingestion continue et afficher un aperçu des données, chargez un nouvel objet blob une fois la configuration terminée.

Optionnellement:

  • Utilisez la liste déroulante du fichier de définition de schéma pour modifier le fichier à partir duquel le schéma est déduit.

  • Utilisez la liste déroulante type de fichier pour explorer les options avancées en fonction du type de données.

  • Utilisez la liste déroulante Table_mapping pour définir un nouveau mappage.

  • Sélectionnez </> pour ouvrir la visionneuse de commandes pour afficher et copier les commandes automatiques générées à partir de vos entrées. Vous pouvez également ouvrir les commandes dans un ensemble de requêtes KQL.

  • Sélectionnez l’icône de crayon pour modifier les colonnes.

Modifier les colonnes

Remarque

  • Pour les formats tabulaires (CSV, TSV, PSV), vous ne pouvez pas mapper une colonne deux fois. Pour mapper à une colonne existante, commencez par supprimer la nouvelle colonne.
  • Vous ne pouvez pas modifier un type de colonne existant. Si vous essayez de mapper à une colonne avec un format différent, vous risquez de vous retrouver avec des colonnes vides.

Les modifications que vous pouvez apporter dans une table dépendent des paramètres suivants :

  • Le type de la table est nouveau ou existant
  • Si le type du mappage est nouveau ou existant
Type de la table Type de mappage Ajustements disponibles
Nouvelle table Nouveau mappage Renommer une colonne, modifier le type de données, modifier la source de données, transformation de mappage, ajouter une colonne, supprimer une colonne
Table existante Nouveau mappage Ajouter une colonne (sur laquelle vous pouvez ensuite modifier le type de données, renommer et mettre à jour)
Table existante Cartographie existante aucun

Capture d’écran de l’éditeur de colonnes avec des colonnes de table ouvertes pour modifier les noms, les types de données et les mappages.

Transformations de cartographie

Certains mappages de format de données (Parquet, JSON et Avro) permettent des transformations simples lors de l'ingestion. Pour appliquer des transformations de mappage, créez ou mettez à jour une colonne dans la fenêtre Modifier les colonnes.

Les transformations de mappage peuvent être effectuées sur une colonne de type chaîne ou datetime, avec la source ayant un type de données int ou long. Pour plus d’informations, consultez la liste complète des transformations de mappage prises en charge.

Options avancées basées sur le type de données

Tabulaire (CSV, TSV, PSV) :

  • Si vous ingérez des formats tabulaires dans une table existante, vous pouvez sélectionner Avancé>Conserver le schéma de table. Les données tabulaires n’incluent pas nécessairement les noms de colonnes utilisés pour mapper les données sources aux colonnes existantes. Lorsque cette option est cochée, le mappage est effectué par ordre et le schéma de table reste le même. Si cette option n’est pas cochée, de nouvelles colonnes sont créées pour les données entrantes, quelle que soit la structure des données.

    Capture d’écran des options avancées.

  • Les données tabulaires n’incluent pas nécessairement les noms de colonnes utilisés pour mapper les données sources aux colonnes existantes. Pour utiliser la première ligne comme noms de colonnes, sélectionnez La première ligne est l’en-tête de colonne.

    Capture d’écran montrant que la première ligne est un commutateur d’en-tête de colonne.

Tabulaire (CSV, TSV, PSV) :

  • Si vous ingestionnez des formats tabulaires dans une table existante, sélectionnez Table_mapping>Utiliser un schéma existant. Les données tabulaires n’incluent pas nécessairement les noms de colonnes utilisés pour mapper les données sources aux colonnes existantes. Lorsque vous sélectionnez cette option, le mappage est effectué par ordre, et le schéma de table reste le même. Si vous désactivez cette option, de nouvelles colonnes sont créées pour les données entrantes, quelle que soit la structure des données.

  • Pour utiliser la première ligne en tant que noms de colonnes, sélectionnez Premier en-tête de ligne.

    Capture d’écran des options CSV avancées, y compris les contrôles pour les paramètres d’en-tête et de délimiteur de première ligne.

JSON :

  • Pour déterminer la division de colonnes des données JSON, sélectionnez niveaux imbriqués, de 1 à 100.

    Capture d’écran des options JSON avancées, y compris le paramètre de niveaux imbriqués utilisé pour fractionner des colonnes JSON.

Passer en revue le résumé de l’ingestion

Dans la fenêtre Résumé, toutes les étapes affichent une coche verte lorsque l’ingestion des données se termine avec succès. Vous pouvez sélectionner une carte pour explorer les données, supprimer les données ingérées ou créer un tableau de bord avec des métriques clés.

Capture d'écran de la page de résumé pour l'ingestion continue terminée avec succès.

Lorsque vous fermez la fenêtre, vous pouvez voir la connexion sous l’onglet Explorateur, sous Flux de données. À partir de là, vous pouvez filtrer les flux de données et supprimer un flux de données.

Capture d’écran de l’Explorateur de bases de données KQL avec flux de données mis en surbrillance.