Transformations de flux de données de mappage dans dataflow gen2 (préversion)

Important

Les transformations de flux de données de mappage dans dataflow gen2 sont actuellement en préversion publique et sont sujettes à modification.

Les transformations MDF (Mappage de flux de données) dans dataflow gen2 vous permettent de créer, d’exécuter et de surveiller des transformations de données basées sur Spark directement dans Data Factory dans Microsoft Fabric.

Les transformations MDF intègrent les fonctionnalités d’Azure Data Factory et des Mapping Data Flows d’Azure Synapse Analytics dans Microsoft Fabric grâce à une expérience de création visuelle low-code familière intégrée à Dataflow Gen2.

Avec les transformations MDF, vous pouvez :

  • Migrez des pipelines de flux de données de Azure Data Factory et de Azure Synapse Analytics existants vers Fabric.
  • Créez des transformations basées sur Spark directement dans Fabric.
  • Exécutez des transformations MDF à l’aide des pipelines de données Fabric.
  • Surveillez l’exécution de la transformation à l’aide d’expériences de supervision intégrées.
  • Continuez à utiliser des modèles de transformation familiers de Mapping Data Flow dans Fabric.

Que sont les transformations dans le flux de données de mappage ?

Les transformations MDF enrichissent Dataflow Gen2 de capacités de transformation basées sur Spark pour les charges de travail de préparation et de transformation des données à grande échelle.

Les transformations MDF fournissent :

  • Expérience de création visuelle à faible code
  • Exécution basée sur Spark
  • Orchestration intégrée via des pipelines Fabric
  • Informations sur la surveillance et l’exécution directement dans Fabric

Utilisez des transformations MDF pour :

  • Migrez des pipelines de flux de données de Azure Data Factory ou de Azure Synapse Analytics existants vers Fabric.
  • Créez des pipelines de transformation basés sur Spark en mode natif dans Fabric.

Les transformations MDF s’intègrent entièrement à Dataflow Gen2 et offrent une expérience de création familière similaire à celle d’Azure Data Factory et des flux de données de mappage d’Azure Synapse Analytics.

Capture d’écran de l’expérience de création de transformation de flux de données de mappage incorporée dans un canevas gen2 de dataflow dans Microsoft Fabric.

Scénarios pris en charge

Les transformations MDF prennent actuellement en charge les scénarios suivants.

Migrer des flux de données de mappage existants

Vous pouvez migrer des flux de données de Azure Data Factory et de mappage de Azure Synapse Analytics existants vers Fabric à l’aide de l’expérience de migration intégrée Azure Data Factory/Synapse Analytics.

Capture d’écran de l’expérience de migration Azure Data Factory pour la mise à niveau des pipelines de flux de données de mappage vers Fabric.

Pendant la migration :

  1. Les flux de données de mappage sont convertis en transformations MDF dans dataflow gen2.
  2. Les pipelines et la logique de transformation sont migrés ensemble.
  3. Les transformations MDF s’ouvrent dans le canevas de transformation intégré de dataflow gen2.
  4. La logique de transformation existante peut continuer à être créée, validée, exécutée et surveillée dans Fabric.

Créer de nouvelles transformations de flux de données avec mappage dans Fabric

Vous pouvez également créer des transformations MDF directement dans dataflow gen2. Cette expérience vous permet de :

  • Générez des transformations basées sur Spark à l’aide d’une interface visuelle.
  • Utilisez les fonctionnalités de transformation familières de Mapping Data Flow.
  • Exécutez des transformations avec les pipelines de données Fabric.
  • Surveillez l’exécution par le biais d’expériences de supervision intégrées.

Prerequisites

Avant d’utiliser des transformations MDF dans dataflow gen2, vérifiez que les conditions préalables suivantes sont remplies :

  • Une capacité Fabric.
  • Autorisations de contributeur ou de niveau supérieur pour l’espace de travail Fabric.
  • Connexions Fabric existantes pour les sources de données prises en charge.
  • (Facultatif) Un espace de travail Azure Data Factory ou Azure Synapse Analytics existant, si vous utilisez des scénarios de migration.

Limitations

Les fonctionnalités suivantes ne sont actuellement pas prises en charge en préversion publique :

Domaine Limitation
Flowlets Non pris en charge.
bibliothèque Data Flow Non pris en charge.
Fonctions définies par l’utilisateur (UDF) Non pris en charge.
Exécution du flux de données Les transformations MDF ne peuvent être exécutées que par le biais de l’activité de flux de données du pipeline. L’exécution directe à partir de dataflow gen2 n’est actuellement pas prise en charge. Seule l’action Enregistrer est disponible dans le menu Enregistrer et exécuter .
Réseau virtuel managé La prise en charge de Managed Réseau virtuel (Managed VNet) n'est pas disponible dans le cadre de cette préversion.
Exécution du runtime L’exécution des transformations MDF utilise actuellement l’environnement d’exécution Synapse Spark sous-jacent, comme Azure Data Factory et les flux de données de mappage d’Azure Synapse Analytics.
Parité des fonctionnalités Toutes les fonctionnalités de mappage Data Flow ne sont pas disponibles dans cette préversion.

Connecteurs pris en charge

Les transformations de flux de données de mappage (MDF) prennent en charge la plupart des connecteurs de source et de destination couramment utilisés disponibles dans Azure Data Factory et dans les flux de données de mappage d’Azure Synapse Analytics.

Les connecteurs suivants sont actuellement pris en charge :

Catégorie Magasin de données Transformations MDF dans dataflow gen2 (source/récepteur) Types d’authentification pris en charge
Azure Service de stockage Blob Azure ✓/✓ De base, Identité managée / Identité de l’espace de travail, Principal de service
Azure Cosmos DB pour NoSQL ✓/✓ Basic
Explorateur de données Azure ✓/✓ Identité managée / Identité de l’espace de travail
Azure Data Lake Storage Gen1 ✓/✓ De base, Identité managée / Identité de l’espace de travail, Principal de service
Azure Data Lake Storage Gen2 ✓/✓ De base, Identité managée / Identité de l’espace de travail, Principal de service
Base de données Azure pour MySQL ✓/✓ Basic
Base de données Azure pour PostgreSQL ✓/✓ Basic
Azure Databricks Delta Lake ✓/✓ Utiliser le format Delta Basic
Azure SQL Database ✓/✓ De base, Identité managée / Identité de l’espace de travail, Principal de service
Azure SQL Managed Instance (Instance gérée Azure SQL) ✓/✓ De base, Identité managée / Identité de l’espace de travail, Principal de service
Azure Synapse Analytics ✓/✓ Basic
Base de données Snowflake ✓/✓ Basic
File Amazon S3 ✓/✓ Basic
SFTP ✓/✓ Basic
REST générique ✓/✓ De base, Service Principal

Pendant la rédaction :

  • Les connexions Fabric existantes peuvent être réutilisées.
  • Vous pouvez créer de nouvelles connexions directement à partir de l’expérience de création à l’aide de l’expérience Obtenir des données .
  • La configuration de la source et de la sortie reprend les modèles habituels des flux de données de mappage.

Transformations prises en charge

Les transformations MDF offrent une expérience familière de transformation visuelle à faible code pour créer des pipelines de transformation de données spark évolutifs dans Fabric.

Les transformations suivantes sont actuellement prises en charge :

Nom Catégorie Description
Agrégat Modificateur de schéma Définissez des agrégations telles que SUM, MIN, MAX et COUNT regroupées par colonnes existantes ou calculées.
Ligne Alter Modificateur de ligne Définissez des politiques d’insertion, de suppression, de mise à jour ou d’insertion, pour les lignes.
Assert Modificateur de ligne Définissez des règles d’assertion pour les lignes du flux de données.
Cast Modificateur de schéma Modifiez les types de données des colonnes avec vérification du type.
Fractionnement conditionnel Entrées/sorties multiples Acheminer les lignes vers différents flux en fonction des conditions correspondantes.
Colonne dérivée Modificateur de schéma Générez de nouvelles colonnes ou modifiez des champs existants à l’aide d’expressions.
Appel externe Modificateur de schéma Appelez des terminaux externes en ligne pour chaque ligne.
Exists Entrées/sorties multiples Vérifiez si des données existent dans une autre source ou un autre flux.
Filtrer Modificateur de ligne Filtrez les lignes en fonction des conditions.
Aplatir Outils de formatage Aplatir des structures hiérarchiques telles que des tableaux JSON en lignes.
Join Entrées/sorties multiples Combinez les données de deux sources ou flux.
Recherche Entrées/sorties multiples Données de référence à partir d’une autre source ou d’un autre flux.
Nouvelle branche Entrées/sorties multiples Appliquez plusieurs chemins de transformation sur le même flux.
Parse Outils de formatage Analyser des chaînes au format JSON, texte délimité ou XML.
Ajouter un tableau croisé dynamique Modificateur de schéma Transformez des valeurs de ligne distinctes en colonnes.
Rank Modificateur de schéma Générez des classements ordonnés en fonction des conditions de tri.
Sélectionnez Modificateur de schéma Renommez, réorganisez ou supprimez des colonnes.
Récepteur - Définissez la destination pour les données transformées.
Trier Modificateur de ligne Triez les lignes dans le flux de données actuel.
Source - Définissez la source du flux de données.
Stringify Outils de formatage Convertissez des types complexes en valeurs de chaîne.
Clé de substitution Modificateur de schéma Générez des valeurs de clé de substitution incrémentées.
Union Entrées/sorties multiples Combinez plusieurs flux de données verticalement.
Supprimer le tableau croisé dynamique Modificateur de schéma Transformez des colonnes en valeurs de ligne.
Fenêtre Modificateur de schéma Définissez des agrégations basées sur des fenêtres sur des flux de données.

Créer une transformation de mappage de flux de données dans Dataflow Gen2

Pour créer une nouvelle transformation MDF dans Fabric :

  1. Ouvrez votre espace de travail Fabric.

  2. Sélectionnez Nouvel élément.

  3. Sélectionnez Dataflow Gen2.

  4. Fournissez un nom pour l’élément de dataflow gen2, puis sélectionnez Créer.

  5. Dans le canevas gen2 du flux de données, utilisez l’une des options suivantes :

    • Sélectionnez Exécuter les transformations du flux de données de mappage dans le groupe d’actions Nouveau du ruban Accueil de Dataflow Gen2.
    • Sélectionnez la vignette Exécuter les transformations du flux de données de mappage (flux de données de mappage ADF) dans le canevas.

    Capture d’écran montrant l’option de création d’une transformation de flux de données de mappage à partir du ruban dataflow gen2 dans Microsoft Fabric.

    Capture d’écran montrant l’option permettant de créer une transformation d’un flux de données de mappage à partir de la vignette du canevas Dataflow Gen2 dans Microsoft Fabric.

Une nouvelle action de transformation MDF s’affiche sur le canevas gen2 du flux de données et ouvre l’expérience de création de transformation MDF incorporée.

Tip

L’expérience de création de transformations MDF utilise une interface visuelle familière, semblable à celle d’Azure Data Factory et d’Azure Synapse Analytics Mapping Data Flows.

Créer des transformations de flux de données de mappage

Après avoir créé une transformation MDF, vous pouvez commencer à créer une logique de transformation.

Activer le mode débogage

Pour la création interactive et la préversion des données :

  1. Activez l’interrupteur Data flow debug dans la barre d’outils flottante.
  2. Attendez que la session de débogage s’initialise.
  3. Une fois activé, vous pouvez afficher un aperçu des données de source et de transformation lors de la création.

Capture d’écran du canevas de transformation du flux de données de mappage avec le mode de débogage du flux de données activé.

Note

Les sessions de débogage peuvent prendre plusieurs minutes pour initialiser en fonction de la disponibilité du runtime Spark.

Ajouter une source

Pour configurer une source :

  1. Sélectionnez Ajouter une source.
  2. Sélectionnez le type de connexion.
  3. Sélectionnez une connexion Fabric existante ou créez des connexions directement via l’expérience Obtenir des données si nécessaire.
  4. Parcourez et sélectionnez le fichier source, la table ou le jeu de données.

Capture d’écran des paramètres de configuration source dans l’expérience de création de transformation de flux de données de mappage.

Après avoir configuré la connexion source et le jeu de données, utilisez l’onglet Aperçu des données pour valider et afficher un aperçu des données sources pendant la création interactive.

Capture d’écran de l’onglet Aperçu des données montrant les données sources dans l’expérience de création de transformation de flux de données de mappage.

Ajouter des transformations

Pour ajouter des transformations :

  1. Sélectionnez l’icône + à côté d’une source ou d’une transformation.
  2. Sélectionnez le type de transformation.
  3. Configurez les paramètres de transformation.

Vous pouvez continuer à générer une logique de transformation à l’aide du canevas de transformation visuelle.

Capture d’écran du graphique de transformation visuel dans l’interface de création de transformations de flux de données de mappage.

Configuration d’un puits de données

Une fois la logique de transformation terminée :

  1. Ajoutez une transformation du récepteur.
  2. Configurez la connexion de destination.
  3. Configurez les paramètres d’écriture.

Capture d’écran de la configuration de la transformation de récepteur dans l’interface de création des transformations du flux de données de mappage.

Valider et enregistrer

Avant l’exécution :

  1. Sélectionnez Valider dans la barre d’outils de transformation MDF.

    Capture d’écran du bouton Valider dans la barre d’outils de transformation du flux de données de mappage.

  2. Résolvez les problèmes de validation s’ils sont signalés.

  3. Sélectionnez Enregistrer dans le menu Enregistrer et exécuter .

    Capture d’écran de l’option Enregistrer dans le menu Enregistrer et exécuter pour une transformation de flux de données de mappage.

Note

Seule l’action Enregistrer est actuellement prise en charge pour les flux de données Gen2 avec des transformations MDF en aperçu public.

Exécuter des transformations de flux de données avec mappage à l’aide des pipelines Fabric

Vous exécutez des transformations MDF par le biais des pipelines de données Fabric à l’aide d’une activité de flux de données.

Pour exécuter une transformation MDF :

  1. Créez un nouveau pipeline dans Fabric.
  2. Ajoutez une activité dataflow au pipeline.
  3. Dans les paramètres d’activité, sélectionnez l’élément dataflow gen2 contenant la transformation MDF.
  4. Sélectionnez la requête de transformation MDF à exécuter.
  5. Configurez les paramètres d’exécution Spark en fonction des besoins.
  6. Validez et publiez le pipeline.
  7. Exécutez le pipeline manuellement ou configurez une planification ou des déclencheurs.

Capture d’écran d’un pipeline Fabric avec une activité de flux de données configurée pour exécuter une transformation de flux de données avec mappage.

Configurer les paramètres du runtime Spark

Les transformations MDF s’exécutent à l’aide du runtime Spark managé intégré à Data Factory dans Microsoft Fabric. Vous pouvez configurer les paramètres d’exécution Spark pendant l’exécution du pipeline, notamment :

  • Dimensionnement du calcul
  • Propriétés du puits

Capture d’écran des paramètres de configuration du runtime Spark pour une activité dataflow dans un pipeline Fabric.

Surveiller les exécutions des transformations de flux de données de mappage

Vous pouvez surveiller l’exécution d’une transformation MDF par :

  • Volet de sortie du pipeline

    Capture d’écran du volet de sortie du pipeline montrant les résultats d’exécution des transformations du flux de données de mappage.

  • Hub de surveillance

    Capture d’écran du Hub de surveillance montrant les exécutions d’activité pour une exécution de transformation de flux de données de mappage.

Pour afficher les détails de la surveillance :

  1. Ouvrez les détails de l’exécution du pipeline.
  2. Sélectionnez l’activité Dataflow dans Exécutions d’activité.
  3. Consultez l’état de l’exécution et les détails du temps d’exécution.

Capture d’écran de la page de surveillance de la transformation de flux de données de mappage montrant l’état d’exécution et les détails de l’exécution.