Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Microsoft Fabric Dataflow Gen2 offre plusieurs moyens d’ingérer, transformer et charger les données de manière efficace. Ces méthodes vous aident à équilibrer les performances, l’extensibilité et les coûts.
Cet article est la référence de performance et de coût pour Dataflow Gen2. Il évalue quatre charges de travail courantes — la copie en masse, la transformation poussée des données, les écritures optimisées dans un lakehouse et la combinaison de fichiers partitionnés — et indique le temps d’exécution ainsi que les unités de capacité (CU) consommées par chacune, mesurées à partir de la télémétrie de capacité. Utilisez-le pour estimer le coût de vos propres rafraîchissements et pour choisir la capacité adaptée à chaque charge de travail.
À grande échelle, Dataflow Gen2 surpasse largement Dataflow Gen1 en termes de vitesse et de coût – et plus la charge de travail est importante, plus l’écart s’élargit. En exécutant le même script M, avec les mêmes données et sur la même capacité Fabric, Dataflow Gen2 a achevé chaque test de performance présenté dans cet article 1,7 à 21 fois plus rapidement que la référence Dataflow Gen1. Dans chaque scénario où la consommation de capacité des deux générations a été mesurée, Dataflow Gen2 a réalisé ce travail plus rapide tout en consommant 82% à 95 unités de capacité% moins – donc l’accélération ne se fait pas au prix d’une capacité supplémentaire. Vous obtenez les deux gains ensemble, sans réécrire une seule requête.
Combien vous gagnez dépend de votre charge de travail, et le facteur le plus important est la durée de vos requêtes. Le calcul standard facture les 10 premières minutes de chaque requête à 12 CU pour chaque seconde, puis seulement 1,5 CU pour chaque seconde supplémentaire, donc plus une requête s’exécute, plus son coût moyen par seconde diminue. Un flux de données court se termine dans ce premier niveau et n’atteint jamais le taux moins cher, donc la différence entre les deux générations est faible. Les gains augmentent avec le volume de données et le temps d’exécution, c’est pourquoi les benchmarks de cet article utilisent de grands ensembles de données à fort volume et des mises à jour de longue durée.
Dataflow Gen2 devient également moins coûteux à périmètre égal : les tarifs et capacités actuels réduisent la consommation de CU de 14 % à 84 % selon la charge de travail, par rapport à ce qu’aurait consommé la même charge de travail avant 2026.
Note
Tout au long de cet article, le coût et la capacité sont mesurés en unités de capacité Fabric (CU). Pour savoir comment Dataflow Gen2 consomme les CU et comment cela correspond à la facturation, voir Dataflow Gen2 tarification. Ces benchmarks et chiffres CU reflètent le modèle et les capacités actuels de tarification Dataflow Gen2, incluant la tarification standard de calcul par paliers, la copie rapide et l’évaluateur moderne. Parce que les performances et l’efficacité des coûts de Dataflow Gen2 se sont améliorées au fil du temps, les chiffres publiés avant 2026 pourraient ne pas refléter le comportement actuel.
Les fonctionnalités suivantes vous aident à optimiser vos flux de données :
- Copie rapide – Accélérez le déplacement massif des données avant la transformation.
- Évaluateur moderne : Accélérez le modelage de données lourdes sur des requêtes non repliables.
- Requêtes intermédiaires : placez les données dans une couche intermédiaire avant d’appliquer des transformations, en activant les modèles ELT.
- Copie optimisée vers Lakehouse – Accélérer l’écriture de données en étapes vers une destination de lakehouse dans les charges de travail ELT.
- Partitioned Compute (Preview) – Transformations à l’échelle à travers de grands ensembles de données et partitionnés.
Cet article traite des cas d’usage courants, des exemples concrets et des résultats de benchmarking pour vous aider à choisir la capacité adaptée à votre charge de travail.
Dataflow Gen2 facture chaque moteur séparément, aux taux actuels suivants :
- Calcul standard (requêtes du moteur mashup) - 12 CU pour chaque seconde jusqu’à 10 minutes de chaque requête, puis 1,5 CU pour chaque seconde supplémentaire.
- Copie rapide (déplacement des données) - 1,5 CU pour chaque seconde d’activité de copie, mesurée sur tous les cœurs utilisés.
Pour le modèle complet de taux, voir tarification Dataflow Gen2.
Référence rapide
Faire correspondre votre charge de travail à la fonctionnalité Dataflow Gen2 appropriée. Pour obtenir un exemple de benchmark de chacun d’eux, consultez le scénario lié.
| Capacité | Utilisez-le quand... | Avantage clé | Point de référence |
|---|---|---|---|
| Copie rapide | Vous avez besoin d’une copie directe à débit élevé à partir d’une source prise en charge sans transformations. | Ingestion plus rapide à moindre coût de calcul. | Scénario 1 : Copier des données |
| Évaluateur moderne | Vous mettez en forme des données à partir de connecteurs non pliables ou partiellement pliables (filtres, dérivations, épuration). | Exécution plus rapide sans modifier la logique. | Scénario 2 : Mise en forme intensive des données |
| Copie optimisée vers Lakehouse | Vous avez activé le staging pour une requête qui écrit dans une destination lakehouse. | Maximise le débit lors de l’écriture des données intermédiaires dans le lakehouse. | Scénario 3 : Copie optimisée vers Lakehouse |
| Calcul partitionné (Aperçu) | Vous transformez des jeux de données volumineux, partitionnés ou multi-fichiers qui peuvent s’exécuter en parallèle. Combinez avec l'évaluateur moderne lorsque cela est pris en charge. | Exécution parallélisée entre les partitions. | Scénario 4 : Combiner les fichiers |
Note
Pour plus d’informations sur l’évaluation des requêtes et le pliage des requêtes, consultez les principes de base du pliage des requêtes.
Résumé des résultats du benchmark
La plupart des scénarios de cet article utilisent le jeu de données New York City Taxi & Limousine Commission (TLC) Trip Data – données d’enregistrement des trajets TLC : des milliards d’enregistrements de trajets en taxi stockés sous forme de fichiers Parquet dans ADLS Gen2, couvrant la période 2021-2025 (jusqu’en août). Le scénario 3 utilise une table d’un lakehouse Fabric contenant environ 113 millions d’enregistrements de trajets en taxi à New York, couvrant la période allant de 2017 à la mi-2018. La destination est une Fabric lakehouse ou un entrepôt, selon le scénario.
Le tableau suivant récapitule les résultats du benchmark dans tous les scénarios. Chaque scénario inclut également une base de référence Dataflow Gen1 pour la comparaison.
| Scénario | Qu’est-ce que cela fait ? | Fonctionnalité activée | Temps d’exécution Gen2 | Accélération par rapport à la ligne de base Gen1 | Gen1 CU | Gen2 CU | Réduction des CU sur Gen2 |
|---|---|---|---|---|---|---|---|
| Scénario 1 : Copier des données | Chargez cinq fichiers Parquet consolidés depuis ADLS Gen2 dans un lakehouse sans effectuer de transformations. | Copie rapide | 00:09:08 | 11× plus vite | 84,411 | 14,593 | 83% |
| Scénario 2 : Mise en forme intensive des données | Appliquez des transformations non pliables (filtres, dérivations, nettoyage) à un seul fichier Parquet volumineux chargé dans un lakehouse. | Évaluateur moderne | 00:46:29 | 1,7× plus vite | 56,855 | 10,485 | 82% |
| Scénario 3 : Copie optimisée vers Lakehouse | Transformez une table des taxis de NYC de 113 millions de lignes provenant d’un lakehouse Fabric et écrivez le résultat dans une table lakehouse via un chemin de copie accéléré. Ce benchmark utilise une copie optimisée vers Lakehouse et V-Order. | Copie optimisée vers Lakehouse | 00:03:34 | 15× plus vite | 50,788 | 2,391 | 95% |
| Scénario 4 : Combiner les fichiers | Combinez et transformez 56 fichiers Parquet partitionnés en parallèle et chargez-les dans un entrepôt. | Calcul partitionné (Aperçu) | 00:04:48 | 21× plus vite | Non mesuré | Non mesuré | Non mesuré |
Le graphique suivant compare les mêmes scénarios par consommation de capacité plutôt que par temps d’exécution.
Pour obtenir des détails pas à pas, des configurations de jeu de données et des modèles de conception pour chaque fonctionnalité, consultez les sections de scénario qui suivent.
Note
Tous les scénarios de cet article ont Modern Evaluator activé et V-Order désactivé, sauf indication contraire explicite. Les colonnes Gen1 CU et Gen2 CU indiquent les secondes de capacité unitaire. La colonne réduction des CU sur Gen2 indique la diminution du nombre de secondes de CU entre la valeur de référence de Dataflow Gen1 et la configuration Dataflow Gen2 la plus performante, calculée comme suit : (Gen1 CU − Gen2 CU) ÷ Gen1 CU.
Comment nous avons mesuré ces références
Chaque scénario exécute le même script M deux fois : une fois sur Dataflow Gen1 pour établir une base, et une fois sur Dataflow Gen2 avec la capacité en test activée.
Chaque exécution dans cet article partage les mêmes conditions de test :
- Tous les scénarios et les deux générations fonctionnaient avec la même capacité Fabric, donc aucun résultat ne reflète une taille de capacité ou un SKU différent.
- Aucune passerelle de données n’a été impliquée. Chaque connexion passait directement du service Fabric à une source de données cloud.
- Chaque scénario utilisait les mêmes données sources et le même script M pour ses exécutions Dataflow Gen1 et Dataflow Gen2.
Les chiffres rapportés signifient les suivants :
- Le temps d’exécution est la durée totale de rafraîchissement rapportée pour l’exécution du flux de données.
- CU consommée correspond aux secondes d’unité de capacité facturées à la capacité pour l’exécution, telles qu’elles sont indiquées dans l’application Microsoft Fabric Capacity Metrics. Comme Dataflow Gen2 facture chaque moteur séparément, le total d’un scénario est la somme de chaque moteur qui a fonctionné lors du rafraîchissement, et les chiffres de CU sont arrondis à la seconde CU entière la plus proche. Pour le modèle complet de taux, voir tarification Dataflow Gen2.
Lorsque vous comparez les deux générations, gardez à l’esprit ces différences architecturales :
- Dataflow Gen1 utilise une architecture fondamentalement différente de Dataflow Gen2, et ne prend pas en charge des fonctionnalités telles que Fast Copy, Modern Evaluator, Optimisation copy to Lakehouse ou Partitioned Compute.
- Dataflow Gen1 ne peut charger que des données sous forme de fichiers CSV, tandis que Dataflow Gen2 charge des données sous forme de fichiers Parquet dans ces scénarios.
Note
Ces chiffres ont été enregistrés dans notre propre environnement de test en août 2026 et ne s’appliquent qu’à ces courses spécifiques. Vos propres résultats varient selon le volume de données, la taille de la capacité et la configuration. Pour mesurer vos propres charges de travail, consultez Calculer les coûts estimés à l’aide de l’application Fabric Metrics et l’historique des rafraîchissements de flux de données.
Scénario 1 : Copier des données
L’équipe d’analyse de NYC Taxi doit charger des millions d’enregistrements bruts de trajets au format Parquet depuis ADLS Gen2 dans un lakehouse Fabric. L’équipe n’a pas besoin de transformations, il suffit d'une copie directe pour prendre en charge les analyses en aval.
Challenges
- Déplacez rapidement de grands volumes de données Parquet dans la maison du lac.
- Réduisez le temps d’ingestion pour les actualisations quotidiennes.
- Réduisez le coût de calcul pour les charges de travail d’extraction simples (EL).
Dataset
Fichiers Parquet des Taxis jaunes de NYC fusionnés par année, cinq partitions unifiées (2021–août 2025).
Solution
L’équipe active la copie rapide dans Dataflow Gen2. La copie rapide optimise les chemins de déplacement des données et parallélise les écritures pour les connecteurs pris en charge.
Design
Cette requête combine les fichiers Parquet de manière annuelle sur cinq années et charge le résultat dans le lakehouse.
Considérations sur la copie rapide
- Prend en charge les formats de fichiers .csv et .parquet.
- Prend en charge jusqu’à 1M de lignes par table par exécution pour Azure SQL Database.
- Mieux adapté aux flux de travail extract-load (EL) avant les transformations.
Results
Lorsque vous activez la copie rapide, Dataflow Gen2 ingère ce jeu de données environ 11 × plus rapidement que la base Dataflow Gen1 (00:09:08 contre 01:38:59) tout en réduisant l’utilisation du calcul. Sans Fast Copy, Dataflow Gen2 est déjà environ 2,8 × plus rapide que Gen1 sur la même charge de travail.
| Configuration | Durée d’exécution (hh :mm :ss) | Comparaison avec Gen1 | CU consommé |
|---|---|---|---|
| Base de référence Dataflow Gen1 | 01:38:59 | — | 84,411 |
| Dataflow Gen2 sans Fast Copy | 00:35:25 | 2,8× plus vite | Non mesuré |
| Dataflow Gen2 avec copie rapide | 00:09:08 | 11× plus vite | 14,593 |
Lorsque vous activez Fast Copy — la configuration Dataflow Gen2 la plus adaptée à ce scénario — l’ingestion Fast Copy du scénario 1 de cinq fichiers Parquet consolidés dans un lakehouse consomme 14 593 secondes de CU. Le tableau suivant décompose ce total par opération :
| Operation | Moteur (compteur) | CU secondes |
|---|---|---|
| Déplacement des données | Copie rapide | 8,280 |
| Exécuter des requêtes | Calcul standard | 6,313 |
| Total | 14,593 |
Le déplacement des données Fast Copy est facturé à un rythme de 1,5 CU pour chaque seconde d’activité de copie, mesuré comme le temps total sur tous les cœurs sur lesquels la copie fonctionne. Dataflow Gen2 ajuste automatiquement le nombre de cœurs utilisés par chaque scénario Fast Copy, de sorte qu’une copie qui se termine rapidement en temps réel peut tout de même consommer un grand nombre de secondes-cœur. Tout temps de requête restant est facturé en Calcul Standard (12 CU pour chaque seconde jusqu’à 10 minutes, puis 1,5 CU pour chaque seconde supplémentaire). Pour le modèle de taux complet, voir tarification Dataflow Gen2.
Points importants à retenir
- L’activation de Fast Copy a réduit une ingestion de 99 minutes en environ neuf minutes, soit une amélioration d’un ordre de grandeur par rapport au même jeu de données et au même script M.
- Dataflow Gen2 utilisait également 83% moins de capacité que Dataflow Gen1 pour le même travail (14 593 contre 84 411 secondes cubes), donc l’accélération ne s’est pas faite au prix d’un calcul supplémentaire.
- L’accélération provient d’un mouvement de données natif, parallélisé, qui contourne le moteur mashup, donc il ne s’applique qu’aux étapes extract-load qui remplissent les prérequis de Fast Copy. Toute transformation qui casse le pliage revient au moteur standard et perd les gains.
- Pour les sources prises en charge, considérez Fast Copy comme la méthode par défaut pour l’ingestion et réservez des moteurs de transformation plus lourds (abordés dans les scénarios suivants) pour les étapes qui modifient réellement les données.
Scénario 2 : Mise en forme intensive des données
Après l’ingestion, l’équipe applique le filtrage, le remplacement des valeurs nulles et la correspondance des codes avant de charger les données dans le lakehouse. Ces transformations ne sont pas entièrement repliées sur Parquet et sont lentes en mémoire.
Challenges
- Améliorez la vitesse de transformation pour les requêtes semi-pliables ou non pliables.
- Conservez la création sans code de Power Query.
- Réduisez le temps et le coût d’actualisation globaux.
Dataset
Tous les fichiers Parquet pour 2021–août 2025 ont été fusionnés en un seul fichier consolidé.
Solution
L'équipe active Modern Evaluator, un moteur d’exécution hautes performances conçu pour une transformation efficace, en particulier pour des connecteurs comme ADLS Gen2 et SharePoint.
Design
Cette requête charge des données à partir d'un fichier Parquet consolidé, filtre les colonnes trip_distance et fare_amount pour conserver les valeurs supérieures à 0, remplace les valeurs nulles dans passenger_count par 1 et crée une nouvelle colonne payment_method en mappant les types de paiement avant de charger les données dans le lac de données.
Considérations des évaluateurs modernes
- Les temps d’actualisation attendus peuvent être beaucoup plus rapides (varient selon le jeu de données et les transformations).
- Optimisé pour les volumes volumineux (millions de lignes).
- Avantageux pour les requêtes non pliables.
- Faster écrit vers des destinations comme une maison au lac.
Results
Lorsque vous activez Modern Evaluator, Dataflow Gen2 exécute cette charge de mise en forme environ 1,7× plus rapidement que la base Dataflow Gen1 (00:46:29 vs. 01:19:56) tout en préservant l’expérience de Power Query sans code. Sans Modern Evaluator, la même charge de travail n’est qu’environ 1,2 × plus rapide que Gen1 (01:08:37 contre 01:19:56).
| Configuration | Durée d’exécution (hh :mm :ss) | Comparaison avec Gen1 | CU consommé |
|---|---|---|---|
| Base de référence Dataflow Gen1 | 01:19:56 | — | 56,855 |
| Dataflow Gen2 sans évaluateur moderne | 01:08:37 | 1.2× plus rapide | Non mesuré |
| Dataflow Gen2 avec évaluateur moderne | 00:46:29 | 1,7× plus vite | 10,485 |
Lorsque vous activez Modern Evaluator - la configuration Dataflow Gen2 optimale pour ce scénario - la mise en forme par Modern Evaluator, dans le scénario 2, d’un seul grand fichier Parquet en lakehouse consomme 10 485 secondes CU. Le tableau suivant décompose ce total par opération :
| Operation | Moteur (compteur) | CU secondes |
|---|---|---|
| Exécuter des requêtes | Calcul standard | 10,485 |
| Total | 10,485 |
Le travail fonctionne entièrement sur le calcul standard, facturé sur deux niveaux : 12 CU pour chaque seconde jusqu’à 10 minutes, puis 1,5 CU pour chaque seconde supplémentaire. Le tableau suivant montre comment la durée facturée et le total de l’unité de crédit se répartissent entre ces niveaux :
| Niveau de facturation | Durée facturée | Rate | CU secondes |
|---|---|---|---|
| Les 10 premières minutes | 00:10:00 (600 secondes) | 12 CU par seconde | 7 200 |
| Au-delà de 10 minutes | 00:36:29 (2 189,8 secondes) | 1,5 CU pour chaque seconde | 3,284.7 |
| Total | 00:46:29 (2 789,8 secondes) | 10,484.7 |
Ce tableau montre le total mesuré avec une décimale, afin que les paliers s’additionnent exactement ; le reste de l’article l’arrondit à 10 485 secondes CU.
La répartition montre à quel point le premier niveau domine l’affiche : les dix premières minutes ne représentent qu’environ 22% du parcours mais représentent environ 69% des secondes CU, car chacune de ces secondes coûte huit fois plus qu’une seconde dans le second niveau. Tout ce qui dépasse les 10 minutes — soit la majeure partie d’un long processus de shaping — est facturé au tarif bien inférieur de 1,5 CU. Modern Evaluator réduit encore la facture en raccourcissant la durée de la facturation elle-même, et non en modifiant le tarif. Pour le modèle de taux complet, voir tarification Dataflow Gen2.
Points importants à retenir
- En l’absence de Modern Evaluator, Dataflow Gen2 n’était qu’environ 1,2 fois plus rapide que la référence Dataflow Gen1 sur cette charge de travail de mise en forme. L’activation de Modern Evaluator a amélioré les performances à environ 1,7 × plus rapide que Gen1, sur un script et un jeu de données M identiques.
- L’économie de capacité est supérieure à celle du gain de temps : Dataflow Gen2 a terminé 1,7× plus vite tout en consommant 82% moins de capacité que Dataflow Gen1 (10 485 contre 56 855 secondes cubes).
- Cette amélioration de performance provient d’un chemin d’exécution plus efficace pour les requêtes non pliables et semi-pliables. Power Query consacre traditionnellement le plus de temps à ces requêtes, surtout lorsque vous utilisez des connecteurs comme ADLS Gen2 et SharePoint. Le gain d'échelle s'accroît avec le volume de lignes et la complexité de la forme.
- Utilisez Modern Evaluator comme référence pour les flux très axés sur le shaping où les requêtes ne reviennent pas entièrement à la source. Plus le jeu de données est important et plus vous appliquez de transformations dans le moteur, plus vous devez vous attendre à un impact important.
Scénario 3 : Copie optimisée vers Lakehouse
L’équipe d’analyse de NYC Taxi transforme une grande table et rédige le résultat dans une maison au bord d’un lac Fabric. Écrire ce volume à destination est la partie la plus lente du rafraîchissement, donc l’équipe veut accélérer l’écriture sans changer la logique de transformation.
Challenges
- Écrivez rapidement un résultat transformé volumineux vers une destination lakehouse.
- Évitez que l’écriture de destination ne devienne le goulot d’étranglement de l’actualisation.
- Préserver l’expérience Power Query sans code et la logique de transformation existante.
Dataset
Une table de la maison lacustre Fabric d’environ 113 millions de trajets en taxi à New York enregistre un nombre de voyages couvrant 2017 à la mi-2018.
Solution
L’équipe active Enable staging et Optimized copy to Lakehouse pour une seule requête qui écrit dans une destination Lakehouse. La copie optimisée vers le Lakehouse déplace le résultat intermédiaire vers le Lakehouse via un chemin accéléré.
Design
Le flux de données de référence utilise une requête unique, avec Activer la préproduction activé, et une destination lakehouse qui utilise V-Order. La requête lise le tableau de taxis de New York, d’environ 113 millions de rangées, provenant d’une maison lacustre de Fabric, trie les rangées par date et heure de prise, et ajoute deux colonnes issues - le début du mois de prise en charge, et la somme de la taxe et de la surcharge d’amélioration de la MTA. Puisque le staging est activé, Optimized copy to Lakehouse écrit le résultat transformé dans la destination Lakehouse via un chemin accéléré, ce qui permet une exécution rapide.
Considérations relatives à la copie optimisée vers le Lakehouse
- Cela nécessite d’activer le staging sur la requête et d’une destination de type lakehouse. Pour plus d’informations, consultez les options de données intermédiaires pour Dataflow Gen2.
- Cela accélère l’écriture dans le lakehouse sans modifier la logique de transformation.
- Combinez-le avec V-Order sur la destination afin d’optimiser les données de sortie pour les analyses en aval.
Results
Lorsque vous activez la copie optimisée vers Lakehouse, Dataflow Gen2 complète ce rafraîchissement environ 15× plus rapidement que la base Dataflow Gen1 (00:03:34 vs. 00:53:20) sans changer la logique de transformation. Sans cela, le même flux de données en phases est environ 3,6 × plus rapide que Gen1.
| Configuration | Durée d’exécution (hh :mm :ss) | Comparaison avec Gen1 | CU consommé |
|---|---|---|---|
| Base de référence Dataflow Gen1 | 00:53:20 | — | 50,788 |
| Dataflow Gen2 avec staging + V-Order (pas de copie optimisée vers Lakehouse) | 00:14:45 | 3,6× plus vite | Non mesuré |
| Dataflow Gen2 avec staging + Copie optimisée vers Lakehouse + V-Order | 00:03:34 | 15× plus rapidement | 2,391 |
Lorsque vous activez le staging, la Copie optimisée vers Lakehouse et V-Order — la configuration Dataflow Gen2 optimale pour ce scénario — l’actualisation, dans le scénario 3, de la table NYC taxi de 113 millions de lignes vers une table lakehouse s’effectue en 00:03:34 et consomme 2 391 secondes CU. Le tableau suivant décompose ce total par opération :
| Operation | Moteur (compteur) | CU secondes |
|---|---|---|
| Exécuter des requêtes | Calcul standard | 2,391 |
| Total | 2,391 |
Le travail est facturé entièrement en calcul standard (12 CU pour chaque seconde jusqu’à 10 minutes, puis 1,5 CU pour chaque seconde supplémentaire). La copie optimisée du lakehouse passe par le moteur mashup, donc il n’y a pas de compteur séparé. Pour le modèle de taux complet, voir tarification Dataflow Gen2.
Points importants à retenir
- La copie optimisée vers le Lakehouse accélère l’écriture du résultat transformé dans la destination Lakehouse, ramenant le temps d’actualisation de 00:14:45 (sans cette fonctionnalité) à 00:03:34, soit environ 4× plus rapide que le même dataflow sans celle-ci, et environ 15× plus rapide que la référence Dataflow Gen1 (00:53:20).
- Ce scénario a permis la plus grande économie de capacité par rapport à Dataflow Gen1 dans cet article : Dataflow Gen2 consommait 95% moins de capacité que Dataflow Gen1 (2 391 contre 50 788 CU seconds).
- Cela nécessite d’activer la mise en scène sur la requête et une destination lakehouse, et cela ne change pas votre logique de transformation.
- Ce scénario utilise explicitement V-Order sur la sortie de destination.
- Utilisez la Copie optimisée vers Lakehouse chaque fois que vous écrivez des données intermédiaires vers une destination Lakehouse et que le temps d’écriture constitue l’essentiel du temps de rafraîchissement.
Scénario 4 : Combiner les fichiers
Note
Le calcul partitionné est actuellement en prévisualisation et disponible uniquement en Dataflow Gen2 avec CI/CD. La capacité est encore en cours d’amélioration, donc son comportement, ses transformations prises en charge et ses performances peuvent évoluer avant la disponibilité générale. Considérez les résultats dans ce scénario comme un instantané de la préversion.
L’équipe doit maintenant agréger et enrichir les données de voyage sur des centaines de fichiers Parquet (partitions mensuelles). Les transformations incluent le calcul des pourcentages de pourboires dans le jeu de données.
Challenges
- Vous devez traiter des centaines de fichiers volumineux.
- Les transformations nécessitent le regroupement, l’agrégation et l’enrichissement entre les partitions.
- L’exécution séquentielle devient un goulot d’étranglement.
Dataset
Cinquante-six dossiers Parquet (2021–août 2025).
Solution
L’équipe active le Partitioned Compute (Preview), qui paralléllise le traitement entre partitions et fusionne efficacement les résultats.
Design
Cette requête combine 56 fichiers Parquet et crée une nouvelle colonne personnalisée pour le pourcentage de pourboire « Tip Pctg » dans le fichier Transform Sample avant de charger les données dans l’entrepôt.
Considérations relatives au calcul partitionné
- Actuellement en prévisualisation et uniquement disponible en Dataflow Gen2 avec CI/CD ; La capacité est encore en cours d’amélioration.
- Utilisez-la lorsque la source ne prend pas en charge le repliement.
- Fournit les meilleures performances lors du chargement de données vers la mise en lots ou l’entrepôt.
- Utilisez le fichier de transformation d’exemple à partir des fichiers Combine pour assurer une logique de transformation cohérente.
- Prend en charge un sous-ensemble de transformations ; les performances varient.
Results
Le calcul partitionné offre environ 21 × performances supérieures à la base Dataflow Gen1 (00:04:48 contre 01:40:57) sur de grands ensembles de données partitionnés et multi-fichiers.
| Configuration | Durée d’exécution (hh :mm :ss) | Comparaison avec Gen1 | CU consommé |
|---|---|---|---|
| Base de référence Dataflow Gen1 | 01:40:57 | — | Non mesuré |
| Dataflow Gen2 avec calcul partitionné | 00:04:48 | 21× plus rapidement | Non mesuré |
Le calcul partitionné vise le temps d’horloge murale plutôt que le coût. Il exécute les partitions en parallèle pour que le rafraîchissement se termine plus tôt, mais ce parallélisme répartit le travail sur plus de calcul au lieu de le réduire, donc le coût est généralement similaire ou supérieur à celui de la même charge de travail sans cette fonctionnalité. La consommation de CU n’a pas été mesurée dans ce scénario, donc cet article ne rapporte que le temps d’exécution.
Points importants à retenir
- Le calcul partitionné a offert une accélération de 21× par rapport à la référence Dataflow Gen1 et s'est terminé en moins de cinq minutes. Comme la fonctionnalité est en préversion et continue d’être améliorée, il faut s’attendre à ce que ces chiffres évoluent.
- Considérez le calcul partitionné comme un moyen de finir plus tôt, pas de dépenser moins. Le parallélisme raccourcit le temps d’horloge murale en faisant fonctionner les partitions en même temps, donc le coût est généralement similaire ou supérieur à celui de la même charge de travail sans cette charge.
- Le gain provient du traitement de chaque partition en parallèle et de la fusion des résultats. Il est donc le plus efficace sur les sources multi-fichiers ou partitionnés où le pliage n’est pas disponible et l’évaluation séquentielle est le goulot d’étranglement.
- Utilisez le motif de fichier de transformation Sample issu des fichiers Combine afin que la logique de transformation soit appliquée de manière cohérente par partition. Partitioned Compute supporte actuellement un sous-ensemble de transformations, donc validez que vos étapes de mise en forme sont compatibles avant de vous y fier, puis vérifiez à nouveau au fur et à mesure que l’aperçu évolue.
- Pour une ingestion avec partitionnement à haut volume vers une zone de transit ou un entrepôt, faites de Calcul partitionné la valeur par défaut et combinez-le avec l’Évaluateur moderne dans la mesure du possible. Comme il est encore en aperçu, validez-le par rapport à votre propre charge de travail avant de l’adopter pour des mises à jour en production.
Coût sur le temps (à l’époque vs maintenant)
Dataflow Gen2 est devenu plus rentable à faire fonctionner au fil du temps. La même logique, sur les mêmes données, consomme aujourd’hui moins de CUs qu’auparavant, sans qu’aucun changement ne soit nécessaire à vos requêtes.
Dans cette comparaison, cela signifie donc la même charge de travail par rapport aux prix et aux capacités généralement disponibles avant 2026. Maintenant désigne la même charge de travail exécutée aujourd’hui avec les meilleurs paramètres généralement disponibles (tels que Modern Evaluator et Fast Copy). Les deux colonnes utilisent la meilleure configuration généralement disponible de leur époque. Les chiffres actuels sont mesurés à partir de la télémétrie de capacité. Les chiffres de l’époque sont des estimations de ce que la même charge de travail aurait consommée à l’époque, car les conditions de service antérieures ne peuvent plus être reproduites aujourd’hui.
| Scénario | Capacité | Estimation de l’CU avant 2026 (meilleure GA) | CU maintenant (GA optimal) | Réduction estimée |
|---|---|---|---|---|
| Scénario 1 : Copier des données | Copie rapide | 17,055 | 14,593 | 14% |
| Scénario 2 : Mise en forme intensive des données | Évaluateur moderne | 66,164 | 10,485 | 84% |
| Scénario 3 : Copie optimisée vers Lakehouse | Copie optimisée vers Lakehouse | 14,173 | 2,391 | 83% |
Par exemple, la charge de travail de mise en forme intensive du Scénario 2 aurait consommé environ 66 164 secondes CU avant 2026, et consomme désormais 10 485 secondes CU. Ce changement est une réduction de 84% avec la même logique et aucun changement nécessaire. Deux améliorations s’additionnent pour la créer. Premièrement, la tarification du calcul standard est devenue progressive : au lieu d’un tarif fixe de 16 CU par seconde pendant toute l’exécution, seules les 10 premières minutes sont facturées à 12 CU par seconde, puis chaque seconde suivante ne coûte plus que 1,5 CU ; ainsi, la longue traîne d’une charge de travail de mise en forme ne coûte désormais qu’une fraction de ce qu’elle coûtait auparavant. Deuxièmement, Modern Evaluator – généralement disponible depuis avril 2026 – raccourcit la durée de facturation lui-même, ce qui réduit les secondes pour facturer à chaque niveau. Une exécution plus courte, facturée selon un tarif de longue traîne bien moins élevé, explique pourquoi la consommation de CU baisse aussi fortement, et c’est pourquoi l’association de Modern Evaluator avec la tarification actuelle par paliers est si importante pour les flux de données comportant beaucoup d’opérations de transformation.
L’ingestion Fast Copy dans le Scénario 1 aurait consommé environ 17 055 secondes CU avant 2026, et consomme désormais 14 593 secondes CU. Ce changement est une réduction de 14%, provoquée par la chute du taux de calcul standard de 16 CU par seconde à 12 CU par seconde jusqu’à 10 minutes ; la partie Fast Copy Data Movement reste inchangée. L’actualisation de la copie optimisée vers le Lakehouse dans le scénario 3 aurait consommé environ 14 173 secondes CU avant 2026, et consomme désormais 2 391 secondes CU. Ce changement représente une réduction de 83%. Chaque comparaison utilise la même charge de travail avec les meilleurs réglages généralement disponibles de son époque.
Note
Cette comparaison entre la situation passée et la situation actuelle exclut le Calcul partitionné, car la consommation de CU n’a pas été mesurée pour ce scénario et cette fonctionnalité est toujours en préversion.
Questions fréquemment posées
Comment la génération 2 de Dataflow est-elle facturée ?
Dataflow Gen2 facture chaque moteur séparément en unités de capacité Fabric (CU). Standard Compute (le moteur de mashup) facture 12 CU pour chaque seconde jusqu’à 10 minutes de chaque requête, puis 1,5 CU pour chaque seconde supplémentaire. La copie rapide (déplacement de données) facture 1,5 CU pour chaque seconde d’activité de copie, mesurée sur tous les cœurs sur lesquels la copie fonctionne. Vous êtes facturé uniquement pour la puissance de calcul réellement utilisée par chaque requête, sans frais fixes par rafraîchissement et sans frais liés au temps d’inactivité. Pour le modèle complet de taux, voir tarification Dataflow Gen2.
La tarification de Dataflow Gen2 est-elle élastique ?
Yes. Dataflow Gen2 ne facture que le calcul utilisé réellement par chaque requête, mesuré en unités de capacité Fabric (CU). Il n’y a pas de frais fixes par rafraîchissement, pas de frais pour le temps d’inactivité, et pas de frais directs pendant la création pour les fonctionnalités natives. Dans les tests de performance de cet article, un rafraîchissement complet a consommé 14 593 secondes CU pour une ingestion Fast Copy et 10 485 secondes CU pour une charge de travail de transformation importante.
Comment puis-je estimer mon coût Dataflow Gen2 avant d’exécuter la charge de travail complète ?
Effectuez une petite mise à jour représentative et mesurez ce qu’elle consomme, plutôt que de construire la solution complète et de découvrir le coût ensuite. Pour estimer le coût de cette manière :
- Construis le flux de données sur un échantillon ou une partition unique de ta source au lieu de l’ensemble de données complète.
- Rafraîchissez-le une fois, puis consultez les secondes d’UC qu’il a consommées dans Microsoft Fabric Capacity Metrics app.
- Vérifiez l’historique des rafraîchissements du flux de données pour voir quels moteurs ont fonctionné, car le calcul standard et la copie rapide sont facturés séparément.
- Divisez les secondes d’unité mesurées par les lignes ou GB que vous avez traitées pour obtenir un débit unitaire, puis multipliez par votre volume total de données.
Note
Dataflow Gen2 est optimisé pour des charges de travail à grande échelle, ses avantages en termes de performance et d’efficacité sont donc particulièrement évidents sur de grands ensembles de données réels. Un échantillon petit ou synthétique peut ne pas montrer les gains complets, et un taux par unité extrapolé à partir d’un tout petit échantillon peut surestimer le coût d’une production complète. Validez avec un volume de données représentatif dès que possible.
Pour la méthode complète, voir Calculer les coûts estimés à l’aide de l’application Fabric Metrics et l’historique des rafraîchissements de flux de données.
Combien de temps prend un rafraîchissement Dataflow Gen2 ?
Cela dépend du volume de données et des transformations que vous appliquez. Dans les benchmarks de cet article, les actualisations Dataflow Gen2 variaient de 00:03:34 pour une copie optimisée d’une table de 113 millions de rangées dans un lakehouse, jusqu’à 00:46:29 pour une charge de mise en forme lourde sur un grand fichier Parquet consolidé. Une copie massive de cinq fichiers Parquet consolidés a terminé en 00:09:08 avec Fast Copy, et une combinaison de 56 fichiers partitionnés a terminé en 00:04:48 avec Partitioned Compute (Preview). Pour les temps complets par scénario, voir le résumé des résultats du benchmark.
Quelle capacité Dataflow Gen2 réduit le plus le coût ?
Cela dépend de la charge de travail, car chaque capacité vise un goulot d’étranglement différent : Copie Rapide pour l’ingestion sans transformation, Évaluateur Moderne pour le modelage de données non pliables, Copie optimisée vers Lakehouse pour accélérer les écritures vers une destination de Lakehouse, et Calcul Partitionné (Prévision) pour de grands ensembles de données multi-fichiers. Par rapport à la référence Dataflow Gen1, la copie optimisée vers le Lakehouse a permis de réaliser les économies les plus importantes dans ces tests de performance, soit 95 % de secondes CU en moins. Par rapport aux exécutions équivalentes de Dataflow Gen2 avant 2026, Modern Evaluator a permis la réduction estimée la plus importante, avec 84 % de secondes-CU en moins sur une charge de transformation importante. Pour adapter une capacité à votre charge de travail, consultez la référence rapide.
Comment puis-je accélérer l’actualisation d’un Dataflow Gen2 ?
Associez la capacité au goulot d’étranglement : activez Fast Copy pour les sources d’extraction et de chargement prises en charge, activez Modern Evaluator pour les transformations ne prenant pas en charge le repliement, activez la copie optimisée vers Lakehouse lors de l’écriture de données intermédiaires dans une destination Lakehouse, et utilisez le Calcul partitionné (préversion) pour les jeux de données partitionnés volumineux ou multi-fichiers. Chaque capacité est évaluée dans cet article avec l’accélération spécifique qu’elle a fournie par rapport à la base de Dataflow Gen1.
Dois-je modifier mes requêtes pour obtenir ces améliorations ?
Non. Chaque benchmark de cet article exécutait le même script M à travers les deux générations et toutes les configurations. Copie rapide, Évaluateur moderne et Copie optimisée vers Lakehouse sont des paramètres que vous activez, et ils modifient la façon dont le moteur exécute vos requêtes plutôt que les requêtes elles-mêmes. Attention toutefois : Fast Copy ne s’applique qu’aux étapes qui remplissent les conditions préalables requises ; une transformation qui rompt le repliement de requête bascule alors vers le moteur standard et fait perdre le gain de performances. Pour ces prérequis, voir Copie rapide dans Dataflow Gen2.
Dataflow Gen2 est-il plus rapide et moins cher que Dataflow Gen1 ?
Pour des charges de travail à fort volume comme celles évaluées dans cet article, oui sur les deux plans. Dataflow Gen2 s’est exécuté entre 1,7× et 21× plus rapidement que la référence Dataflow Gen1 sur les mêmes données et avec le même script M, et a consommé de 82 % à 95 % d’unités de capacité en moins dans les scénarios où les deux générations ont été mesurées. Par exemple, une copie en bloc qui a pris 01:38:59 dans Dataflow Gen1 s’est terminée en 00:09:08 dans Dataflow Gen2 avec Fast Copy - environ 11 × plus rapide. La différence est plus faible pour les flux de données à court terme, car une requête qui se termine dans les dix premières minutes n’atteint jamais le niveau moins cher de 1,5 CU, donc les gains augmentent avec le volume de données et le temps d’exécution. Pour la comparaison complète par scénario, voir le résumé des résultats du benchmark.
Quelle capacité consomme Dataflow Gen1 par rapport à Dataflow Gen2 ?
Dans les scénarios où les deux générations étaient mesurées, Dataflow Gen1 consommait plusieurs fois plus de capacité que Dataflow Gen2 pour le même volume élevé de travail. L’ingestion Fast Copy consommait 84 411 secondes cubes sur Dataflow Gen1 contre 14 593 secondes cubes sur Dataflow Gen2, soit une réduction de 83%. La lourde charge de travail de modelage des données a consommé 56 855 secondes de crédit sur Dataflow Gen1 contre 10 485 secondes de crédit sur Dataflow Gen2, soit une réduction de 82%. La charge de travail optimisée de copie vers Lakehouse a consommé 50 788 secondes de CU sur Dataflow Gen1, contre 2 391 secondes de CU sur Dataflow Gen2, soit une réduction de 95 %. Ces trois actualisations durent bien plus de 10 minutes, donc la plupart de leurs factures Dataflow Gen2 sont facturées à un débit plus bas de 1,5 CU. Pour les chiffres par scénario, voir le résumé des résultats du benchmark.
Dois-je transférer mes dataflows Dataflow Gen1 vers Dataflow Gen2 ?
Yes. Dataflow Gen2 est la génération actuelle de dataflows dans Microsoft Fabric, donc prévoyez de transférer tous les dataflows Dataflow Gen1 vers celle-ci. Sur l’ensemble des tests de performance présentés dans cet article, Dataflow Gen2 a exécuté le même script M de 1,7× à 21× plus rapidement, tout en consommant 82 % à 95 % d’unités de capacité en moins que Dataflow Gen1 — la même logique, exécutée plus rapidement et consommant moins de capacité. Les capacités qui apportent ces gains – Fast Copy, Modern Evaluator, Optimized copy to Lakehouse et Partitioned Compute – ne sont disponibles que dans Dataflow Gen2, donc l’écart ne cesse de s’élargir à mesure que ces capacités s’améliorent. Attendez-vous aux plus gros gains lors des renouvellements à fort volume et de longue durée. Lors de la migration, testez une charge de travail représentative pour confirmer les gains sur vos propres données et capacité. Pour commencer, consultez la présentation de Dataflow Gen2.
Dataflow Gen2 est-il devenu plus rentable avec le temps ?
Yes. La charge de travail de transformation intensive du scénario 2 aurait consommé environ 66 164 secondes CU avant 2026 et n’en consomme désormais plus que 10 485 grâce aux fonctionnalités actuellement en disponibilité générale, soit une réduction estimée de 84 % avec une logique identique et sans nécessiter de modifications. Pour les chiffres par scénario, voir Coût dans le temps (à l’époque vs. maintenant).
Les anciens chiffres de coût et de performance de Dataflow Gen2 sont-ils encore exacts ?
Pas nécessairement. Les chiffres de cet article reflètent le modèle actuel de tarification Dataflow Gen2 – 12 CU pour chaque seconde jusqu’à 10 minutes de calcul standard, puis 1,5 CU pour chaque seconde supplémentaire – ainsi que des capacités actuelles telles que Fast Copy et Modern Evaluator. Parce que Dataflow Gen2 est devenue plus rapide et plus rentable au fil du temps, les chiffres de référence ou les estimations de coûts publiés avant 2026 pourraient surestimer le coût actuel ou sous-estimer la performance actuelle. Validez vos propres charges de travail par rapport à l’application Microsoft Fabric Capacity Metrics.