Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Note
Les options de données intermédiaires décrites dans cet article sont actuellement en version préliminaire.
Lorsque vous activez staging pour une requête, Dataflow Gen2 écrit les résultats intermédiaires dans un Lakehouse de préproduction interne afin que le moteur puisse utiliser la capacité de calcul de Fabric pour les transformations ou pour déposer des données dans une destination.
La section Données intermédiaires dans les paramètres de mise à l’échelle du flux de données vous permet de régler deux aspects de ce pipeline :
- Copie optimisée vers Lakehouse (préversion) : utilisez un chemin plus rapide pour écrire des données intermédiaires dans une destination de données Fabric Lakehouse.
- Activer la compression V-Order (Aperçu) — Appliquer la compression V-Order aux données écrites dans le Lakehouse de transit.
Les deux options s’appliquent au niveau du flux de données et prennent effet uniquement dans Dataflow Gen2.
Où trouver les paramètres
- Ouvrez votre dataflow dans l’éditeur Power Query.
- Sélectionnez Options dans le menu.
- Accédez à l’onglet Échelle .
- Les deux paramètres sont répertoriés sous Données intermédiaires.
Copie optimisée vers Lakehouse (préversion)
Lorsque cette option est activée, Dataflow Gen2 utilise un chemin de déplacement de données optimisé pour les requêtes qui :
- Avoir activé la mise en lots et
- Écrire dans une destination de données Fabric Lakehouse.
Dans le chemin par défaut, les données circulent de l’entrepôt de transit vers le Lakehouse, avec une sérialisation supplémentaire et des sauts réseau. Le chemin optimisé réduit ces sauts, ce qui peut considérablement raccourcir le temps de rafraîchissement des flux de données qui utilisent beaucoup la zone de transit et qui aboutissent dans un Lakehouse.
Pour un exemple mesuré de l’impact du temps de rafraîchissement et de la consommation de CU de cette option, voir Scénario 3 : Copie optimisée vers Lakehouse dans les benchmarks de coût et de performance Dataflow Gen2.
Quand l′utiliser ?
Activez cette option lorsque vous mettez en scène des requêtes qui atterrissent finalement dans une destination de données Fabric Lakehouse. La préproduction est la plus utile quand :
- Votre requête contient des transformations qui ne peuvent pas être repliées sur la source.
- Vous souhaitez vous appuyer sur la capacité de calcul de préproduction de Fabric (Lakehouse ou Warehouse) pour exécuter des opérations lourdes telles que des jointures, des regroupements ou des filtres avant d’écrire vers la destination.
Pour en savoir plus sur les cas où la préproduction est utile, consultez les meilleures pratiques pour obtenir des performances optimales avec Dataflow Gen2.
Comportement par défaut
L’option est désactivée par défaut. Pour la plupart des dataflows qui préparent les données et les écrivent dans un Fabric Lakehouse, il est avantageux d’activer cette option.
Observations
- L’option s’applique uniquement aux requêtes pour lesquelles la préproduction est activée et qui écrivent vers une destination de données Fabric Lakehouse. Pour les requêtes qui écrivent dans d’autres destinations (Fabric Warehouse, Fabric base de données SQL, Azure SQL, Snowflake, KQL, Azure Data Lake Storage Gen2, destinations de fichiers), l’option n’a aucun effet.
- Si vous désactivez le transfert intermédiaire pour une requête, le chemin de copie optimisé ne s’applique pas à cette requête.
- L’option s’applique à toutes les requêtes éligibles dans le flux de données. Il n’existe actuellement aucune surcharge pour chaque requête.
Activer la compression V-Order (Aperçu)
V-Order est une optimisation du temps d’écriture pour le format de fichier Parquet qui améliore les performances de lecture pour les moteurs de Fabric en aval, au coût d’un processeur supplémentaire pendant l’écriture. Pour plus de contexte et des conseils multi-moteur, consultez l’optimisation des tables Delta Lake et V-Order et la maintenance et l’optimisation des tables entre charges de travail.
Lorsque cette option est activée, Dataflow Gen2 applique la compression V-Order aux données écrites dans le Lakehouse intermédiaire. Lorsqu’elles sont désactivées, les données intermédiaires sont écrites sans V-Order.
Quand activer ou désactiver la commande V pour la préproduction
Le lakehouse intermédiaire contient des données intermédiaires utilisées uniquement par Dataflow Gen2 elle-même : le flux de données réécrit les données intermédiaires pendant la même actualisation pour appliquer d’autres transformations ou écrire dans une destination, et le connecteur Dataflow lit à partir des données intermédiaires lorsque d’autres éléments interrogent la sortie du flux de données. Les moteurs de requête destinés aux utilisateurs finaux (Power BI Direct Lake, Fabric Warehouse, point de terminaison d’analyses SQL, Spark) ne lisent pas directement le lakehouse intermédiaire. Ces scénarios s’appliquent plutôt à votre destination de données Lakehouse. Pour obtenir des conseils sur la destination, consultez Activer la compression V-Order sur une destination Lakehouse.
Étant donné que les données intermédiaires sont généralement lues un petit nombre de fois au cours de la même actualisation, la désactivation de V-Order pour la préproduction est un bon choix pour la plupart des flux de données. Ignorer V-Order réduit le processeur en temps d’écriture et raccourcit la durée d’actualisation, en particulier pour les écritures intermédiaires volumineuses. Envisagez d’activer V-Order sur le stockage intermédiaire si la sortie de stockage intermédiaire du flux de données est consommée de nombreuses fois via le connecteur Dataflow et que vous souhaitez privilégier les performances de lecture de ces requêtes en aval par rapport au coût d’écriture du stockage intermédiaire.
Comportement par défaut
L’option est activée par défaut. Utilisez les conseils ci-dessus pour déterminer ce qui convient à votre dataflow.
Dans quels autres cas V-Order s’applique-t-il ?
Outre le paramètre défini au niveau du flux de données qui contrôle le Lakehouse intermédiaire, V-Order peut également être contrôlé directement sur la connexion de destination de données du Lakehouse, via l’option avancée Activer l’utilisation de la compression V-Order. Ce paramètre contrôle si les données écrites dans la destination Lakehouse sont compressées V-Order. La destination est la surface lue par Direct Lake, Fabric Warehouse, le point de terminaison d’analytique SQL et Spark. Par conséquent, les instructions au niveau de la destination sont basées sur des scénarios.
Pour plus d’informations sur l’option au niveau de la destination, consultez Activer la compression V-Order sur une destination Lakehouse.
Contenu connexe
- Benchmarks de coût et de performance de la Gen2 Dataflow
- Meilleures pratiques pour obtenir les meilleures performances avec Dataflow Gen2
- Destinations de données Dataflow Gen2 et paramètres managés
- Optimisation des tables Delta Lake et V-Order
- Maintenance et optimisation des tableaux multi-charges de travail
- Évaluateur moderne pour Dataflow Gen2 avec CI/CD
- Utiliser le calcul partitionné dans Dataflow Gen2 (préversion)