Données dans les éléments intermédiaires Dataflow Gen2

Pour améliorer les performances et la fiabilité, Dataflow Gen2 utilise des éléments de transit pour stocker des données intermédiaires pendant la transformation des données. Cet article décrit ce que sont les éléments de mise en scène, les modèles ELT qu'ils permettent à travers le modèle mettre en scène une fois, référencer plusieurs fois, et comment gérer les données qu'ils contiennent.

Qu’est-ce que les éléments intermédiaires ?

Les éléments intermédiaires sont des emplacements de stockage de données intermédiaires utilisés par Dataflow Gen2 pour stocker des données pendant la transformation des données. Ces éléments passent par les noms « DataflowsStagingLakehouse » et « DataflowsStagingWarehouse ». Les éléments intermédiaires sont utilisés pour stocker des données intermédiaires pendant la transformation des données afin d’améliorer les performances. Ces éléments sont créés automatiquement lorsque vous créez votre premier dataflow et sont gérés par Dataflow Gen2. Ces éléments sont masqués pour l'utilisateur dans l'espace de travail, mais peuvent être visibles dans d'autres expériences telles que le Get Data ou l'explorateur Lakehouse. Nous vous conseillons vivement de ne pas accéder ou modifier les données dans les éléments intermédiaires directement, car cela peut entraîner un comportement inattendu. En outre, le stockage de données soi-même dans les éléments intermédiaires n’est pas pris en charge et peut entraîner une perte de données.

Modèles ELT : exécuter une fois, répéter souvent

Au-delà de la fourniture d’un stockage intermédiaire, la mise en scène déverrouille un ensemble de modèles ELT basés sur une base unique : stocker une fois, faire référence plusieurs fois. Une requête source est marquée comme mise en attente afin que sa sortie soit matérialisée dans le stockage temporaire interne. Les requêtes en aval font ensuite référence à cette requête intermédiaire au lieu de relire la source. La copie rapide est un accélérateur facultatif qui fait que la requête en cours de traitement se remplit plus rapidement, mais ce n'est pas ce qui définit le schéma.

Le modèle importe, car une fois les données mises en scène, les requêtes en aval peuvent :

  • Exécutez une copie indexée et interrogeable sans avoir à nouveau atteint la source.
  • Renvoyez les filtres, les jointures et les agrégations au point de terminaison SQL intermédiaire au lieu de les exécuter dans le moteur Mashup.
  • Branchez dans plusieurs transformations ou destinations parallèles à partir d’un résultat matérialisé unique.

Cas d’utilisation courants

Les modèles suivants sont généralement superposés au-dessus d’une requête source intermédiaire.

Cas d’utilisation Description
Mettre en forme des données intermédiaires dans des modèles d’analytique Les requêtes référencées forment des données intermédiaires dans des tables de faits et de dimensions, des résumés, des cumuls ou des indicateurs de performance clés par le biais de la déduplication, du regroupement et de la génération de clés.
Mécanisme de calcul pliable Les requêtes référencées écrites sur des données intermédiaires plient leurs jointures, filtres et opérations groupées vers le point de terminaison SQL intermédiaire, envoyant le calcul au moteur d’entrepôt au lieu du moteur de mashup. Il s'agit souvent du plus grand avantage de performance qu'offre la mise en scène.
Branche de qualité et d’audit des données Les requêtes référencées valident ou inspectent les données intermédiaires (vérifications null, validation de contrainte, nombres de lignes) sans relecture de la source.
Fan-out vers plusieurs destinations Plusieurs requêtes référencées chargent chacune une destination différente depuis la même source intermédiaire (par exemple, un Lakehouse et un entrepôt).
Stage-then-merge Chaque source est mise en scène dans sa propre requête, puis une requête référencée en aval fusionne ou joint les résultats mis en scène, en repliant la jointure vers le point de terminaison SQL de mise en scène.

Lorsque la mise en scène n’est pas adaptée

La mise en scène ajoute un coût de stockage et une opération d'écriture supplémentaire avant l’exécution des requêtes en aval. Envisagez de l’ignorer quand :

  • Votre transformation s'étend déjà de bout en bout jusqu'au système source, sans calcul dans le moteur de mashup.
  • Le flux de données a une seule sortie et aucun branchement, validation ou fan-out en aval.
  • La latence de la source est le goulot d'étranglement et la source ne peut pas être parallélisée à l'aide d'une étape intermédiaire.

Pour obtenir des conseils supplémentaires sur l’activation ou la désactivation de la mise en scène, consultez les meilleures pratiques pour obtenir les meilleures performances avec Dataflow Gen2.

Données dans les éléments intermédiaires

Les éléments intermédiaires ne sont pas conçus pour un accès direct par les utilisateurs. Dataflow Gen2 gère les données dans les éléments intermédiaires et garantit que les données sont dans un état cohérent. L’accès aux données dans les éléments intermédiaires directement n’est pas pris en charge, car il ne peut pas être garanti que les données sont dans un état cohérent. Si vous avez besoin d’accéder aux données dans des éléments intermédiaires, vous pouvez utiliser le connecteur de flux de données dans Power BI, Excel ou d’autres dataflows.

Important

L'API interne qui fournit des données préparées aux consommateurs en aval (comme les modèles sémantiques ou d'autres flux de données utilisant le connecteur Dataflows) peut rencontrer des délais d'expiration intermittents. Ces délais d'expiration peuvent entraîner des échecs d'actualisation dans les éléments consommés, souvent sous la forme de l'erreur « La clé ne correspond à aucune ligne du tableau ». Cette erreur n'indique pas de problème de données. Cela signifie que le back-end n’a pas pu récupérer les résultats intermédiaires dans le temps.

Solution de contournement recommandée : Configurez une destination de données (Lakehouse ou Warehouse) pour votre flux de données et mettez à jour les éléments en aval pour lire directement à partir de cette destination à l’aide du connecteur Lakehouse ou Warehouse. Cela contourne l’API intermédiaire interne et améliore la fiabilité de l’actualisation.

Pour plus d’informations, consultez les limitations de Data Factory.

La suppression de données des éléments intermédiaires peut être forcée par l’une des actions suivantes :

  • Désactiver l'étape intermédiaire dans le flux de données et actualiser (après 30 jours, nous supprimons les données).
  • Supprimer le flux de données (supprime directement les données).
  • Supprimer l’espace de travail (supprime directement le StagingLakehouse et le StagingWarehouse).

Implications du coût de la mise en lots

L’entrepôt intermédiaire Lakehouse et l’entrepôt intermédiaire stockent les données intermédiaires dans le cadre de votre traitement de flux de données. Le stockage consommé par ces éléments intermédiaires est facturé dans le cadre de votre stockage OneLake. Cela signifie que les données stockées dans les éléments intermédiaires comptent vers votre consommation globale de stockage OneLake et les coûts associés.

Pour gérer efficacement les coûts de stockage :

  • Surveiller l’utilisation du stockage intermédiaire : sachez que les données intermédiaires s’accumulent avec chaque actualisation du flux de données jusqu’à ce qu’elles soient collectées ou supprimées explicitement.
  • Désactivez la mise en lots si nécessaire : si vos transformations se plient au système source, vous n’avez peut-être pas besoin d’activer la mise en lots. Désactiver le staging réduit la consommation de stockage.
  • Nettoyer les dataflows inutilisés : la suppression de dataflows qui ne sont plus nécessaires supprime immédiatement leurs données intermédiaires associées.
  • Envisagez la fréquence d’actualisation : les actualisations fréquentes avec la préproduction activée peuvent entraîner une consommation de stockage plus élevée. Équilibrer les avantages en matière de performances par rapport aux coûts de stockage.

Pour plus d’informations sur la tarification du stockage OneLake, consultez la tarification de Microsoft Fabric.