Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Exécutez la maintenance de table sur des tables Delta pour les maintenir saines au fil du temps en compactant de petits fichiers, en appliquant des optimisations de lecture et en supprimant les fichiers obsolètes qui ne sont plus référencés.
Vous pouvez exécuter la maintenance soit en opération ad hoc dans le portail Fabric (action de maintenance de la table lakehouse), soit en processus planifié et orchestré en utilisant des notebooks, pipelines ou une API REST. Les pipelines Fabric Data Factory incluent une activité dédiée de maintenance Lakehouse (Preview) qui peut exécuter OPTIMIZE (avec un V-order optionnel) et VACUUM sur les tables Delta de Lakehouse dans le cadre des flux de travail programmés du pipeline. Cet article se concentre sur le flux de travail du portail ad hoc.
Pour obtenir des conseils sur la maintenance inter-charges de travail, notamment des recommandations pour le point de terminaison d'analyse SQL, Power BI Direct Lake et les consommateurs de Data Warehouse, consultez Maintenance et optimisation des tables de charge de travail croisées . Pour les modèles de maintenance code-first, voir Optimisation des tables Delta Lake et V-order et Gérer le lakehouse avec l’API Fabric REST.
Entretien de la table de course depuis la maison du lac
L’entretien des tables dans le Lakehouse ne s’applique qu’aux tables Delta. Les tables Hive héritées qui utilisent des formats tels que Parquet, ORC, AVRO ou CSV ne sont pas prises en charge.
Dans la boîte de dialogue Exécuter les commandes de maintenance , choisissez les options en fonction de votre objectif.
En règle générale, exécutez la maintenance après une activité majeure d’ingestion ou de mise à jour, ou lorsque vous observez de nombreux petits fichiers et des performances de lecture plus lentes.
Remarque
Orchestrer avec des pipelines : pour les travaux de maintenance périodiques, utilisez l'« Activité Maintenance Lakehouse (Version Préliminaire) » dans les pipelines Fabric Data Factory. Il expose les mêmes options (OPTIMIZE avec l’ordre V optionnel, VACUUM) et s’intègre avec d’autres étapes du pipeline via des dépendances, des déclencheurs et des paramètres — vous pouvez donc enchaîner la maintenance avec les charges de données et suivre une activité Refresh SQL Endpoint dans le même pipeline.
Depuis votre compte Fabric, naviguez vers la maison du lac souhaitée.
Dans Lakehouse Explorer, sous Tableaux, faites un clic droit sur la table cible (ou utilisez l’ellipsie).
Sélectionnez l’entrée du menu Maintenance.
Dans la boîte de dialogue Exécuter les commandes de maintenance , choisissez les options de maintenance :
Sélectionnez l’option On pour compacter les petits fichiers Parquet en fichiers plus volumineux pour obtenir des lectures plus efficaces.
Si On est sélectionné, vous pouvez également cocher la case Appliquer l’ordre V. Lorsque vous sélectionnez cette option, Fabric applique l’ordre V (tri, encodage et compression optimisés) dans le cadre de l’optimisation.
Remarque
L’ordre en V a un impact d’environ 15% sur les temps d’écriture moyens. Il peut également fournir jusqu’à 50% plus de compression.
Sélectionnez l’option Activé pour exécuter la commande Delta Lake
VACUUMet supprimez les fichiers non référencés antérieurs à votre seuil de rétention. Pour plus d’informations sur le comportement de rétention et la sécurité, consultez les paramètres de rétention sous vide.Sélectionnez l’option Activé pour fusionner les transactions dans des fichiers Parquet et supprimer les fichiers de vecteurs de suppression supplémentaires, nettoyant l’espace et optimisant les lectures de table.
Sélectionnez Exécuter maintenant pour exécuter le travail de maintenance de tables.
Effectuez le suivi de l’exécution des travaux à l’un des emplacements suivants :
- Volet Notifications (icône en forme de cloche dans l’en-tête du portail Fabric) pour l’état d’exécution immédiat.
-
Hub de surveillance (sélectionnez Surveiller dans le volet de navigation gauche) pour obtenir les détails complets du travail. Recherchez les activités qui contiennent
TableMaintenancedans le nom de l’activité pour les exécutions initiées par le portail. Pour une exécution de maintenance via les pipelines Fabric Data Factory, recherchez l’exécution du pipeline dans la section Pipelines du hub > de surveillance et filtrez par le nom de l’activité Maintenance du Lakehouse.
Une fois la maintenance exécutée, la réussite s’affiche sous la forme d’une activité de maintenance de table terminée dans Notifications et comme entrée réussie TableMaintenance dans le hub de surveillance.
Pour plus d’informations sur la navigation et les filtres du hub de surveillance, consultez Utiliser le hub de surveillance.
Paramètres de rétention du vide
La VACUUM commande supprime les fichiers qui ne sont plus référencés par le journal Delta et qui sont plus anciens que votre seuil de rétention. Le seuil de rétention par défaut est de sept jours.
L’utilisation d’un intervalle de rétention plus court peut réduire l’historique des déplacements temporels Delta et peut affecter les lecteurs ou les enregistreurs simultanés. Les demandes de maintenance du portail Fabric et de l’API échouent par défaut pour les intervalles de rétention de moins de sept jours.
Si vous devez utiliser un intervalle de rétention de moins de spark.databricks.delta.retentionDurationCheck.enabled sept jours, définissez spark.databricks.delta.retentionDurationCheck.enabled sur dans les propriétés Spark de l’environnement Fabric utilisé par vos charges de travail Spark dans votre espace de travail. Pour savoir où configurer et associer des environnements, consultez Créer, configurer et utiliser un environnement dans Fabric et Paramètres de configuration de calcul Spark dans les environnements Fabric.