Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
S’applique à :✅ Ingénierie des données fabric et science des données
Les pools dynamiques personnalisés sont des clusters Spark préhydratés qui permettent un démarrage de session quasi instantané pour les notebooks dans Fabric. Cet article explique comment créer, configurer et gérer des pools dynamiques personnalisés pour des performances optimales.
Prerequisites
Avant de configurer des pools dynamiques personnalisés, vérifiez que vous disposez des éléments suivants :
- Accès à un espace de travail Fabric avec un SKU Fabric payant (les capacités d'essai Fabric ne sont pas prises en charge).
- Rôle administrateur ou membre dans l’espace de travail.
- Une capacité Fabric active attribuée à votre espace de travail.
- Environnement Fabric publié à utiliser pour la configuration de la bibliothèque.
- Une piscine Spark personnalisée existante. Seuls les administrateurs d’espaces de travail peuvent créer des pools Spark personnalisés.
Si vous avez le rôle Membre , un administrateur d’espace de travail doit activer la configuration existante Personnaliser la configuration de calcul pour les objets .
Important
Les pools de démarrage ne sont pas pris en charge pour les pools en direct personnalisés. Si votre espace de travail utilise un pool de démarrage, vous devez créer un pool Spark personnalisé avant de configurer un pool dynamique personnalisé.
Utilisez le paramètre de personnalisation de calcul existant
Les pools actifs personnalisés utilisent le paramètre d’espace de travail existant Personnaliser la configuration de calcul des éléments. Ils n’ont pas de paramètre de délégation distinct. Avant qu’un membre de l’espace de travail puisse créer ou mettre à jour une configuration personnalisée de live pool, un administrateur de l’espace doit activer le paramètre existant :
Accédez à votre espace de travail Fabric.
Sélectionnez Paramètres de l’espace de travail dans le ruban d’accueil de l’espace de travail.
Développez Data Engineering/Science et sélectionnez Paramètres Spark.
Sélectionnez l’onglet Pool .
Activez la fonction Personnaliser la configuration de calcul des objets.
Cliquez sur Enregistrer.
Lorsque ce paramètre est activé, les membres peuvent utiliser un environnement Fabric pour sélectionner un pool Spark personnalisé existant, ajuster les cœurs de pilotes au niveau de la session, la mémoire des pilotes, les cœurs exécuteurs et la mémoire des exécuteurs, et créer ou mettre à jour la configuration du pool en direct. Les membres peuvent alors sauvegarder et publier l’environnement.
Ce paramètre ne permet pas aux membres de créer ou de gérer des pools Spark personnalisés dans les paramètres de l’espace de travail. Un administrateur d’espace de travail doit créer le pool Spark personnalisé sous-jacent.
Lorsque la personnalisation de la configuration de calcul pour les éléments est désactivée, les environnements utilisent le pool par défaut de l’espace de travail et sa configuration de calcul. Les membres ne peuvent pas créer ou mettre à jour une configuration personnalisée de live pool tant qu’un administrateur d’espace de travail n’a pas activé le paramètre.
Pour plus d’informations sur ce contrôle d’espace de travail, consultez les paramètres d’administration de l’espace de travail en ingénierie des données.
Créez un pool personnalisé pour le pool en direct (administrateur uniquement)
Cette tâche nécessite le rôle d’espace de travail Admin. Si un pool Spark personnalisé existe déjà, les membres de l’espace de travail peuvent sauter cette tâche et configurer le calcul en direct du pool sur le pool existant.
- Accédez à votre espace de travail Fabric.
- Sélectionnez Paramètres de l’espace de travail dans le ruban d’accueil de l’espace de travail.
- Développez Data Engineering/Science et sélectionnez Paramètres Spark.
- Sélectionnez l’onglet Pool .
- Dans la liste déroulante Pool par défaut pour l’espace de travail , sélectionnez Nouveau pool.
- Attribuez un nom à votre pool. Ce nom est un identificateur unique pour le pool, tel que
dev-team-poolouprod-daily-analytics. - Sélectionnez une famille de nœuds et une taille de nœud pour votre charge de travail.
- Cochez la case Mise à l’échelle automatique pour activer la mise à l’échelle automatique pour le pool.
Configurer un pool actif
Les administrateurs et membres de l’espace de travail peuvent créer ou mettre à jour une configuration de pool en direct via les paramètres de l’environnement . Pour les membres, un administrateur d’espace de travail doit d’abord activer la configuration de calcul personnalisée des éléments. Les membres doivent sélectionner un pool Spark personnalisé existant créé par un administrateur d’espace de travail.
Dans votre espace de travail Fabric, ouvrez l’environnement que vous souhaitez associer à un pool personnalisé en direct.
Dans le volet gauche, sélectionnez Calcul.
Sélectionnez le pool que vous avez créé à l’étape précédente dans la liste déroulante.
Sous Live pool, cochez l’option pour activer le calcul du pool en direct pour cet environnement.
Sous Planification du pool en direct, sélectionnez le bouton radio pour activer cette option. Tous les pools dynamiques personnalisés doivent avoir une planification. Les clusters sont maintenus hydratés uniquement pendant la fenêtre planifiée.
Spécifiez les paramètres de planification :
- Indique si la planification est périodique
- Début et fin de la journée et de l'heure
- Fuseau horaire
- Quand désactiver et réactiver le pool
- Autres paramètres, le cas échéant
Important
Fabric utilise le provisionnement Spark standard pour l’activité en dehors de la fenêtre planifiée, qui a des temps de démarrage plus lents. Les clusters ne sont pas conservés à chaud en dehors de la fenêtre planifiée.
Pour obtenir des conseils de planification, consultez les meilleures pratiques de planification.
Enregistrez les paramètres de calcul.
Sélectionnez le bouton Publier dans le ruban supérieur.
Une fois que vous avez publié, le pool est actif et Fabric commence à hydrater les clusters avant la prochaine période de programmation.
Note
La publication peut prendre plusieurs minutes.
Toutes les modifications de l’environnement nécessitent une republication de celui-ci et la mise à jour des clusters hydratés.
Comprendre la fenêtre du planning
Le planning définit la fenêtre pendant laquelle Fabric maintient les clusters hydratés et peut réhydrater ceux qu’il a désactivés. Cela ne maintient pas la piscine active au chaud en dehors de la fenêtre configurée.
Par exemple, considérons un emploi du temps récurrent qui se déroule tous les jours de 8h00 à 17h00 :
- À 8h00, la fenêtre du planning quotidien commence et Fabric commence ou poursuit l’hydratation.
- Pendant la plage de planification, un cluster inactif peut être désactivé après le délai d’inactivité configuré. Fabric peut réhydrater un remplacement en fonction de l’intervalle de réactivation configuré.
- À 17h00, la fenêtre du planning se termine. Fabric ne continue pas à réhydrater les grappes entre 17h00 et 8h00 le lendemain.
- Un notebook soumis en dehors de la fenêtre de planification utilise le provisionnement Spark standard et ne bénéficie pas de l’avantage du démarrage à chaud du pool live.
- Le même comportement quotidien se répète jusqu’à la date de fin du planning configuré.
L’heure de début prévue ne garantit pas qu’un cluster soit déjà disponible à cette heure précise. L’hydratation prend du temps, surtout après une mise à jour de l’environnement ou lorsque Fabric doit provisionner un nouveau cluster. Si un notebook planifié doit démarrer à 8 h 00, démarrez la planification du pool actif 60 à 90 minutes plus tôt. Avant l’exécution du notebook, utilisez le hub de surveillance pour confirmer que les clusters disponibles sont supérieurs à zéro. Un carnet entrant ne reçoit une session chaude que lorsqu’un cluster hydraté compatible est disponible.
Surveiller l’état du pool
Pour vérifier l’état de votre pool actif personnalisé :
Dans le portail Fabric, ouvrez le hub de surveillance.
Recherchez l’environnement que vous avez publié et sélectionnez les points de suspension (...) pour ouvrir le menu contextuel.
Sélectionnez Afficher les détails.
Dans le volet droit, développez la section État du pool en temps réel pour afficher l’état actuel du pool.
Le statut du pool en direct inclut des détails tels que :
- État du pool : par exemple, Actif, Hydratation, Inactif ou Arrêté
- Clusters disponibles : nombre de clusters prêts pour les sessions de notebook
- Clusters occupés : nombre de clusters en cours d’exécution de sessions
- Planification suivante : fenêtre d’activité à venir
Bonnes pratiques
Pour tirer le meilleur parti des pools dynamiques personnalisés, tenez compte des meilleures pratiques suivantes pour la configuration et la gestion :
Optimiser les coûts et les performances
- Aligner le nombre avec la demande : définissez le nombre maximal de clusters en fonction des sessions simultanées attendues. Le surapprovisionnement augmente les coûts.
- Surveiller l’utilisation : passez régulièrement en revue les métriques du pool et ajustez le nombre de clusters si nécessaire.
- Organiser efficacement les plannings : évitez de chevaucher les plannings entre plusieurs pools, sauf si nécessaire.
- Tirez parti du délai d’inactivité : définissez les délais d’inactivité appropriés pour maintenir un équilibre entre la disponibilité des ressources et éviter les redémarrages fréquents du cluster.
Dimensionnement du cluster
Lors de la configuration de votre pool, tenez compte des paramètres et recommandations suivants :
- Taille du cluster : nombre d’instances d’exécuteur pour les sessions de notebook (plage : 1 à 16).
- Nombre maximal de clusters : nombre maximal de clusters à conserver hydraté. Définir en fonction des sessions simultanées attendues.
- Délai d’inactivité : durée pendant laquelle un cluster inutilisé reste alloué avant que Fabric ne le termine.
| Type de charge de travail | Taille recommandée | Description |
|---|---|---|
| Analyse exploratoire | 2 à 4 cœurs | Charges de travail légères, exploration rapide des données |
| Puissance de calcul moyenne | 8 à 12 cœurs | Rapports quotidiens, jeux de données de taille moyenne |
| Calcul lourd | 14 à 16 cœurs | Jeux de données volumineux, transformations complexes |
Gérer les dépendances de bibliothèque
- Utilisez le regroupement d’environnements : préinstallez les bibliothèques courantes dans l’environnement plutôt que l’installation à la volée.
- Gestion des versions de l’environnement : la mise à jour d’un environnement attaché nécessite une nouvelle publication et l’actualisation des clusters hydratés.
- Actualiser les clusters hydratés : après des modifications dans l’environnement, actualisez le pool ou attendez le prochain cycle planifié pour appliquer les changements.
Adapter aux modèles de charge de travail
- Surveiller le comportement extérieur : ajustez les délais d’inactivité en fonction des modèles d’utilisation réels.
- Partager entre les sessions : envisagez de partager le même environnement entre plusieurs pools si vous avez des modèles de charge de travail cohérents pour améliorer l’utilisation des ressources.
Planifier les meilleures pratiques
- S'adapter aux modèles de charge de travail : planifiez les périodes d'activité lorsque votre équipe exécute des notebooks, qu'ils soient interactifs ou planifiés.
- Temps tampon : Commencez le planning 60 à 90 minutes avant la première course prévue sur le carnet pour permettre à l’hydratation de se terminer.
- Vérifier la disponibilité : Avant une exécution programmée sensible à la latence, confirmez que le pool en direct dispose d’au moins un cluster disponible dans le hub de surveillance.
- Tenez compte des fuseaux horaires : si votre équipe s’étend sur plusieurs fuseaux horaires, étendez la planification pour couvrir les intervalles de temps requis.
Résolution des problèmes
La résolution des problèmes de pools dynamiques personnalisés implique la vérification de l’état du pool, de l’intégrité de l’environnement et de la configuration planifiée, comme indiqué dans les scénarios suivants :
Le pool reste indisponible
Si le pool ne parvient pas à activer ou affiche l’état « Non disponible » :
- Vérifiez que la Capacité Fabric est active et actuellement affectée au workspace.
- Vérifiez que l’environnement attaché est dans un état « Prêt ».
- Vérifiez que l’environnement attaché est publié et n’a pas d’erreurs.
L’hydratation prend plus de temps que prévu
Si l’hydratation est plus lente que prévu :
- Vérifiez les dépendances d’environnement et l’état de build.
- Vérifiez que l’environnement est dans un état « Prêt ».
- Consultez les détails du pool pour plus d'informations.
Échec du démarrage des sessions ou des blocs-notes
Si les sessions de notebook ne parviennent pas à démarrer même avec un pool actif :
- Vérifiez que la session utilise l’environnement approprié.
- Vérifiez que le pool est dans l’état « Disponible » et entièrement hydraté.
Les paramètres de piscine live ne sont pas disponibles
Si vous ne pouvez pas créer ou mettre à jour la configuration du pool en direct :
- Vérifiez que vous avez le rôle d’Administrateur ou de Membre de l’espace de travail.
- Si vous avez le rôle Membre , demandez à un administrateur d’espace de travail d’activer la personnalisation de la configuration de calcul des éléments.
- Vérifiez qu’un administrateur d’espace de travail a créé un pool Spark personnalisé que vous pouvez sélectionner dans l’environnement.