Présentation

Effectué

Chaque charge de travail Azure Databricks s’exécute sur des ressources de calcul, mais le choix du type de calcul ou de la configuration incorrect entraîne des coûts inutiles, des performances médiocres ou des fonctionnalités bloquées. Le calcul serverless démarre en quelques secondes, mais ne prend pas en charge les API RDD. Le calcul classique offre une flexibilité complète, mais nécessite davantage de surcharge de gestion. Les entrepôts SQL excellent dans les requêtes analytiques, tandis que les clusters de jobs optimisent les flux de travail automatisés. La compréhension de ces différences vous permet de faire correspondre le calcul aux exigences de charge de travail.

Au-delà de la sélection d’un type de calcul, les décisions de configuration définissent la façon dont votre charge de travail fonctionne. Les types de nœuds déterminent la capacité de traitement et la disponibilité de la mémoire. La mise à l’échelle automatique équilibre les coûts et la réactivité. Les autorisations d’accès contrôlent qui peut utiliser des ressources de calcul pendant que les installations de bibliothèque fournissent les dépendances dont votre code a besoin. Chaque choix de configuration affecte plusieurs dimensions : performances, coût, sécurité et complexité opérationnelle.

L’obtention d’une configuration de calcul appropriée importe tout au long du cycle de vie du développement. Pendant l’exploration, vous avez besoin de cycles d’itération rapides et d’une surcharge minimale de configuration. En production, la stabilité et l’efficacité des coûts sont prioritaires. L’accélération photon peut doubler les performances des requêtes pour les charges de travail SQL. Les pools d’instances réduisent le temps de démarrage, mais nécessitent un paiement pour une capacité inactive. Les modes d’accès dédié permettent la collaboration de groupes sécurisés tout en appliquant des limites d’autorisation.

Dans ce module, vous allez apprendre à évaluer systématiquement les options de calcul et à configurer des ressources qui correspondent aux caractéristiques de votre charge de travail. Vous découvrez quand le calcul serverless offre la meilleure expérience, comment paramétrer les paramètres de performances pour différents scénarios et les meilleures pratiques pour gérer l’accès et les dépendances au sein de votre organisation.