Calcul sans serveur vs. classique pour pipelines

Chaque pipeline de type Pipelines Lakeflow exécute ses mises à jour soit sur un calcul serverless, soit sur un calcul classique. Le type de calcul est un paramètre par pipeline que vous choisissez dans les paramètres du pipeline. Ce n’est pas automatique : un pipeline s’exécute sur des ressources de calcul serverless uniquement lorsque vous activez le paramètre Serverless, et sur des ressources de calcul classiques dans le cas contraire. Cette page compare les deux options afin que vous puissiez choisir la bonne pour chaque pipeline.

Databricks recommande le calcul serverless pour presque tous les pipelines. Avec le serverless, Azure Databricks gère l’infrastructure pour vous. Il n’y a pas de clusters à dimensionner, configurer, sécuriser ou accorder des permissions, et vous bénéficiez de fonctionnalités que le calcul classique ne peut offrir, comme le rafraîchissement incrémental et l’autoscaling vertical. Avec le calcul classique, cette infrastructure est de votre responsabilité de configurer et de maintenir. Le serverless prend en charge presque tout ce que permet Classic Compute. Les exceptions sont le métastore Hive hérité et certaines configurations réseau. Pour la plupart des pipelines, choisir le calcul classique signifie prendre en charge un travail manuel que le serverless gérerait autrement.

Important

L’actualisation incrémentale des vues matérialisées est disponible uniquement sur les pipelines serverless. Les vues matérialisées qui s’exécutent en calcul classique sont toujours entièrement recalculées. Si l’actualisation incrémentale est obligatoire pour votre charge de travail, utilisez le calcul serverless. Consultez Actualisation incrémentielle pour les vues matérialisées.

Comparer les options de calcul

Le tableau suivant compare le calcul serverless et le calcul classique selon les capacités qui guident le plus souvent le choix :

Capacité Serverless Classic
Gestion de l’infrastructure Azure Databricks gère toute l’infrastructure. Il n’y a pas de configuration de cluster. Vous devez configurer les clusters, y compris l’autoscaling, les types d’instance et les politiques de cluster.
Actualisation incrémentielle pour les vues matérialisées Supported. Les vues matérialisées sont rafraîchies progressivement chaque fois que cela est rentable, afin de réduire les coûts de calcul. Consultez Actualisation incrémentielle pour les vues matérialisées. Non pris en charge. Les vues matérialisées sont toujours entièrement recalculées.
Autoscaling Autoscaling amélioré qui évolue horizontalement (plus d’exécuteurs) et verticalement (exécuteurs plus grands). Consultez Optimiser l’utilisation du cluster de pipeline Lakeflow avec la mise à l’échelle automatique. Un autoscaling amélioré qui s’adapte horizontalement. Vous sélectionnez les types d’instances.
Canalisation des cours d’eau Option activée par défaut. Les microlots s’exécutent en parallèle pour augmenter le débit et réduire la latence. Consultez Configurer un pipeline serverless. Non disponible.
Autorisation de création de ressources de calcul Non obligatoire. Tous les utilisateurs de l’espace de travail peuvent exécuter par défaut des pipelines serverless. Required. Les utilisateurs ont besoin d’une autorisation de création de cluster sans restriction ou d’un accès à une politique de calcul.
Politiques de calcul et types d’instances Géré par Azure Databricks. Vous ne définissez pas les types d’instance ni la politique de calcul. Vous appliquez manuellement une politique de calcul et sélectionnez les types d’instance de travailleur et de pilote.
Unity Catalog Il utilise toujours Unity Catalog. Peut utiliser Unity Catalog ou le métastore Hive ancien.
Attribution des coûts Appliquez des balises personnalisées avec une politique d’utilisation sans serveur. Appliquez des tags personnalisés au pipeline. Vous devez rattacher manuellement les données des tags aux données de facturation.
Clusters de mise à jour et de maintenance Géré par Azure Databricks. Vous configurez séparément les clusters de mise à jour et de maintenance.
Calcul à nœud unique Non nécessaire. Les tailles Azure Databricks sont automatiquement calculées pour la charge de travail. Vous configurez le calcul à nœud unique pour de petites charges de travail ou non distribuées.

Quand utiliser l’informatique sans serveur

Utilisez le calcul sans serveur pour tout pipeline qui n’est concerné par aucune des limitations propres au mode classique ci-dessous. En particulier, le serverless est le choix idéal lorsque :

  • Vous voulez qu’Azure Databricks gère l’infrastructure pour vous, y compris l’autoscaling vertical et la sélection des instances, au lieu de configurer et maintenir les clusters vous-même.
  • Vous souhaitez une actualisation incrémentielle des vues matérialisées afin de réduire les coûts d’actualisation.
  • Vous voulez que les utilisateurs de l’espace de travail exécutent des pipelines sans permissions de création de cluster.

Les pipelines serverless nécessitent un espace de travail avec Unity Catalog activé et une région prenant en charge le calcul serverless. Pour les exigences et la configuration, voir Configurer un pipeline serverless.

Quand utiliser le calcul classique

Le serverless prend en charge presque toutes les charges de travail du pipeline, donc utilisez le calcul classique uniquement lorsque le serverless ne peut pas exécuter votre pipeline du tout :

  • Vos tables utilisent le métastore Hive hérité au lieu de Unity Catalog. Pour migrer les tables métastore de la Ruche vers Unity Catalog et activer le serverless, voir Mettre à jour les tables et vues de la Ruche vers le Catalogue Unity.
  • Votre pipeline nécessite un réseau privé que le serverless ne prend pas en charge.
  • Votre pipeline fonctionne dans une région où le serverless n’est pas disponible.

Avec le calcul classique, les politiques de calcul, les types d’instance, le calcul à nœud unique et les clusters séparés de mise à jour et de maintenance sont à vous de configurer et de maintenir, un travail que le serverless fait pour vous.

Pour les options d’installation et de configuration, consultez Configurer le calcul classique pour les pipelines.

Définir le type de calcul

Vous choisissez le type de calcul dans les paramètres de calcul du pipeline en activant ou désactivant le paramètre Serverless . Les nouveaux pipelines utilisent le serverless par défaut. Vous pouvez aussi convertir un pipeline existant configuré avec Unity Catalog en serverless.

Ressources additionnelles