Computación sin servidor vs. clásica para pipelines

Cada pipeline de Lakeflow Pipelines ejecuta sus actualizaciones tanto en computación serverless como en computación clásica. El tipo de proceso es una configuración de cada canalización que elige en la configuración de la canalización. No es automático: una canalización se ejecuta en cómputo sin servidor solo cuando activas la opción Serverless, y de lo contrario se ejecuta en cómputo clásico. Esta página compara las dos opciones para que puedas elegir la adecuada para cada pipeline.

Databricks recomienda el cómputo sin servidor para casi todas las canalizaciones. Con serverless, Azure Databricks gestiona la infraestructura por ti. No hay clústeres para dimensionar, configurar, asegurar o conceder permisos, y obtienes capacidades que la computación clásica no puede ofrecer, como la actualización incremental y el escalado automático vertical. Con la computación clásica, esa infraestructura es tu responsabilidad para configurarla y mantenerla. Serverless soporta casi todo lo que hace Classic Compute. Las excepciones son la metatienda Hive heredada y algunas configuraciones de red. Para la mayoría de las canalizaciones, elegir la computación clásica supone hacerse cargo de tareas manuales de las que, de otro modo, se encargaría la informática sin servidor.

Importante

La actualización incremental de vistas materializadas solo está disponible en canalizaciones sin servidor. Las vistas materializadas que se ejecutan en computación clásica siempre se recalculan completamente. Si la actualización incremental es un requisito para tu carga de trabajo, utiliza proceso sin servidor. Consulte Actualización incremental para obtener vistas materializadas.

Comparar opciones de cálculo

La siguiente tabla compara la computación serverless y la computación clásica entre las capacidades que más a menudo impulsan la elección:

Capacidad Serverless Classic
Administración de la infraestructura Azure Databricks gestiona toda la infraestructura. No hay configuración de clúster. Debes configurar clústeres, incluyendo autoescalado, tipos de instancias y políticas de clúster.
Actualización incremental para obtener vistas materializadas Supported. Las vistas materializadas se actualizan de forma incremental siempre que es rentable, para reducir los costes de cálculo. Consulte Actualización incremental para obtener vistas materializadas. No está soportado. Las vistas materializadas siempre se recalculan completamente.
Autoscaling Autoescalado mejorado que escala horizontalmente (más ejecutores) y verticalmente (ejecutores más grandes). Consulte Optimizar la utilización del clúster de canalización de Lakeflow mediante escalado automático. Escalado automático mejorado que escala horizontalmente. Seleccionas los tipos de instancias.
Canalización de flujos Habilitado de forma predeterminada. Los microlotes se ejecutan simultáneamente para mejorar el rendimiento y la latencia. Consulte Configuración de una canalización sin servidor. No está disponible.
Permiso para crear recursos de computación No es necesario. Todos los usuarios del espacio de trabajo pueden ejecutar canalizaciones sin servidor por defecto. Required. Los usuarios necesitan permiso de creación de clústeres sin restricciones o acceso a una política de cómputo.
Políticas de cómputo y tipos de instancias Gestionado por Azure Databricks. No se establecen tipos de instancia ni una política de cómputo. Aplicas manualmente una política de cómputo y seleccionas los tipos de instancias de trabajador y controlador.
Catálogo de Unity Siempre usa Unity Catalog. Se puede usar Unity Catalog o el antiguo metastore Hive.
Atribución de costos Aplica etiquetas personalizadas con una política de uso sin servidor. Aplica etiquetas personalizadas a la canalización. Debes unir manualmente los datos de etiquetas a los datos de facturación.
Clústeres de actualización y mantenimiento Gestionado por Azure Databricks. Configuras los clústeres de actualización y mantenimiento por separado.
Cálculo de un solo nodo No es necesario. Los tamaños de Azure Databricks se calculan automáticamente para la carga de trabajo. Configuras el cálculo de un solo nodo para cargas de trabajo pequeñas o no distribuidas.

Cuándo usar computación sin servidor

Utiliza proceso sin servidor para cualquier canalización que no se vea afectada por ninguna de las limitaciones exclusivas de Classic que se indican a continuación. En particular, el serverless es la opción correcta cuando:

  • Quieres que Azure Databricks gestione la infraestructura por ti, incluyendo escalado automático vertical y selección de instancias, en lugar de configurar y mantener los clústeres tú mismo.
  • Deseas una actualización incremental para las vistas materializadas y así reducir los costes de actualización.
  • Quieres que los usuarios del espacio de trabajo ejecuten pipelines sin permisos de creación de clúster.

Las canalizaciones sin servidor requieren un área de trabajo con Unity Catalog activado y una región compatible con sin servidor. Para requisitos y configuración, consulte Configurar una canalización sin servidor.

Cuándo usar la computación clásica

La informática sin servidor admite casi todas las cargas de trabajo de canalización, así que use la informática clásica solo cuando la informática sin servidor no pueda ejecutar la canalización en ningún caso:

  • Sus tablas usan el metastore heredado de Hive en lugar de Unity Catalog. Para migrar las tablas de metastore de Hive a Unity Catalog y habilitar serverless, consulta Actualizar tablas y vistas de Hive a Unity Catalog.
  • Tu pipeline requiere redes privadas que el serverless no soporta.
  • Su canalización se ejecuta en una región en la que no está disponible la tecnología sin servidor.

Con el cómputo clásico, las políticas de cómputo, los tipos de instancia, el cómputo de un solo nodo y los clústeres separados de actualización y mantenimiento son tuyos para configurar y mantener, un trabajo que el serverless hace por ti.

Para conocer las opciones de instalación y configuración, consulte Configurar el proceso clásico para las canalizaciones.

Establecer el tipo de cómputo

Eliges el tipo de cómputo en la configuración de Cómputo de la tubería activando o deshabilitando la configuración Serverless . Las nuevas canalizaciones usan la arquitectura sin servidor por defecto. También puedes convertir una pipeline existente configurada con Unity Catalog a serverless.

Recursos adicionales