Modo de canalización desencadenado frente a continuo

Los modos de canalización desencadenados y continuos controlan cómo una canalización procesa los datos: el modo desencadenado actualiza los datos disponibles y se detiene, mientras que el modo continuo mantiene las tablas actualizadas a medida que llegan nuevos datos. Para las cargas de trabajo que requieren latencia de milisegundos, consulte Uso del modo en tiempo real en canalizaciones de Lakeflow.

El modo de canalización es independiente del tipo de tabla que se está calculando. Tanto las vistas materializadas como las tablas de streaming se pueden actualizar en cualquier modo de canalización.

Note

Las operaciones de actualización para vistas materializadas independientes y tablas de streaming siempre se ejecutan mediante el modo de canalización desencadenado.

¿Qué es el modo de canalización desencadenado?

Si el proceso usa el modo triggered, el sistema se detiene después de actualizar todas las tablas a partir de los datos disponibles cuando se inició la actualización.

¿Qué es el modo de canalización continua?

Si la canalización utiliza la ejecución continua, procesa nuevos datos conforme llegan a los orígenes de datos para mantener actualizadas las tablas de toda la canalización.

Para evitar el procesamiento innecesario en modo de ejecución continua, las canalizaciones supervisan automáticamente las tablas Delta dependientes y realizan una actualización solo cuando el contenido de esas tablas dependientes ha cambiado.

Elección de un modo de canalización de datos

En la tabla siguiente se resaltan las diferencias entre los modos de canalización desencadenados y continuos:

Preguntas clave Desencadenado Continuo
¿Cuándo se detiene la actualización? Automáticamente al completarse. Se ejecuta continuamente hasta que se detiene manualmente.
¿Qué datos se procesan? Datos disponibles cuando se inicia la actualización. Todos los datos a medida que llegan a los orígenes configurados.
¿Para qué requisitos de actualización de datos es mejor? Las actualizaciones de datos se ejecutan cada 10 minutos, cada hora o diariamente. Las actualizaciones de datos se desean entre cada 10 segundos y unos minutos.

Las canalizaciones desencadenadas pueden reducir el consumo y el gasto de recursos, ya que el clúster solo se ejecuta lo suficientemente largo como para actualizar la canalización. Sin embargo, los nuevos datos no se procesan hasta que se desencadene la canalización. Las canalizaciones continuas requieren un clúster siempre en ejecución, que es más caro, pero reduce la latencia de procesamiento.

Ejecute una canalización continua con un trabajo continuo

Databricks recomienda ejecutar canalizaciones continuas con un trabajo continuo en lugar de poner el valor del modo Pipeline en continuo. Cuando un trabajo continuo orquesta una canalización, este gestiona el ciclo de vida de la ejecución de la canalización y desbloquea modos de rendimiento sin servidor, como el modo Estándar, que el modo continuo integrado no soporta.

Note

La orquestación de trabajos controla el modo de ejecución solo para las canalizaciones Lakeflow. Las vistas materializadas independientes y las tablas en streaming siempre se ejecutan en modo desencadenado, independientemente de la orquestación del trabajo.

Cuando un trabajo orquesta una canalización, el trabajo determina el modo de ejecución y tiene prioridad sobre la configuración del modo Pipeline de la canalización. Un trabajo continuo ejecuta su canalización de forma continua incluso si se activa el modo Pipeline de la canalización, y un trabajo activado o programado ejecuta su canalización como una única actualización incluso si el modo Pipeline de la canalización es continuo.

Como el trabajo anula la configuración del modo de canalización, establezca el modo Pipeline de la canalización en activado (el valor predeterminado) cuando la incluya en un trabajo continuo. Esto evita comportamientos inesperados si la canalización se ejecuta fuera del trabajo.

Para configurar un trabajo continuo para una canalización, consulte Ejecutar una canalización continuamente con un trabajo continuo.

Ejecute una canalización con el modo continuo incorporado

La configuración continua integrada de la canalización no se va a eliminar, pero Databricks desaconseja su uso en las nuevas canalizaciones en favor del patrón de trabajo continuo. Para cambiar entre desencadenado y continuo, utilice la opción modo de canalización en la configuración de canalización al crear o editar una canalización. Consulte Configuración de canalizaciones.

Configurar intervalo de desencadenador para canalizaciones continuas

Al configurar canalizaciones para el modo continuo, puede establecer intervalos de desencadenador para controlar la frecuencia con la que la canalización inicia una actualización para cada flujo. El intervalo de activación es una configuración de la canalización que se aplica independientemente de si la canalización se ejecuta en modo continuo mediante su propia opción Modo de canalización o mediante un trabajo continuo.

Puede usar pipelines.trigger.interval para controlar el intervalo de activación de un flujo que actualiza una tabla o una canalización completa. Como una canalización desencadenada procesa cada tabla una sola vez, pipelines.trigger.interval solo se usa con canalizaciones continuas. Databricks recomienda configurarlo en tablas individuales, porque las consultas de streaming y lotes tienen valores predeterminados diferentes. Establezca el valor en una canalización solo cuando el procesamiento requiera controlar las actualizaciones de todo el gráfico de canalización.

Para consultar los valores predeterminados por tipo de flujo y ejemplos de cómo configurar pipelines.trigger.interval en SQL, Python y la configuración de la canalización, consulte Intervalo de activación de las canalizaciones.