Modo de operações da linha de produção acionado entre contínuo

Os modos acionado e contínuo do pipeline controlam a forma como um pipeline processa os dados: o modo acionado atualiza os dados disponíveis e para, enquanto o modo contínuo mantém as tabelas atualizadas à medida que vão chegando novos dados. Para cargas de trabalho que requerem latência de milissegundos, consulte Utilizar o modo em tempo real nos pipelines do Lakeflow.

O modo de pipeline é independente do tipo de tabela que está a ser calculada. Tanto as visualizações materializadas como as tabelas de streaming podem ser atualizadas em qualquer um dos modos pipeline.

Note

As operações de atualização de vistas materializadas independentes e de tabelas de fluxo são sempre executadas no modo de pipeline acionado.

O que é o modo de pipeline acionado?

Se o pipeline usar o modo acionado, o sistema para após atualizar todas as tabelas com base nos dados disponíveis no momento em que a atualização começou.

O que é o modo de pipeline contínuo?

Se a canalização usar execução contínua, processa novos dados à medida que chegam às fontes de dados, mantendo as tabelas em toda a canalização atualizadas.

Para evitar processamento desnecessário no modo de execução contínua, os pipelines monitoram automaticamente as tabelas Delta dependentes e executam uma atualização somente quando o conteúdo dessas tabelas dependentes for alterado.

Escolha um modo de pipeline de dados

A tabela a seguir destaca as diferenças entre os modos de pipeline acionado e contínuo:

Questões essenciais Acionado Contínuo
Quando é que a atualização para? Automaticamente quando concluído. Funciona continuamente até ser interrompido manualmente.
Que dados são tratados? Dados disponíveis quando a atualização é iniciada. Todos os dados à medida que chegam às fontes configuradas.
Para que requisitos de atualização de dados isso é melhor? As atualizações de dados são executadas a cada 10 minutos, de hora em hora ou diariamente. As atualizações de dados são desejadas a cada 10 segundos e alguns minutos.

Os pipelines ativados podem reduzir o consumo e a despesa de recurso porque o cluster é executado apenas pelo tempo necessário para atualizar o pipeline. No entanto, novos dados não são processados até que o pipeline seja ativado. Os pipelines contínuos exigem um cluster que funcione continuamente, o que é mais caro, mas reduz a latência de processamento.

Executar um pipeline contínuo com um trabalho contínuo

A Databricks recomenda executar pipelines contínuos com uma tarefa contínua, em vez de definir Pipeline mode como contínuo. Quando um trabalho contínuo orquestra um pipeline, o trabalho gere o ciclo de vida de execução do pipeline e desbloqueia modos de desempenho sem servidor, como o modo Standard, que o modo contínuo integrado do pipeline não suporta.

Note

A orquestração de trabalhos controla o modo de execução apenas para os pipelines do Lakeflow. As visualizações materializadas independentes e as tabelas de fluxo são sempre executadas em modo acionado, independentemente da orquestração de tarefas.

Quando um trabalho orquestra um pipeline, o trabalho define o modo de execução e tem precedência sobre a definição modo do pipeline do pipeline. Um trabalho contínuo executa o seu pipeline continuamente mesmo que o modo Pipeline do pipeline seja ativado, e um trabalho acionado ou agendado executa o seu pipeline como uma única atualização, mesmo que o modo Pipeline do pipeline seja contínuo.

Como a tarefa substitui a definição do modo do pipeline, define o Modo do pipeline como acionado (predefinição) quando a encapsulares numa tarefa contínua. Isto evita comportamentos inesperados se o pipeline correr fora do trabalho.

Para configurar uma tarefa contínua para um pipeline, consulte Executar um pipeline continuamente com uma tarefa contínua.

Execute um pipeline com o modo contínuo integrado

A configuração contínua incorporada do pipeline não está a ser removida, mas o Databricks desencoraja o seu uso para novos pipelines em favor do padrão contínuo de trabalho. Para alternar entre acionado e contínuo, use a opção modo de Pipeline nas configurações do pipeline ao criar ou editar um pipeline. Veja Configurar pipelines.

Definir intervalo de gatilho para pipelines contínuos

Ao configurar pipelines para o modo contínuo, você pode definir intervalos de gatilho para controlar a frequência com que o pipeline inicia uma atualização para cada fluxo. O intervalo de acionamento é uma configuração do pipeline que se aplica quer o pipeline seja executado em modo contínuo através da sua própria definição Pipeline mode quer através de um trabalho contínuo.

Você pode usar pipelines.trigger.interval para controlar o intervalo de disparo para um fluxo que atualiza uma tabela ou um pipeline inteiro. Uma vez que um pipeline desencadeado processa cada tabela apenas uma vez, o pipelines.trigger.interval é usado apenas com pipelines contínuos. A Databricks recomenda defini-la ao nível de cada tabela, porque as consultas de streaming e em lote têm valores predefinidos diferentes. Defina o valor em um pipeline somente quando o processamento exigir o controle de atualizações para todo o gráfico de pipeline.

Para os valores predefinidos por tipo de fluxo e exemplos de definição pipelines.trigger.interval em SQL, Python e a configuração do pipeline, veja Pipelines trigger interval.