Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Os modos acionado e contínuo do pipeline controlam a forma como um pipeline processa os dados: o modo acionado atualiza os dados disponíveis e para, enquanto o modo contínuo mantém as tabelas atualizadas à medida que vão chegando novos dados. Para cargas de trabalho que requerem latência de milissegundos, consulte Utilizar o modo em tempo real nos pipelines do Lakeflow.
O modo de pipeline é independente do tipo de tabela que está a ser calculada. Tanto as visualizações materializadas como as tabelas de streaming podem ser atualizadas em qualquer um dos modos pipeline.
Note
As operações de atualização de vistas materializadas independentes e de tabelas de fluxo são sempre executadas no modo de pipeline acionado.
O que é o modo de pipeline acionado?
Se o pipeline usar o modo acionado, o sistema para após atualizar todas as tabelas com base nos dados disponíveis no momento em que a atualização começou.
O que é o modo de pipeline contínuo?
Se a canalização usar execução contínua, processa novos dados à medida que chegam às fontes de dados, mantendo as tabelas em toda a canalização atualizadas.
Para evitar processamento desnecessário no modo de execução contínua, os pipelines monitoram automaticamente as tabelas Delta dependentes e executam uma atualização somente quando o conteúdo dessas tabelas dependentes for alterado.
Escolha um modo de pipeline de dados
A tabela a seguir destaca as diferenças entre os modos de pipeline acionado e contínuo:
| Questões essenciais | Acionado | Contínuo |
|---|---|---|
| Quando é que a atualização para? | Automaticamente quando concluído. | Funciona continuamente até ser interrompido manualmente. |
| Que dados são tratados? | Dados disponíveis quando a atualização é iniciada. | Todos os dados à medida que chegam às fontes configuradas. |
| Para que requisitos de atualização de dados isso é melhor? | As atualizações de dados são executadas a cada 10 minutos, de hora em hora ou diariamente. | As atualizações de dados são desejadas a cada 10 segundos e alguns minutos. |
Os pipelines ativados podem reduzir o consumo e a despesa de recurso porque o cluster é executado apenas pelo tempo necessário para atualizar o pipeline. No entanto, novos dados não são processados até que o pipeline seja ativado. Os pipelines contínuos exigem um cluster que funcione continuamente, o que é mais caro, mas reduz a latência de processamento.
Executar um pipeline contínuo com um trabalho contínuo
A Databricks recomenda executar pipelines contínuos com uma tarefa contínua, em vez de definir Pipeline mode como contínuo. Quando um trabalho contínuo orquestra um pipeline, o trabalho gere o ciclo de vida de execução do pipeline e desbloqueia modos de desempenho sem servidor, como o modo Standard, que o modo contínuo integrado do pipeline não suporta.
Note
A orquestração de trabalhos controla o modo de execução apenas para os pipelines do Lakeflow. As visualizações materializadas independentes e as tabelas de fluxo são sempre executadas em modo acionado, independentemente da orquestração de tarefas.
Quando um trabalho orquestra um pipeline, o trabalho define o modo de execução e tem precedência sobre a definição modo do pipeline do pipeline. Um trabalho contínuo executa o seu pipeline continuamente mesmo que o modo Pipeline do pipeline seja ativado, e um trabalho acionado ou agendado executa o seu pipeline como uma única atualização, mesmo que o modo Pipeline do pipeline seja contínuo.
Como a tarefa substitui a definição do modo do pipeline, define o Modo do pipeline como acionado (predefinição) quando a encapsulares numa tarefa contínua. Isto evita comportamentos inesperados se o pipeline correr fora do trabalho.
Para configurar uma tarefa contínua para um pipeline, consulte Executar um pipeline continuamente com uma tarefa contínua.
Execute um pipeline com o modo contínuo integrado
A configuração contínua incorporada do pipeline não está a ser removida, mas o Databricks desencoraja o seu uso para novos pipelines em favor do padrão contínuo de trabalho. Para alternar entre acionado e contínuo, use a opção modo de Pipeline nas configurações do pipeline ao criar ou editar um pipeline. Veja Configurar pipelines.
Definir intervalo de gatilho para pipelines contínuos
Ao configurar pipelines para o modo contínuo, você pode definir intervalos de gatilho para controlar a frequência com que o pipeline inicia uma atualização para cada fluxo. O intervalo de acionamento é uma configuração do pipeline que se aplica quer o pipeline seja executado em modo contínuo através da sua própria definição Pipeline mode quer através de um trabalho contínuo.
Você pode usar pipelines.trigger.interval para controlar o intervalo de disparo para um fluxo que atualiza uma tabela ou um pipeline inteiro. Uma vez que um pipeline desencadeado processa cada tabela apenas uma vez, o pipelines.trigger.interval é usado apenas com pipelines contínuos. A Databricks recomenda defini-la ao nível de cada tabela, porque as consultas de streaming e em lote têm valores predefinidos diferentes. Defina o valor em um pipeline somente quando o processamento exigir o controle de atualizações para todo o gráfico de pipeline.
Para os valores predefinidos por tipo de fluxo e exemplos de definição pipelines.trigger.interval em SQL, Python e a configuração do pipeline, veja Pipelines trigger interval.