Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Os modos acionado e contínuo do pipeline controlam como o pipeline processa os dados: o modo acionado atualiza os dados disponíveis e para, enquanto o modo contínuo mantém as tabelas atualizadas à medida que novos dados chegam. Para cargas de trabalho que exigem latência de milissegundos, consulte Usar o modo em tempo real em pipelines do Lakeflow.
O modo de pipeline é independente do tipo de tabela que está sendo computada. As exibições materializadas e as tabelas de streaming podem ser atualizadas em um dos modos de pipeline.
Note
As operações de atualização de visualizações materializadas autônomas e tabelas de streaming sempre são executadas no modo de pipeline acionado.
O que é o modo de pipeline disparado?
Se o pipeline usa o modo acionado, o sistema é interrompido depois de atualizar todas as tabelas com base nos dados disponíveis quando a atualização começou.
O que é o modo de pipeline contínuo?
Se o pipeline usa execução contínua, ele processa novos dados à medida que chegam às fontes de dados para manter as tabelas ao longo de todo o pipeline sempre atualizadas.
Para evitar o processamento desnecessário no modo de execução contínua, os pipelines monitoram automaticamente tabelas Delta dependentes e executam uma atualização somente quando o conteúdo dessas tabelas dependentes é alterado.
Escolher um modo de pipeline de dados
A seguinte tabela destaca as diferenças entre os modos de pipeline contínuo e disparado:
| Principais perguntas | Disparado | Contínuo |
|---|---|---|
| Quando a atualização é interrompida? | Automaticamente quando concluído. | Funciona continuamente até ser interrompido manualmente. |
| Quais dados são processados? | Dados disponíveis quando a atualização é iniciada. | Todos os dados à medida que chegam às fontes configuradas. |
| Para quais requisitos de atualização de dados isso é melhor? | As atualizações de dados são executadas a cada 10 minutos, por hora ou diariamente. | As atualizações de dados são desejadas entre 10 segundos e alguns minutos. |
Os pipelines disparados podem reduzir o consumo de recursos e as despesas porque o cluster é executado apenas pelo tempo suficiente para atualizar o pipeline. No entanto, novos dados não são processados até que o pipeline seja acionado. Os pipelines contínuos exigem um cluster sempre em execução, o que é mais caro mas reduz a latência de processamento.
Executar um pipeline contínuo com um trabalho contínuo
O Databricks recomenda executar pipelines contínuos com um trabalho contínuo, em vez de configurar o Modo de pipeline como contínuo. Quando um trabalho contínuo orquestra um pipeline, o trabalho gerencia o ciclo de vida da execução do pipeline e habilita os modos de desempenho sem servidor, como o modo Standard, que o modo contínuo interno do pipeline não oferece.
Note
A orquestração de trabalhos controla o modo de execução apenas para pipelines do Lakeflow. Visualizações materializadas independentes e tabelas de streaming sempre rodam no modo acionado, independentemente da orquestração do trabalho.
Quando um trabalho orquestra um pipeline, ele determina o modo de execução e prevalece sobre a configuração Modo do pipeline do pipeline. Um trabalho contínuo executa seu pipeline continuamente, mesmo que o Modo pipeline do pipeline seja acionado, e um trabalho acionado ou agendado executa seu pipeline em uma única atualização, mesmo que o Modo pipeline do pipeline seja contínuo.
Como o trabalho substitui a configuração do modo pipeline, defina o Modo pipeline do pipeline como acionado (o padrão) ao encapsulá-lo em um trabalho contínuo. Isso evita comportamentos inesperados se o pipeline rodar fora do trabalho.
Para configurar um trabalho contínuo para um pipeline, consulte Executar um pipeline continuamente com um trabalho contínuo.
Executar um pipeline com o modo contínuo interno
A configuração contínua interna do pipeline não está sendo removida, mas o Databricks desencoraja seu uso por novos pipelines em favor do padrão contínuo de trabalho. Para alterar entre os modos disparado e contínuo, use a opção Modo Pipeline nas configurações de pipeline durante a criação ou edição de um pipeline. Consulte Configurar pipelines.
Definir o intervalo de gatilho para pipelines contínuos
Ao configurar pipelines para o modo contínuo, você pode definir intervalos de gatilho para controlar com que frequência o pipeline inicia uma atualização para cada fluxo. O intervalo do gatilho é uma configuração do pipeline que se aplica seja quando o pipeline é executado em modo contínuo por meio da própria configuração Modo pipeline, seja por meio de um trabalho contínuo.
Você pode usar pipelines.trigger.interval para controlar o intervalo de ativação para um fluxo que atualiza uma tabela ou um pipeline inteiro. Como um pipeline disparado processa cada tabela uma única vez, o pipelines.trigger.interval é usado apenas com pipelines contínuos. O Databricks recomenda defini-lo em tabelas individuais, porque consultas de streaming e em lote têm padrões diferentes. Defina o valor em um pipeline somente quando o processamento exigir o controle de atualizações para todo o grafo de pipeline.
Para os valores padrão por tipo de fluxo e exemplos de configuração pipelines.trigger.interval em SQL, Python e a configuração do pipeline, veja Pipelines trigger interval.