Oleodutos independentes vs. oleodutos Lakeflow

O Azure Databricks oferece duas formas de construir vistas materializadas e tabelas de streaming: pipelines independentes ou pipelines Lakeflow. Ambos funcionam no mesmo motor declarativo e produzem tabelas geridas pelo Unity Catalog. A diferença está na quantidade do pipeline que crias e operas.

  • Uma visualização materializada autónoma ou tabela de streaming é um único conjunto de dados definido com sintaxe SQL. O Azure Databricks cria e gere um pipeline nos bastidores para atualizá-lo. Pode criar e atualizar conjuntos de dados autónomos a partir de um Databricks SQL warehouse ou de um notebook em computação geral sem servidor com spark.sql(). Ver Oleodutos independentes.
  • Uma pipeline Lakeflow é uma pipeline que define e opera como uma unidade. Pode conter muitos conjuntos de datos, em SQL e Python, com orquestração de dependências, linhagem e funcionalidades operacionais em toda a pipeline. Veja: O que são oleodutos?

Quando cria uma vista materializada independente ou uma tabela de streaming, o pipeline gerido aparece na página Jobs & Pipelines com um tipo de pipeline de MV/ST. Os conjuntos de dados definidos num pipeline do Lakeflow têm o tipo de pipeline ETL.

Quando usar um pipeline autónomo

Utilize visualizações materializadas independentes e tabelas de fluxo quando:

  • Acelera consultas ou transforma dados com uma única visualização materializada ou tabela de streaming.
  • Trabalhas a partir de um armazém SQL do Databricks, do editor SQL, ou de um caderno em computação geral sem servidor, e agendas atualizações com SCHEDULE, TRIGGER ON UPDATE, ou uma tarefa SQL num trabalho.
  • Não precisas de sinks, orquestração em vários estágios ou outras funcionalidades apenas de pipeline.

Quando usar um gasoduto Lakeflow

Utilize um oleoduto Lakeflow quando:

  • Constróis um pipeline de múltiplas fases com conjuntos de dados intermédios, onde o Azure Databricks gere as dependências e a linhagem entre os conjuntos de dados. Conjuntos de dados intermédios podem ser publicados no catálogo ou mantidos privados no pipeline.
  • Tu crias tabelas e fluxos em Python.
  • Pode escrever em tabelas Delta externas ou em destinos de transmissão de eventos utilizando sinks (create_sink() ou foreach_batch_sink()).
  • Aplica a captura de dados alterados a partir de um instantâneo da base de dados usando create_auto_cdc_from_snapshot_flow().
  • Queres uma execução desencadeada ou contínua em todo o pipeline.

Comparison

Property Mesa de streaming autónoma ou visualização materializada Tabela de transmissão em fluxo da canalização ou vista materializada
Interface de criação Sintaxe SQL, a partir de um armazém Databricks SQL ou com spark.sql() num bloco de notas em computação geral sem servidor SQL e Python
Scope Um conjunto de dados, num pipeline que o Azure Databricks gere para ti Muitos conjuntos de dados num único pipeline, com orquestração de dependências e rastreabilidade
Execução Acionado, com SCHEDULE, TRIGGER ON UPDATE, ou com uma tarefa SQL Acionado ou contínuo
Funcionalidades exclusivas do pipeline Sumidouros, create_auto_cdc_from_snapshot_flow(), conjuntos de dados privados
Rótulo de tipo de oleoduto MV/ST ETL
Movimentação entre oleodutos Não suportado; recriar a tabela no pipeline de destino Suportado