Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
O Azure Databricks oferece duas formas de construir vistas materializadas e tabelas de streaming: pipelines independentes ou pipelines Lakeflow. Ambos funcionam no mesmo motor declarativo e produzem tabelas geridas pelo Unity Catalog. A diferença está na quantidade do pipeline que crias e operas.
-
Uma visualização materializada autónoma ou tabela de streaming é um único conjunto de dados definido com sintaxe SQL. O Azure Databricks cria e gere um pipeline nos bastidores para atualizá-lo. Pode criar e atualizar conjuntos de dados autónomos a partir de um Databricks SQL warehouse ou de um notebook em computação geral sem servidor com
spark.sql(). Ver Oleodutos independentes. - Uma pipeline Lakeflow é uma pipeline que define e opera como uma unidade. Pode conter muitos conjuntos de datos, em SQL e Python, com orquestração de dependências, linhagem e funcionalidades operacionais em toda a pipeline. Veja: O que são oleodutos?
Quando cria uma vista materializada independente ou uma tabela de streaming, o pipeline gerido aparece na página Jobs & Pipelines com um tipo de pipeline de MV/ST. Os conjuntos de dados definidos num pipeline do Lakeflow têm o tipo de pipeline ETL.
Quando usar um pipeline autónomo
Utilize visualizações materializadas independentes e tabelas de fluxo quando:
- Acelera consultas ou transforma dados com uma única visualização materializada ou tabela de streaming.
- Trabalhas a partir de um armazém SQL do Databricks, do editor SQL, ou de um caderno em computação geral sem servidor, e agendas atualizações com
SCHEDULE,TRIGGER ON UPDATE, ou uma tarefa SQL num trabalho. - Não precisas de sinks, orquestração em vários estágios ou outras funcionalidades apenas de pipeline.
Quando usar um gasoduto Lakeflow
Utilize um oleoduto Lakeflow quando:
- Constróis um pipeline de múltiplas fases com conjuntos de dados intermédios, onde o Azure Databricks gere as dependências e a linhagem entre os conjuntos de dados. Conjuntos de dados intermédios podem ser publicados no catálogo ou mantidos privados no pipeline.
- Tu crias tabelas e fluxos em Python.
- Pode escrever em tabelas Delta externas ou em destinos de transmissão de eventos utilizando sinks (
create_sink()ouforeach_batch_sink()). - Aplica a captura de dados alterados a partir de um instantâneo da base de dados usando
create_auto_cdc_from_snapshot_flow(). - Queres uma execução desencadeada ou contínua em todo o pipeline.
Comparison
| Property | Mesa de streaming autónoma ou visualização materializada | Tabela de transmissão em fluxo da canalização ou vista materializada |
|---|---|---|
| Interface de criação | Sintaxe SQL, a partir de um armazém Databricks SQL ou com spark.sql() num bloco de notas em computação geral sem servidor |
SQL e Python |
| Scope | Um conjunto de dados, num pipeline que o Azure Databricks gere para ti | Muitos conjuntos de dados num único pipeline, com orquestração de dependências e rastreabilidade |
| Execução | Acionado, com SCHEDULE, TRIGGER ON UPDATE, ou com uma tarefa SQL |
Acionado ou contínuo |
| Funcionalidades exclusivas do pipeline | Sumidouros, create_auto_cdc_from_snapshot_flow(), conjuntos de dados privados |
|
| Rótulo de tipo de oleoduto | MV/ST |
ETL |
| Movimentação entre oleodutos | Não suportado; recriar a tabela no pipeline de destino | Suportado |