Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Os pipelines do Lakeflow baseiam-se em Apache Spark™ Declarative Pipelines (SDP). Os pipelines do Lakeflow são executados no Databricks Runtime, otimizado em termos de desempenho, e são interoperáveis com o SDP. Como os pipelines baseiam-se em SDP em vez de APIs proprietárias, o código de transformação que escreves mantém-se portátil para outros runtimes SDP.
O que é Spark Declarative Pipelines?
Apache Spark Declarative Pipelines é uma estrutura declarativa para desenvolver e executar pipelines de dados em lote e streaming em SQL e Python. O SDP automatiza a orquestração e organiza as dependências entre os fluxos no seu pipeline. O SDP simplifica a ingestão e o desenvolvimento de transformações, para que não tenha de se concentrar nos mecanismos de orquestração dos seus fluxos de trabalho de dados.
Casos de uso comuns para SDP incluem:
- Ingestão de dados em lote a partir de fontes como armazenamento na nuvem (Amazon S3, Azure ADLS Gen2 e Google Cloud Storage).
- Ingestão incremental de dados a partir de barramentos de mensagens (como Apache Kafka, Amazon Kinesis, Google Pub/Sub, Azure EventHub e Apache Pulsar).
- Transformações incrementais em lote e em fluxo com operadores sem estado e com estado interno.
Para obter mais detalhes sobre o processamento de dados declarativos, consulte Processamento de dados processuais versus declarativos no Databricks.
Como é que os oleodutos Lakeflow estendem o SDP?
Os pipelines Lakeflow partilham o mesmo modelo declarativo de autoria do SDP e adicionam funcionalidades de produção como AUTO CDC, expectativas de qualidade de dados e um registo de eventos consultável. Esta tabela compara as capacidades que os pipelines Lakeflow partilham com o SDP e as funcionalidades de produção que o Databricks adiciona por cima. Para uma correspondência propriedade a propriedade entre a especificação do projeto SDP e a configuração do pipeline, consulte Referência das propriedades do pipeline.
| Capability | SDP | Condutas de fluxo de lago |
|---|---|---|
| Pipelines declarativos em SQL e Python | ✓ | ✓ |
| Tabelas de streaming | ✓ | ✓ |
| Visões materializadas | ✓ | ✓ |
| Vistas temporárias | ✓ | ✓ |
| Anexar fluxos | ✓ | ✓ |
| Sinks (Delta, Apache Kafka, and Hubs de Eventos do Azure) | ✓ | ✓ |
| Orquestração automática e resolução de dependências | ✓ | ✓ |
| Código de canalização portável entre ambientes de execução SDP | ✓ | ✓ |
| AUTO CDC (SCD tipo 1 e SCD tipo 2) e AUTO CDC a partir de um instantâneo | — | ✓ |
| Expectativas de qualidade dos dados | — | ✓ |
| Registo de eventos consultável | — | ✓ |
Atualize fluxos e foreachBatch destinos |
— | ✓ |
| Modo contínuo | — | ✓ |