Pipelines Declarativos Apache Spark

Os pipelines do Lakeflow baseiam-se em Apache Spark™ Declarative Pipelines (SDP). Os pipelines do Lakeflow são executados no Databricks Runtime, otimizado em termos de desempenho, e são interoperáveis com o SDP. Como os pipelines baseiam-se em SDP em vez de APIs proprietárias, o código de transformação que escreves mantém-se portátil para outros runtimes SDP.

O que é Spark Declarative Pipelines?

Apache Spark Declarative Pipelines é uma estrutura declarativa para desenvolver e executar pipelines de dados em lote e streaming em SQL e Python. O SDP automatiza a orquestração e organiza as dependências entre os fluxos no seu pipeline. O SDP simplifica a ingestão e o desenvolvimento de transformações, para que não tenha de se concentrar nos mecanismos de orquestração dos seus fluxos de trabalho de dados.

Casos de uso comuns para SDP incluem:

  • Ingestão de dados em lote a partir de fontes como armazenamento na nuvem (Amazon S3, Azure ADLS Gen2 e Google Cloud Storage).
  • Ingestão incremental de dados a partir de barramentos de mensagens (como Apache Kafka, Amazon Kinesis, Google Pub/Sub, Azure EventHub e Apache Pulsar).
  • Transformações incrementais em lote e em fluxo com operadores sem estado e com estado interno.

Para obter mais detalhes sobre o processamento de dados declarativos, consulte Processamento de dados processuais versus declarativos no Databricks.

Como é que os oleodutos Lakeflow estendem o SDP?

Os pipelines Lakeflow partilham o mesmo modelo declarativo de autoria do SDP e adicionam funcionalidades de produção como AUTO CDC, expectativas de qualidade de dados e um registo de eventos consultável. Esta tabela compara as capacidades que os pipelines Lakeflow partilham com o SDP e as funcionalidades de produção que o Databricks adiciona por cima. Para uma correspondência propriedade a propriedade entre a especificação do projeto SDP e a configuração do pipeline, consulte Referência das propriedades do pipeline.

Capability SDP Condutas de fluxo de lago
Pipelines declarativos em SQL e Python
Tabelas de streaming
Visões materializadas
Vistas temporárias
Anexar fluxos
Sinks (Delta, Apache Kafka, and Hubs de Eventos do Azure)
Orquestração automática e resolução de dependências
Código de canalização portável entre ambientes de execução SDP
AUTO CDC (SCD tipo 1 e SCD tipo 2) e AUTO CDC a partir de um instantâneo
Expectativas de qualidade dos dados
Registo de eventos consultável
Atualize fluxos e foreachBatch destinos
Modo contínuo

Recursos adicionais