Pipelines Declarativos do Apache Spark

Os pipelines do Lakeflow são baseados no Apache Spark™ Declarative Pipelines (SDP). Os pipelines do Lakeflow são executados no Databricks Runtime com otimização de desempenho e são interoperáveis com o SDP. Como os pipelines se baseiam em SDP em vez de APIs proprietárias, o código de transformação que você escreve permanece portátil para outros runtimes do SDP.

O que é o Spark Declarative Pipelines?

O Apache Spark Declarative Pipelines é uma estrutura declarativa para desenvolver e executar pipelines de dados em lote e streaming no SQL e Python. O SDP automatiza a orquestração e organiza as dependências entre os fluxos no seu pipeline. O SDP simplifica o desenvolvimento de ingestão e transformação, para que você não precise se concentrar na mecânica da orquestração de seus fluxos de trabalho de dados.

Casos de uso comuns para SDP incluem:

  • Ingestão de dados em lote de fontes como armazenamento em nuvem (Amazon S3, Azure ADLS Gen2 e Google Cloud Storage).
  • Ingestão incremental de dados de barramentos de mensagens (como Apache Kafka, Amazon Kinesis, Google Pub/Sub, Azure EventHub e Apache Pulsar).
  • Transformações incrementais em lote e de streaming com operadores em estado e com estado.

Para obter mais detalhes sobre o processamento de dados declarativos, consulte Processual versus processamento de dados declarativos no Databricks.

Como os pipelines do Lakeflow estendem o SDP?

Os pipelines do Lakeflow compartilham o mesmo modelo de criação declarativa que o SDP e adicionam recursos de produção, como AUTO CDC, expectativas de qualidade de dados e um log de eventos queryable. Esta tabela compara os recursos que os pipelines do Lakeflow compartilham com o SDP e os recursos de produção que o Databricks adiciona na parte superior. Para obter um mapeamento de propriedade por propriedade entre a especificação do projeto SDP e a configuração do pipeline, consulte Referência de propriedades do pipeline.

Capability SDP Pipelines do Lakeflow
Pipelines declarativos em SQL e Python
Tabelas de streaming
Visões materializadas
Visualizações temporárias
Anexar fluxos
Coletores (Delta, Apache Kafka e Hubs de Eventos do Azure)
Orquestração automática e resolução de dependência
Código de pipeline portável entre ambientes de execução do SDP
AUTO CDC (SCD tipo 1 e SCD tipo 2) e AUTO CDC a partir do instantâneo
Expectativas de qualidade de dados
Log de eventos consultável
Atualizar fluxos e foreachBatch coletores
Modo contínuo

Recursos adicionais