Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Os pipelines do Lakeflow são baseados no Apache Spark™ Declarative Pipelines (SDP). Os pipelines do Lakeflow são executados no Databricks Runtime com otimização de desempenho e são interoperáveis com o SDP. Como os pipelines se baseiam em SDP em vez de APIs proprietárias, o código de transformação que você escreve permanece portátil para outros runtimes do SDP.
O que é o Spark Declarative Pipelines?
O Apache Spark Declarative Pipelines é uma estrutura declarativa para desenvolver e executar pipelines de dados em lote e streaming no SQL e Python. O SDP automatiza a orquestração e organiza as dependências entre os fluxos no seu pipeline. O SDP simplifica o desenvolvimento de ingestão e transformação, para que você não precise se concentrar na mecânica da orquestração de seus fluxos de trabalho de dados.
Casos de uso comuns para SDP incluem:
- Ingestão de dados em lote de fontes como armazenamento em nuvem (Amazon S3, Azure ADLS Gen2 e Google Cloud Storage).
- Ingestão incremental de dados de barramentos de mensagens (como Apache Kafka, Amazon Kinesis, Google Pub/Sub, Azure EventHub e Apache Pulsar).
- Transformações incrementais em lote e de streaming com operadores em estado e com estado.
Para obter mais detalhes sobre o processamento de dados declarativos, consulte Processual versus processamento de dados declarativos no Databricks.
Como os pipelines do Lakeflow estendem o SDP?
Os pipelines do Lakeflow compartilham o mesmo modelo de criação declarativa que o SDP e adicionam recursos de produção, como AUTO CDC, expectativas de qualidade de dados e um log de eventos queryable. Esta tabela compara os recursos que os pipelines do Lakeflow compartilham com o SDP e os recursos de produção que o Databricks adiciona na parte superior. Para obter um mapeamento de propriedade por propriedade entre a especificação do projeto SDP e a configuração do pipeline, consulte Referência de propriedades do pipeline.
| Capability | SDP | Pipelines do Lakeflow |
|---|---|---|
| Pipelines declarativos em SQL e Python | ✓ | ✓ |
| Tabelas de streaming | ✓ | ✓ |
| Visões materializadas | ✓ | ✓ |
| Visualizações temporárias | ✓ | ✓ |
| Anexar fluxos | ✓ | ✓ |
| Coletores (Delta, Apache Kafka e Hubs de Eventos do Azure) | ✓ | ✓ |
| Orquestração automática e resolução de dependência | ✓ | ✓ |
| Código de pipeline portável entre ambientes de execução do SDP | ✓ | ✓ |
| AUTO CDC (SCD tipo 1 e SCD tipo 2) e AUTO CDC a partir do instantâneo | — | ✓ |
| Expectativas de qualidade de dados | — | ✓ |
| Log de eventos consultável | — | ✓ |
Atualizar fluxos e foreachBatch coletores |
— | ✓ |
| Modo contínuo | — | ✓ |