Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Les pipelines Lakeflow sont basés sur des pipelines déclaratifs Apache Spark™ (SDP). Les pipelines Lakeflow s’exécutent sur le runtime Databricks optimisé pour les performances et sont interopérables avec SDP. Étant donné que les pipelines s’appuient sur SDP plutôt que sur des API propriétaires, le code de transformation que vous écrivez reste portable dans d’autres runtimes SDP.
Qu’est-ce que les pipelines déclaratifs Spark ?
Apache Spark Declarative Pipelines est une infrastructure déclarative pour le développement et l’exécution de pipelines de données par lots et de diffusion en continu dans SQL et Python. SDP automatise l’orchestration et organise les dépendances entre les flux de votre pipeline. SDP simplifie l’ingestion et le développement de transformation, afin que vous n’ayez pas à vous concentrer sur la mécanique de l’orchestration de vos flux de travail de données.
Les cas d’usage courants pour SDP sont les suivants :
- Ingestion de données batch à partir de sources telles que le stockage cloud (Amazon S3, Azure ADLS Gen2 et Google Cloud Storage).
- Ingestion incrémentielle de données depuis des bus de messages (comme Apache Kafka, Amazon Kinesis, Google Pub/Sub, Azure EventHub et Apache Pulsar).
- Transformations incrémentielles de traitement par lots et en flux avec des opérateurs avec et sans état.
Pour plus d’informations sur le traitement déclaratif des données, consultez Procédures et traitement déclaratif des données dans Databricks.
Comment les pipelines Lakeflow étendent-ils SDP ?
Les pipelines Lakeflow partagent le même modèle de création déclaratif que SDP et ajoutent des fonctionnalités de production telles que auto CDC, les attentes de qualité des données et un journal des événements interrogeable. Ce tableau compare les fonctionnalités que les pipelines Lakeflow partagent avec SDP et les fonctionnalités de production que Databricks ajoute en haut. Pour obtenir un mappage de propriété par propriété entre la spécification du projet SDP et la configuration du pipeline, consultez la référence des propriétés du pipeline.
| Capability | SDP | Pipelines de Lakeflow |
|---|---|---|
| Pipelines déclaratifs dans SQL et Python | ✓ | ✓ |
| Tables de streaming | ✓ | ✓ |
| Vues matérialisées | ✓ | ✓ |
| Vues temporaires | ✓ | ✓ |
| Flux d’ajout | ✓ | ✓ |
| Récepteurs (Delta, Apache Kafka et Azure Event Hubs) | ✓ | ✓ |
| Orchestration automatique et résolution des dépendances | ✓ | ✓ |
| Code de pipeline portable sur les runtimes SDP | ✓ | ✓ |
| AUTO CDC (SCD Type 1 et SCD Type 2) et AUTO CDC à partir d’un instantané | — | ✓ |
| Attentes en matière de qualité des données | — | ✓ |
| Journal des événements interrogeable | — | ✓ |
Mettre à jour les flux et les foreachBatch destinations |
— | ✓ |
| Mode continu | — | ✓ |