Notitie
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen u aan te melden of de directory te wijzigen.
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen de mappen te wijzigen.
Lakeflow-pijplijnen zijn gebaseerd op Apache Spark™ Declarative Pipelines (SDP). Lakeflow-pijplijnen worden uitgevoerd op de voor prestaties geoptimaliseerde Databricks Runtime en werken samen met SDP. Omdat pijplijnen bouwen op SDP in plaats van eigen API's, blijft de transformatiecode die u schrijft overdraagbaar naar andere SDP-runtimes.
Wat zijn declaratieve Spark-pijplijnen?
Apache Spark-declaratieve pijplijnen is een declaratief framework voor het ontwikkelen en uitvoeren van pijplijnen voor batch- en streaminggegevens in SQL en Python. SDP automatiseert de indeling en organiseert de afhankelijkheden tussen de stromen in uw pijplijn. SDP vereenvoudigt de opname- en transformatieontwikkeling, zodat u zich niet hoeft te richten op de mechanismen van de indeling van uw gegevenswerkstromen.
Veelvoorkomende gebruiksvoorbeelden voor SDP zijn:
- Batchgegevensopname van bronnen zoals cloudopslag (Amazon S3, Azure ADLS Gen2 en Google Cloud Storage).
- Incrementele gegevensopname van berichtbussen (zoals Apache Kafka, Amazon Kinesis, Google Pub/Sub, Azure EventHub en Apache Pulsar).
- Incrementele batch- en streamingtransformaties met stateless en stateful operators.
Hoe breiden Lakeflow-pijplijnen SDP uit?
Lakeflow-pijplijnen delen hetzelfde declaratieve ontwerpmodel als SDP en voegen productiefuncties zoals AUTO CDC, verwachtingen van gegevenskwaliteit en een querybaar gebeurtenislogboek toe. In deze tabel worden de mogelijkheden vergeleken die Lakeflow-pijplijnen delen met SDP en de productiefuncties die Databricks bovenaan toevoegt. Zie Referentie voor pijplijneigenschappen voor een toewijzing van eigenschappen per eigenschap tussen de specificatie van het SDP-project en de pijplijnconfiguratie.
| Capability | SDP | Lakeflow-pijplijnen |
|---|---|---|
| Declaratieve pijplijnen in SQL en Python | ✓ | ✓ |
| Streamingtabellen | ✓ | ✓ |
| Gematerealiseerde weergaven | ✓ | ✓ |
| Tijdelijke weergaven | ✓ | ✓ |
| Flows toevoegen | ✓ | ✓ |
| Sinks (Delta, Apache Kafka en Azure Event Hubs) | ✓ | ✓ |
| Automatische orkestratie en het oplossen van afhankelijkheden | ✓ | ✓ |
| Pijplijncode die overdraagbaar is in SDP-runtimes | ✓ | ✓ |
| AUTO CDC (SCD Type 1 en SCD Type 2) en AUTO CDC uit momentopname | — | ✓ |
| Verwachtingen voor gegevenskwaliteit | — | ✓ |
| Query's uitvoeren op een gebeurtenislogboek | — | ✓ |
Gegevensstromen en foreachBatch doelen bijwerken |
— | ✓ |
| Doorlopende modus | — | ✓ |