Declaratieve Apache Spark-pijplijnen

Lakeflow-pijplijnen zijn gebaseerd op Apache Spark™ Declarative Pipelines (SDP). Lakeflow-pijplijnen worden uitgevoerd op de voor prestaties geoptimaliseerde Databricks Runtime en werken samen met SDP. Omdat pijplijnen bouwen op SDP in plaats van eigen API's, blijft de transformatiecode die u schrijft overdraagbaar naar andere SDP-runtimes.

Wat zijn declaratieve Spark-pijplijnen?

Apache Spark-declaratieve pijplijnen is een declaratief framework voor het ontwikkelen en uitvoeren van pijplijnen voor batch- en streaminggegevens in SQL en Python. SDP automatiseert de indeling en organiseert de afhankelijkheden tussen de stromen in uw pijplijn. SDP vereenvoudigt de opname- en transformatieontwikkeling, zodat u zich niet hoeft te richten op de mechanismen van de indeling van uw gegevenswerkstromen.

Veelvoorkomende gebruiksvoorbeelden voor SDP zijn:

  • Batchgegevensopname van bronnen zoals cloudopslag (Amazon S3, Azure ADLS Gen2 en Google Cloud Storage).
  • Incrementele gegevensopname van berichtbussen (zoals Apache Kafka, Amazon Kinesis, Google Pub/Sub, Azure EventHub en Apache Pulsar).
  • Incrementele batch- en streamingtransformaties met stateless en stateful operators.

Zie Procedureel versus declaratieve gegevensverwerking in Databricks voor meer informatie over declaratieve gegevensverwerking.

Hoe breiden Lakeflow-pijplijnen SDP uit?

Lakeflow-pijplijnen delen hetzelfde declaratieve ontwerpmodel als SDP en voegen productiefuncties zoals AUTO CDC, verwachtingen van gegevenskwaliteit en een querybaar gebeurtenislogboek toe. In deze tabel worden de mogelijkheden vergeleken die Lakeflow-pijplijnen delen met SDP en de productiefuncties die Databricks bovenaan toevoegt. Zie Referentie voor pijplijneigenschappen voor een toewijzing van eigenschappen per eigenschap tussen de specificatie van het SDP-project en de pijplijnconfiguratie.

Capability SDP Lakeflow-pijplijnen
Declaratieve pijplijnen in SQL en Python
Streamingtabellen
Gematerealiseerde weergaven
Tijdelijke weergaven
Flows toevoegen
Sinks (Delta, Apache Kafka en Azure Event Hubs)
Automatische orkestratie en het oplossen van afhankelijkheden
Pijplijncode die overdraagbaar is in SDP-runtimes
AUTO CDC (SCD Type 1 en SCD Type 2) en AUTO CDC uit momentopname
Verwachtingen voor gegevenskwaliteit
Query's uitvoeren op een gebeurtenislogboek
Gegevensstromen en foreachBatch doelen bijwerken
Doorlopende modus

Aanvullende bronnen