Standardanslutningar i Lakeflow Connect

Den här sidan beskriver standardkontakterna i Databricks Lakeflow Connect, som erbjuder högre nivåer av anpassning av datainmatningspipeline jämfört med de hanterade kontakterna.

Lager i ETL-stacken

Vissa kontakter fungerar på en nivå av ETL-stacken. Databricks erbjuder till exempel fullständigt hanterade anslutningsappar för företagsprogram som Salesforce och databaser som SQL Server. Andra anslutningar verkar på flera nivåer i ETL-stacken. Du kan till exempel använda standardanslutningar i antingen Strukturerad direktuppspelning för fullständig anpassning eller Lakeflow-pipelines för en mer hanterad upplevelse.

ETL-stackdiagram

Databricks rekommenderar att du börjar med det mest hanterade lagret. Om den inte uppfyller dina krav (till exempel om den inte stöder din datakälla) går du ned till nästa lager.

I följande tabell beskrivs de tre lagren med inmatningsprodukter, ordnade från de mest anpassningsbara till de flesta hanterade:

Skikt Beskrivning
Strukturerad direktuppspelning Apache Spark Structured Streaming är en strömningsmotor som erbjuder feltolerans från slutpunkt till slutpunkt med bearbetningsgarantier exakt en gång med spark-API:er.
Lakeflow-pipelines Lakeflow-pipelines utökar Structured Streaming och erbjuder ett deklarativt ramverk för att skapa datapipelines. Du kan definiera de omvandlingar som ska utföras på dina data och Lakeflow-pipelines hanterar orkestrering, övervakning, datakvalitet, fel med mera. De erbjuder mer automatisering och mindre omkostnader än strukturerad direktuppspelning.
Hanterade kontakter Fullständigt hanterade anslutningar bygger vidare på Lakeflow-pipelines och erbjuder ännu mer automatisering för de mest populära datakällorna. De utökar Funktionerna för Lakeflow-pipelines till att även omfatta källspecifik autentisering, CDC, hantering av gränsfall, långsiktigt API-underhåll, automatiserade återförsök, automatiserad schemautveckling och så vidare. Därför erbjuder de ännu mer automatisering för alla datakällor som stöds.

Välj en anslutning

I följande tabell visas standardkopplingar för datainmatning utifrån datakälla och grad av pipelineanpassning. För en helt automatiserad inmatningsupplevelse använder du hanterade anslutningar i stället.

SQL-exempel för inkrementell inmatning från molnobjektlagring använder CREATE STREAMING TABLE syntax. Det ger SQL-användare en skalbar och robust inmatningsupplevelse, därför är det det rekommenderade alternativet till COPY INTO.

Källa Mer anpassning Viss anpassning Mer automatisering
Lagring av molnobjekt Automatisk inläsning med strukturerad direktuppspelning
(Python, Scala)
Auto Loader med Lakeflow-pipelines
(Python, SQL)
Automatisk inläsning med Databricks SQL
(SQL)
SFTP-servrar Mata in filer från SFTP-servrar
(Python, SQL)
N/A N/A
Apache Kafka Strukturerad direktuppspelning med Kafka-källa
(Python, Scala)
Lakeflow pipelines med Kafka som källa
(Python, SQL)
Databricks SQL med Kafka-källa
(SQL)
Google Pub/Sub Strukturerad direktuppspelning med Pub/Sub-källa
(Python, Scala)
Lakeflow-pipelines med Pub/Sub-källa
(Python, SQL)
Databricks SQL med Pub/Sub-källa
(SQL)
Apache Pulsar Strukturerad direktuppspelning med Pulsar-källa
(Python, Scala)
Lakeflow-pipelines med Pulsar-källa
(Python, SQL)
Databricks SQL med Pulsar-källa
(SQL)

inmatningsscheman

Du kan konfigurera inmatningspipelines så att de körs enligt ett återkommande schema eller kontinuerligt.

Användningsfall Dataflödesläge
Batchinmatning Utlöses: Bearbetar nya data enligt ett schema eller när de utlöses manuellt.
Inmatning av direktuppspelning Kontinuerlig: Bearbetar nya data när de tas emot i källan.