Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Hinweis
Die Lakeflow Connect-Steckverbinder befinden sich in verschiedenen Release-Zuständen.
Lakeflow Connect organisiert Connectors nach Quelltyp, einschließlich Datenbank-, SaaS-, Datei- und Streaming-Connectors sowie Community- und Custom-Connectors für Quellen ohne integrierte Option. Diese Seite beschreibt die Konzepte, die von den verwalteten Connectors von Lakeflow Connect geteilt werden: die verfügbaren Connector-Typen, wie ein Connector strukturiert ist, wie er ausgeführt wird und wie er Daten schrittweise einnimmt. Managed Connectors erzeugen Ingestionspipelines, die unter der Governance von Unity Catalog stehen und auf serverlosem Computing sowie Lakeflow-Pipelines basieren. Dabei werden effiziente inkrementelle Lese- und Schreibvorgänge verwendet, um Ihre Daten für die nachgelagerte Nutzung aktuell zu halten.
Wenn Sie mehr Kontrolle über Ihre Pipelines benötigen, können Sie auch Standardkonnektoren verwenden, bei denen Sie zugunsten einer breiteren Unterstützung von Datenquellen und mehr Anpassungsmöglichkeiten auf einen Teil der Automatisierung verzichten. Siehe Choose a Standard Connector.
Verbindertypen
| Konnektortyp | BESCHREIBUNG |
|---|---|
| Community Connectors | Daten über Open-Source-Konnektoren, die von der Community erstellt wurden, einlesen. |
| Datenbankanschlüsse (CDC) | Erfassen von Daten aus relationalen Datenbanken, einschließlich MySQL, PostgreSQL und SQL Server mithilfe der Änderungsdatenerfassung. |
| Dateiquellenkonnektoren | Importieren Sie unstrukturierte und strukturierte Dateien aus Dateispeicherdiensten für Unternehmen, einschließlich Google Drive und SharePoint. |
| Abfragebasierte Konnektoren | Erfassen Sie Daten aus Datenbanken, indem Sie die Quelle direkt abfragen, ohne dass eine Change-Data-Capture-(CDC-)Konfiguration erforderlich ist. |
| SaaS-Verbinder | Daten aus Unternehmens-SaaS-Anwendungen wie Salesforce, HubSpot, Jira, Workday und mehr erfassen. |
| Streaming-Konnektoren | Daten kontinuierlich aus Nachrichtenbussen und Event-Streaming-Quellen erfassen, darunter RabbitMQ. |
Architektur
Jeder Verbindertyp verfügt über einen unterschiedlichen Satz von Komponenten. SaaS- und Datei-Konnektoren verwenden eine Verbindung, eine Ingestionspipeline und Zieltabellen. Datenbank-Connectoren umfassen auch ein Ingestion-Gateway und Zwischenspeicher zur Unterstützung der kontinuierlichen Erfassung von Änderungen. Abfragebasierte und Streaming-Connectoren verwenden die in den folgenden Abschnitten beschriebenen Komponenten. Details zu SaaS und Datenbank-Connectoren finden Sie unter Managed SaaS Connectors und Managed database Connectors.
Abfragebasierte Connectorkomponenten
Ein abfragebasierter Connector fragt die Quelldatenbank gemäß einem Zeitplan direkt ab, ohne dass ein Gateway oder Stagingspeicher erforderlich ist. Eine Übersicht über die Funktionsweise abfragebasierter Connectors finden Sie unter Abfragebasierte Connectors.
| Bestandteil | BESCHREIBUNG |
|---|---|
| Verbindung | Ein sicherungsfähiges Unity-Katalog-Objekt, das Authentifizierungsdetails für die Quelldatenbank speichert. Entweder eine direkte Unity Catalog-Verbindung (für die Erfassung externer Verbindungen) oder ein Unity Catalog-fremder Katalog (für die Erfassung eines fremden Katalogs durch die Lakehouse Federation). |
| Aufnahmepipeline | Eine Pipeline, die die Quelldatenbank direkt abfragt und die Ergebnisse in Streamingtabellen schreibt. Die Pipeline wird standardmäßig auf serverloser Berechnung ausgeführt. |
| Ziel-Tabellen | Die Streamingtabellen, in die die Aufnahmepipeline die Daten schreibt. |
Komponenten des Streamingconnectors
Ein Streaming-Connector liest kontinuierlich Nachrichten aus einem Nachrichtenbus oder einer Event-Streaming-Quelle und schreibt sie in Streamingtabellen. Für einen Überblick darüber, wie Streaming-Stecker funktionieren, siehe Streaming-Verbinder.
| Bestandteil | BESCHREIBUNG |
|---|---|
| Verbindung | Ein sicherungsfähiges Unity-Katalog-Objekt, das den Quellendpunkt und die Authentifizierungsanmeldeinformationen für Ihre Streamingquelle speichert. Der verwaltete Connector verwendet diese Verbindung, um sich zu authentifizieren, ohne dass Anmeldeinformationen in Ihrer Pipelinekonfiguration erforderlich sind. |
| Aufnahmepipeline | Eine Pipeline, die kontinuierlich Nachrichten aus der Streamingquelle liest und die Ergebnisse in Streamingtabellen schreibt. Die Pipeline wird auf Serverless-Compute ausgeführt. |
| Ziel-Tabellen | Die Streamingtabellen, in die die Aufnahmepipeline die Daten schreibt. |
Orchestrierung
Sie können Ihre Erfassungspipeline nach ein oder mehreren benutzerdefinierten Zeitplänen ausführen. Für jeden Zeitplan, den Sie einer Pipeline hinzufügen, erstellt Lakeflow Connect automatisch einen Auftrag dafür. Die Pipeline zum Einbinden von Daten ist eine Aufgabe innerhalb eines Jobs. Sie können dem Auftrag optional weitere Aufgaben hinzufügen.
Bei Datenbankkonnektoren wird das Ingestion Gateway in einem eigenen Job als kontinuierliche Aufgabe ausgeführt.
Inkrementelle Erfassung
Lakeflow Connect verwendet die inkrementelle Aufnahme, um die Pipelineeffizienz zu verbessern. Beim ersten Ausführen Ihrer Pipeline bindet es alle ausgewählten Daten aus der Quelle ein. Parallel werden Änderungen an den Quelldaten nachverfolgt. Bei jedem weiteren Durchlauf der Pipeline nutzt sie diese Änderungsverfolgung, um nach Möglichkeit nur die Daten zu übernehmen, die sich gegenüber dem vorherigen Durchlauf geändert haben.
Der genaue Ansatz hängt davon ab, was in Ihrer Datenquelle verfügbar ist. Sie können z. B. sowohl die Änderungsnachverfolgung als auch die Datenerfassung (Change Data Capture, CDC) mit SQL Server verwenden. Im Gegensatz dazu wählt der Salesforce-Connector eine Cursorspalte aus einer festgelegten Liste von Optionen aus.
Einige Quellen oder bestimmte Tabellen unterstützen derzeit keine inkrementelle Aufnahme. Databricks plant, die Abdeckung für inkrementelle Unterstützung zu erweitern.
Vernetzung
Es gibt mehrere Optionen zum Herstellen einer Verbindung mit einer SaaS-Anwendung oder -Datenbank.
- Konnektoren für SaaS-Anwendungen greifen auf die APIs der Quelle zu. Sie sind auch automatisch mit der serverless Egress-Steuerung kompatibel.
- Connectors für Cloud-Datenbanken können sich über Private Link mit der Quelle verbinden. Alternativ können Sie, wenn Ihr Arbeitsbereich über ein Virtual Network (VNet) oder eine Virtual Private Cloud (VPC) verfügt, die mit dem VNet oder der VPC, die Ihre Datenbank hostet, gekoppelt ist, das Gateway darin bereitstellen.
- Connectors für lokale Datenbanken können eine Verbindung mit Diensten wie AWS Direct Connect und Azure ExpressRoute herstellen.
Einsatz
Sie können Aufnahmepipelinen mithilfe von deklarativen Automatisierungspaketen bereitstellen, die bewährte Methoden wie Quellcodeverwaltung, Codeüberprüfung, Tests und kontinuierliche Integration und Übermittlung (CI/CD) ermöglichen. Bundles werden mithilfe der Databricks CLI verwaltet und können in verschiedenen Zielarbeitsbereichen ausgeführt werden, z. B. Entwicklung, Staging und Produktion.
Programmgesteuertes Erstellen von Verbindungen
Für Connectors, die die nur API-Authentifizierung verwenden (alle Datenbankconnectors und die meisten SaaS-Connectors), können Sie Verbindungen programmgesteuert mithilfe von Notizbüchern, der Databricks CLI oder deklarativen Automatisierungsbündeln anstelle der Benutzeroberfläche des Katalog-Explorers erstellen.
- Notizbücher: Verwenden Sie die Connections-API aus einem Notizbuch, um eine Verbindung zu erstellen und an Ihre Pipeline zu übergeben.
-
Databricks CLI: Führen Sie
databricks connections createmit--jsonaus, um Verbindungstyp und Anmeldeinformationen anzugeben. Der JSON-Text folgt demselben Schema wie die Connections-REST-API. -
Deklarative Automatisierungs-Bundles: Verwenden Sie ein Skript vor der Bereitstellung oder eine Jobaufgabe, um
databricks connections createals Teil Ihres Bundle-Workflows aufzurufen, bevor Sie die Pipeline bereitstellen.
Hinweis
Connectors, die browserbasierte OAuth (OAuth U2M) als einzige Authentifizierungsoption verwenden, können nicht programmgesteuert erstellt werden. Für diese Connectors ist eine interaktive Anmeldung erforderlich, um das ursprüngliche OAuth-Token abzurufen. Dazu gehören: Confluence, Google Ads, HubSpot, Jira, Meta Ads, Slack, Slack Audit Logs, TikTok Ads und Zendesk Support.
Wiederherstellung nach Fehlern
Als vollständig verwalteter Dienst zielt Lakeflow Connect darauf ab, Probleme nach Möglichkeit automatisch zu beheben. Wenn zum Beispiel ein Konnektor ausfällt, versucht er es automatisch mit exponentiellem Backoff erneut.
Es ist jedoch möglich, dass ein Fehler Ihre Intervention erfordert (z. B. wenn Anmeldeinformationen ablaufen). In diesen Fällen versucht der Verbinder, fehlende Daten zu vermeiden, indem die letzte Position des Cursors gespeichert wird. Es kann dann beim nächsten Ausführen der Pipeline, wenn möglich, von dieser Position aus weitermachen.
Überwachung
Lakeflow Connect bietet robuste Warnungen und Überwachungen, die Ihnen bei der Wartung Ihrer Pipelines helfen. Dazu gehören Ereignisprotokolle, Clusterprotokolle, Pipelineintegritätsmetriken und Datenqualitätsmetriken. Sie können die system.billing.usage Tabelle auch verwenden, um die Kosten nachzuverfolgen und die Pipelinenutzung zu überwachen. Siehe Überwachung der Kosten der verwalteten Erfassungspipeline.
Bei Datenbankconnectors können Sie den Gatewaystatus mithilfe von Ereignisprotokollen in Echtzeit überwachen. Siehe Überwachen des Erfassungsgatewaystatus mit Ereignisprotokollen.
Community Connectors
Community Connectors erweitern die Funktionen von Lakeflow Connect für Quellen, für die es keine Unterstützung für verwaltete Connectors gibt. Sie werden von der Community erstellt und gepflegt. Siehe Community Connectors in Lakeflow Connect.
Individuelle Stecker
Wenn kein verwalteter oder Community-Connector deine Quelle unterstützt, kannst du deinen eigenen benutzerdefinierten Connector erstellen und ihn in deinem Arbeitsbereich ausführen. Siehe Baue einen benutzerdefinierten Connector für Lakeflow Connect.
Abhängigkeit von externen Diensten
Databricks SaaS, die Datenbank und andere vollständig verwaltete Connectors hängen von der Verfügbarkeit, Kompatibilität und Stabilität der Anwendung, Datenbank oder externen Dienste ab, mit denen sie verbunden sind. Databricks kontrolliert diese externen Dienste nicht und hat daher (falls vorhanden) eingeschränkten Einfluss auf ihre Änderungen, Updates und Wartungen.
Wenn Änderungen, Unterbrechungen oder Umstände im Zusammenhang mit einem externen Dienst den Betrieb eines Connectors behindern oder unpraktisch darstellen, kann Databricks die Aufrechterhaltung dieses Connectors einstellen oder beenden. Databricks wird angemessene Anstrengungen unternehmen, um Kunden darüber zu informieren, dass die Wartung eingestellt oder eingestellt wird, einschließlich Aktualisierungen der anwendbaren Dokumentation.