Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Usługa Lakeflow Connect oferuje proste i wydajne łączniki do pozyskiwania danych z plików lokalnych, popularnych aplikacji dla przedsiębiorstw, baz danych, magazynu w chmurze, magistrali komunikatów i innych. Na tej stronie opisano niektóre sposoby, w jakie program Lakeflow Connect może poprawić wydajność funkcji ETL. Obejmuje również typowe przypadki użycia i zakres obsługiwanych narzędzi do przetwarzania danych, od w pełni zarządzanych połączeń do struktur w pełni konfigurowalnych.
Łączniki według typu
Lakeflow Connect organizuje łączniki według rodzaju źródła, z którego pobierasz. Każdy typ ma zestaw złączy oraz przegląd ich działania:
| Typ łącznika | Opis |
|---|---|
| Łączniki bazy danych | Pozyskuj dane z relacyjnych baz danych, takich jak MySQL, PostgreSQL, Oracle i SQL Server, za pomocą mechanizmu przechwytywania zmian danych. |
| Łączniki SaaS | Pozyskuj dane z aplikacji SaaS dla przedsiębiorstw, takich jak Salesforce, HubSpot, Jira i Workday. |
| Łączniki plików | Pobieraj pliki strukturalne i nieustrukturyzowane z chmurowego przechowywania obiektów oraz usług plików dla przedsiębiorstw, takich jak Google Drive i SharePoint. |
| Łączniki przesyłania strumieniowego | Ciągłe pobieranie z magistrali wiadomości i źródeł strumieniowania zdarzeń, takich jak Apache Kafka i RabbitMQ. |
| Łączniki oparte na zapytaniach | Pozyskuj dane z baz danych, wysyłając zapytania bezpośrednio do źródła, bez mechanizmu przechwytywania danych o zmianach. |
| Bezpośredni zapis (Zerobus Ingest API) | Zapisuj rekordy bezpośrednio do tabel streamingowych z aplikacji, korzystając z API Zerobus Ingest. |
Elastyczne modele usług
Program Lakeflow Connect oferuje szeroką gamę łączników dla aplikacji dla przedsiębiorstw, magazynu w chmurze, baz danych, magistrali komunikatów i nie tylko. Zapewnia również elastyczność wyboru między następującymi elementami:
| Opcja | Opis |
|---|---|
| W pełni zarządzana usługa | Gotowe łączniki, które demokratyzują dostęp do danych za pomocą prostych interfejsów użytkownika i zaawansowanych interfejsów API. Dzięki temu można szybko tworzyć niezawodne potoki pozyskiwania przy jednoczesnym zminimalizowaniu długoterminowych kosztów konserwacji. |
| Potok niestandardowy | Jeśli potrzebujesz większych możliwości dostosowania, możesz użyć potoków Lakeflow lub Structured Streaming. Ostatecznie ta wszechstronność umożliwia usłudze Lakeflow Connect spełnienie konkretnych potrzeb organizacji. |
Integracja z kluczowymi narzędziami Databricks
Usługa Lakeflow Connect używa podstawowych funkcji usługi Databricks w celu zapewnienia kompleksowego zarządzania danymi. Na przykład oferuje zarządzanie za pomocą Unity Catalog, orkiestrację przy użyciu Lakeflow Jobs i holistyczne monitorowanie w twoich potokach. Ułatwia to organizacji zarządzanie zabezpieczeniami danych, jakością i kosztami przy jednoczesnym ujednoliceniu procesów pozyskiwania za pomocą innych narzędzi do inżynierii danych. Lakeflow Connect jest zbudowany na otwartej platformie Data + AI, oferując pełną elastyczność w wykorzystaniu preferowanych narzędzi firm trzecich. Zapewnia to dostosowane rozwiązanie, które jest zgodne z istniejącą infrastrukturą i przyszłymi strategiami danych.
Szybkie, skalowalne pozyskiwanie
Program Lakeflow Connect używa przyrostowych operacji odczytu i zapisu w celu wydajnego przetwarzania danych. W połączeniu z przekształceniami przyrostowymi w dalszej części procesu może to znacznie poprawić wydajność ETL.
Typowe przypadki użycia
Klienci pozyskują dane, aby rozwiązać najbardziej trudne problemy organizacji. Przykładowe przypadki użycia obejmują następujące elementy:
| Przypadek użycia | Opis |
|---|---|
| Klient 360 | Mierzenie wydajności kampanii i ocenianie leadów klientów |
| Zarządzanie portfelem | Maksymalizowanie zwrotu z inwestycji za pomocą modeli historycznych i prognozowania |
| Analiza konsumentów | Personalizowanie środowisk zakupów klientów |
| Scentralizowane zasoby ludzkie | Wspieranie pracowników organizacji |
| Cyfrowe bliźniaki | Zwiększenie wydajności produkcyjnej |
| Chatboty RAG | Tworzenie czatbotów w celu ułatwienia użytkownikom zrozumienia zasad, produktów i nie tylko |
Warstwy stosu ETL
Niektóre łączniki działają na jednym poziomie stosu ETL. Na przykład usługa Databricks oferuje w pełni zarządzane łączniki dla aplikacji dla przedsiębiorstw, takich jak Salesforce i bazy danych, takie jak SQL Server. Inne łączniki działają w innej warstwie stosu ETL. Na przykład można użyć standardowych łączników w potokach Lakeflow, aby uzyskać więcej opcji dostosowywania. Podobnie możesz wybrać poziom dostosowywania danych przesyłanych strumieniowo z platformy Apache Kafka, Amazon Kinesis, Google Pub/Sub i Apache Pulsar.
Usługa Databricks zaleca rozpoczęcie od najbardziej zarządzanej warstwy. Jeśli nie spełnia Twoich wymagań (na przykład, jeśli nie obsługuje Twojego źródła danych), przejdź do następnej warstwy.
W poniższej tabeli opisano warstwy produktów przetwarzania:
| Warstwa | Opis |
|---|---|
| Potoki Lakeflow | Potoki Lakeflow oferują deklaratywną strukturę do tworzenia potoków danych. Zdefiniuj przekształcenia, a potoki Lakeflow zajmą się orkiestracją, monitorowaniem, jakością danych, obsługą błędów i nie tylko. Są oparte na Structured Streaming i obsługują większość jego funkcji. Jeśli funkcja Structured Streaming nie jest jeszcze dostępna w potokach Lakeflow, możesz bezpośrednio korzystać z interfejsów API Structured Streaming. |
| W pełni zarządzane łączniki | W pełni zarządzane łączniki opierają się na potokach Lakeflow, zapewniając jeszcze wyższy poziom automatyzacji dla najpopularniejszych źródeł danych. Rozszerzają one funkcjonalność potoków Lakeflow o uwierzytelnianie specyficzne dla źródła, obsługę CDC, obsługę sytuacji wyjątkowych, długoterminowe utrzymanie interfejsu API, automatyczne ponawianie prób, automatyczną ewolucję schematu itd. W związku z tym oferują jeszcze większą automatyzację dla wszystkich obsługiwanych źródeł danych. |
Łączniki zarządzane
Możesz użyć w pełni zarządzanych łączników do pozyskiwania danych z aplikacji i baz danych przedsiębiorstw. Zobacz koncepcje złączy Lakeflow Connect, aby uzyskać pełną listę obsługiwanych złączy.
Obsługiwane interfejsy obejmują:
- Interfejs użytkownika usługi Databricks
- Pakiety automatyzacji deklaratywnej
- Interfejsy API usługi Databricks
- Zestawy SDK usługi Databricks
- Interfejs wiersza polecenia usługi Databricks
Łączniki społeczności
Łączniki społeczności rozszerzają Lakeflow Connect na źródła, które nie są obsługiwane przez zarządzane łączniki. Są one open-source, budowane i utrzymywane przez społeczność, a nie wspierane przez SLA Databricks. Użyj łącznika, który społeczność już zarejestrowała, aby pobierać dane z obsługiwanego źródła. Zobacz Łączniki społeczności w programie Lakeflow Connect.
Złącza niestandardowe
Niestandardowe złącza pozwalają zbudować własne złącze dla źródła, które nie ma złącza zarządzanego. Budujesz, testujesz, wdrażasz i uruchamiasz niestandardowy łącznik w swojej własnej przestrzeni roboczej Azure Databricks, bez rejestracji w społeczności. Zobacz Zbuduj niestandardowy łącznik dla Lakeflow Connect.
Łączniki standardowe
Oprócz zarządzanych łączników usługa Databricks oferuje dostosowywalne łączniki dla magazynu obiektów w chmurze i magistrali komunikatów. Zobacz Wybierz standardowe złącze.
Tworzenie lub modyfikowanie tabeli z przeładowanego pliku (Interfejs dodawania danych)
Można przetwarzać pliki znajdujące się w sieci lokalnej, pliki przesłane na wolumin lub pliki pobrane z lokalizacji internetowej. Zobacz Tworzenie lub modyfikowanie tabeli za pomocąprzesyłania pliku.
partnerzy ds. przetwarzania danych
Wiele narzędzi firm trzecich obsługuje wsadowe lub strumieniowe pozyskiwanie danych do usługi Databricks. Usługa Databricks weryfikuje różne integracje innych firm, chociaż kroki konfigurowania dostępu do systemów źródłowych i pozyskiwania danych różnią się w zależności od narzędzia. Aby uzyskać listę zweryfikowanych narzędzi, sprawdź partnerów ds. integracji. Niektórzy partnerzy technologiczni są również polecani w narzędziu Databricks Partner Connect, który ma interfejs użytkownika, który upraszcza łączenie narzędzi innych firm z danymi usługi Lakehouse.
wprowadzanie DIY
Usługa Databricks udostępnia ogólną platformę obliczeniową. W związku z tym możesz utworzyć własne łączniki pozyskiwania przy użyciu dowolnego języka programowania obsługiwanego przez usługę Databricks, takiego jak Python lub Java. Można również importować i używać popularnych bibliotek łączników typu open source, takich jak narzędzie do ładowania danych, airbyte i debezium.
alternatywy przyjmowania
Databricks zaleca ingestowanie dla większości przypadków użycia, ponieważ skaluje się, aby obsłużyć duże ilości danych, zapytania o niskie opóźnienia i limity interfejsu API innych firm. Przenoszenie danych kopiuje dane z systemów źródłowych do usługi Azure Databricks, co powoduje zduplikowanie danych, które z czasem mogą stać się nieaktualne. Jeśli nie chcesz kopiować danych, możesz użyć następujących narzędzi:
| Narzędzie | Opis |
|---|---|
| Federacja Lakehouse | Umożliwia wykonywanie zapytań względem zewnętrznych źródeł danych bez przenoszenia danych. |
| OpenSharing | Umożliwia bezpieczne udostępnianie danych między platformami, chmurami i regionami. |