Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Projekt sdp-meta z usługi Databricks Labs udostępnia narzędzia do generowania potoków z zarządzanych metadanych.
Note
Projekt open source sdp-meta, podobnie jak wszystkie projekty na koncie GitHub databrickslabs, istnieje wyłącznie w celach eksploracji. Usługa Azure Databricks nie obsługuje jej ani nie zapewnia umów dotyczących poziomu usług (SLA). Nie zgłaszaj do pomocy technicznej Azure Databricks problemów dotyczących tego projektu. Zamiast tego zgłoś zgłoszenie w serwisie GitHub, które zostanie przejrzane, gdy czas na to pozwoli.
Czym jest sdp-meta?
Potoki Lakeflow umożliwiają deklaratywne definiowanie tabeli oraz tworzenie przepływu w ramach potoku, który zarówno tworzy tę tabelę, jak i utrzymuje ją na bieżąco w miarę zmian danych źródłowych. Jeśli jednak organizacja ma setki tabel, generowanie tych potoków i zarządzanie nimi jest czasochłonne i może prowadzić do niespójnych praktyk.
Projekt sdp-meta to ramy metaprogramowania oparte na metadanych, zaprojektowane do pracy z potokami Lakeflow. Ta struktura umożliwia automatyzację potoków danych z brązu i srebra dzięki wykorzystaniu metadanych zarejestrowanych w zestawie plików JSON i YAML. W czasie wykonywania potoki ogólnego przeznaczenia odczytują Twoje metadane i dynamicznie konstruują opisane w nich przepływy. Obróbka brązu i srebra może przebiegać w oddzielnych rurociągach lub razem w połączonym potoczniku. Generujesz metadane o swoich pipeline'ach, a sdp-meta generuje twoje pipeline.
Dzięki scentralizowanej logice w jednym miejscu (metadanych) system jest szybszy, wielokrotnego użytku i łatwiejszy w obsłudze.
Note
Projekt sdp-meta wcześniej nazywał się dlt-meta, od starszej funkcji Delta Live Tables w Azure Databricks.
Delta Live Tables zostały zastąpione przez rurociągi Lakeflow, a sdp-meta współpracuje z rurociągami Lakeflow. Jeśli aktualizujesz istniejącą dlt-meta instalację, zobacz przewodnik migracji w dokumentacji sdp-meta.
Korzyści z sdp-meta
Istnieją dwa główne zastosowania sdp-meta:
- Z łatwością importuj i oczyszczaj dużą liczbę tabel.
- Wymuszaj standardy inżynierii danych we wszystkich potokach i u wszystkich użytkowników.
Zalety korzystania z podejścia opartego na metadanych obejmują:
- Utrzymywanie metadanych można wykonywać bez znajomości języka Python lub SQL.
- Utrzymywanie metadanych, a nie kodu, wymaga mniejszego nakładu pracy i zmniejsza błędy.
- Kod jest generowany przez sdp-meta, więc pozostaje spójny i zawiera mniej niestandardowego kodu w potokach i opublikowanych tabelach.
- Tabele można łatwo grupować w pipeline’y w ramach metadanych, tworząc tyle pipeline’ów, ile potrzeba, aby jak najwydajniej aktualizować dane.
Jak działa sdp-meta
Poniższy obraz przedstawia przegląd systemu sdp-meta:
- Tworzysz pliki metadanych jako wejście do sdp-meta, aby określić pliki źródłowe i wyjścia, reguły jakości oraz wymagane przetwarzanie. Te pliki onboardingowe mogą być napisane w JSON lub YAML.
- Prowadzisz zadanie onboardingu w SDP-meta. Silnik kompiluje pliki onboardingowe do specyfikacji przepływu danych, zwanej DataflowSpec, i przechowuje ją w tabelach Delta (
bronze_dataflowspecisilver_dataflowspec) do późniejszego użycia. - W czasie działania generyczny potok odczytuje DataflowSpec i dynamicznie buduje graf przetwarzania brązu. Odczytuje dane źródłowe (pliki, strumienie lub CDC) i stosuje właściwe oczekiwania dotyczące danych, aby spełnić Twoje zasady jakości, generując Twoje brązowe tabele i kwarantannę poddawa rekordy, które nie spełniają tych zasad.
- Przetwarzanie srebra może działać w osobnym, uniwersalnym potoku, który jest domyślnym dla Deklaratywnych Pakietów Automatyzacji, lub w tym samym potoku, gdy używasz trybu połączonego. Potok przetwarzania wykorzystuje DataflowSpec do zastosowania odpowiednich przekształceń i innych operacji przetwarzania, generując tabele warstwy silver, które są oczyszczone, wzbogacone i gotowe do analiz.
Uruchamiasz potoki generowane przez sdp-meta, aby dane wyjściowe były aktualne w miarę aktualizowania danych źródłowych.
Wprowadzenie
Aby użyć sdp-meta, musisz:
- Wdroż i skonfiguruj rozwiązanie SDP-meta.
- Przygotuj metadane dla tabel warstw bronze i silver.
- Utwórz zadanie dołączania metadanych.
- Użyj metadanych, aby utworzyć pipeline’y dla swoich tabel.
Projekt sdp-meta obsługuje kilka interfejsów wdrożeniowych: pakiety (zalecane), interaktywny interfejs CLI, aplikację Databricks z interfejsem graficznym przeglądarkowym, serwer MCP do konfiguracji wspomaganej AI oraz przenośną umiejętność Agent Skill dla agentów AI świadomych umiejętności.
Dokumentacja sdp-meta na GitHub zawiera samouczek, który pomoże Ci zacząć ten proces. Więcej informacji znajdziesz w artykule Rozpoczęcie korzystania z sdp-meta na GitHub.