Zarządzanie śledzeniem pochodzenia zmaterializowanych widoków w systemie Fabric dla jezior danych.

Zmaterializowane widoki jeziora danych (MLV) pomagają w zarządzaniu dużymi zestawami danych i wykonywaniu zapytań przez wstępne obliczanie i przechowywanie wyników zapytań. W systemie Fabric linia pochodzenia pomaga zrozumieć zależności i przepływ odświeżania, dzięki czemu można bardziej niezawodnie obsługiwać MLV.

W tym artykule wyjaśniono, jak wyświetlać lineage, zrozumieć interfejs lineage i używać rozszerzonego lineage do śledzenia zależności między systemami lakehouse.

Wyświetl linię pochodzenia

Zmaterializowany widok jeziora pokazuje kolejność zależności dla operacji odświeżania. W przypadku MLV linie procesu reprezentują sekwencję widoków, które muszą być uruchamiane po udostępnieniu nowych danych.

Po utworzeniu MLV w Fabric wybierz zakładkę Materialized lake views na wstążce, a następnie wybierz Manage, aby przejść do linii MLV.

Zrealizowane ciągi widoków jeziora

Kod notesu definiuje pochodzenie (przepływ MLV), a Fabric tworzy go podczas tworzenia kompleksowego przepływu MLV.

Ważne

Widok rodowodu traktuje wszystkie skróty jako jednostki źródłowe. Widok pochodzenia traktuje wszystkie tabele lub zmaterializowane widoki lake w schemacie skrótów jako jednostki źródłowe.

Zrzut ekranu przedstawiający wykres zadań w pochodzeniu.

Aby uruchomić przepływ danych, zaplanuj go zgodnie z wymaganiami odświeżania. Po zaplanowaniu zadania przejdź do bieżącego uruchomienia, aby wyświetlić wykonywanie pochodzenia.

Zrzut ekranu przedstawiający wykonany widok ścieżki pochodzenia.

Omówienie widoku pochodzenia

W zmaterializowanym widoku pochodzenia widoków jeziorowych, system przetwarza dane zgodnie z kolejnością zależności. Każdy zmaterializowany widok typu lake reprezentuje operację (na przykład odczytywanie z tabeli źródłowej lub uruchamianie przekształcenia). Strzałki pokazują rodzaj każdej relacji zależności oraz kolejność wykonywania.

Wybierz zmaterializowany widok jeziora, aby sprawdzić relacje nadrzędne i podrzędne.

Strona pochodzenia zawiera następujące akcje:

  • Odśwież: odświeża widok pochodzenia, aby odzwierciedlić ostatnie zmiany stanu.

    Uwaga / Notatka

    Ta akcja odświeża tylko widok pochodzenia. Nie odświeża danych. Widok dziedziczenia jest automatycznie odświeżany co 2 minuty, gdy proces jest uruchomiony i zakładka przeglądarki jest aktywna.

    Zrzut ekranu przedstawiający sposób odświeżania interfejsu użytkownika linii.

  • Wyszukiwanie w pochodzeniu: Wyszukaj określony materializowany widok jeziora danych lub tabelę po nazwie w grafie pochodzenia.

Zrzut ekranu pokazujący, jak wyszukiwać w interfejsie użytkownika lineage.

  • Nowy zmaterializowany widok jeziora: otwiera notes, w którym można tworzyć lub modyfikować zmaterializowane widoki jeziora (MLV).

    Uwaga / Notatka

    Te notatniki nie są bezpośrednio połączone z widokiem genealogii.

    Zrzut ekranu przedstawiający nowy zmaterializowany widok jeziora.

  • Zarządzanie harmonogramami: Otwiera panel Zarządzanie harmonogramami, aby tworzyć lub zarządzać harmonogramami odświeżania.

    Zrzut ekranu przedstawiający przycisk harmonogramu.

  • Zresetuj rodowód: zresetuje układ rodowodu dla bieżącego rozmiaru ekranu.

    Zrzut ekranu pokazujący, jak zmienić układ widoku dziedzictwa.

Wyświetl rozszerzone pochodzenie danych

Standardowy widok pochodzenia pokazuje zależności w kontekście bieżącego lakehouse’u oraz jego bezpośrednio nadrzędnych lakehouse’ów lub źródeł (o jeden poziom w górę). Rozszerzone pochodzenie rozszerza ten widok, dzięki czemu można śledzić każdą zależność aż do źródła — rekurencyjnie między lakehouse’ami.

Standardowy rodowód Pochodzenie rozszerzone
Scope Bieżący lakehouse + jeden poziom nadrzędnych elementów między lakehouse’ami Pełny łańcuch rekursywny we wszystkich jeziorach
Nadrzędne uczenia maszynowego Wyświetlane jako węzły końcowe — nie widać, co je zasila W pełni rozwinięte — każdy widok nadrzędny i jego źródła są widoczne
Cross-lakehouse Nie pokazano Widoczne, jeśli masz dostęp do odczytu w nadrzędnym obszarze roboczym

Aby wyświetlić rozszerzone pochodzenie:

  1. Otwórz kartę Zarządzanie zmaterializowanego widoku jeziora.

  2. Włącz przełącznik rozszerzone pochodzenie na pasku narzędzi.

Pochodzenie aktualizacji w celu wyświetlenia wszystkich zależności nadrzędnych, w tym zmaterializowanych widoków jeziora i tabel źródłowych w innych magazynach typu lakehouse. Każdy węzeł na wykresie wyświetla nazwę oraz lakehouse. Typ węzła (tabela, skrót lub zmaterializowany widok typu lake) jest wskazywany przez ikonę.

Uwaga / Notatka

Zależności nadrzędne można zobaczyć tylko w obszarach roboczych, w których masz co najmniej uprawnienia do odczytu. Zależności w obszarach roboczych, do których nie można uzyskać dostępu, są wyświetlane jako uszkodzony węzeł.

Uszkodzone węzły

Jeśli zależność nadrzędna nie istnieje, została usunięta lub jest niedostępna, pojawia się jako węzeł z błędem w grafie rodowodu. Węzły z błędami wyświetlają wskaźnik błędu z komunikatem wyjaśniającym problem (na przykład "brak lub niedostępny").

Wykonywanie między magazynami lakehouse

Rozszerzone pochodzenie danych umożliwia wykonywanie między środowiskami lakehouse. Pojedynczy lakehouse może definiować i odświeżać zmaterializowane widoki lakehouse, które odwołują się do tabel w wielu lakehouse’ach — w tym w lakehouse’ach w innych obszarach roboczych — eliminując konieczność powielania logiki transformacji w każdym z nich.

Na przykład jeśli masz trzy lakehouse’y — Bronze, Silver i Gold — możesz zdefiniować wszystkie zmaterializowane widoki danych w lakehouse Gold, odwołując się do tabel źródłowych lub zmaterializowanych widoków danych w lakehouse’ach Bronze i Silver. Te lakehouse’y mogą znajdować się w tym samym obszarze roboczym lub w różnych obszarach roboczych. Fabric obsługuje odczyty cross-lakehouse podczas odświeżania, dzięki czemu utrzymuje się jeden zestaw definicji zamiast trzech.

Planowanie zmaterializowanych widoków jeziora nadrzędnego

Z poziomu rozszerzonego widoku pochodzenia można zaplanować odświeżenia zmaterializowanych widoków lake w źródłowych lakehouse'ach — bez konieczności przechodzenia oddzielnie do każdego źródłowego lakehouse'a. Podczas tworzenia harmonogramu lub uruchomienia ad hoc możesz wybrać, które lakehouse’y mają zostać uwzględnione w odświeżeniu. Aby uzyskać szczegółowe informacje, zobacz Planowanie zmaterializowanego odświeżania widoku lake.

Uprawnienia do rozszerzonego śledzenia pochodzenia

Działania Wymagane uprawnienie
Wyświetl rozszerzone pochodzenie danych Dostęp do odczytu w nadrzędnych obszarach roboczych
Planowanie zmaterializowanych widoków jeziora nadrzędnego Współtwórca projektu upstream lakehouse
Wyświetlanie szczegółów zależności nadrzędnych Dostęp do odczytu w elemencie

Wyświetl pochodzenie importu plików

Gdy widok zmaterializowanego jeziora pobiera pliki z USING OneLake_Files, jego źródłem jest fizyczny folder OneLake lub skrót do folderu OneLake, a nie tabela upstream. Widok pochodzenia danych przedstawia to źródło jako węzeł folder źródłowy, który zasila widok importujący pliki, dzięki czemu można śledzić i monitorować kompletny potok medallion oparty na plikach.

Wykres linii genealogicznej zaczyna się od folderu źródłowego, który widok pobiera. Węzeł folderu łączy się z materializowanym widokiem jeziora pobierającym plik bronze, który z kolei dostarcza widoki srebrne i złote w dalszej fazie, zgodnie z tym samym porządkiem zależności, jaki Fabric stosuje do widoków tabelowych.

Zrzut ekranu zmaterializowanego jeziora pokazuje wykres linii rodowej przedstawiający folder źródłowy zasilający widok pobierający plik z brązu, a następnie widoki srebrne i złote.

Aby sprawdzić potok z kopią plikową i potwierdzić, że odświeżenie wykryło zmiany źródłowe, należy postępować zgodnie z następującymi krokami:

  1. Wybierz węzeł folderu źródłowego, aby otworzyć panel szczegółów. Panel pokazuje ścieżkę OneLake oraz pliki odkryte w folderze.

    Zrzut ekranu panelu szczegółów folderu źródłowego pokazujący ścieżkę OneLake i pliki w tym folderze.

  2. Wybierz węzeł materializowany widok jeziora pobierającego plik, aby zobaczyć jego szczegóły, w tym format źródłowy, tryb schematu i tryb odświeżania.

    Zrzut ekranu z widokiem na jezioro materializowanym w materializacji pokazujący format, tryb schematu i tryb odświeżania.

  3. Otwórz kartę Ostatnie uruchomienia, przejdź do szczegółów zarządzanego uruchomienia i wybierz widok wczytywania plików, aby zobaczyć metryki liczby przetworzonych plików i dodanych wierszy.

    Zrzut ekranu szczegółów uruchomienia pokazujący liczbę przetworzonych plików i liczbę dodanych wierszy dla zmaterializowanego widoku jeziora danych wczytującego pliki.

Interpretacja metryk przetwarzania plików

Pliki przetworzone są metryką na poziomie run, a nie łączną liczbą plików obecnych w folderze źródłowym. Liczba zależy od trybu odświeżania widoku:

  • W trybie odświeżania APPEND_ONLY zliczane są nowe pliki, które przetwarza dane uruchomienie. Nie zlicza plików, które zostały już utworzone przez wcześniejsze uruchomienia.
  • W trybie odświeżania FULL zlicza pliki odczytywane podczas odbudowywania widoku z bieżącej migawki folderu.
  • Udane uruchomienie może zgłosić brak przetworzonych plików, gdy zarządzane odświeżenie nie wykryje żadnych nowych plików źródłowych.

Użyj panelu szczegółów folderu źródłowego, aby wyświetlić bieżącą zawartość folderu, oraz panelu szczegółów uruchomienia, aby wyświetlić pliki przetworzone w ramach określonego odświeżenia. Obie liczby odpowiadają na różne pytania i w przypadku uruchomienia przyrostowego nie muszą być takie same.

Wskazówka

Każdy wprowadzony wiersz zawiera również kolumnę __filepath__ zapisującą jego plik źródłowy. Użyj GROUP BY __filepath__, aby sprawdzić pliki uwzględnione w bieżącym zmaterializowanym wyniku. Ten widok odzwierciedla aktualną linię wierszową, natomiast Pliki przetworzone odzwierciedlają pracę wykonywaną przez jedno odświeżenie.