Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Zmaterializowane widoki jeziora danych (MLV) pomagają w zarządzaniu dużymi zestawami danych i wykonywaniu zapytań przez wstępne obliczanie i przechowywanie wyników zapytań. W systemie Fabric linia pochodzenia pomaga zrozumieć zależności i przepływ odświeżania, dzięki czemu można bardziej niezawodnie obsługiwać MLV.
W tym artykule wyjaśniono, jak wyświetlać lineage, zrozumieć interfejs lineage i używać rozszerzonego lineage do śledzenia zależności między systemami lakehouse.
Wyświetl linię pochodzenia
Zmaterializowany widok jeziora pokazuje kolejność zależności dla operacji odświeżania. W przypadku MLV linie procesu reprezentują sekwencję widoków, które muszą być uruchamiane po udostępnieniu nowych danych.
Po utworzeniu MLV w Fabric wybierz zakładkę Materialized lake views na wstążce, a następnie wybierz Manage, aby przejść do linii MLV.
Zrealizowane ciągi widoków jeziora
Kod notesu definiuje pochodzenie (przepływ MLV), a Fabric tworzy go podczas tworzenia kompleksowego przepływu MLV.
Ważne
Widok rodowodu traktuje wszystkie skróty jako jednostki źródłowe. Widok pochodzenia traktuje wszystkie tabele lub zmaterializowane widoki lake w schemacie skrótów jako jednostki źródłowe.
Aby uruchomić przepływ danych, zaplanuj go zgodnie z wymaganiami odświeżania. Po zaplanowaniu zadania przejdź do bieżącego uruchomienia, aby wyświetlić wykonywanie pochodzenia.
Omówienie widoku pochodzenia
W zmaterializowanym widoku pochodzenia widoków jeziorowych, system przetwarza dane zgodnie z kolejnością zależności. Każdy zmaterializowany widok typu lake reprezentuje operację (na przykład odczytywanie z tabeli źródłowej lub uruchamianie przekształcenia). Strzałki pokazują rodzaj każdej relacji zależności oraz kolejność wykonywania.
Wybierz zmaterializowany widok jeziora, aby sprawdzić relacje nadrzędne i podrzędne.
Strona pochodzenia zawiera następujące akcje:
Odśwież: odświeża widok pochodzenia, aby odzwierciedlić ostatnie zmiany stanu.
Uwaga / Notatka
Ta akcja odświeża tylko widok pochodzenia. Nie odświeża danych. Widok dziedziczenia jest automatycznie odświeżany co 2 minuty, gdy proces jest uruchomiony i zakładka przeglądarki jest aktywna.
Wyszukiwanie w pochodzeniu: Wyszukaj określony materializowany widok jeziora danych lub tabelę po nazwie w grafie pochodzenia.
Nowy zmaterializowany widok jeziora: otwiera notes, w którym można tworzyć lub modyfikować zmaterializowane widoki jeziora (MLV).
Uwaga / Notatka
Te notatniki nie są bezpośrednio połączone z widokiem genealogii.
Zarządzanie harmonogramami: Otwiera panel Zarządzanie harmonogramami, aby tworzyć lub zarządzać harmonogramami odświeżania.
Zresetuj rodowód: zresetuje układ rodowodu dla bieżącego rozmiaru ekranu.
Wyświetl rozszerzone pochodzenie danych
Standardowy widok pochodzenia pokazuje zależności w kontekście bieżącego lakehouse’u oraz jego bezpośrednio nadrzędnych lakehouse’ów lub źródeł (o jeden poziom w górę). Rozszerzone pochodzenie rozszerza ten widok, dzięki czemu można śledzić każdą zależność aż do źródła — rekurencyjnie między lakehouse’ami.
| Standardowy rodowód | Pochodzenie rozszerzone | |
|---|---|---|
| Scope | Bieżący lakehouse + jeden poziom nadrzędnych elementów między lakehouse’ami | Pełny łańcuch rekursywny we wszystkich jeziorach |
| Nadrzędne uczenia maszynowego | Wyświetlane jako węzły końcowe — nie widać, co je zasila | W pełni rozwinięte — każdy widok nadrzędny i jego źródła są widoczne |
| Cross-lakehouse | Nie pokazano | Widoczne, jeśli masz dostęp do odczytu w nadrzędnym obszarze roboczym |
Aby wyświetlić rozszerzone pochodzenie:
Otwórz kartę Zarządzanie zmaterializowanego widoku jeziora.
Włącz przełącznik rozszerzone pochodzenie na pasku narzędzi.
Pochodzenie aktualizacji w celu wyświetlenia wszystkich zależności nadrzędnych, w tym zmaterializowanych widoków jeziora i tabel źródłowych w innych magazynach typu lakehouse. Każdy węzeł na wykresie wyświetla nazwę oraz lakehouse. Typ węzła (tabela, skrót lub zmaterializowany widok typu lake) jest wskazywany przez ikonę.
Uwaga / Notatka
Zależności nadrzędne można zobaczyć tylko w obszarach roboczych, w których masz co najmniej uprawnienia do odczytu. Zależności w obszarach roboczych, do których nie można uzyskać dostępu, są wyświetlane jako uszkodzony węzeł.
Uszkodzone węzły
Jeśli zależność nadrzędna nie istnieje, została usunięta lub jest niedostępna, pojawia się jako węzeł z błędem w grafie rodowodu. Węzły z błędami wyświetlają wskaźnik błędu z komunikatem wyjaśniającym problem (na przykład "brak lub niedostępny").
Wykonywanie między magazynami lakehouse
Rozszerzone pochodzenie danych umożliwia wykonywanie między środowiskami lakehouse. Pojedynczy lakehouse może definiować i odświeżać zmaterializowane widoki lakehouse, które odwołują się do tabel w wielu lakehouse’ach — w tym w lakehouse’ach w innych obszarach roboczych — eliminując konieczność powielania logiki transformacji w każdym z nich.
Na przykład jeśli masz trzy lakehouse’y — Bronze, Silver i Gold — możesz zdefiniować wszystkie zmaterializowane widoki danych w lakehouse Gold, odwołując się do tabel źródłowych lub zmaterializowanych widoków danych w lakehouse’ach Bronze i Silver. Te lakehouse’y mogą znajdować się w tym samym obszarze roboczym lub w różnych obszarach roboczych. Fabric obsługuje odczyty cross-lakehouse podczas odświeżania, dzięki czemu utrzymuje się jeden zestaw definicji zamiast trzech.
Planowanie zmaterializowanych widoków jeziora nadrzędnego
Z poziomu rozszerzonego widoku pochodzenia można zaplanować odświeżenia zmaterializowanych widoków lake w źródłowych lakehouse'ach — bez konieczności przechodzenia oddzielnie do każdego źródłowego lakehouse'a. Podczas tworzenia harmonogramu lub uruchomienia ad hoc możesz wybrać, które lakehouse’y mają zostać uwzględnione w odświeżeniu. Aby uzyskać szczegółowe informacje, zobacz Planowanie zmaterializowanego odświeżania widoku lake.
Uprawnienia do rozszerzonego śledzenia pochodzenia
| Działania | Wymagane uprawnienie |
|---|---|
| Wyświetl rozszerzone pochodzenie danych | Dostęp do odczytu w nadrzędnych obszarach roboczych |
| Planowanie zmaterializowanych widoków jeziora nadrzędnego | Współtwórca projektu upstream lakehouse |
| Wyświetlanie szczegółów zależności nadrzędnych | Dostęp do odczytu w elemencie |
Wyświetl pochodzenie importu plików
Gdy widok zmaterializowanego jeziora pobiera pliki z USING OneLake_Files, jego źródłem jest fizyczny folder OneLake lub skrót do folderu OneLake, a nie tabela upstream. Widok pochodzenia danych przedstawia to źródło jako węzeł folder źródłowy, który zasila widok importujący pliki, dzięki czemu można śledzić i monitorować kompletny potok medallion oparty na plikach.
Wykres linii genealogicznej zaczyna się od folderu źródłowego, który widok pobiera. Węzeł folderu łączy się z materializowanym widokiem jeziora pobierającym plik bronze, który z kolei dostarcza widoki srebrne i złote w dalszej fazie, zgodnie z tym samym porządkiem zależności, jaki Fabric stosuje do widoków tabelowych.
Aby sprawdzić potok z kopią plikową i potwierdzić, że odświeżenie wykryło zmiany źródłowe, należy postępować zgodnie z następującymi krokami:
Wybierz węzeł folderu źródłowego, aby otworzyć panel szczegółów. Panel pokazuje ścieżkę OneLake oraz pliki odkryte w folderze.
Wybierz węzeł materializowany widok jeziora pobierającego plik, aby zobaczyć jego szczegóły, w tym format źródłowy, tryb schematu i tryb odświeżania.
Otwórz kartę Ostatnie uruchomienia, przejdź do szczegółów zarządzanego uruchomienia i wybierz widok wczytywania plików, aby zobaczyć metryki liczby przetworzonych plików i dodanych wierszy.
Interpretacja metryk przetwarzania plików
Pliki przetworzone są metryką na poziomie run, a nie łączną liczbą plików obecnych w folderze źródłowym. Liczba zależy od trybu odświeżania widoku:
- W trybie odświeżania
APPEND_ONLYzliczane są nowe pliki, które przetwarza dane uruchomienie. Nie zlicza plików, które zostały już utworzone przez wcześniejsze uruchomienia. - W trybie odświeżania
FULLzlicza pliki odczytywane podczas odbudowywania widoku z bieżącej migawki folderu. - Udane uruchomienie może zgłosić brak przetworzonych plików, gdy zarządzane odświeżenie nie wykryje żadnych nowych plików źródłowych.
Użyj panelu szczegółów folderu źródłowego, aby wyświetlić bieżącą zawartość folderu, oraz panelu szczegółów uruchomienia, aby wyświetlić pliki przetworzone w ramach określonego odświeżenia. Obie liczby odpowiadają na różne pytania i w przypadku uruchomienia przyrostowego nie muszą być takie same.
Wskazówka
Każdy wprowadzony wiersz zawiera również kolumnę __filepath__ zapisującą jego plik źródłowy. Użyj GROUP BY __filepath__, aby sprawdzić pliki uwzględnione w bieżącym zmaterializowanym wyniku. Ten widok odzwierciedla aktualną linię wierszową, natomiast Pliki przetworzone odzwierciedlają pracę wykonywaną przez jedno odświeżenie.