Ładowanie danych do Lakehouse przy użyciu partycji w pipeline

Funkcja partycjonowania w tabeli Lakehouse jako docelowej destynacji oferuje możliwość ładowania danych do tabeli Lakehouse z wykorzystaniem partycji. Partycje są generowane w docelowym usłudze Lakehouse, a następnie wspomagają zadania podrzędne lub konsumpcję.

Ten samouczek pomoże Ci nauczyć się, jak załadować dane do systemu Lakehouse, używając partycji w potoku. Na przykład przykład przykładowy zestaw danych jest ładowany do usługi Lakehouse przy użyciu jednej lub wielu kolumn partycji, wykonując następujące kroki. Próbny zbiór danych Public Holidays jest używany jako dane przykładowe.

Warunek wstępny

  • Upewnij się, że masz obszar roboczy z włączoną obsługą Project Microsoft Fabric: Utwórz obszar roboczy.

Stwórz potok

  1. Przejdź do Power BI.

  2. Wybierz ikonę Power BI w lewym dolnym rogu ekranu, a następnie wybierz pozycję Fabric aby otworzyć stronę główną usługi Data Factory.

  3. Przejdź do obszaru roboczego Microsoft Fabric. Jeśli utworzono nowy obszar roboczy w poprzedniej sekcji Wymagania wstępne, użyj tego obszaru.

  1. Wybierz pozycję + Nowy element.

  2. Wyszukaj i wybierz pozycję Potok , a następnie wprowadź nazwę potoku, aby utworzyć nowy potok. w celu utworzenia nowego potoku.

    Zrzut ekranu przedstawiający przycisk nowego potoku w nowo utworzonym obszarze roboczym.

    Zrzut ekranu przedstawiający nazwę nowej ścieżki.

Ładowanie danych do Lakehouse za pomocą kolumn partycji

  1. Otwórz potok danych i dodaj działanie kopiowania, wybierając pozycję Działanie potoku danych ->Kopiuj dane. W obszarze Źródło wybierz pozycję Więcej w dolnej części listy połączeń, a następnie wybierz pozycję Dni wolne od pracy na karcie Przykładowe dane.

    Zrzut ekranu przedstawiający korzystanie z przykładowego zestawu danych.

    Zrzut ekranu przedstawiający wybieranie przykładowego zestawu danych.

  2. Na karcie Miejsce docelowe wybierz opcję Więcej u dołu listy połączeń, a następnie wybierz istniejący Lakehouse na karcie OneLake. Określ swój Lakehouse lub utwórz nowy Lakehouse na karcie Narzędzia główne. Wybierz Tabela w folderze głównym i określ nazwę swojej tabeli.

    Zrzut ekranu przedstawiający konfigurację docelową.

  3. Rozwiń Zaawansowane, w akcji Tabela wybierz Zastąp, a następnie wybierz Włącz partycję, w obszarze Kolumny partycji wybierz Dodaj kolumnę i wybierz kolumnę, której chcesz użyć jako kolumny partycji. Możesz użyć jednej kolumny lub wielu kolumn jako kolumny partycji.

    Jeśli używasz jednej kolumny, countryOrRegion (typ ciągu) zostanie wybrany jako przykład w tym samouczku. Dane będą partycjonowane według różnych wartości kolumn.

    Zrzut ekranu przedstawiający konfigurację kolumn partycji w obszarze docelowym.

    Uwaga

    Kolumna partycji, którą można wybrać, powinna być typu ciąg, liczba całkowita, wartość logiczna i data/godzina. Kolumny innych typów danych nie są wyświetlane na liście rozwijanej.

    Jeśli używasz wielu kolumn partycji, dodaj jeszcze jedną kolumnę i wybierz wartość isPaidTimeOff , która jest typem logicznym jako przykład. Następnie uruchom potok. Logika polega na tym, że tabela jest najpierw partycjonowana przez pierwsze dodane wartości kolumn, a następnie partycjonowane dane nadal są partycjonowane przez drugie dodane wartości kolumn.

    Zrzut ekranu przedstawiający konfigurowanie wielu kolumn partycji.

    Napiwek

    Możesz przeciągać kolumny, aby zmienić sekwencję kolumn, a sekwencja partycji również ulegnie zmianie.

  4. Wybierz opcję Uruchom i opcję Zapisz i uruchom, aby uruchomić potok.

    Zrzut ekranu przedstawiający zapisywanie i uruchamianie.

  5. Po pomyślnym uruchomieniu potoku przejdź do swojej Lakehouse. Znajdź skopiowaną tabelę. Kliknij prawym przyciskiem myszy nazwę tabeli i wybierz pozycję Wyświetl pliki.

    W przypadku jednej kolumny partycji (countryOrRegion) tabela jest podzielona na różne foldery według nazw krajów lub regionów. Znak specjalny w nazwie kolumny jest zakodowany i może się okazać, że nazwa pliku różni się od wartości kolumn podczas wyświetlania plików w usłudze Lakehouse.

    Zrzut ekranu przedstawiający widok pliku w usłudze Lakehouse.

    Zrzut ekranu przedstawiający widok pliku skopiowanych danych świąt publicznych.

    W przypadku wielu kolumn partycji tabela jest podzielona na różne foldery według nazw krajów lub regionów.

    Zrzut ekranu przedstawiający folder kraju lub regionu partycji.

    Wybierz jeden folder, na przykład contryOrRegion=Stany Zjednoczone. Tabela, która została podzielona na partycje według nazwy kraju lub regionu, jest ponownie partycjonowana według wartości drugiej dodanej kolumny isPaidTimeOff: True lub False lub __HIVE_DEFAULT_PARTITION__ (reprezentuje pustą wartość w przykładowym zestawie danych).

    Zrzut ekranu przedstawiający podział kraju lub regionu na podstawie właściwości ispaidtimeoff.

    Podobnie, jeśli dodasz trzy kolumny do partycji tabeli, otrzymasz folder drugiego poziomu partycjonowany przez dodaną trzecią kolumnę.

Następnie przejdź dalej, aby dowiedzieć się więcej na temat kopiowania z Azure Blob Storage do usługi Lakehouse.