Opcje danych przejściowych dla Dataflow Gen2

Note

Opcje danych etapowych opisanych w tym artykule są obecnie dostępne w wersji zapoznawczej.

Po włączeniu staging w zapytaniu usługa Dataflow Gen2 zapisuje wyniki pośrednie w wewnętrznym tymczasowym repozytorium Lakehouse, aby silnik mógł korzystać z zasobów obliczeniowych Fabric na potrzeby przekształceń lub zapisywać dane w miejscu docelowym.

Sekcja Dane przejściowe w ustawieniach skalowania przepływu danych umożliwia dostosowanie dwóch aspektów tego potoku danych:

  • Zoptymalizowane kopiowanie do Lakehouse (wersja zapoznawcza) — Użyj szybszej ścieżki do zapisywania danych przejściowych w miejscu docelowym danych Lakehouse w usłudze Fabric.
  • Włącz kompresję V-Order (wersja zapoznawcza) — zastosuj kompresję V-Order do danych zapisanych w przejściowej usłudze Lakehouse.

Obie opcje mają zastosowanie na poziomie przepływu danych i obowiązują tylko w usłudze Dataflow Gen2.

Gdzie znaleźć ustawienia

  1. Otwórz przepływ danych w edytorze Power Query.
  2. Wybierz pozycję Opcje z menu.
  3. Przejdź do karty Skalowanie .
  4. Te dwa ustawienia są wyświetlane w obszarze Dane etapowe.

Zrzut ekranu przedstawiający okno dialogowe Opcje z wybraną kartą Skalowanie i wyróżnioną sekcją Dane etapowe.

Zoptymalizowane kopiowanie do Lakehouse (wersja zapoznawcza)

Gdy ta opcja jest włączona, usługa Dataflow Gen2 używa zoptymalizowanej ścieżki przenoszenia danych dla zapytań, które:

  • Włączono środowisko przejściowe i
  • Zapisz do miejsca docelowego danych Fabric Lakehouse.

W domyślnej ścieżce dane przepływają z magazynu pośredniego do Lakehouse z dodatkowymi operacjami serializacji i dodatkowymi przeskokami sieciowymi. Zoptymalizowana ścieżka zmniejsza liczbę tych przeskoków, co może znacznie skrócić czas odświeżania w przypadku przepływów danych intensywnie wykorzystujących obszar przejściowy, które trafiają do Lakehouse.

Przykład ilustrujący wpływ tej opcji na czas odświeżania i zużycie CU można znaleźć w Scenariuszu 3: Zoptymalizowana kopia do Lakehouse w benchmarkach kosztów i wydajności rozwiązania Dataflow Gen2.

Kiedy należy go używać

Włącz to, gdy etapujesz zapytania, których wyniki ostatecznie trafiają do miejsca docelowego danych Fabric Lakehouse. Staging jest najbardziej przydatny, gdy:

  • Zapytanie zawiera przekształcenia, których nie można złożyć do źródła danych.
  • Chcesz korzystać z zasobów obliczeniowych środowiska przejściowego w usłudze Fabric (Lakehouse lub Warehouse), aby wykonywać zasobożerne operacje, takie jak złączenia, grupowanie lub filtrowanie, przed zapisem do miejsca docelowego.

Więcej informacji o tym, kiedy obszar przejściowy jest pomocny, znajdziesz w artykule Najlepsze rozwiązania dotyczące uzyskiwania najlepszej wydajności w usłudze Dataflow Gen2.

Domyślne zachowanie

Opcja jest domyślnie wyłączona. W przypadku większości przepływów danych, które przechowują dane w obszarze przejściowym i zapisują je w magazynie Lakehouse usługi Fabric, włączenie tej opcji jest korzystne.

Zagadnienia do rozważenia

  • Opcja ma zastosowanie tylko do zapytań, w których włączono obszar przejściowy i które zapisują dane w docelowym miejscu danych usługi Fabric Lakehouse. W przypadku zapytań, które zapisują dane do innych miejsc docelowych (Fabric Warehouse, Fabric SQL Database, Azure SQL, Snowflake, KQL, Azure Data Lake Storage Gen2, lokalizacje docelowe plików), ta opcja nie ma wpływu.
  • Jeśli wyłączysz obszar przejściowy dla zapytania, zoptymalizowana ścieżka kopiowania nie jest stosowana do tego zapytania.
  • Opcja ma zastosowanie do wszystkich kwalifikujących się zapytań w przepływie danych. Obecnie nie ma możliwości nadpisania dla poszczególnych zapytań.

Włączanie kompresji V-Order (wersja zapoznawcza)

V-Order to optymalizacja stosowana podczas zapisu w formacie plików Parquet, która poprawia wydajność odczytu w silnikach Fabric używanych na dalszych etapach przetwarzania, kosztem większego użycia procesora podczas zapisu. Aby uzyskać informacje ogólne i wskazówki dotyczące różnych silników, zobacz Optymalizacja tabel Delta Lake i V-Order oraz Konserwacja i optymalizacja tabel w różnych obciążeniach.

Gdy ta opcja jest włączona, Dataflow Gen2 stosuje kompresję V-Order do danych zapisywanych w przejściowym magazynie Lakehouse. Gdy ta opcja jest wyłączona, dane przejściowe są zapisywane bez V-Order.

Kiedy włączyć lub wyłączyć funkcję V-Order do przygotowania

Usługa Staging Lakehouse przechowuje dane pośrednie, które są używane tylko przez samą usługę Dataflow Gen2: przepływ danych ponownie odczytuje dane etapowe podczas tego samego odświeżania, aby zastosować dalsze przekształcenia lub zapisać w miejscu docelowym, a łącznik Przepływu danych odczytuje dane etapowe, gdy inne elementy wysyłają zapytania do danych wyjściowych przepływu danych. Silniki zapytań użytkowników końcowych (Power BI Direct Lake, Fabric Warehouse, punkt końcowy analityki SQL, Spark) nie odczytują bezpośrednio przejściowego środowiska Lakehouse. Te scenariusze dotyczą zamiast tego miejsca docelowego danych Lakehouse. Aby uzyskać wskazówki dotyczące miejsca docelowego danych, zobacz Włącz kompresję V-Order dla miejsca docelowego Lakehouse.

Ponieważ dane przejściowe są zwykle odczytywane tylko kilka razy podczas tego samego odświeżenia, wyłączenie funkcji V-Order dla danych przejściowych to dobry wybór dla większości przepływów danych. Pomijanie kolejności V-Order skraca czas trwania operacji zapisu i skraca czas trwania odświeżania, szczególnie w przypadku dużych zapisów przejściowych. Rozważ włączenie opcji V-Order on dla obszaru przejściowego, jeśli dane wyjściowe przepływu danych zapisane w obszarze przejściowym są wielokrotnie używane za pośrednictwem łącznika Dataflow i chcesz przedłożyć wydajność odczytu dla tych kolejnych zapytań nad koszt zapisu do obszaru przejściowego.

Domyślne zachowanie

Opcja jest domyślnie włączona. Skorzystaj z powyższych wskazówek, aby zdecydować, co jest właściwe dla przepływu danych.

Gdzie jeszcze obowiązuje V-Order

Oprócz ustawienia na poziomie przepływu danych, które steruje przejściowym magazynem Lakehouse, ustawieniem V-Order można również sterować bezpośrednio w połączeniu miejsca docelowego danych Lakehouse za pomocą opcji zaawansowanej Włącz użycie kompresji V-Order. To ustawienie określa, czy dane zapisywane w docelowym Lakehouse są kompresowane przy użyciu formatu V-Order. Miejscem docelowym jest powierzchnia odczytywana przez usługę Direct Lake, Fabric Warehouse, punkt końcowy analizy SQL i platformę Spark, więc wskazówki na poziomie docelowym są oparte na scenariuszach.

Aby uzyskać szczegółowe informacje na temat opcji na poziomie miejsca docelowego, zobacz temat Włączanie kompresji V-Order w miejscu docelowym usługi Lakehouse.