Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Uwaga / Notatka
Partycjonowane przetwarzanie jest obecnie w wersji zapoznawczej i dostępne tylko w usłudze Dataflow Gen2 z ciągłą integracją i ciągłym wdrażaniem (CI/CD).
Funkcja partycjonowanych obliczeń w silniku Dataflow Gen2 pozwala na równoległe uruchamianie części logiki przepływu danych, co skraca czas zakończenia działań.
Scenariusze z partycjonowanymi celami obliczeniowymi dotyczą przypadków, w których silnik przetwarzania danych może wydajnie integrować operacje, które mogą partycjonować źródło danych i przetwarzać każdą partycję równolegle. Na przykład w scenariuszu, w którym łączysz się z wieloma plikami przechowywanymi w Azure Data Lake Storage Gen2, możesz podzielić listę plików ze źródła, efektywnie pobrać partycjonowaną listę plików przy użyciu składania zapytań, użyć funkcji łączenia plików, i przetworzyć wszystkie pliki równolegle.
Uwaga / Notatka
Tylko łączniki dla Azure Data Lake Storage Gen2, Folderu i Azure Blob Storage generują poprawny skrypt do używania partycjonowanych obliczeń. Łączniki dla SharePoint i Fabric Lakehouse nie obsługują go dzisiaj.
Jak ustawić partycjonowane obliczenia
Aby użyć tej funkcji, wykonaj następujące kroki:
Włączanie ustawień przepływu danych
Na karcie Narzędzia główne na wstążce wybierz przycisk Opcje , aby wyświetlić okno dialogowe. Przejdź do sekcji Skalowanie i włącz ustawienie zezwalające na używanie partycjonowanych obliczeń.
Włączenie tej opcji ma dwa cele:
Umożliwia Dataflow korzystanie z partycjonowanych zasobów obliczeniowych, gdy zostaną one wykryte za pomocą skryptów zapytań
Doświadczenia, takie jak łączenie plików, będą teraz automatycznie tworzyć klucze partycji, których można używać do obliczeń partycjonowanych.
Należy również włączyć ustawienie w sekcji Prywatność , aby zezwolić na łączenie danych z wielu źródeł.
Wykonywanie zapytań przy użyciu klucza partycji
Uwaga / Notatka
Aby używać partycjonowanych obliczeń, upewnij się, że zapytanie jest ustawione na etapy.
Po włączeniu ustawienia możesz użyć środowiska łączenia plików dla źródła danych, które korzysta z widoku systemu plików, takiego jak Azure Data Lake Storage Gen2. Po zakończeniu procesu łączenia plików zauważysz, że zapytanie ma krok Dodano niestandardowy, który ma skrypt podobny do następującego:
let
rootPath = Text.TrimEnd(Value.Metadata(Value.Type(#"Filtered hidden files"))[FileSystemTable.RootPath]?, "\"),
combinePaths = (path1, path2) => Text.Combine({Text.TrimEnd(path1, "\"), path2}, "\"),
getRelativePath = (path, relativeTo) => Text.Middle(path, Text.Length(relativeTo) + 1),
withRelativePath = Table.AddColumn(#"Filtered hidden files", "Relative Path", each getRelativePath(combinePaths([Folder Path], [Name]), rootPath), type text),
withPartitionKey = Table.ReplacePartitionKey(withRelativePath, {"Relative Path"})
in
withPartitionKey
Ten skrypt, a w szczególności składnik withPartitionKey, określa logikę sposobu, w jaki Dataflow próbuje dzielić dane na partycje i jak próbuje oceniać elementy równolegle.
Możesz użyć funkcji Table.PartitionKey względem kroku Dodany niestandardowy. Ta funkcja zwraca klucz partycji określonej tabeli. W powyższym przypadku jest to kolumna RelativePath. Możesz uzyskać odrębną listę wartości w tej kolumnie, aby poznać wszystkie partycje używane podczas uruchamiania przepływu danych.
Ważne
Ważne jest, aby kolumna klucza partycji pozostała w zapytaniu w celu zastosowania partycjonowanych zasobów obliczeniowych.
Zagadnienia i zalecenia
Partycjonowane zasoby obliczeniowe a szybkie kopiowanie: jeśli źródło danych nie obsługuje składania przekształceń dla plików, zalecamy wybranie partycjonowanych zasobów obliczeniowych w ramach szybkiej kopii.
Lakehouse file access: Aby nawiązać połączenie z plikami w usłudze Lakehouse, zalecamy użycie łącznika Azure Data Lake Storage Gen2 przez przekazanie adresu URL węzła
Files.Najlepsza wydajność: użyj tej metody, aby załadować dane bezpośrednio do obszaru tymczasowego jako miejsce docelowe lub do magazynu Fabric.
Przechowywanie danych: Tylko najnowsze uruchomienie partycji jest przechowywane w usłudze Dataflow Staging Lakehouse i zwracane przez łącznik Przepływu Danych. Rozważ użycie miejsca docelowego danych do przechowywania danych dla każdej oddzielnej partycji.
Przekształcenia plików: użyj przykładowego pliku przekształcenia ze środowiska Łączenia plików , aby wprowadzić przekształcenia, które powinny nastąpić w każdym pliku.
Obsługiwane przekształcenia: Partycjonowane obliczenia obsługują tylko podzestaw przekształceń. Wydajność może się różnić w zależności od źródła i zestawu użytych przekształceń.
Rozliczenia: Opłata za uruchomienie przepływu danych jest naliczana na podstawie zużycia jednostek pojemności (CU). Uruchamianie partycji równolegle skraca cały czas (zegar ścienny) na zakończenie uruchomienia, podczas gdy Dataflow Gen2 oblicza zużycie CU na podstawie łącznego wyniku obliczeniowego każdej partycji. Każda partycja jest obciążona za własny czas przetwarzania. W rezultacie przebieg partycjonowany może zużywać podobną lub większą ilość CU niż sekwencyjny przebieg tego samego obciążenia, mimo że kończy się szybciej. Pełny model stawek można znaleźć w artykule Cennik Dataflow Gen2.