Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Ten artykuł zawiera najlepsze rozwiązania dotyczące optymalizacji wydajności usługi Dataflow Gen2 w usłudze Fabric Data Factory. Postępując zgodnie z tymi wytycznymi, możesz zwiększyć wydajność i szybkość procesów integracji danych.
Czego się nauczysz
W tym artykule znajdziesz następujące informacje:
- Kluczowe obszary optymalizacji wydajności: opis trzech krytycznych składników (źródła danych, aparatu przepływu danych i miejsca docelowego danych), które mają wpływ na wydajność przepływu danych
- Podstawowe techniki optymalizacji: Jak wykorzystać szybkie kopiowanie, składanie zapytań i przemieszczanie w celu zmaksymalizowania wydajności
- Rzeczywiste scenariusze: typowe wyzwania związane z wydajnością i ich konkretne rozwiązania
- Najlepsze rozwiązania: Wskazówki umożliwiające podejmowanie działań dla różnych wzorców integracji danych i przypadków użycia
Jakie są kluczowe obszary, na których należy skoncentrować się na optymalizacji wydajności?
W środowisku końcowym przepływu danych istnieje kilka kluczowych obszarów, na których należy skoncentrować się na optymalizacji wydajności. Obszary te obejmują przenoszenie danych, aparat przepływu danych i przekształcenia danych. Każdy z tych składników i ścieżek między odgrywają kluczową rolę w ogólnej wydajności przepływu danych, a ich optymalizacja może prowadzić do znaczących ulepszeń czasu wykonywania i wykorzystania zasobów.
Przenoszenie danych
Przenoszenie danych jest krytycznym aspektem wydajności przepływu danych. Obejmuje ona transfer danych między różnymi składnikami, takimi jak źródła danych, obszary przejściowe i końcowe miejsca docelowe. Wydajne przenoszenie danych może znacznie skrócić czas wykonywania i zużycie zasobów. W usłudze Dataflow Gen2 przenoszenie danych jest zoptymalizowane za pomocą technik, takich jak Fast Copy, co umożliwia transfer danych o wysokiej przepływności bez narzutu przekształceń, które nie są składane w systemie źródłowym. Dowiedz się więcej o szybkim kopiowaniu.
Transformacja danych
Przekształcanie danych to proces konwertowania danych z jednej struktury na inną, często obejmujących operacje, takie jak filtrowanie, agregowanie i łączenie. W usłudze Dataflow Gen2 przekształcenia są zaprojektowane, aby były wydajne i wykorzystywały możliwości składania zapytań zawsze, gdy to możliwe. Składanie zapytań umożliwia przesuwanie przekształceń do systemu źródłowego, zmniejszając ilość danych przesyłanych i przetwarzanych w przepływie danych Gen2. Ta redukcja jest szczególnie ważna w przypadku dużych zestawów danych, ponieważ minimalizuje obciążenie aparatu przepływu danych i skraca czas wykonywania. Aby dowiedzieć się więcej na temat składania zapytań, przejdź do artykułu Składanie zapytań. Należy również postępować zgodnie z innymi najlepszymi rozwiązaniami dotyczącymi optymalizacji zapytań, takimi jak wczesne i częste filtrowanie przy użyciu parametryzacji w celu ograniczenia podglądów danych i uniknięcia niepotrzebnych przekształceń w przepływie danych. Aby dowiedzieć się więcej na temat optymalizacji zapytań, przejdź do artykułu Optymalizacja zapytań.
Przejściowe dane i obliczenia magazynu
Dane przejściowe to technika stosowana do poprawy wydajności dzięki tymczasowemu przechowywaniu wyników pośrednich w obszarze przejściowym. Usługa Dataflow Gen2 jest dostarczana z przejściowym magazynem Lakehouse i przejściowym magazynem, który może służyć do wydajniejszego wykonywania przekształceń. Dzięki przejściowym danym można użyć zasobów obliczeniowych tych obszarów przejściowych, aby podzielić złożone przepływy danych na możliwe do zarządzania kroki, skracając całkowity czas przetwarzania. Ten podział jest szczególnie przydatny w przypadku dużych zestawów danych lub złożonych przekształceń, które w przeciwnym razie wykonanie w jednym kroku zajęłoby dużo czasu. Lokalizacje przejściowe można rozważyć jako tymczasowy obszar przechowywania, który umożliwia wykonywanie przekształceń. Takie podejście jest szczególnie korzystne w przypadku pracy ze źródłami danych, które nie obsługują składania zapytań lub gdy przekształcenia są zbyt złożone, aby można je było wypchnąć do systemu źródłowego. Aby skutecznie zastosować etapy wdrażania, możesz śledzić wskaźniki składania w edytorze przepływu danych, aby upewnić się, że przekształcenia są przenoszone w dół do źródła. Jeśli zauważysz, że transformacja nie działa zgodnie z oczekiwaniami, rozważ podzielenie zapytania na dwa zapytania i wykonanie przekształcenia w drugim zapytaniu. Włącz staging w pierwszej kwerendzie, aby przeprowadzić transformację w środowisku obliczeniowym Staging Lakehouse lub Warehouse. Takie podejście umożliwia korzystanie z zasobów obliczeniowych dostępnych w obszarach przejściowych przy jednoczesnym zapewnieniu, że przepływ danych pozostaje wydajny i dynamiczny.
Jeśli masz już dane przygotowane w usłudze Lakehouse lub Warehouse i stosujesz więcej przekształceń, które są w pełni zintegrowane w kolejnych zapytaniach, przepływ danych zapisze dane wyjściowe w magazynie przejściowym. Może to być szybsze niż zapisywanie w przejściowym Lakehouse, ponieważ zestaw danych może być zapisywany równolegle przez DW i poddawany mniejszej liczbie przeskoków sieciowych z odpowiadającymi im krokami serializacji.
Scenariusze i jakie optymalizacje należy wziąć pod uwagę
Podczas pracy z usługą Dataflow Gen2 ważne jest zrozumienie różnych scenariuszy, które można napotkać i jak zoptymalizować wydajność w każdym przypadku. Poniższe zagadnienia zawierają praktyczne wskazówki dotyczące stosowania najlepszych rozwiązań w rzeczywistych sytuacjach. Dzięki dostosowaniu podejścia na podstawie określonych cech danych i przekształceń można osiągnąć optymalną wydajność w przepływach pracy integracji danych. Poniżej przedstawiono kilka typowych scenariuszy, które mogą wystąpić podczas pracy z usługą Dataflow Gen2 wraz z zalecanymi akcjami w celu zoptymalizowania wydajności. Należy pamiętać, że optymalizacja wydajności jest trwającym procesem i bardzo specyficznym dla danego scenariusza. Może być konieczne dostosowanie podejścia na podstawie określonych cech własnych danych i przekształceń.
Uwaga 1. Ulepszanie przenoszenia danych za pomocą szybkiej kopii
W tym scenariuszu zauważysz, że przenoszenie danych między źródłem danych a obszarem przejściowym lub do końcowego miejsca docelowego trwa dłużej niż oczekiwano. Może być zaangażowanych kilka czynników, takich jak opóźnienie sieci, duże rozmiary zestawów danych lub nieefektywne metody transferu danych.
W takim przypadku rozważ ocenę ścieżki przenoszenia danych i optymalizację jej pod kątem lepszej wydajności. Jednym z podejść jest użycie funkcji Fast Copy do transferu danych o wysokiej przepływności, co może znacznie zmniejszyć środowisko uruchomieniowe. Funkcja Fast Copy została zaprojektowana tak, aby wydajnie obsługiwać duże ilości danych, minimalizując obciążenie związane z tradycyjnymi metodami transferu danych. Należy jednak zachować ostrożność: jeśli dodasz transformacje w tym samym zapytaniu co operacja szybkiego kopiowania, funkcja szybkiego kopiowania może zostać wyłączona, jeśli transformacje nie są składane w systemie źródłowym. W takich przypadkach rozważ rozdzielenie zapytania na dwa kroki: jeden dla operacji szybkiej kopiowania, a drugi dla przekształceń przy użyciu przejściowego środowiska obliczeniowego Lakehouse lub Warehouse. Takie podejście umożliwia korzystanie z funkcji szybkiego kopiowania w celu przenoszenia danych o wysokiej przepływności podczas wykonywania niezbędnych przekształceń w osobnym kroku. Dowiedz się więcej o szybkim kopiowaniu.
Szybkie kopiowanie można włączyć w ustawieniach przepływu danych. To ustawienie jest domyślnie włączone, ale można również wymagać użycia funkcji Fast Copy dla określonego zapytania w przepływie danych. W tym celu wybierz opcję Wymagaj szybkiego kopiowania w ustawieniach zapytania. Ta akcja gwarantuje, że opcja Szybkie kopiowanie jest używana dla wybranego zapytania i że ignoruje minimalny próg rozmiaru dla opcji Szybkie kopiowanie. To ustawienie jest szczególnie przydatne, gdy chcesz upewnić się, że funkcja Fast Copy jest używana dla określonych zapytań, niezależnie od rozmiaru danych lub innych warunków. Jeśli potrzebujesz Fast Copy, upewnij się, że źródło danych jest kompatybilne z funkcją Fast Copy i że przekształcenia w zapytaniu można przekazać do systemu źródłowego. Jeśli potrzebujesz Fast Copy w zapytaniu, które nie jest zgodne z Fast Copy, przepływ danych zakończy się niepowodzeniem. Jeśli nie potrzebujesz Fast Copy, przepływ danych nadal działa, ale może powrócić do domyślnej metody przenoszenia danych, która może nie być tak wydajna jak Fast Copy. Ta elastyczność umożliwia optymalizowanie przepływu danych na podstawie określonych wymagań procesów integracji danych.
Uwaga 2. Poprawa czasu wykonywania złożonych przekształceń przy użyciu etapu pośredniego
W tym scenariuszu masz przepływ danych z wieloma złożonymi przekształceniami, takimi jak sprzężenia, agregacje i filtrowanie. Czas wykonywania jest dłuższy niż żądany i chcesz zoptymalizować wydajność tych przekształceń.
W takim przypadku rozważ podzielenie przepływu danych na mniejsze, bardziej możliwe do zarządzania kroki. Zamiast wykonywać wszystkie przekształcenia w jednym zapytaniu, możesz przygotować dane w przejściowej usłudze Lakehouse lub Warehouse, a następnie zastosować przekształcenia w kolejnych zapytaniach. Takie podejście umożliwia zastosowanie zasobów obliczeniowych obszaru przejściowego na potrzeby złożonych przekształceń, co zmniejsza całkowity czas wykonywania. Ponadto upewnij się, że przekształcenia zostały zaprojektowane tak, aby były składane do systemu źródłowego zawsze, gdy jest to możliwe, ponieważ może to znacznie poprawić wydajność, zmniejszając ilość przesyłanych i przetwarzanych danych w przepływie danych Gen2. Jeśli zauważysz, że niektóre przekształcenia nie składają się, rozważ podzielenie ich na osobne zapytania i zastosowanie ich po wstępnym przetworzeniu danych.
Na poniższej ilustracji zwróć uwagę na to, jak wskaźniki zwijania w edytorze przepływów danych mogą ułatwić określenie, które przekształcenia są przenoszone do systemu źródłowego.
Aby efektywnie zaimplementować etapowanie, możesz podzielić przepływ danych na dwa zapytania. Możesz to zrobić, klikając prawym przyciskiem myszy pierwszy krok, który nie jest zgodny z systemem źródłowym i wybierając opcję Wyodrębnij poprzedni. Ta akcja tworzy nowe zapytanie, które etapuje dane w środowisku obliczeniowym staging Lakehouse lub Warehouse, co pozwala wykonać transformację w osobnym kroku. Takie podejście ułatwia korzystanie z zasobów obliczeniowych dostępnych w obszarach przejściowych przy jednoczesnym zapewnieniu, że przepływ danych pozostaje wydajny i dynamiczny.
Następnie podaj nazwę nowego zapytania i wybierz pozycję "OK".
Teraz po utworzeniu nowego zapytania możesz sprawdzić, czy dla pierwszego zapytania włączono środowisko przygotowawcze. Jeśli obsługa środowiska przejściowego nie jest włączona, możesz je włączyć, wybierając opcję Włącz obsługę środowiska przejściowego w ustawieniach zapytania. Ta akcja umożliwia wykonywanie przekształceń w środowisku obliczeniowym przejściowym Lakehouse lub Warehouse, optymalizując wydajność przepływu danych. Ustawienie drugiego zapytania jest opcjonalne, ale może jeszcze bardziej zwiększyć wydajność, umożliwiając wykonywanie dodatkowych przekształceń w obszarze tymczasowym przed zapisaniem wyniku końcowego do miejsca docelowego.
Jeśli teraz przyjrzysz się wskaźnikom składania w edytorze przepływu danych, przekształcenia w pierwszym zapytaniu są przenoszone do systemu źródłowego. Drugie zapytanie może nie odzwierciedlać tych samych wskaźników złożenia, ponieważ jest ono świadome informacji o obszarze przejściowym i przekształceniach, które można wypchnąć do obszaru przejściowego tylko w czasie wykonywania.
Aby dowiedzieć się więcej o tym, jak zoptymalizować przekształcenia przepływu danych i upewnić się, że są one przesuwane do systemu źródłowego, przejdź do Składanie zapytań.
Kwestia 3: Optymalizacja przenoszenia danych ze stagingu do usługi Lakehouse dla miejsca docelowego typu Lakehouse
W tym scenariuszu użyj miejsca docelowego usługi Lakehouse dla przepływu danych i włącz przejściowe uruchamianie przekształceń przed zapisaniem końcowych danych wyjściowych. Upewnij się, że krok przenoszący dane przejściowe do Lakehouse niepotrzebnie nie wydłuża całkowitego czasu odświeżania.
Lakehouse jest w pełni wspieranym, wysokowydajnym miejscem docelowym dla tego wzorca. Przenoszenie danych z magazynu przejściowego do miejsca docelowego usługi Lakehouse jest zoptymalizowane, więc nie trzeba już przełączać miejsca docelowego do magazynu, aby uzyskać dobrą wydajność. Zalecanym podejściem jest wzorzec ELT: użyj Fast Copy, aby szybko załadować dane, uruchomić przekształcenia na danych przejściowych przy użyciu przejściowego środowiska obliczeniowego rozwiązania Fabric i zapisać wynik końcowy w usłudze Lakehouse. W przypadku dużych zestawów danych szybkie kopiowanie pozostaje zalecanym sposobem efektywnego przenoszenia danych.
Aby obecnie w pełni wykorzystać ten wzorzec, rozdziel operację Fast Copy i przekształcenia na dwa zapytania: jedno zapytanie, które wykonuje przenoszenie danych za pomocą funkcji Fast Copy, oraz drugie zapytanie, które stosuje przekształcenia do danych przejściowych przed zapisaniem ich w docelowym magazynie Lakehouse. Połączenie operacji Szybkiego kopiowania z przekształceniami bez składania zapytań w tym samym zapytaniu wyłącza funkcję Szybkiego kopiowania, dlatego najważniejsze jest, aby utrzymywać je w osobnych zapytaniach. Jeśli przekształcenia są w pełni złożone do źródła, możesz również zapisywać bezpośrednio w usłudze Lakehouse z wyłączonym przemieszczaniem.
Po przygotowaniu danych i zapisie w miejscu docelowym usługi Lakehouse włącz opcję Zoptymalizowana kopia do usługi Lakehouse (wersja zapoznawcza) na karcie Skalowanie, aby skierować dane etapowe do usługi Lakehouse przez szybszą ścieżkę kopiowania, co zmniejsza obciążenie przeskoku przejściowego do usługi Lakehouse. Aby uzyskać więcej informacji, zobacz Opcje danych etapowych dla usługi Dataflow Gen2.
Rozważenie 4: Podgląd dużych danych podczas projektowania
W tym scenariuszu pracujesz nad przepływem danych z dużymi zestawami danych, a środowisko projektowania działa wolno z powodu rozmiaru podglądów danych. Ten proces może utrudnić tworzenie i testowanie przepływu danych.
W takim przypadku rozważ użycie widoku schematu lub parametryzacji, aby ograniczyć rozmiar podglądów danych. Stosując filtry na podstawie parametrów, takich jak zakres dat lub określone identyfikatory, można zmniejszyć ilość danych wyświetlanych w środowisku czasu projektowania. Takie podejście pomaga zapewnić dynamiczne i wydajne środowisko projektowe, co pozwala skupić się na tworzeniu i testowaniu przepływu danych bez zakłócania korzystania z dużych wersji zapoznawczych danych. Ponadto można dostosować parametry w czasie wykonywania, aby pobrać pełny zestaw danych w razie potrzeby.
Jeśli na przykład pracujesz z dużym transakcyjnym zestawem danych, możesz utworzyć parametr, który filtruje dane na podstawie określonego zakresu dat. Dzięki temu w czasie projektowania zobaczysz tylko podzbiór danych, które są istotne dla bieżącej pracy. Gdy wszystko będzie gotowe do uruchomienia przepływu danych, możesz dostosować parametr tak, aby zawierał pełny zestaw danych, zapewniając, że procesy integracji danych pozostają wydajne i dynamiczne. W poniższym przykładzie pokazano, jak skonfigurować parametr w usłudze Dataflow Gen2:
Wybierz opcję Zarządzaj parametrami w edytorze przepływu danych.
Wybierz przycisk Dodaj parametr , aby dodać nowy parametr.
Wypełnij szczegóły parametru, takie jak nazwa, typ i wartość. Na przykład można utworzyć parametr o nazwie DesignDateFilter typu
DateTimez wartością domyślną, która ogranicza podgląd danych do określonego zakresu dat.
Zastosuj parametr w zapytaniach przepływu danych, używając go w warunkach filtrowania. Można na przykład filtrować dane na podstawie parametru DesignDateFilter , aby ograniczyć podgląd danych do określonego zakresu dat. W takim przypadku filtrujemy dane tak, aby zawierały tylko rekordy, w których kolumna "Date" jest większa niż parametr DesignDateFilter .
Teraz możesz użyć parametru DesignDateFilter w zapytaniach przepływu danych, aby ograniczyć podgląd danych w czasie projektowania. Gdy wszystko będzie gotowe do uruchomienia przepływu danych, możesz dostosować wartość parametru, aby uwzględnić pełny zestaw danych, zapewniając, że procesy integracji danych pozostają wydajne i dynamiczne.
Inną opcją jest użycie widoku schematu, który umożliwia wyświetlenie struktury danych bez ładowania całego zestawu danych. Ten widok zawiera ogólne omówienie typów danych i kolumn w zestawie danych, co umożliwia projektowanie i testowanie przepływu danych bez wpływu na duże podglądy danych. Aby przełączyć się do widoku schematu, wybierz opcję Widok schematu w edytorze przepływu danych.
5. Charakterystyki środowiska uruchomieniowego Dataflow Gen2 w porównaniu z Dataflow Gen1
W tym scenariuszu zauważysz, że wydajność usługi Dataflow Gen2 jest niższa niż w przypadku usługi Dataflow Gen1, szczególnie w zakresie czasu wykonywania i użycia zasobów. Ta różnica w wydajności może być spowodowana kilkoma czynnikami, w tym różnicami w technikach optymalizacji i formatach danych wyjściowych używanych w usłudze Dataflow Gen2.
Przepływ danych w Gen2 emituje dane w formacie Delta Parquet, gdy używasz miejsc docelowych przejściowych lub Lakehouse, co różni się od wyjścia CSV w Dataflow Gen1. Chociaż Delta Parquet może spowodować dłuższy czas wykonywania ETL w porównaniu z CSV, umożliwia zaawansowane możliwości, takie jak Direct Lake, Lakehouses i Warehouses, pozwalając tym usługom na wydajne korzystanie z danych bez dodatkowego przetwarzania lub kosztów. Ta różnica w metodzie magazynowania oznacza, że chociaż początkowy czas wykonywania może być dłuższy, ogólna wydajność i wydajność procesów podrzędnych mogą być znacznie ulepszone i mogą prowadzić do lepszej długoterminowej wydajności przepływów pracy integracji danych. Dowiedz się więcej o formacie Delta Parquet.
Uwaga 6. Optymalizowanie czasu odświeżania dla dużych transakcyjnych zestawów danych przy użyciu odświeżania przyrostowego
W tym scenariuszu masz do czynienia z dużym transakcyjnym zestawem danych, który jest często aktualizowany i chcesz zoptymalizować czas odświeżania przepływu danych. Ta optymalizacja może być trudna ze względu na ilość danych i konieczność przetwarzania tylko nowych lub zmienionych rekordów.
W takim przypadku rozważ użycie odświeżania przyrostowego lub wzorca, aby przyrostowo zgromadzić dane. Odświeżanie przyrostowe umożliwia przetwarzanie tylko nowych lub zmienionych danych od czasu ostatniego odświeżenia, zmniejszając ilość przetwarzanych danych i przyspieszając całkowity czas wykonywania. Takie podejście jest szczególnie przydatne w scenariuszach, w których dane są często aktualizowane, na przykład w systemach transakcyjnych. Implementując odświeżanie przyrostowe, można zoptymalizować wydajność przepływu danych i zapewnić, że procesy integracji danych pozostaną wydajne i dynamiczne. Dowiedz się więcej na temat odświeżania przyrostowego lub przyrostowego wzorca gromadzenia danych.
Uwaga 7: Używam bramy do nawiązywania połączenia z lokalnym źródłem danych i chcę zoptymalizować wydajność przepływu danych
W tym scenariuszu używasz bramy do łączenia się z lokalnym źródłem danych i chcesz zoptymalizować wydajność przepływu danych. Bramy mogą wprowadzać dodatkowe opóźnienia i nakłady pracy, co może mieć wpływ na ogólną wydajność przepływu danych.
W takim przypadku rozważ podzielenie przepływu danych na dwa oddzielne przepływy danych: jeden na potrzeby przenoszenia danych z lokalnego źródła danych do miejsca docelowego danych (takiego jak Lakehouse lub Warehouse), a drugi na potrzeby przekształceń i końcowych danych wyjściowych. Takie podejście umożliwia optymalizację kroku przenoszenia danych dzięki wykorzystaniu funkcji Szybkiego kopiowania na potrzeby transferu danych o wysokiej przepływności, przy jednoczesnym zachowaniu kroku transformacji skoncentrowanego na wydajnym przetwarzaniu danych i skróceniu ogólnego czasu wykonywania. Oddzielając kroki przenoszenia i przekształcania danych, można zmniejszyć wpływ opóźnienia bramy i ograniczeń pojemności. Przyczyną jest to, że brama uruchamia cały przepływ danych, a jeśli przepływ danych jest złożony lub ma wiele przekształceń, może to prowadzić do wolniejszej wydajności, ponieważ brama przetwarza wszystkie przekształcenia na komputerze hostujący bramę. Dzieląc przepływ danych, możesz upewnić się, że brama jest odpowiedzialna tylko za krok przenoszenia danych, co może znacznie poprawić wydajność i skrócić czas wykonywania.
Uwaga 8: Używam łączników przepływu danych do korzystania z danych z przepływu danych i chcę zoptymalizować procesy integracji danych
W tym scenariuszu używasz łączników przepływu danych do pobierania danych ze swojego przepływu danych i chcesz zoptymalizować procesy integracji danych. Łączniki przepływu danych mogą zapewnić wygodny sposób uzyskiwania dostępu do danych i korzystania z nich.
W takim przypadku rozważ użycie miejsc docelowych danych zamiast łączników przepływu danych do korzystania z danych z przepływu danych. Miejsca docelowe danych, takie jak Lakehouses i Warehouses, zostały zaprojektowane tak, aby efektywnie przechowywać i obsługiwać dane, co pozwala na wykorzystanie ich możliwości do dalszego przetwarzania. Główną zaletą korzystania z miejsc docelowych danych jest to, że często służą one bardziej uniwersalnym sposobom łączenia się z danymi, takim jak endpoint analityki SQL lub korzystanie z funkcji Direct Lake, które mogą znacząco poprawić wydajność i zmniejszyć zużycie zasobów.
Uwaga 9. Włączanie nowoczesnego ewaluatora w celu zwiększenia wydajności wykonywania zapytań
W tym scenariuszu chcesz poprawić ogólną wydajność przepływu danych, szczególnie w przypadku złożonych przekształceń lub podczas pracy z łącznikami, które nie umożliwiają składania zapytań.
W takim przypadku rozważ włączenie nowoczesnego aparatu oceny zapytań (Modern Evaluator) dla przepływu danych Gen2 z CI/CD. Modern Evaluator to nowy aparat wykonywania zapytań uruchomiony na platformie .NET Core 8, który może znacznie poprawić wydajność przebiegów przepływu danych. Zaleca się zawsze włączenie tej funkcji w obsługiwanych scenariuszach, ponieważ zapewnia kilka kluczowych korzyści:
- Szybsze wykonywanie przepływu danych: nowoczesny aparat może znacznie skrócić czas oceny zapytań. Wiele przepływów danych działa znacznie szybciej, co umożliwia częstsze odświeżanie danych lub spełnianie napiętych okien odświeżania.
- Bardziej wydajne przetwarzanie: aparat jest zoptymalizowany pod kątem wydajności przy użyciu ulepszonych algorytmów i nowoczesnego środowiska uruchomieniowego. Oznacza to, że może obsługiwać złożone przekształcenia z mniejszym obciążeniem, co pomaga utrzymać wydajność w miarę wzrostu ilości danych.
- Skalowalność i niezawodność: Dzięki przyspieszeniu wykonywania oraz redukcji wąskich gardeł, nowoczesny komponent ewaluacyjny pomaga skalować przepływy danych do większych wolumenów przy zwiększonej niezawodności. Możesz oczekiwać bardziej spójnych czasów trwania odświeżania i mniejszej liczby problemów z limitem czasu w dużych przepływach danych.
Nowoczesny ewaluator jest szczególnie korzystny, gdy:
- Pracujesz z nieskładalnymi lub częściowo składanymi łącznikami
- Stosujesz filtry, wyprowadzenia kolumn lub operacje czyszczenia danych
- Masz do czynienia z dużymi woluminami danych lub złożonymi przekształceniami
- Przepływy danych są uruchamiane wiele razy dziennie i musisz zgromadzić oszczędności czasu
Aby włączyć nowoczesnego ewaluatora:
- Otwórz przepływ danych w edytorze Power Query.
- Wybierz pozycję Opcje z menu.
- Przejdź do karty Skalowanie .
- Włącz opcję Nowoczesny silnik oceny zapytań.
- Zapisz i uruchom przepływ danych.
Modern Evaluator obsługuje rosnącą listę łączników. Aby uzyskać pełną listę obsługiwanych łączników i bieżący stan funkcji, zobacz Modern Evaluator for Dataflow Gen2 with CI/CD (Modern Evaluator for Dataflow Gen2 with CI/CD). Jeśli przepływ danych używa łączników, które nie znajdują się na liście obsługiwanych, te zapytania będą nadal uruchamiane za pomocą standardowego silnika.
Aby dowiedzieć się więcej na temat Modern Evaluator dla Dataflow Gen2 z CI/CD, zobacz stronę Modern Evaluator dla Dataflow Gen2 z CI/CD.
Conclusion
Postępując zgodnie z tymi najlepszymi rozwiązaniami i biorąc pod uwagę konkretne cechy danych i przekształceń, możesz zoptymalizować wydajność przepływów danych Gen2 w usłudze Fabric Data Factory. Niezależnie od tego, czy pracujesz z dużymi zestawami danych, złożonymi transformacjami, czy konkretnymi wzorcami integracji danych, te wytyczne zapewniają praktyczne szczegółowe informacje w celu zwiększenia wydajności i szybkości procesów integracji danych. Pamiętaj, że optymalizacja wydajności jest ciągłym procesem i może być konieczne dostosowanie podejścia w oparciu o zmieniające się potrzeby przepływów pracy integracji danych. Stale monitorując i optymalizując przepływy danych, możesz zapewnić, że pozostaną one wydajne i reagujące na wymagania biznesowe.