Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Odświeżanie przyrostowe dla źródeł danych w oparciu o Azure Data Lake Storage daje następujące korzyści:
- Szybsze odświeżenia — Odświeżane są tylko te dane, które zostały zmienione. Można na przykład odświeżyć tylko ostatnie pięć dni z historycznego zestawu danych.
- Zwiększona niezawodność — Wraz z mniejszą liczbą odświeżeń nie jest konieczne długie utrzymywanie połączeń z nietrwałymi systemami źródłowymi, co zmniejsza ryzyko problemów z połączeniem.
- Zmniejszone zużycie zasobów — Odświeżanie tylko podzbioru wszystkich danych zwiększa efektywność korzystania z zasobów obliczeniowych i obniża zużycie środowiska.
Konfiguruj przyrostowe odświeżanie źródeł danych Azure Data Lake Storage
Microsoft zaleca format Delta Lake, aby uzyskać najlepszą wydajność i wyniki podczas pracy z dużymi zestawami danych. Aplikacja Customer Insights - Data zapewnia łącznik zoptymalizowany pod kątem danych w formacie Delta Lake. Procesy wewnętrzne, takie jak ujednolicenie, są zoptymalizowane tak, aby przyrostowo przetwarzać tylko zmienione dane, co skutkuje krótszym czasem przetwarzania.
Aby użyć przyrostowego pozyskiwania i odświeżania tabeli Data Lake, skonfiguruj tę tabelę podczas dodawania lub edytowania źródła danych Azure Data Lake. Folder danych tabeli musi zawierać następujące foldery:
- FullData: Folder z plikami danych zawierającymi początkowe rekordy
- IncrementalData: Folder z folderami hierarchii dat/godzin w formacie rrrr/mm/dd/hh zawierający aktualizacje przyrostowe. Oczekuje się, że foldery roku, miesiąca, dnia i godziny będą miały odpowiednio cztery i dwie cyfry. hh oznacza godzinę aktualizacji w czasie UTC i zawiera foldery Upserts i Deletes. Upserts zawierają pliki danych wraz z aktualizacjami istniejących rekordów lub nowych rekordów. Usunięcia zawierają pliki danych, których rekordy należy usunąć.
Kolejność przetwarzania danych przyrostowych
System przetwarza pliki w folderze IncrementalDatapo zakończeniu określonej godziny UTC. Na przykład, jeśli system uruchomi przetwarzanie odświeżenia danych w dniu 21 stycznia 2023 r. o 8:15, będą przetwarzane wszystkie pliki z folderu 2023/01/21/07 (reprezentujące pliki danych przechowywane od 7:00 do 8:00). Wszelkie pliki w folderze 2023/01/21/08 (reprezentującym bieżącą godzinę, w której pliki są nadal generowane) nie zostaną przetworzone aż do następnego uruchomienia.
Jeśli dla tego samego klucza podstawowego istnieją dwa rekordy — upsert i usunięcie — aplikacja Customer Insights - Data używa rekordu o najpóźniejszej dacie modyfikacji. Na przykład jeśli znacznik czasu usuwania to 2023-01-21T08:00:00, a czas znacznika czasu typu 2023-01-21T08:30:00, jest używany rekord upsert. Jeśli usunięcie nastąpiło po operacji upsert, system zakłada, że rekord został usunięty.
Konfiguracja odświeżenia przyrostowego dla źródeł danych Azure Data Lake
W przypadku dodawania lub edytowania źródła danych przejdź do okienka Atrybuty tabeli.
Przejrzyj atrybuty. Upewnij się, że atrybut daty utworzenia lub ostatniej aktualizacji jest skonfigurowany z dateTimeformatem danych oraz Calendar.Datetypem semantycznym. W razie potrzeby dokonaj edycji atrybutu i wybierz opcję Wykonane.
W okienku Wybierz tabele dokonaj edycji tabeli. Pole wyboru Pozyskiwanie przyrostowe jest zaznaczone.
- Przejdź do folderu głównego zawierającego pliki CSV lub .parquet po pełne dane, przeniesienia przyrostowe danych i usunięcia przyrostowe danych.
- Wprowadź rozszerzenie dla pełnych danych oraz obu plików przyrostowych (.csv lub .parquet).
- W przypadku plików .csv wybierz ogranicznik kolumny i jeśli chcesz, aby pierwszy wiersz pliku był nagłówkiem kolumny.
- Wybierz pozycję Zapisz.
Dla daty ostatniej aktualizacji wybierz atrybut sygnatury czasowej daty.
Jeśli Klucz podstawowy nie jest zaznaczony, wybierz klucz podstawowy. Klucz podstawowy jest atrybutem unikalnym dla danej tabeli. Aby atrybut był prawidłowym kluczem podstawowym, nie może zawierać zduplikowanych wartości, brakujących wartości ani wartości null. Atrybuty typu ciąg, liczba całkowita i GUID są obsługiwane jako klucze podstawowe.
Wybierz Zamknij, by zapisać i zamknąć okienko.
Kontynuuj dodawanie i edytowanie źródła danych.
Uruchom jednorazowe pełne odświeżenie źródeł danych Azure Data Lake
Po skonfigurowaniu odświeżenia przyrostowego dla źródeł danych Azure Data Lake zdarzają się sytuacje, w których dane muszą zostać przetworzone w ramach pełnego odświeżenia. Folder pełnych danych skonfigurowany do odświeżania przyrostowego musi zawierać lokalizację pełnych danych.
Podczas edytowania źródła danych przejdź do okienka Wybierz tabelę i edytuj tabelę, którą chcesz odświeżyć.
W okienku Edytuj tabelę przewiń do pola wyboru Uruchom jednorazowe pełne odświeżanie i zaznacz je.
W przypadku opcji Przetwarzaj pliki przyrostowe z, określ datę i godzinę na potrzeby przechowywania plików przyrostowych. Pełne dane plus dane przyrostowe rozpoczynają przetwarzanie po określonej dacie i godzinie. Na przykład, jeśli chcesz przeprowadzić częściowe odświeżanie/uzupełnianie danych do końca listopada, zachowując dane przyrostowe od początku grudnia do dzisiaj (30 grudnia), wprowadź 1 grudnia. Aby zastąpić wszystkie dane i zignorować dane w folderze przyrostowym, podaj przyszłą datę.
Wybierz Zamknij, by zapisać i zamknąć okienko.
Wybierz przycisk Zapisz, aby zastosować zmiany i wrócić do strony Źródła danych. Źródło danych jest w stanie Refreshing; trwa pełne odświeżanie.