Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
DOTYCZY:
Azure Data Factory
Azure Synapse Analytics
Napiwek
Data Factory w usłudze Microsoft Fabric jest następną generacją Azure Data Factory z prostszą architekturą, wbudowaną sztuczną inteligencją i nowymi funkcjami. Jeśli dopiero zaczynasz integrować dane, zacznij od Fabric Data Factory. Istniejące obciążenia ADF można zaktualizować do Fabric, aby uzyskać dostęp do nowych możliwości w zakresie nauki o danych, analiz w czasie rzeczywistym oraz raportowania.
W tym samouczku utworzysz fabrykę danych w portalu Azure. Następnie użyjesz narzędzia do kopiowania danych, aby utworzyć potok, który przyrostowo kopiuje nowe pliki na podstawie czasowo partycjonowanej nazwy pliku z usługi Azure Blob Storage do usługi Azure Blob Storage.
Uwaga
Jeśli dopiero zaczynasz pracę z Azure Data Factory, zobacz Wprowadzenie do Azure Data Factory.
Ten samouczek obejmuje wykonanie następujących kroków:
- Tworzenie fabryki danych.
- Użyj narzędzia 'Kopiowanie danych', aby utworzyć potok.
- Monitorowanie potoku danych i wykonywanie działań.
Wymagania wstępne
- Subskrypcja Azure: Jeśli nie masz subskrypcji Azure, przed rozpoczęciem utwórz darmowe konto.
- Konto magazynu Azure: użyj usługi Blob Storage jako magazynu danych źródła i odbiornika. Jeśli nie masz konta magazynu Azure, zapoznaj się z instrukcjami w Tworzenie konta magazynu.
Tworzenie dwóch kontenerów w usłudze Blob Storage
Przygotuj przestrzeń przechowywania obiektów blob na potrzeby samouczka, wykonując następujące kroki.
Utwórz kontener o nazwie source. Utwórz ścieżkę folderu jako 2021/07/15/06 w kontenerze. Utwórz pusty plik tekstowy i nadaj mu nazwę file1.txt. Prześlij file1.txt do ścieżki folderu source/2021/07/15/06 w koncie magazynowym. Możesz użyć różnych narzędzi do wykonywania tych zadań, takich jak Eksplorator usługi Azure Storage.
Uwaga
Proszę dostosować nazwę folderu, uwzględniając czas UTC. Jeśli na przykład bieżąca godzina UTC to 6:10 w dniu 15 lipca 2021 r., możesz utworzyć ścieżkę folderu jako źródło/2021/07/15/06/ przez regułę source/{Year}/{Month}/{Day}/{Hour}/.
Utwórz kontener o nazwie destination. Możesz użyć różnych narzędzi do wykonywania tych zadań, takich jak Eksplorator usługi Azure Storage.
Tworzenie fabryki danych
W górnym menu wybierz pozycję Utwórz zasób>Analityka>Data Factory :
Na stronie Nowa fabryka danych w polu Nazwa wprowadź wartość ADFTutorialDataFactory.
Nazwa Twojej fabryki danych musi być globalnie unikatowa. Może zostać wyświetlony następujący komunikat o błędzie:
Jeśli zostanie wyświetlony komunikat o błędzie dotyczącym wartości nazwy, wprowadź inną nazwę dla fabryki danych. Na przykład użyj nazwy twojanazwaADFTutorialDataFactory. Artykuł Data Factory naming rules (Zasady nazewnictwa fabryki danych) zawiera zasady nazewnictwa artefaktów usługi Data Factory.
Wybierz Azure subskrypcję w której ma zostać utworzona nowa fabryka danych.
W obszarze Grupa zasobów wykonaj jedną z następujących czynności:
a. Wybierz pozycję Użyj istniejącej, a następnie wybierz istniejącą grupę zasobów z listy rozwijanej.
b. Wybierz pozycję Utwórz nową, a następnie wprowadź nazwę grupy zasobów.
Aby dowiedzieć się więcej o grupach zasobów, zobacz Użyj grupy zasobów do zarządzania zasobami Azure.
W obszarze Wersja wybierz wersję V2.
W obszarze lokalizacja wybierz lokalizację fabryki danych. Na liście rozwijanej są wyświetlane tylko obsługiwane lokalizacje. Magazyny danych (na przykład Azure Storage i SQL Database) oraz obliczenia (na przykład Azure HDInsight), które są używane przez fabrykę danych, mogą znajdować się w innych lokalizacjach i regionach.
Wybierz pozycję Utwórz.
Po zakończeniu tworzenia zostanie wyświetlona strona główna usługi Data Factory.
Aby uruchomić interfejs użytkownika Azure Data Factory na osobnej karcie, wybierz Otwórz na kafelku Otwórz Azure Data Factory Studio.
Użyj narzędzia Kopiowanie Danych, aby utworzyć potok
Na stronie głównej Azure Data Factory wybierz tytuł Ingest aby uruchomić narzędzie do kopiowania danych.
Na stronie Właściwości wykonaj następujące czynności:
W obszarze Typ zadania wybierz pozycję Wbudowane zadanie kopiowania.
W obszarze Harmonogram zadań wybierz pozycję Przetaczane okno.
W obszarze Cykl wprowadź 1 godzinę(y).
Wybierz Dalej.
Na stronie Źródłowy magazyn danych wykonaj następujące czynności:
a. Wybierz pozycję + Nowe połączenie , aby dodać połączenie.
b. Wybierz Azure Blob Storage z galerii, a następnie wybierz pozycję Continue.
c. Na stronie Nowe połączenie (Azure Blob Storage) wprowadź nazwę połączenia. Wybierz subskrypcję Azure, a następnie wybierz konto magazynu z listy nazw konta magazynu. Przetestuj połączenie, a następnie wybierz pozycję Utwórz.
d. Na stronie Źródłowy magazyn danych wybierz nowo utworzone połączenie w sekcji Połączenie.
e. W sekcji Plik lub folder przeglądaj i wybierz kontener źródłowy, a następnie wybierz przycisk OK.
f. W sekcji Zachowanie ładowania plików wybierz opcję Ładowanie przyrostowe: nazwy folderów/plików partycjonowanych czasowo.
g. Zapisz ścieżkę folderu dynamicznego jako źródło/{rok}/{month}/{day}/{hour}/, a następnie zmień format, jak pokazano na poniższym zrzucie ekranu.
h. Zaznacz Kopia binarna i wybierz Dalej.
Na stronie Docelowy skład danych, wykonaj następujące kroki:
Wybierz usługę AzureBlobStorage, która jest tym samym kontem magazynowym co źródło danych.
Przeglądaj i wybierz folder docelowy, a następnie wybierz OK.
Zapisz ścieżkę folderu dynamicznego jako docelową/{rok}/{month}/{day}/{hour}/, a następnie zmień format, jak pokazano na poniższym zrzucie ekranu.
Wybierz Dalej.
Na stronie Ustawienia, pod Nazwa zadania wprowadź DeltaCopyFromBlobPipeline, a następnie wybierz pozycję Dalej. Interfejs użytkownika usługi Data Factory tworzy potok o określonej nazwie zadania.
Na stronie Podsumowanie sprawdź ustawienia, a następnie kliknij przycisk Dalej.
Na stronie Wdrażanie wybierz pozycję Monitorowanie, aby monitorować potok (zadanie).
Zwróć uwagę, że karta Monitor po lewej stronie jest automatycznie wybrana. Musisz poczekać na uruchomienie potoku, gdy zostanie on wyzwolony automatycznie (około po godzinie). Po uruchomieniu wybierz link DeltaCopyFromBlobPipeline aby wyświetlić szczegóły przebiegu aktywności lub ponownie uruchomić potok. Wybierz pozycję Odśwież, aby odświeżyć listę.
W potoku danych jest tylko jedno działanie (działanie kopiowania), dlatego widzisz tylko jedną pozycję. Dostosuj szerokość kolumn źródłowych i docelowych (w razie potrzeby), aby wyświetlić więcej szczegółów, możesz zobaczyć, że plik źródłowy (file1.txt) został skopiowany ze źródła/2021/07/07/06/ do lokalizacji docelowej/2021/07/15/06/ o tej samej nazwie pliku.
Możesz również sprawdzić to samo za pomocą Eksplorator usługi Azure Storage (https://storageexplorer.com/), aby skanować pliki.
Utwórz kolejny pusty plik tekstowy o nowej nazwie jako file2.txt. Przekaż plik o nazwie file2.txt do ścieżki folderu source/2021/07/15/07 na koncie magazynowym. Możesz użyć różnych narzędzi do wykonywania tych zadań, takich jak Eksplorator usługi Azure Storage.
Uwaga
Być może trzeba będzie utworzyć nową ścieżkę folderu. Proszę dostosować nazwę folderu, uwzględniając czas UTC. Na przykład, jeśli bieżąca godzina UTC to 7:30 rano w dniu w lipcu. 15 lipca 2021 można utworzyć ścieżkę folderu jako source/2021/07/15/07/ według reguły {Year}/{Month}/{Day}/{Hour}/.
Aby wrócić do widoku Uruchomienia potoków, wybierz pozycję Wszystkie uruchomienia potoków i poczekaj, aż ten sam potok zostanie automatycznie wyzwolony ponownie po kolejnej godzinie.
Wybierz nowy link DeltaCopyFromBlobPipeline dla drugiego przebiegu potoku, a następnie wykonaj to samo, aby przejrzeć szczegóły. Zobaczysz, że plik źródłowy (file2.txt) został skopiowany ze źródła/2021/07/15/07/ do lokalizacji docelowej/2021/07/15/07/ o tej samej nazwie pliku. Możesz również sprawdzić to samo za pomocą Eksplorator usługi Azure Storage (https://storageexplorer.com/), aby skanować pliki w kontenerze destination.
Powiązana zawartość
Przejdź do następującego samouczka, aby dowiedzieć się więcej o przekształcaniu danych przy użyciu klastra Spark w Azure: