Przyrostowe kopiowanie nowych plików na podstawie nazwy pliku partycjonowanego w czasie przy użyciu narzędzia do kopiowania danych

DOTYCZY: Azure Data Factory Azure Synapse Analytics

Napiwek

Data Factory w usłudze Microsoft Fabric jest następną generacją Azure Data Factory z prostszą architekturą, wbudowaną sztuczną inteligencją i nowymi funkcjami. Jeśli dopiero zaczynasz integrować dane, zacznij od Fabric Data Factory. Istniejące obciążenia ADF można zaktualizować do Fabric, aby uzyskać dostęp do nowych możliwości w zakresie nauki o danych, analiz w czasie rzeczywistym oraz raportowania.

W tym samouczku utworzysz fabrykę danych w portalu Azure. Następnie użyjesz narzędzia do kopiowania danych, aby utworzyć potok, który przyrostowo kopiuje nowe pliki na podstawie czasowo partycjonowanej nazwy pliku z usługi Azure Blob Storage do usługi Azure Blob Storage.

Uwaga

Jeśli dopiero zaczynasz pracę z Azure Data Factory, zobacz Wprowadzenie do Azure Data Factory.

Ten samouczek obejmuje wykonanie następujących kroków:

  • Tworzenie fabryki danych.
  • Użyj narzędzia 'Kopiowanie danych', aby utworzyć potok.
  • Monitorowanie potoku danych i wykonywanie działań.

Wymagania wstępne

  • Subskrypcja Azure: Jeśli nie masz subskrypcji Azure, przed rozpoczęciem utwórz darmowe konto.
  • Konto magazynu Azure: użyj usługi Blob Storage jako magazynu danych źródła i odbiornika. Jeśli nie masz konta magazynu Azure, zapoznaj się z instrukcjami w Tworzenie konta magazynu.

Tworzenie dwóch kontenerów w usłudze Blob Storage

Przygotuj przestrzeń przechowywania obiektów blob na potrzeby samouczka, wykonując następujące kroki.

  1. Utwórz kontener o nazwie source. Utwórz ścieżkę folderu jako 2021/07/15/06 w kontenerze. Utwórz pusty plik tekstowy i nadaj mu nazwę file1.txt. Prześlij file1.txt do ścieżki folderu source/2021/07/15/06 w koncie magazynowym. Możesz użyć różnych narzędzi do wykonywania tych zadań, takich jak Eksplorator usługi Azure Storage.

    przekazywanie plików

    Uwaga

    Proszę dostosować nazwę folderu, uwzględniając czas UTC. Jeśli na przykład bieżąca godzina UTC to 6:10 w dniu 15 lipca 2021 r., możesz utworzyć ścieżkę folderu jako źródło/2021/07/15/06/ przez regułę source/{Year}/{Month}/{Day}/{Hour}/.

  2. Utwórz kontener o nazwie destination. Możesz użyć różnych narzędzi do wykonywania tych zadań, takich jak Eksplorator usługi Azure Storage.

Tworzenie fabryki danych

  1. W górnym menu wybierz pozycję Utwórz zasób>Analityka>Data Factory :

    Wybór usługi Data Factory w panelu „Nowy”

  2. Na stronie Nowa fabryka danych w polu Nazwa wprowadź wartość ADFTutorialDataFactory.

    Nazwa Twojej fabryki danych musi być globalnie unikatowa. Może zostać wyświetlony następujący komunikat o błędzie:

    Nowy komunikat o błędzie fabryki danych dla zduplikowanej nazwy.

    Jeśli zostanie wyświetlony komunikat o błędzie dotyczącym wartości nazwy, wprowadź inną nazwę dla fabryki danych. Na przykład użyj nazwy twojanazwaADFTutorialDataFactory. Artykuł Data Factory naming rules (Zasady nazewnictwa fabryki danych) zawiera zasady nazewnictwa artefaktów usługi Data Factory.

  3. Wybierz Azure subskrypcję w której ma zostać utworzona nowa fabryka danych.

  4. W obszarze Grupa zasobów wykonaj jedną z następujących czynności:

    a. Wybierz pozycję Użyj istniejącej, a następnie wybierz istniejącą grupę zasobów z listy rozwijanej.

    b. Wybierz pozycję Utwórz nową, a następnie wprowadź nazwę grupy zasobów.

    Aby dowiedzieć się więcej o grupach zasobów, zobacz Użyj grupy zasobów do zarządzania zasobami Azure.

  5. W obszarze Wersja wybierz wersję V2.

  6. W obszarze lokalizacja wybierz lokalizację fabryki danych. Na liście rozwijanej są wyświetlane tylko obsługiwane lokalizacje. Magazyny danych (na przykład Azure Storage i SQL Database) oraz obliczenia (na przykład Azure HDInsight), które są używane przez fabrykę danych, mogą znajdować się w innych lokalizacjach i regionach.

  7. Wybierz pozycję Utwórz.

  8. Po zakończeniu tworzenia zostanie wyświetlona strona główna usługi Data Factory.

  9. Aby uruchomić interfejs użytkownika Azure Data Factory na osobnej karcie, wybierz Otwórz na kafelku Otwórz Azure Data Factory Studio.

    Strona główna Azure Data Factory z kafelkiem Open Azure Data Factory Studio.

Użyj narzędzia Kopiowanie Danych, aby utworzyć potok

  1. Na stronie głównej Azure Data Factory wybierz tytuł Ingest aby uruchomić narzędzie do kopiowania danych.

    Zrzut ekranu przedstawiający stronę główną usługi ADF.

  2. Na stronie Właściwości wykonaj następujące czynności:

    1. W obszarze Typ zadania wybierz pozycję Wbudowane zadanie kopiowania.

    2. W obszarze Harmonogram zadań wybierz pozycję Przetaczane okno.

    3. W obszarze Cykl wprowadź 1 godzinę(y).

    4. Wybierz Dalej.

    Strona właściwości

  3. Na stronie Źródłowy magazyn danych wykonaj następujące czynności:

    a. Wybierz pozycję + Nowe połączenie , aby dodać połączenie.

    b. Wybierz Azure Blob Storage z galerii, a następnie wybierz pozycję Continue.

    c. Na stronie Nowe połączenie (Azure Blob Storage) wprowadź nazwę połączenia. Wybierz subskrypcję Azure, a następnie wybierz konto magazynu z listy nazw konta magazynu. Przetestuj połączenie, a następnie wybierz pozycję Utwórz.

    Strona magazynu źródłowych danych

    d. Na stronie Źródłowy magazyn danych wybierz nowo utworzone połączenie w sekcji Połączenie.

    e. W sekcji Plik lub folder przeglądaj i wybierz kontener źródłowy, a następnie wybierz przycisk OK.

    f. W sekcji Zachowanie ładowania plików wybierz opcję Ładowanie przyrostowe: nazwy folderów/plików partycjonowanych czasowo.

    g. Zapisz ścieżkę folderu dynamicznego jako źródło/{rok}/{month}/{day}/{hour}/, a następnie zmień format, jak pokazano na poniższym zrzucie ekranu.

    h. Zaznacz Kopia binarna i wybierz Dalej.

    Zrzut ekranu przedstawiający konfigurację strony magazynu danych źródłowych.

  4. Na stronie Docelowy skład danych, wykonaj następujące kroki:

    1. Wybierz usługę AzureBlobStorage, która jest tym samym kontem magazynowym co źródło danych.

    2. Przeglądaj i wybierz folder docelowy, a następnie wybierz OK.

    3. Zapisz ścieżkę folderu dynamicznego jako docelową/{rok}/{month}/{day}/{hour}/, a następnie zmień format, jak pokazano na poniższym zrzucie ekranu.

    4. Wybierz Dalej.

    Zrzut ekranu przedstawiający konfigurację strony Docelowego magazynu danych.

  5. Na stronie Ustawienia, pod Nazwa zadania wprowadź DeltaCopyFromBlobPipeline, a następnie wybierz pozycję Dalej. Interfejs użytkownika usługi Data Factory tworzy potok o określonej nazwie zadania.

    Zrzut ekranu przedstawiający konfigurację strony ustawień.

  6. Na stronie Podsumowanie sprawdź ustawienia, a następnie kliknij przycisk Dalej.

    Strona podsumowania

  7. Na stronie Wdrażanie wybierz pozycję Monitorowanie, aby monitorować potok (zadanie). Strona Wdrażanie

  8. Zwróć uwagę, że karta Monitor po lewej stronie jest automatycznie wybrana. Musisz poczekać na uruchomienie potoku, gdy zostanie on wyzwolony automatycznie (około po godzinie). Po uruchomieniu wybierz link DeltaCopyFromBlobPipeline aby wyświetlić szczegóły przebiegu aktywności lub ponownie uruchomić potok. Wybierz pozycję Odśwież, aby odświeżyć listę.

    Zrzut ekranu przedstawia panel Uruchomienia potoku.

  9. W potoku danych jest tylko jedno działanie (działanie kopiowania), dlatego widzisz tylko jedną pozycję. Dostosuj szerokość kolumn źródłowych i docelowych (w razie potrzeby), aby wyświetlić więcej szczegółów, możesz zobaczyć, że plik źródłowy (file1.txt) został skopiowany ze źródła/2021/07/07/06/ do lokalizacji docelowej/2021/07/15/06/ o tej samej nazwie pliku.

    Zrzut ekranu przedstawiający szczegóły wykonania potoku.

    Możesz również sprawdzić to samo za pomocą Eksplorator usługi Azure Storage (https://storageexplorer.com/), aby skanować pliki.

    Zrzut ekranu przedstawiający szczegóły przebiegu potoku dla miejsca docelowego.

  10. Utwórz kolejny pusty plik tekstowy o nowej nazwie jako file2.txt. Przekaż plik o nazwie file2.txt do ścieżki folderu source/2021/07/15/07 na koncie magazynowym. Możesz użyć różnych narzędzi do wykonywania tych zadań, takich jak Eksplorator usługi Azure Storage.

    Uwaga

    Być może trzeba będzie utworzyć nową ścieżkę folderu. Proszę dostosować nazwę folderu, uwzględniając czas UTC. Na przykład, jeśli bieżąca godzina UTC to 7:30 rano w dniu w lipcu. 15 lipca 2021 można utworzyć ścieżkę folderu jako source/2021/07/15/07/ według reguły {Year}/{Month}/{Day}/{Hour}/.

  11. Aby wrócić do widoku Uruchomienia potoków, wybierz pozycję Wszystkie uruchomienia potoków i poczekaj, aż ten sam potok zostanie automatycznie wyzwolony ponownie po kolejnej godzinie.

    Zrzut ekranu przedstawia łącze Wszystkie uruchomienia potoku, prowadzący z powrotem na tę stronę.

  12. Wybierz nowy link DeltaCopyFromBlobPipeline dla drugiego przebiegu potoku, a następnie wykonaj to samo, aby przejrzeć szczegóły. Zobaczysz, że plik źródłowy (file2.txt) został skopiowany ze źródła/2021/07/15/07/ do lokalizacji docelowej/2021/07/15/07/ o tej samej nazwie pliku. Możesz również sprawdzić to samo za pomocą Eksplorator usługi Azure Storage (https://storageexplorer.com/), aby skanować pliki w kontenerze destination.

Przejdź do następującego samouczka, aby dowiedzieć się więcej o przekształcaniu danych przy użyciu klastra Spark w Azure: