Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Jedną z podstawowych metod dostępu do danych w usłudze Azure Data Lake Storage jest usługa Hadoop FileSystem. Użytkownicy usługi Data Lake Storage w usłudze Azure Blob Storage mogą uzyskać dostęp do sterownika systemu plików Azure Blob lub ABFS. System ABFS jest częścią platformy Apache Hadoop i jest zawarty w wielu komercyjnych dystrybucjach platformy Hadoop. Korzystając ze sterownika ABFS, wiele aplikacji i frameworków może uzyskiwać dostęp do danych w usłudze Azure Blob Storage bez konieczności jawnego odwoływania się w kodzie do usługi Data Lake Storage.
Wcześniejsza funkcja: sterownik blobów usługi Windows Azure Storage
Sterownik Blob usługi Windows Azure Storage lub sterownik WASB zapewniał początkową obsługę usługi Azure Blob Storage. Ten sterownik wykonuje złożone zadanie mapowania semantyki systemu plików (zgodnie z wymaganiami interfejsu Hadoop FileSystem) na interfejs w stylu magazynu obiektów udostępniany przez Azure Blob Storage. Ten sterownik nadal obsługuje ten model, zapewniając wysokowydajny dostęp do danych przechowywanych w obiektach blob. Zawiera jednak znaczną ilość kodu, który wykonuje to mapowanie, co utrudnia konserwację. Ponadto operacje FileSystem.rename() i FileSystem.delete(), stosowane w odniesieniu do katalogów, wymagają od sterownika wykonania ogromnej liczby operacji, ponieważ magazyny obiektów nie zapewniają natywnej obsługi katalogów. To obciążenie często prowadzi do obniżenia wydajności. Sterownik ABFS przezwycięża nieodłączne niedoskonałości systemu WASB.
Jak działa usługa ABFS
Interfejs REST Azure Data Lake Storage obsługuje semantykę systemu plików za pośrednictwem Azure Blob Storage. Ze względu na to, że system plików Hadoop jest również przeznaczony do obsługi tej samej semantyki, nie ma potrzeby tworzenia złożonych mapowań w sterowniku. Zatem sterownik systemu plików Azure Blob (czyli ABFS) jest jedynie prostą nakładką kliencką dla interfejsu API REST.
Sterownik musi jednak nadal wykonywać pewne funkcje:
Schemat URI do odwoływania się do danych referencyjnych
Zgodnie z innymi implementacjami systemów plików w środowisku Hadoop sterownik ABFS definiuje własny schemat URI, dzięki czemu zasoby (katalogi i pliki) mogą być jednoznacznie adresowane. Schemat URI opisano w dokumencie Use the Azure Data Lake Storage URI. Struktura identyfikatora URI to: abfs[s]://file_system@account_name.dfs.core.windows.net/<path>/<path>/<file_name>, gdzie abfss:// używa protokołu TLS dla szyfrowanych połączeń.
Korzystając z tego formatu identyfikatora URI, standardowe narzędzia i struktury hadoop mogą odwoływać się do następujących zasobów:
hdfs dfs -mkdir -p abfs://fileanalysis@myanalytics.dfs.core.windows.net/tutorials/flightdelays/data
hdfs dfs -put flight_delays.csv abfs://fileanalysis@myanalytics.dfs.core.windows.net/tutorials/flightdelays/data/
Wewnętrznie sterownik ABFS tłumaczy zasoby określone w identyfikatorze URI na pliki i katalogi i wykonuje wywołania interfejsu API REST Azure Data Lake Storage przy użyciu tych odwołań.
Uwierzytelnianie
Sterownik ABFS obsługuje dwie formy uwierzytelniania, dzięki czemu aplikacja Hadoop może bezpiecznie uzyskiwać dostęp do zasobów zawartych w ramach konta obsługującego Data Lake Storage. Uwierzytelnianie wymaga konta magazynu z włączoną hierarchiczną przestrzenią nazw. Aby uzyskać szczegółowe informacje na temat dostępnych schematów uwierzytelniania, zobacz przewodnik po zabezpieczeniach Azure Storage. Obsługiwane schematy uwierzytelniania to:
Klucz wspólny: Ta metoda uwierzytelniania umożliwia użytkownikom dostęp do wszystkich zasobów na koncie. Klucz jest szyfrowany i przechowywany w konfiguracji usługi Hadoop.
Token okaziciela OAuth usługi Microsoft Entra ID: Sterownik uzyskuje i odświeża tokeny okaziciela Microsoft Entra przy użyciu tożsamości użytkownika końcowego lub skonfigurowanej jednostki usługi. W przypadku korzystania z tego modelu uwierzytelniania można autoryzować cały dostęp dla poszczególnych wywołań przy użyciu tożsamości skojarzonej z podanym tokenem, która jest oceniana względem przypisanej listy Access Control POSIX (ACL).
Uwaga
Azure Data Lake Storage obsługuje uwierzytelnianie OAuth 2.0 Microsoft Entra ID.
Konfigurowanie
Zapisz całą konfigurację sterownika ABFS w core-site.xml pliku konfiguracji. W dystrybucjach usługi Hadoop, które zawierają funkcję Ambari, można również zarządzać konfiguracją przy użyciu portalu internetowego lub interfejsu API REST systemu Ambari.
Aby uzyskać szczegółowe informacje o wszystkich obsługiwanych elementach konfiguracji, zapoznaj się z Oficjalną dokumentacją Hadoop.