Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Azure Data Lake Storage wykorzystuje hierarchiczną przestrzeń nazw, aby zapewnić wydajność systemu plików przy skali i koszcie magazynu obiektowego. Ta funkcja organizuje kolekcję obiektów i plików w ramach konta w hierarchii katalogów i zagnieżdżonych podkatalogów, podobnie jak w systemie plików na komputerze. Po włączeniu hierarchicznej przestrzeni nazw konto magazynu może oferować skalowalność i efektywność kosztową magazynu obiektowego, a także semantykę systemu plików, która jest dobrze znana silnikom analitycznym i platformom.
Zalety hierarchicznej przestrzeni nazw
Systemy plików, które obsługują hierarchiczną przestrzeń nazw dla danych obiektów blob, oferują następujące korzyści:
Atomowe operacje na katalogach: Magazyny obiektów przybliżają hierarchię katalogów, stosując konwencję osadzania ukośników (/) w nazwie obiektu w celu oznaczenia segmentów ścieżki. Chociaż ta konwencja działa w przypadku organizowania obiektów, nie zapewnia pomocy w zakresie akcji takich jak przenoszenie, zmienianie nazw lub usuwanie katalogów. Bez faktycznych katalogów aplikacje muszą przetwarzać potencjalnie miliony pojedynczych obiektów blob, aby wykonywać operacje na poziomie katalogu. Z kolei hierarchiczna przestrzeń nazw przetwarza te zadania, aktualizując pojedynczy wpis (katalog nadrzędny).
Ta optymalizacja jest szczególnie istotna w przypadku wielu struktur analizy danych big data. Narzędzia takie jak Hive i Spark często zapisują dane wyjściowe w lokalizacji tymczasowej, a następnie po zakończeniu zadania zmieniają nazwę tej lokalizacji. Bez hierarchicznej przestrzeni nazw ta operacja zmiany nazwy może często trwać dłużej niż sam proces analizy. Mniejsze opóźnienie zadania jest równe niższemu całkowitemu kosztowi posiadania (TCO) dla obciążeń analitycznych.
Znany styl interfejsu: Deweloperzy i użytkownicy rozumieją systemy plików. Po przejściu do chmury nie musisz uczyć się nowego paradygmatu przechowywania danych, ponieważ usługa Data Lake Storage udostępnia ten sam interfejs systemu plików, z którego korzystają komputery — zarówno duże, jak i małe.
Jednym z powodów, dla których magazyn obiektów historycznie nie obsługiwał hierarchicznej przestrzeni nazw, jest to, że hierarchiczna przestrzeń nazw ogranicza skalę. Jednak hierarchiczna przestrzeń nazw Data Lake Storage jest skalowana liniowo i nie obniża wydajności ani pojemności danych.
Zdecyduj, czy włączyć hierarchiczną przestrzeń nazw
Po włączeniu hierarchicznej przestrzeni nazw na koncie nie można przywrócić jej z powrotem do płaskiej przestrzeni nazw. Dlatego należy rozważyć, czy włączyć hierarchiczną przestrzeń nazw, biorąc pod uwagę charakter obciążeń magazynu obiektów. Aby ocenić wpływ włączenia hierarchicznej przestrzeni nazw dla obciążeń, aplikacji, kosztów, integracji usług, narzędzi, funkcji i dokumentacji, zobacz Uaktualnianie usługi Azure Blob Storage za pomocą funkcji usługi Azure Data Lake Storage.
Niektóre obciążenia robocze mogą nie odnieść żadnych korzyści z włączenia hierarchicznej przestrzeni nazw. Przykłady obejmują kopie zapasowe, magazyn obrazów i inne aplikacje, w których organizacja obiektów jest przechowywana oddzielnie od samych obiektów (na przykład w oddzielnej bazie danych).
Ponadto, chociaż obsługa funkcji usługi Blob Storage i ekosystem usługi Azure nadal rośnie, niektóre funkcje i usługi Azure nie są jeszcze obsługiwane na kontach, które mają hierarchiczną przestrzeń nazw. Zobacz Znane problemy.
Obciążenia, które korzystają z hierarchicznej przestrzeni nazw
Ogólnie rzecz biorąc, włącz hierarchiczną przestrzeń nazw dla obciążeń magazynu przeznaczonych dla systemów plików, które manipulują katalogami. Ten warunek obejmuje wszystkie obciążenia przetwarzania analiz. Zestawy danych, które wymagają wysokiego stopnia organizacji, również korzystają z włączenia hierarchicznej przestrzeni nazw.
Użyj analizy TCO, aby określić, czy włączyć hierarchiczną przestrzeń nazw. Ogólnie rzecz biorąc, zmniejszenie opóźnień obciążenia dzięki przyspieszeniu pamięci masowej oznacza krótsze wykorzystanie zasobów obliczeniowych. Opóźnienia w przypadku wielu obciążeń mogą się zmniejszyć dzięki atomowym operacjom na katalogach umożliwianym przez hierarchiczną przestrzeń nazw. W wielu obciążeniach zasób obliczeniowy reprezentuje ponad 85% całkowitego kosztu, więc nawet niewielkie zmniejszenie opóźnienia obciążenia oznacza znaczną ilość oszczędności całkowitego kosztu posiadania. Nawet w przypadkach, gdy włączenie hierarchicznej przestrzeni nazw zwiększa koszty magazynowania, koszt TCO jest nadal obniżany z powodu zmniejszonych kosztów obliczeniowych.
Aby przeanalizować różnice w cenach magazynowania danych, cenach transakcji i cenach rezerwacji pojemności magazynu między kontami, które mają płaską przestrzeń nazw a hierarchiczną przestrzenią nazw, zobacz Azure Data Lake Storage cennik.
Aby włączyć hierarchiczną przestrzeń nazw, zobacz Tworzenie konta magazynu do użycia z usługą Azure Data Lake Storage (nowe konta) lub Uaktualnianie usługi Azure Blob Storage przy użyciu funkcji Azure Data Lake Storage (istniejące konta).
Następne kroki
- Włącz hierarchiczną przestrzeń nazw podczas tworzenia nowego konta magazynowego. Zobacz Tworzenie konta magazynowego na potrzeby usługi Azure Data Lake Storage.
- Włącz hierarchiczną przestrzeń nazw na istniejącym koncie magazynu. Zobacz Uaktualnianie usługi Azure Blob Storage przy użyciu funkcji usługi Azure Data Lake Storage.