Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
O Azure Data Lake Storage utiliza um namespace hierárquico para fornecer desempenho do sistema de ficheiros à escala e preço do armazenamento de objetos. Esta funcionalidade organiza a coleção de objetos e ficheiros dentro de uma conta numa hierarquia de diretórios e subdiretórios aninhados, semelhante ao sistema de ficheiros do seu computador. Quando ativa um namespace hierárquico, uma conta de armazenamento pode oferecer a escalabilidade e a relação custo-benefício do armazenamento de objetos, juntamente com semântica do sistema de ficheiros que os motores de análise e frameworks consideram familiares.
Os benefícios de um namespace hierárquico
Sistemas de ficheiros que implementam um namespace hierárquico sobre dados blob oferecem os seguintes benefícios:
Manipulação atómica de diretórios: Os armazenamentos de objetos simulam uma hierarquia de diretórios adotando a convenção de inserir barras (/) no nome do objeto para denotar segmentos do caminho. Embora esta convenção funcione para organizar objetos, não oferece assistência para ações como mover, renomear ou eliminar diretórios. Sem diretórios reais, os aplicativos devem processar potencialmente milhões de blobs individuais para realizar tarefas no nível de diretório. Por outro lado, um namespace hierárquico processa essas tarefas atualizando uma única entrada (o diretório pai).
Esta otimização é especialmente significativa para muitos frameworks de análise de big data. Ferramentas como o Hive e o Spark gravam frequentemente os resultados em locais temporários e depois renomeiam esse local no final da tarefa. Sem um namespace hierárquico, esta operação de renomeação pode muitas vezes demorar mais do que o próprio processo de análise. Uma menor latência das tarefas significa um menor custo total de propriedade (TCO) para cargas de trabalho analíticas.
Estilo de interface familiar: Desenvolvedores e utilizadores compreendem sistemas de ficheiros. Quando passa para a cloud, não precisa de aprender um novo paradigma de armazenamento porque o Data Lake Storage expõe a mesma interface de sistema de ficheiros usada por computadores, grandes e pequenos.
Uma das razões pelas quais os armazenamentos de objetos historicamente não suportavam um namespace hierárquico é que um namespace hierárquico limita a escala. No entanto, o namespace hierárquico Data Lake Storage escala linearmente e não degrada nem a capacidade nem o desempenho dos dados.
Decidir se deve ativar um namespace hierárquico
Depois de ativares um namespace hierárquico na tua conta, não podes revertê-lo para um namespace plano. Portanto, considere se faz sentido habilitar um namespace hierárquico com base na natureza das cargas de trabalho do repositório de objetos. Para avaliar o impacto da habilitação de um namespace hierárquico em cargas de trabalho, aplicativos, custos, integrações de serviços, ferramentas, recursos e documentação, consulte Atualizando o Armazenamento de Blobs do Azure com os recursos do Armazenamento Azure Data Lake.
Algumas cargas de trabalho podem não obter nenhum benefício habilitando um namespace hierárquico. Exemplos incluem backups, armazenamento de imagens e outras aplicações onde a organização dos objetos é armazenada separadamente dos próprios objetos (por exemplo, numa base de dados separada).
Além disso, embora o suporte para funcionalidades de armazenamento Blob e o ecossistema de serviços do Azure continue a crescer, algumas funcionalidades e serviços do Azure ainda não são suportados em contas com um namespace hierárquico. Consulte Problemas conhecidos.
Cargas de trabalho que beneficiam de um namespace hierárquico
Em geral, ativa um namespace hierárquico para cargas de trabalho de armazenamento desenhadas para sistemas de ficheiros que manipulam diretórios. Esta condição inclui todas as cargas de trabalho de processamento analítico. Conjuntos de dados que exigem um elevado grau de organização também beneficiam de permitir um namespace hierárquico.
Use uma análise TCO para determinar se deve ativar um namespace hierárquico. De um modo geral, melhorias na latência da carga de trabalho devido à aceleração do armazenamento requerem recursos computacionais por menos tempo. A latência para muitas cargas de trabalho pode melhorar devido à manipulação de diretórios atómicos que um namespace hierárquico permite. Em muitas cargas de trabalho, o recurso de computação representa mais de 85% do custo total, pelo que mesmo uma redução modesta na latência da carga de trabalho equivale a uma poupança significativa de TCO. Mesmo nos casos em que a habilitação de um namespace hierárquico aumenta os custos de armazenamento, o TCO ainda é reduzido devido aos custos de computação reduzidos.
Para analisar diferenças nos preços de armazenamento de dados, preços de transação e preços de reserva de capacidade de armazenamento entre contas que têm um namespace plano versus um namespace hierárquico, veja Azure Data Lake Storage fiking.
Para ativar um namespace hierárquico, veja Criar uma conta de armazenamento para usar com Azure Data Lake Storage (novas contas) ou Atualizar o Armazenamento de Blobs do Azure com capacidades do Azure Data Lake Storage (contas existentes).
Próximos passos
- Habilite um namespace hierárquico ao criar uma nova conta de armazenamento. Consulte Criar uma conta de armazenamento para utilizar com o Azure Data Lake Storage.
- Habilite um namespace hierárquico em uma conta de armazenamento existente. Consulte Atualize o Armazenamento de Blobs do Azure com capacidades do Azure Data Lake Storage.