Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Azure Data Lake Storage é um conjunto de capacidades dedicado à análise de grandes volumes de dados, construído no Armazenamento de Blobs do Azure. Este artigo apresenta as principais funcionalidades, integrações suportadas e arquitetura do Azure Data Lake Storage para o ajudar a avaliá-lo para as suas cargas de trabalho analíticas.
O Azure Data Lake Storage baseia-se nas capacidades pioneiras do Azure Data Lake Storage Gen1, combinando-as com o Armazenamento de Blobs do Azure. Por exemplo, o Armazenamento Data Lake fornece semântica do sistema de arquivos, segurança em nível de arquivo e escala. Como estas capacidades são construídas sobre o Armazenamento de Blobs, também obtém armazenamento de baixo custo, em níveis, com alta disponibilidade e capacidades de recuperação de desastres.
O Data Lake Storage faz do Armazenamento do Azure a base para a construção de data lakes empresariais no Azure. Projetado desde o início para atender a vários petabytes de informações enquanto sustenta centenas de gigabits de taxa de transferência, o Data Lake Storage permite gerenciar facilmente grandes quantidades de dados.
O que é um data lake?
Um data lake é um repositório único e centralizado onde você pode armazenar todos os seus dados, estruturados e não estruturados. Um data lake permite que sua organização armazene, acesse e analise de forma rápida e mais fácil uma ampla variedade de dados em um único local. Com um data lake, não precisas adequar os teus dados para encaixarem numa estrutura existente. Em vez disso, você pode armazenar seus dados em seu formato bruto ou nativo, geralmente como arquivos ou como objetos binários grandes (blobs).
O Azure Data Lake Storage é uma solução de data lake empresarial baseada na nuvem. Ele foi projetado para armazenar grandes quantidades de dados em qualquer formato e para facilitar cargas de trabalho analíticas de big data. Utilize-o para capturar dados de qualquer tipo e velocidade de ingestão num único local, facilitando o acesso e a análise, utilizando vários frameworks.
Capacidades do Azure Data Lake Storage
O Armazenamento Azure Data Lake não é um serviço dedicado ou um tipo de conta. Em vez disso, ele é implementado como um conjunto de recursos que você usa com o serviço de Armazenamento de Blob da sua conta de Armazenamento do Azure. Desbloqueie estas capacidades ativando a definição hierárquica de namespace.
O Armazenamento Data Lake inclui os seguintes recursos.
Acesso compatível com Hadoop
Estrutura hierárquica de diretórios
Custo e desempenho otimizados
Modelo de segurança com granularidade fina
Enorme capacidade de escalabilidade
Acesso compatível com Hadoop
O Armazenamento Azure Data Lake foi projetado principalmente para trabalhar com o Hadoop e todas as estruturas que usam o Apache Hadoop Distributed File System (HDFS) como sua camada de acesso a dados. As distribuições de Hadoop incluem o driver do Sistema de Arquivos de Blob do Azure (ABFS), que permite a muitas aplicações e frameworks aceder diretamente aos dados do Armazenamento de Blobs do Azure. O driver ABFS é otimizado especificamente para análise de big data. As respetivas APIs REST estão disponíveis através do endpoint dfs.core.windows.net.
As estruturas de análise de dados que usam o HDFS como sua camada de acesso a dados podem acessar diretamente os dados do Armazenamento do Azure Data Lake por meio do ABFS. O mecanismo de análise Apache Spark e o mecanismo de consulta Presto SQL são exemplos dessas estruturas.
Para obter mais informações sobre serviços e plataformas suportados, consulte Serviços do Azure que suportam o Armazenamento do Azure Data Lake e Plataformas de código aberto que suportam o Armazenamento do Azure Data Lake.
Estrutura hierárquica de diretórios
O namespace hierárquico é um recurso fundamental que permite que o Armazenamento Azure Data Lake forneça acesso a dados de alto desempenho em escala e preço de armazenamento de objetos. Use esta funcionalidade para organizar todos os objetos e ficheiros dentro da sua conta de armazenamento numa hierarquia de diretórios e subdiretórios aninhados. Em outras palavras, seus dados do Armazenamento do Azure Data Lake são organizados da mesma forma que os arquivos são organizados em seu computador.
Operações como renomear ou eliminar um diretório tornam-se operações de metadados atómicos únicos no diretório. Não há necessidade de enumerar e processar todos os objetos que compartilham o prefixo de nome do diretório.
Custo e desempenho otimizados
O preço do Armazenamento Azure Data Lake é calculado de acordo com os níveis de Armazenamento de Blob do Azure. Baseia-se em capacidades do Armazenamento de Blobs do Azure, como gestão automatizada de políticas do ciclo de vida e escalonamento ao nível do objeto, para gerir custos de armazenamento em big data.
O desempenho melhora porque não é necessário copiar ou transformar dados antes da análise. O recurso de namespace hierárquico do Armazenamento do Azure Data Lake permite acesso e navegação eficientes. Esta arquitetura significa que o processamento de dados requer menos recursos computacionais, reduzindo tanto o tempo como o custo de aceder aos dados.
Modelo de segurança com granularidade fina
O modelo de controle de acesso do Armazenamento do Azure Data Lake suporta o controle de acesso baseado em função do Azure (Azure RBAC) e as listas de controle de acesso (ACLs) da Interface do Sistema Operacional Portátil para UNIX (POSIX). Há também algumas configurações de segurança extras que são específicas para o Armazenamento do Azure Data Lake. Defina permissões ao nível do diretório ou ficheiro. O Azure Data Lake Storage encripta todos os dados em repouso utilizando chaves de encriptação geridas pela Microsoft ou geridas pelo cliente.
Enorme capacidade de escalabilidade
O Armazenamento Azure Data Lake oferece armazenamento massivo e aceita vários tipos de dados para análise. Ele não impõe limites para tamanhos de contas, tamanhos de arquivos ou a quantidade de dados que podem ser armazenados no data lake. Ficheiros individuais podem ter tamanhos que vão desde alguns quilobytes (KBs) até centenas de terabytes (TBs). O Azure Data Lake Storage processa pedidos com latências quase constantes por pedido, medidas ao nível de serviço, conta e ficheiro.
Esse design significa que o Armazenamento Azure Data Lake pode ser dimensionado de forma fácil e rápida para atender às cargas de trabalho mais exigentes. Também pode reduzir com a mesma facilidade quando a procura diminui.
Baseado no Armazenamento de Blobs do Azure
Os dados que ingeres persistem como blobs na conta de armazenamento. O serviço que gerencia blobs é o serviço de Armazenamento de Blobs do Azure. Data Lake Storage descreve as capacidades ou "melhorias" deste serviço que respondem às exigências das cargas de trabalho analíticas de big data.
Como estas funcionalidades são baseadas no Armazenamento de Blobs, funcionalidades como logs de diagnóstico, níveis de acesso e políticas de gestão de ciclo de vida estão disponíveis na sua conta. A maioria dos recursos de armazenamento de Blob são totalmente suportados, mas alguns recursos podem ser suportados apenas no nível de visualização e há alguns deles que ainda não são suportados. Para obter uma lista completa das instruções de suporte, consulte Suporte ao recurso de Armazenamento de Blob em contas de Armazenamento do Azure. O estado de cada funcionalidade listada muda ao longo do tempo à medida que o suporte continua a expandir-se.
Terminologia: blobs, ficheiros e contentores
O sumário do Armazenamento de Blobs do Azure apresenta duas seções de conteúdo. A seção de conteúdo Armazenamento Data Lake fornece práticas recomendadas e orientações para o uso dos recursos do Armazenamento Data Lake. A seção de conteúdo Armazenamento de Blobs fornece orientação para recursos de conta não específicos do Armazenamento Data Lake.
À medida que você se move entre as seções, você pode notar algumas pequenas diferenças terminológicas. Por exemplo, o conteúdo apresentado na documentação do Armazenamento de Blobs utiliza o termo blob em vez de ficheiro. Tecnicamente, os ficheiros que ingere para a sua conta de armazenamento tornam-se blobs na sua conta. Portanto, o termo está correto. No entanto, o termo blob pode causar confusão se estiveres habituado ao termo ficheiro. Também pode ver o termo contentor utilizado para se referir a sistema de ficheiros. Considere estes termos como sinónimos.