Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Todo pipeline do Lakeflow Pipelines executa suas atualizações em computação sem servidor ou clássica. O tipo de computação é uma configuração por pipeline que você escolhe nas configurações do pipeline. Não é automático: um pipeline é executado em computação sem servidor apenas quando você ativa a configuração Serverless, e, caso contrário, é executado na computação clássica. Esta página compara as duas opções para que você possa escolher a certa para cada pipeline.
Databricks recomenda computação sem servidor para quase todos os pipelines. Com serverless, o Azure Databricks gerencia a infraestrutura para você. Não há clusters para dimensionar, configurar, proteger ou conceder permissões, e você recebe capacidades que a computação clássica não pode oferecer, como atualização incremental e autoscaling vertical. Com a computação clássica, essa infraestrutura é sua responsabilidade para configurar e manter. Serverless suporta quase tudo que o Classic Compute faz. As exceções são a metastore legada do Hive e algumas configurações de rede. Para a maioria dos pipelines, escolher a computação clássica significa ter de realizar trabalho manual que a computação sem servidor, de outra forma, realizaria.
Importante
A atualização incremental para visualizações materializadas está disponível apenas em pipelines sem servidor. Visões materializadas que rodam na computação clássica são sempre totalmente recomputadas. Se a atualização incremental for necessária para a sua carga de trabalho, use computação sem servidor. Confira Atualização incremental para exibições materializadas.
Comparar opções de computação
A tabela a seguir compara computação serverless e clássica entre as capacidades que mais frequentemente impulsionam a escolha:
| Capacidade | Serverless | Classic |
|---|---|---|
| Gerenciamento de infraestrutura | Azure Databricks gerencia toda a infraestrutura. Não há configuração de cluster. | Você deve configurar clusters, incluindo autoescalonamento, tipos de instância e políticas de cluster. |
| Atualização incremental para exibições materializadas | Suportado. As visualizações materializadas são atualizadas incrementalmente sempre que é eficiente em termos de custo, para reduzir os custos de computação. Confira Atualização incremental para exibições materializadas. | Sem suporte. Visões materializadas são sempre totalmente recalculadas. |
| Dimensionamento automático | Redimensionamento automático aprimorado que escala horizontalmente (mais executores) e verticalmente (executores maiores). Consulte Otimizar utilização do cluster de pipeline do Lakeflow com dimensionamento automático. | Escalonamento automático aprimorado com escalabilidade horizontal. Você seleciona os tipos de instância. |
| Tubulação de rios | Habilitado por padrão. Microlotes rodam simultaneamente para melhorar a taxa de transferência e a latência. Consulte Configurar um pipeline sem servidor. | Não disponível. |
| Permissão para criação de recursos de computação | Não necessário. Todos os usuários do workspace podem rodar pipelines serverless por padrão. | Required. Os usuários precisam de permissão irrestrita para criação de cluster ou acesso a uma política de computação. |
| Políticas de computação e tipos de instância | Gerenciado por Azure Databricks. Você não define tipos de instância nem uma política de computação. | Você aplica manualmente uma política de computação e seleciona os tipos de instância de trabalhador e driver. |
| Catálogo do Unity | Sempre usa o Unity Catalog. | Pode usar o Unity Catalog ou o metastore legado do Hive. |
| Atribuição de custo | Aplique tags personalizadas com uma política de uso sem servidor. | Aplique tags personalizadas ao pipeline. Você deve associar manualmente os dados da tag aos dados de faturamento. |
| Clusters de atualização e manutenção | Gerenciado por Azure Databricks. | Você configura os clusters de atualização e manutenção separadamente. |
| Computação em nó único | Não é necessário. O Azure Databricks dimensiona automaticamente a computação para a carga de trabalho. | Você configura computação em nó único para cargas de trabalho pequenas ou não distribuídas. |
Quando usar computação serverless
Use a computação sem servidor para qualquer pipeline que não esteja sujeita a uma das limitações exclusivas do modo clássico listadas abaixo. Em particular, serverless é a escolha certa quando:
- Você quer que o Azure Databricks gerencie a infraestrutura para você, incluindo autoescalonamento vertical e seleção de instâncias, em vez de configurar e manter clusters você mesmo.
- Você quer atualização incremental para visualizações materializadas para reduzir custos de atualização.
- Você quer que os usuários do workspace executem pipelines sem permissões de criação de cluster.
Pipelines sem servidor exigem um workspace com o Catálogo do Unity ativado e em uma região com suporte sem servidor. Para os requisitos e a configuração, consulte Configurar um pipeline serverless.
Quando usar computação clássica
Serverless suporta quase todas as cargas de trabalho do pipeline, então use computação clássica apenas quando serverless não puder rodar seu pipeline de forma alguma:
- Suas tabelas usam o Hive Metastore legado em vez do Unity Catalog. Para migrar tabelas do metastore do Hive para o Unity Catalog e habilitar o serverless, consulte Atualizar tabelas e exibições do Hive para o Unity Catalog.
- Seu pipeline exige rede privada, algo que o serverless não oferece suporte.
- Seu pipeline é executado em uma região onde sem servidor não está disponível.
Com a computação clássica, fica por sua conta configurar e manter políticas de computação, tipos de instância, computação de nó único e clusters separados para atualização e manutenção — trabalho que a computação sem servidor faz para você.
Para opções de instalação e configuração, veja Configurar computação clássica para pipelines.
Definir o tipo de computação
Você escolhe o tipo de computação nas configurações de Compute do pipeline ativando ou desativando a configuração Serverless . Novos pipelines usam serverless por padrão. Você também pode converter um pipeline existente configurado com o Unity Catalog para serverless.
- Para configurar e converter pipelines sem servidor, consulte Configurar um pipeline sem servidor.
- Para configurar a computação clássica, consulte Configurar a computação clássica para pipelines.