Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Cada pipeline do Lakeflow Pipelines executa as suas atualizações em computação sem servidor ou clássica. O tipo de processamento é uma configuração de cada pipeline que pode ser escolhida nas definições do pipeline. Não é automático: um pipeline é executado em computação sem servidor apenas quando se ativa a definição Serverless, e é executado em computação clássica caso contrário. Esta página compara as duas opções para que possa escolher a certa para cada pipeline.
A Databricks recomenda computação sem servidor para quase todos os pipelines. Com o serverless, o Azure Databricks gere a infraestrutura por si. Não existem clusters para dimensionar, configurar, proteger ou conceder permissões, e tens capacidades que a computação clássica não consegue oferecer, como atualização incremental e autoscaling vertical. Com a computação clássica, essa infraestrutura é da sua responsabilidade para configurar e manter. Serverless suporta quase tudo o que o Classic Compute faz. As exceções são a metastore Hive antiga e algumas configurações de rede. Para a maioria dos pipelines, escolher a computação tradicional significa assumir tarefas manuais que, de outra forma, seriam tratadas pela computação sem servidor.
Importante
A atualização incremental para visualizações materializadas está disponível apenas em pipelines serverless. As vistas materializadas que correm em computação clássica são sempre totalmente recomputadas. Se a atualização incremental for um requisito da sua carga de trabalho, utilize computação sem servidor. Consulte Atualização incremental para ver vistas materializadas.
Compare opções de computação
A tabela seguinte compara a computação serverless e a computação clássica em termos das capacidades que mais frequentemente determinam a escolha:
| Capacidade | Serverless | Classic |
|---|---|---|
| Gestão da infraestrutura | Azure Databricks gere toda a infraestrutura. Não existe configuração de cluster. | Deve configurar clusters, incluindo escalabilidade automática, tipos de instância e políticas de cluster. |
| Atualização incremental para visualizações materializadas | Apoiado. As vistas materializadas são atualizadas incrementalmente sempre que é eficiente em termos de custos, para reduzir os custos de computação. Consulte Atualização incremental para ver vistas materializadas. | Não suportadas. As visualizações materializadas são sempre totalmente recalculadas. |
| Autoscaling | Dimensionamento automático otimizado, que permite dimensionar horizontalmente (mais executores) e verticalmente (executores maiores). Consulte Otimize a utilização do cluster do pipeline Lakeflow com dimensionamento automático. | Dimensionamento automático melhorado com escalabilidade horizontal. Selecionas os tipos de instância. |
| Canalização de cursos de água | Ativado por padrão. Os microlotes executam-se em simultâneo para melhorar a taxa de transferência e a latência. Consulte Configurar um pipeline sem servidor. | Não disponível. |
| Permissão de criação de computação | Não necessário. Todos os utilizadores do workspace podem executar pipelines serverless por predefinição. | Required. Os utilizadores precisam de permissão irrestrita para criação de clusters ou acesso a uma política de computação. |
| Políticas de computação e tipos de instância | Gerido por Azure Databricks. Não defines tipos de instância nem uma política de computação. | Aplica-se manualmente uma política de computação e seleciona-se os tipos de instância de trabalhador e driver. |
| Catálogo Unity | Usa sempre o Unity Catalog. | Pode usar o Unity Catalog ou a antiga metastore Hive. |
| Atribuição de custos | Aplique etiquetas personalizadas com uma política de uso sem servidor. | Aplique etiquetas personalizadas à canalização. Deve juntar manualmente os dados da etiqueta aos dados de faturação. |
| Clusters de atualização e manutenção | Gerido por Azure Databricks. | Configura os clusters de atualização e manutenção separadamente. |
| Computação de nó único | Não é necessário. O Azure Databricks dimensiona automaticamente os recursos de computação para a carga de trabalho. | Configura computação de nó único para cargas de trabalho de pequena dimensão ou não distribuídas. |
Quando usar computação sem servidor
Utilize computação sem servidor para qualquer pipeline que não esteja sujeito a uma das limitações exclusivas do modo clássico abaixo. Em particular, o serverless é a escolha certa quando:
- Quer que o Azure Databricks gere a infraestrutura por si, incluindo autoescalabilidade vertical e seleção de instâncias, em vez de configurar e manter clusters por si próprio.
- Queres atualização incremental para visualizações materializadas para reduzir os custos de atualização.
- Pretende que os utilizadores da área de trabalho executem pipelines sem permissão para criar clusters.
As pipelines sem servidor exigem um espaço de trabalho com Unity Catalog ativado e uma região com suporte para serverless. Para conhecer os requisitos e a configuração, consulte Configurar um pipeline sem servidor.
Quando usar computação clássica
O serverless suporta quase todas as cargas de trabalho do pipeline, por isso usa computação clássica apenas quando o serverless não consegue correr o teu pipeline de todo:
- As tuas tabelas usam o metastore legado do Hive em vez do Catálogo Unity. Para migrar tabelas do metastore do Hive para o Unity Catalog e ativar o modo serverless, consulte Migrar tabelas e vistas do Hive para o Unity Catalog.
- O seu pipeline necessita de uma rede privada que a arquitetura sem servidor não suporta.
- O seu pipeline é executado numa região em que a execução sem servidor não está disponível.
Com a computação clássica, cabe-lhe configurar e manter políticas de computação, tipos de instância, computação de nó único e clusters separados para atualização e manutenção — tarefas de que o serverless trata por si.
Para opções de instalação e configuração, consulte Configurar computação clássica para pipelines.
Definir o tipo de computação
Escolhe o tipo de computação nas definições de Computação do pipeline ativando ou desativando a definição Serverless . Os novos pipelines utilizam a arquitetura sem servidor por defeito. Também pode converter um pipeline existente configurado com Unity Catalog para o modo serverless.
- Para configurar e converter pipelines sem servidor, consulte Configurar um pipeline sem servidor.
- Para configurar a computação clássica, consulte Configurar a computação clássica para pipelines.