Computação sem servidor vs. computação tradicional para pipelines

Cada pipeline do Lakeflow Pipelines executa as suas atualizações em computação sem servidor ou clássica. O tipo de processamento é uma configuração de cada pipeline que pode ser escolhida nas definições do pipeline. Não é automático: um pipeline é executado em computação sem servidor apenas quando se ativa a definição Serverless, e é executado em computação clássica caso contrário. Esta página compara as duas opções para que possa escolher a certa para cada pipeline.

A Databricks recomenda computação sem servidor para quase todos os pipelines. Com o serverless, o Azure Databricks gere a infraestrutura por si. Não existem clusters para dimensionar, configurar, proteger ou conceder permissões, e tens capacidades que a computação clássica não consegue oferecer, como atualização incremental e autoscaling vertical. Com a computação clássica, essa infraestrutura é da sua responsabilidade para configurar e manter. Serverless suporta quase tudo o que o Classic Compute faz. As exceções são a metastore Hive antiga e algumas configurações de rede. Para a maioria dos pipelines, escolher a computação tradicional significa assumir tarefas manuais que, de outra forma, seriam tratadas pela computação sem servidor.

Importante

A atualização incremental para visualizações materializadas está disponível apenas em pipelines serverless. As vistas materializadas que correm em computação clássica são sempre totalmente recomputadas. Se a atualização incremental for um requisito da sua carga de trabalho, utilize computação sem servidor. Consulte Atualização incremental para ver vistas materializadas.

Compare opções de computação

A tabela seguinte compara a computação serverless e a computação clássica em termos das capacidades que mais frequentemente determinam a escolha:

Capacidade Serverless Classic
Gestão da infraestrutura Azure Databricks gere toda a infraestrutura. Não existe configuração de cluster. Deve configurar clusters, incluindo escalabilidade automática, tipos de instância e políticas de cluster.
Atualização incremental para visualizações materializadas Apoiado. As vistas materializadas são atualizadas incrementalmente sempre que é eficiente em termos de custos, para reduzir os custos de computação. Consulte Atualização incremental para ver vistas materializadas. Não suportadas. As visualizações materializadas são sempre totalmente recalculadas.
Autoscaling Dimensionamento automático otimizado, que permite dimensionar horizontalmente (mais executores) e verticalmente (executores maiores). Consulte Otimize a utilização do cluster do pipeline Lakeflow com dimensionamento automático. Dimensionamento automático melhorado com escalabilidade horizontal. Selecionas os tipos de instância.
Canalização de cursos de água Ativado por padrão. Os microlotes executam-se em simultâneo para melhorar a taxa de transferência e a latência. Consulte Configurar um pipeline sem servidor. Não disponível.
Permissão de criação de computação Não necessário. Todos os utilizadores do workspace podem executar pipelines serverless por predefinição. Required. Os utilizadores precisam de permissão irrestrita para criação de clusters ou acesso a uma política de computação.
Políticas de computação e tipos de instância Gerido por Azure Databricks. Não defines tipos de instância nem uma política de computação. Aplica-se manualmente uma política de computação e seleciona-se os tipos de instância de trabalhador e driver.
Catálogo Unity Usa sempre o Unity Catalog. Pode usar o Unity Catalog ou a antiga metastore Hive.
Atribuição de custos Aplique etiquetas personalizadas com uma política de uso sem servidor. Aplique etiquetas personalizadas à canalização. Deve juntar manualmente os dados da etiqueta aos dados de faturação.
Clusters de atualização e manutenção Gerido por Azure Databricks. Configura os clusters de atualização e manutenção separadamente.
Computação de nó único Não é necessário. O Azure Databricks dimensiona automaticamente os recursos de computação para a carga de trabalho. Configura computação de nó único para cargas de trabalho de pequena dimensão ou não distribuídas.

Quando usar computação sem servidor

Utilize computação sem servidor para qualquer pipeline que não esteja sujeito a uma das limitações exclusivas do modo clássico abaixo. Em particular, o serverless é a escolha certa quando:

  • Quer que o Azure Databricks gere a infraestrutura por si, incluindo autoescalabilidade vertical e seleção de instâncias, em vez de configurar e manter clusters por si próprio.
  • Queres atualização incremental para visualizações materializadas para reduzir os custos de atualização.
  • Pretende que os utilizadores da área de trabalho executem pipelines sem permissão para criar clusters.

As pipelines sem servidor exigem um espaço de trabalho com Unity Catalog ativado e uma região com suporte para serverless. Para conhecer os requisitos e a configuração, consulte Configurar um pipeline sem servidor.

Quando usar computação clássica

O serverless suporta quase todas as cargas de trabalho do pipeline, por isso usa computação clássica apenas quando o serverless não consegue correr o teu pipeline de todo:

  • As tuas tabelas usam o metastore legado do Hive em vez do Catálogo Unity. Para migrar tabelas do metastore do Hive para o Unity Catalog e ativar o modo serverless, consulte Migrar tabelas e vistas do Hive para o Unity Catalog.
  • O seu pipeline necessita de uma rede privada que a arquitetura sem servidor não suporta.
  • O seu pipeline é executado numa região em que a execução sem servidor não está disponível.

Com a computação clássica, cabe-lhe configurar e manter políticas de computação, tipos de instância, computação de nó único e clusters separados para atualização e manutenção — tarefas de que o serverless trata por si.

Para opções de instalação e configuração, consulte Configurar computação clássica para pipelines.

Definir o tipo de computação

Escolhe o tipo de computação nas definições de Computação do pipeline ativando ou desativando a definição Serverless . Os novos pipelines utilizam a arquitetura sem servidor por defeito. Também pode converter um pipeline existente configurado com Unity Catalog para o modo serverless.

Recursos adicionais