Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Você pode criar e executar um trabalho usando a interface do usuário Jobs ou ferramentas de desenvolvedor, como a CLI do Databricks ou a API REST. Usando a interface do usuário ou a API, você pode reparar e executar novamente um trabalho com falha ou cancelado. Este artigo mostra como criar, configurar e editar trabalhos usando a interface do usuário do espaço de trabalho Jobs & Pipelines . Para obter informações sobre outras ferramentas, consulte o seguinte:
- Para aprender sobre a utilização da CLI Databricks para criar e executar trabalhos, consulte a CLI Databricks.
- Para saber mais sobre como usar a API de Trabalhos para criar e executar trabalhos, consulte Trabalhos na referência da API REST.
- Se preferir uma abordagem infraestrutura como código (IaC) para configurar tarefas, pode usar Pacotes de Automação Declarativa. Para saber como usar bundles para configurar e orquestrar os seus trabalhos, consulte Declarative Automation Bundles.
- Para saber como executar e agendar trabalhos diretamente em um bloco de anotações Databricks, consulte Criar e gerenciar trabalhos agendados do bloco de anotações.
Gorjeta
Para exibir um trabalho como YAML, clique no menu de opções à esquerda de Executar agora para o trabalho e, em seguida, clique em Alternar para a versão de código (YAML).
Configuração mínima para um trabalho
Todos os trabalhos no Azure Databricks requerem o seguinte:
- Uma tarefa que contém lógica a ser executada, como um bloco de anotações Databricks. Consulte Configurar e editar tarefas no Lakeflow Jobs
- Um recurso de computação para executar a lógica. O recurso de computação pode ser computação sem servidor, computação de trabalhos clássicos ou computação multiuso. Consulte Configurar computação para trabalhos.
- Um cronograma especificado para quando o trabalho deve ser executado. Opcionalmente, você pode omitir a definição de uma agenda e acionar o trabalho manualmente.
- Um nome único.
Criar uma nova tarefa
Esta secção descreve os passos para criar uma nova tarefa com um notebook e agendar utilizando a interface do utilizador do espaço de trabalho.
Os trabalhos contêm uma ou mais tarefas. Você cria um novo trabalho configurando a primeira tarefa para esse trabalho.
Nota
Cada tipo de tarefa tem opções de configuração dinâmica na interface do usuário do espaço de trabalho. Consulte Configurar e editar tarefas no Lakeflow Jobs.
- No espaço de trabalho, clique no
Jobs & Pipelines na barra lateral.
- Clique em Criar e depois Trabalho.
- Clique no bloco Notebook para configurar a primeira tarefa. Se o mosaico Bloco de Notas não estiver disponível, clique em Adicionar outro tipo de tarefa e procure Bloco de Notas.
- Insira um nome de tarefa.
- Selecione um bloco de anotações para o campo Caminho.
- Clique em Salvar tarefa.
Se o espaço de trabalho não estiver habilitado para computação sem servidor para trabalhos, selecione uma opção Computação . O Databricks recomenda sempre usar a computação de trabalhos ao configurar tarefas.
Um novo trabalho aparece na lista de trabalhos do espaço de trabalho com o nome padrão New Job <date> <time>.
Você pode continuar a adicionar mais tarefas dentro do mesmo trabalho, se necessário para seu fluxo de trabalho. Trabalhos com mais de 100 tarefas podem ter requisitos especiais. Para obter mais informações, consulte Trabalhos com um grande número de tarefas.
Agendar um trabalho
Você pode decidir quando seu trabalho será executado. Por defeito, só funciona quando o inicias manualmente, mas também podes configurá-lo para correr automaticamente. Pode criar um gatilho para executar um trabalho numa agenda ou com base num evento.
Controlar o fluxo de tarefas dentro do trabalho
Ao configurar várias tarefas em trabalhos, você pode usar tarefas especializadas para controlar como as tarefas são executadas. Consulte Controlar o fluxo de tarefas no Lakeflow Jobs.
Selecione um trabalho para editar no espaço de trabalho
Para editar um trabalho existente com a interface do usuário do espaço de trabalho, faça o seguinte:
- Na barra lateral do seu workspace do Azure Databricks, clique em
Jobs & Pipelines . - Opcionalmente, selecione os filtros Trabalhos e Propriedade de mim .
- Clique no link Nome da sua vaga.
Utilize a interface de tarefas para fazer o seguinte:
- Editar configurações de trabalho
- Renomear, clonar ou excluir um trabalho
- Adicionar novas tarefas a um trabalho existente
- Editar configurações de tarefas
Nota
Você também pode exibir as definições JSON para uso com a API REST get, create, e reset endpoints.
Editar configurações de trabalho
O painel lateral contém os detalhes do trabalho. Você pode alterar o agendamento ou gatilho de trabalho, parâmetros de trabalho, configuração de computação, tags, notificações, o número máximo de execuções simultâneas, limites de duração e configurações do Git. Você também pode editar permissões de trabalho se o controle de acesso ao trabalho estiver habilitado.
Adicionar parâmetros para todas as tarefas de trabalho
Os parâmetros configurados ao nível do trabalho são passados para as tarefas do trabalho que aceitam parâmetros-chave-valor, incluindo ficheiros de roda Python configurados para aceitar argumentos de palavras-chave. Consulte Parametrizar trabalhos.
Adicionar tags a um trabalho
Para adicionar rótulos ou atributos de chave-valor ao seu trabalho, você pode adicionar tags ao editá-lo. Pode usar tags para filtrar empregos na lista de Empregos . Por exemplo, você pode usar uma department tag para filtrar todos os trabalhos que pertencem a um departamento específico.
Nota
Como as tags de trabalho não são projetadas para armazenar informações confidenciais, como informações de identificação pessoal ou senhas, a Databricks recomenda o uso de tags apenas para valores não confidenciais.
As etiquetas também se propagam para clusters de tarefas criados quando uma tarefa é executada, permitindo que use as etiquetas com o seu monitoramento de cluster existente.
Marque no painel lateral de detalhes do trabalho para adicionar ou editar etiquetas. Você pode adicionar a etiqueta como um rótulo ou um par chave-valor. Para adicionar um rótulo, insira o rótulo no campo Chave e deixe o campo Valor vazio.
Usar o Git com tarefas
Pode configurar tarefas de trabalho para extrair código-fonte diretamente de um repositório Git remoto. Para instruções e boas práticas, incluindo verificação esparsa para grandes repositórios, veja Usar Git com Lakeflow Jobs.
Adicionar uma política de utilização serverless a uma tarefa
Se o seu espaço de trabalho utilizar políticas de utilização sem servidor para atribuir a utilização sem servidor, pode selecionar a política de utilização sem servidor da sua tarefa através da definição Política de utilização no painel lateral Detalhes da tarefa. Veja Utilização de atributos com políticas de uso serverless.
Renomear, clonar ou excluir um trabalho
Para renomear uma tarefa, vai à interface de empregos, clica no nome da vaga e insere um novo nome.
Você pode criar rapidamente um novo trabalho clonando um trabalho existente. A clonagem de um trabalho cria uma cópia idêntica do trabalho, exceto para a ID do trabalho. Para clonar um trabalho, faça o seguinte:
- Clique no
Jobs & Pipelines na barra lateral esquerda.
- Clique no nome da tarefa que pretende clonar para abrir a interface de tarefas.
- Clique no
ao lado do botão Executar agora .
- Selecione tarefa de clonagem no menu suspenso.
- Insira um nome para o trabalho clonado.
- Clique em Clonar.
Excluir uma tarefa
Para excluir um trabalho, vá para a página do trabalho, clique no ao lado do nome do trabalho e selecione Excluir trabalho no menu suspenso.
Configurar limites para a duração da execução de tarefas ou métricas de acumulação de streaming
Importante
A observabilidade de streaming para Lakeflow Jobs está em Visualização Pública.
Pode configurar limites opcionais para a duração da execução de trabalhos ou para métricas de atraso de streaming. Para configurar limiares de duração ou das métricas de streaming, clique em Duração e limiares de backlog de streaming no painel Detalhes da tarefa.
Para configurar os limites de tempo de execução, incluindo os tempos de conclusão esperados e máximos para o trabalho, selecione Duração da execução no menu suspenso Métrica. Insira uma duração no campo Aviso para configurar o tempo esperado de conclusão do trabalho. Se o trabalho exceder esse limite, um evento será acionado. Você pode usar esse evento para notificar quando um trabalho está sendo executado lentamente. Consulte Configurar notificações para trabalhos lentos. Para configurar um tempo máximo de conclusão de um trabalho, insira a duração máxima no campo Tempo limite . Se a tarefa não for concluída nesse período, o Azure Databricks define o seu estado para "Esgotado".
Para configurar um limite para uma métrica de lista de pendências de streaming, selecione a métrica no menu suspenso Métrica e insira um valor para o limite. Para saber mais sobre as métricas específicas suportadas por uma fonte de streaming, consulte Exibir métricas para tarefas de streaming.
Se um evento for acionado porque um limite é excedido, você pode usar o evento para enviar uma notificação. Consulte Configurar notificações para trabalhos lentos.
Nota
Os limiares de atraso de streaming não são suportados para tarefas de pipeline. Consulte os alertas de backlog de streaming e as tarefas de pipeline.
Opcionalmente, você pode especificar limites de duração para tarefas. Consulte Configurar os limiares para a duração da execução da tarefa ou as métricas de atraso de transmissão.
Habilitar o enfileiramento de tarefas
Nota
O enfileiramento é habilitado por padrão para trabalhos criados por meio da interface do usuário após 15 de abril de 2024.
Para evitar que execuções de um trabalho sejam ignoradas devido a limites de simultaneidade, pode-se habilitar a colocação em fila para o trabalho. Quando a fila está habilitada, a execução permanece na fila até 48 horas, caso os recursos não estejam disponíveis para a execução de uma tarefa. Quando há capacidade, a tarefa é retirada da fila e executada. As execuções em fila são exibidas na lista de execuções para o trabalho e na lista de execuções recentes de trabalho.
Uma execução é enfileirada quando um dos seguintes limites é atingido:
- O máximo de ativos simultâneos é executado no espaço de trabalho.
- A tarefa simultânea
Run Jobmáxima é executada no espaço de trabalho. - O número máximo de execuções simultâneas da tarefa.
O enfileiramento é uma propriedade de nível de tarefa que organiza a execução apenas para essa tarefa.
Para ativar ou desativar a colocação em fila, clique em Definições avançadas e clique no botão de alternar Fila no painel lateral Detalhes da tarefa.
Configurar o máximo de execuções simultâneas
Por padrão, o máximo de execuções simultâneas para todos os novos trabalhos é 1.
Clique em Editar execuções simultâneas em Configurações avançadas para definir o número máximo de execuções paralelas deste trabalho.
O Azure Databricks salta a execução se o trabalho já tiver atingido o número máximo de execuções ativas ao tentar iniciar uma nova execução.
Defina esse valor como maior que 1 para permitir várias execuções simultâneas do mesmo trabalho. Isso é útil, por exemplo, se o utilizador acionar o seu trabalho numa agenda frequente e quiser permitir que execuções consecutivas se sobreponham ou que sejam acionadas várias execuções com diferentes parâmetros de entrada.