Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Use a tarefa de notebook para implantar notebooks do Databricks.
Requirements
- Seu bloco de anotações deve estar em um local acessível pelo usuário que está configurando o trabalho.
Configurar uma tarefa de notebook
Note
A interface de trabalhos exibe opções de forma dinâmica com base em outras configurações definidas.
Para iniciar o processo de configuração de uma tarefa Notebook:
- Navegue até a guia Tarefas na interface de usuário de tarefas.
- Clique
Adicionar tarefa.
- Insira um nome no campo Nome da tarefa .
- No menu suspenso Tipo, escolha
Notebook.
Configurar a origem
No menu suspenso Origem, selecione um local para o notebook Python usando uma das opções a seguir.
Workspace
Use o Workspace para configurar um notebook armazenado no workspace concluindo as etapas a seguir.
- Clique no campo Caminho. A caixa de diálogo Selecionar Notebook será exibida.
- Navegue até o notebook, clique para realçar o arquivo e clique em Confirmar.
Note
Você pode usar essa opção para configurar uma tarefa para um notebook armazenado em uma pasta Git do Databricks. O Databricks recomenda usar a opção de provedor Git e um repositório Git remoto para controlar a versão de ativos agendados com trabalhos.
Provedor Git
Use Provedor Git para configuração de um notebook em um repositório Git remoto.
As opções exibidas pela interface do usuário dependem se você já configurou ou não um provedor Git em outro lugar. Apenas um repositório Git remoto pode ser usado para todas as tarefas em um trabalho. Confira Usar Git com trabalhos do Lakeflow.
Importante
Os notebooks criados pelo Lakeflow Jobs que são executados a partir de repositórios Git remotos são efêmeros e não devem ser usados para rastrear execuções, experimentos ou modelos do MLflow. Ao criar um notebook a partir de um trabalho, use um experimento de workspace do MLflow (em vez de um experimento de notebook do MLflow) e chame mlflow.set_experiment("/path/to/experiment") no notebook do workspace antes de executar um código de acompanhamento do MLflow. Para obter mais detalhes, confira Evitar perda de dados em experimentos do MLflow.
O campo Caminho aparece depois que você configura uma referência git.
Insira o caminho relativo do seu notebook, por exemplo, etl/bronze/ingest.py.
Importante
Quando você insere o caminho relativo, não comece com / ou ./. Por exemplo, se o caminho absoluto para o notebook que você deseja acessar for /etl/bronze/ingest.py, insira etl/bronze/ingest.py no campo Caminho.
Configurar ambiente de computação e bibliotecas dependentes
Note
Você pode selecionar um warehouse SQL como computação para uma tarefa de notebook somente quando o notebook for escrito inteiramente em SQL e o SQL estiver definido como seu idioma padrão. Se o notebook usar outro idioma padrão ou misturar idiomas, selecione um cluster ou outro recurso de computação compatível.
- Use Computação para selecionar ou configurar um cluster que ofereça suporte à lógica em seu notebook.
- Se você usar computação
Serverless, instale bibliotecas diretamente no notebook, usando o painel Ambiente ou%pip install. Consulte Configurar o ambiente sem servidor. - Para todas as outras configurações de computação, clique no
Adicione em bibliotecas dependentes. A caixa de diálogo Adicionar biblioteca dependente é exibida.
- Você pode selecionar uma biblioteca existente ou carregar uma nova biblioteca.
- Você só pode usar bibliotecas armazenadas em um local compatível com suas configurações de computação. Consulte Suporte da biblioteca Python.
- Cada Fonte da Biblioteca tem um fluxo diferente para selecionar ou carregar uma biblioteca. Consulte Instalar bibliotecas.
Finalizar a configuração do trabalho
- (Opcional) Configure Parâmetros como pares chave-valor que podem ser acessados no caderno usando
dbutils.widgets. Consulte Configurar parâmetros de tarefa. - (Opcional) Para definir novas tentativas, limites de tempo de execução ou de backlog de streaming ou notificações, confira as configurações de tarefa Avançadas.
- Clique em Salvar tarefa.
Para editar, clonar, desabilitar ou excluir essa tarefa, consulte Configurar e editar tarefas em Trabalhos do Lakeflow.
Preparação de dados visuais
A preparação de dados visuais na lista suspensa Tipo da tarefa cria uma tarefa de notebook para um arquivo de preparação de dados visuais. Você cria esses arquivos em uma tela visual no Lakeflow Designer, que salva cada um deles como um bloco de anotações chamado <name>.designer.ipynb. Para executar um deles como tarefa, adicione uma tarefa de notebook e selecione o arquivo .designer.ipynb como origem. Consulte Lakeflow Designer.
Limitations
A saída total da célula do notebook (a saída combinada de todas as células do notebook) está sujeita a um limite de tamanho de 30 MB. Além disso, a saída individual da célula está sujeita a um limite de tamanho de 8 MB. Se a saída total da célula exceder 30 MB de tamanho ou se a saída de uma célula individual for maior que 8 MB, a execução será cancelada e marcada como falha.
Se você precisar de ajuda para encontrar células próximas ao limite ou que o tenham ultrapassado, execute o notebook em um cluster de uso geral e use esta técnica de salvamento automático do notebook.
Recursos adicionais
- Tarefa de caderno: Defina uma tarefa de caderno como código com Pacotes de Automação Declarativa.
- Use o Git com Trabalhos do Lakeflow: versão dos notebooks com um provedor Git.
- Configurar parâmetros da tarefa: Passar parâmetros para o notebook.