Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Use a tarefa do notebook para implantar notebooks Databricks.
Requirements
- O seu portátil deve estar num local acessível ao utilizador que está a configurar o trabalho.
Configurar uma tarefa do bloco de notas
Note
A interface de trabalhos exibe opções dinamicamente com base em outras configurações.
Para iniciar o fluxo de configuração de uma tarefa Notebook:
- Navegue para o separador Tarefas na UI de Trabalhos.
-
Adicionar tarefa.
- Insira um nome no campo Nome da tarefa .
- No menu suspenso do Tipo , selecione
Notebook.
Configurar a origem
No menu pendente Source, selecione uma localização para o bloco de notas utilizando uma das seguintes opções.
Workspace
Use o espaço de trabalho para configurar um bloco de anotações armazenado no espaço de trabalho concluindo as seguintes etapas:
- Clique no campo Caminho . A caixa de diálogo Selecionar Bloco de Anotações é apresentada.
- Navegue até o bloco de anotações, clique para realçar o arquivo e clique em Confirmar.
Note
Você pode usar esta opção para configurar uma tarefa para um notebook armazenado numa pasta Git do Databricks. O Databricks recomenda o uso da opção de fornecedor Git e de um repositório Git remoto para o versionamento de ativos agendados com tarefas.
Fornecedor Git
Recorra ao provedor Git para configurar um notebook num repositório Git remoto.
As opções exibidas pela interface do usuário dependem se você já configurou ou não um provedor Git em outro lugar. Apenas um repositório Git remoto pode ser usado para todas as tarefas em um trabalho. Veja Usar o Git com Lakeflow Jobs.
Importante
Os notebooks criados pelo Lakeflow Jobs que são executados a partir de repositórios Git remotos são efêmeros e não podem ser usados para rastrear execuções, experimentos ou modelos do MLflow. Ao criar um bloco de anotações a partir de um trabalho, utilize um experimento MLflow do espaço de trabalho (em vez de um experimento MLflow do bloco de anotações) e chame mlflow.set_experiment("/path/to/experiment") no bloco de anotações do espaço de trabalho antes de executar qualquer código de rastreamento MLflow. Para obter mais detalhes, consulte Evitar perda de dados em experimentos MLflow.
O campo Caminho aparece depois de configurar uma referência Git.
Insira o caminho relativo para o seu caderno, como etl/bronze/ingest.py.
Importante
Ao inserir o caminho relativo, não comece com / ou ./. Por exemplo, se o caminho absoluto para o bloco de anotações que se deseja acessar for /etl/bronze/ingest.py, introduza etl/bronze/ingest.py no campo Caminho.
Configurar recursos de computação e bibliotecas dependentes
Note
Só pode selecionar um armazém de SQL como motor de computação para uma tarefa de notebook apenas quando o notebook estiver totalmente escrito em SQL e SQL estiver definido como o seu idioma predefinido. Se o notebook utilizar outro idioma predefinido ou misturar idiomas, selecione um cluster ou outro recurso de computação suportado em vez disso.
- Use o Computação para selecionar ou configurar um cluster que suporte a lógica no seu notebook.
- Se usares
Serverlesscompute, instala as bibliotecas diretamente dentro do notebook, usando o painel de Ambiente ou usando%pip install. Consulte Configurar o ambiente sem servidor. - Para todas as outras configurações de computação, clique no
Adicione em Bibliotecas Dependentes. A caixa de diálogo Adicionar biblioteca dependente é exibida.
- Você pode selecionar uma biblioteca existente ou carregar uma nova biblioteca.
- Você só pode usar bibliotecas armazenadas em um local suportado por suas configurações de computação. Veja suporte da biblioteca Python.
- Cada fonte de biblioteca tem um fluxo diferente para selecionar ou carregar uma biblioteca. Consulte Instalar bibliotecas.
Finalizar a configuração do trabalho
- (Opcional) Configure os Parâmetros como pares chave-valor que podem ser acedidos no notebook através de
dbutils.widgets. Consulte Configurar parâmetros de tarefa. - (Opcional) Para configurar tentativas, limiares para a duração da execução ou para o backlog de streaming, ou notificações, consulte Definições avançadas da tarefa.
- Clique em Salvar tarefa.
Para editar, clonar, desativar ou eliminar esta tarefa, consulte Configurar e editar tarefas em Lakeflow Jobs.
Preparação de dados visuais
Preparação visual de dados na lista pendente Tipo da tarefa cria uma tarefa de notebook para um ficheiro de preparação visual de dados. Constróis estes ficheiros numa tela visual no Lakeflow Designer, que guarda cada um como um caderno chamado <name>.designer.ipynb. Para executar um destes como trabalho, adicione uma tarefa de notebook e selecione o respetivo ficheiro .designer.ipynb como origem. Veja Lakeflow Designer.
Limitations
A saída total de células do notebook (a saída combinada de todas as células do notebook) está sujeita a um limite de tamanho de 30MB. Além disso, a saída de célula individual está sujeita a um limite de tamanho de 8MB. Se a produção total da célula exceder 30MB, ou se a saída de uma célula individual for superior a 8MB, a execução é cancelada e marcada como falhada.
Se precisar de ajuda para localizar células próximas ou além do limite, execute o notebook em um cluster geral e use esta técnica de salvamento automático de notebook.
Recursos adicionais
- Tarefa de caderno: Defina uma tarefa de caderno como código com Pacotes de Automação Declarativa.
- Use o Git com Lakeflow Jobs: Versão dos notebooks com um fornecedor Git.
- Configurar parâmetros da tarefa: Passar os parâmetros para o caderno.