Mover um arquivo de preparação visual de dados para produção

Cada arquivo de preparação de dados visuais que você cria no Lakeflow Designer é apoiado pelo código pronto para produção e armazenado como um notebook chamado <name>.designer.ipynb. Você pode movê-lo para produção com as mesmas ferramentas que você usa para outros códigos do Azure Databricks: armazená-lo no Git, executá-lo como um job e implantá-lo com Pacotes de Automação Declarativa.

Esta página explica como levar um arquivo de preparação de dados visuais do protótipo para a produção.

Repositório e versão no Git

O workspace armazena arquivos de preparação de dados visuais nativamente. Para versionar um arquivo de preparação visual de dados, coloque-o em uma pasta do Git e rastreie-o como qualquer outro notebook:

  1. Crie uma pasta Git em seu workspace.
  2. Mova o arquivo de preparação de dados visuais para essa pasta Git.
  3. Acompanhe, confirme e controle a versão do arquivo como qualquer outro bloco de anotações no Git. No Git, o arquivo aparece como <file_name>.designer.ipynb.

Para saber mais sobre pastas Git, consulte pastas Git do Azure Databricks. Para exportar ou importar um arquivo de preparação de dados visuais, consulte Exportar e importar um arquivo de preparação de dados visuais.

Agendar como uma tarefa

Você pode automatizar um arquivo de preparação de dados visuais agendando-o como um trabalho.

  • Agende diretamente: clique no botão Agendar no menu superior para criar um trabalho agendado para o arquivo de preparação de dados visuais.
  • Adicionar a um trabalho: crie um trabalho Azure Databricks e adicione seu arquivo de preparação de dados visuais como uma tarefa. Isso permite que você combine esse arquivo de preparação de dados visuais com outras tarefas em um pipeline maior. Na lista suspensa Tipo de tarefa, selecione Preparação de dados visuais e, em seguida, selecione o arquivo.

As execuções agendadas exibem cada operador como um nó individual no grafo de tarefas de Trabalhos para que você possa inspecionar os resultados de cada operador em uma execução, da mesma forma que no canvas.

Para exibir e gerenciar agendas existentes, clique em Agendar novamente para abrir a lista. Clique em Adicionar agendamento para criar outro, ou abra o menu kebab Ícone de menu Kebab. do agendamento para Editar, Executar agora, Pausar, Clonar, Exibir em Trabalhos ou Excluir.

Exibir a saída do operador em uma execução

Por padrão, uma execução agendada gera saída somente para operadores de terminal (operadores sem conexão downstream), como um operador de saída. Para ver os resultados de cada operador na execução, expanda as configurações avançadas na caixa de diálogo de agendamento e selecione Exibir saída do operador.

Controle de agendamento de LFD para automatizar um arquivo de preparação visual de dados como um trabalho.

Desative essa opção para telas grandes para evitar exceder o limite de tamanho de saída de execução.

Selecione o ambiente sem servidor

Ao trabalhar com um arquivo de preparação de dados visuais, você pode selecionar o ambiente sem servidor usado para execuções interativas e trabalhos agendados. Configure-o no painel lateral Ícone de ambiente.Ambiente na barra lateral direita, da mesma forma que você faz com um notebook. No ambiente Base, selecione uma versão do ambiente. Consulte Configurar o ambiente sem servidor.

Parametrizar entre ambientes

Os parâmetros são valores nomeados definidos para o arquivo de preparação de dados visuais como um todo que você pode referenciar de operadores SQL e Python. Para obter detalhes sobre como definir e referenciar parâmetros, consulte Parâmetros.

Os parâmetros permitem executar o mesmo arquivo de preparação de dados visuais em ambientes diferentes, por exemplo, um catálogo de teste durante o desenvolvimento e um catálogo de produção em produção.

  • Ao agendar um trabalho na interface do usuário: substitua os valores dos parâmetros para cada agendamento. Por exemplo, crie um agendamento que seja executado com um parâmetro environment definido como test e outro que seja executado com ele definido como production.
  • Ao fazer a implantação com um pacote: defina os valores dos parâmetros por meio do parameters do trabalho e use os destinos do pacote para fornecer valores diferentes por ambiente. Os alvos de desenvolvimento e produção do bundle permitem implantar a mesma tarefa em ambientes separados com configurações específicas de cada ambiente. Consulte os modos de implantação de Pacotes de Automação Declarativa e a configuração de Pacotes de Automação Declarativa.

Em runtime, um arquivo de preparação de dados visuais lê seus parâmetros da mesma maneira, seja ele executado interativamente ou como um trabalho, de modo que o mesmo arquivo funcione em todos os seus ambientes sem alterações.

Ler de tabelas diferentes por ambiente

Para ler de uma tabela de origem diferente em cada ambiente, use um operador SQL com parâmetros em vez de um operador de origem fixo. Defina os parâmetros catalog, schema e table e, em seguida, faça referência a eles com a cláusula IDENTIFIER() para criar o nome da tabela dinamicamente:

SELECT * FROM IDENTIFIER(:catalog || '.' || :schema || '.' || :table)

Substitua os parâmetros catalog, schema ou table para cada agendamento ou destino de pacote para apontar o mesmo arquivo de preparação visual de dados nos dados de teste durante o desenvolvimento e para dados de produção em produção. Para obter mais informações sobre a cláusula IDENTIFIER(), consulte a cláusula IDENTIFIER.

Implantar com pacotes de automação declarativa

Os Pacotes de Automação Declarativa permitem definir e implantar recursos Azure Databricks, como trabalhos como arquivos de origem, para que você possa aplicar práticas recomendadas de engenharia de software, como controle do código-fonte, revisão de código, teste e CI/CD aos arquivos de preparação de dados visuais. Veja o que são pacotes de automação declarativa?.

Para implantar um arquivo de preparação visual de dados com um pacote, defina uma tarefa de notebook e faça referência ao caminho do arquivo .designer.ipynb em notebook_task.notebook_path. Em um pacote, um arquivo de preparação visual de dados usa a chave notebook_task, embora a interface de Trabalhos o exiba como um tipo de tarefa Preparação visual de dados.

O exemplo a seguir define um trabalho que executa um arquivo de preparação de dados visuais localizado ao lado do arquivo de configuração do pacote:

resources:
  jobs:
    daily_prep_job:
      name: daily_prep_job
      tasks:
        - task_key: run_visual_data_prep
          notebook_task:
            notebook_path: ./my_transformation.designer.ipynb

Implante e execute o pacote com a CLI do Azure Databricks:

databricks bundle deploy
databricks bundle run daily_prep_job

Para ver todas as chaves de tarefa do Notebook, consulte Notebook task. Para obter um passo a passo completo da definição de um trabalho em um pacote, consulte Desenvolver um trabalho com Pacotes de Automação Declarativa.

Automatize com CI/CD

Para validar e implantar pacotes de preparação de dados visuais automaticamente, integre-os a um pipeline de CI/CD. Para obter um exemplo usando GitHub Actions, consulte GitHub Actions.

Recursos adicionais