Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Este artigo explica como funciona a integração do Git para definições de trabalhos do Spark (SJD) no Microsoft Fabric. Saiba como configurar uma conexão de repositório, gerenciar alterações da definição de trabalho do Spark por meio do controle de origem e implantá-las em vários espaços de trabalho.
Quando você habilita a integração com o Git para definições de jobs do Spark no Azure DevOps, é possível acompanhar as mudanças através do histórico completo do Git. Se você selecionar PySpark ou SparkR, o arquivo principal de definição e o arquivo de referência são incluídos como parte do commit. A integração com o Git também acompanha as alterações no código-fonte dentro desses arquivos.
Importante
Esse recurso está em versão prévia.
Configurar uma conexão
Nas configurações do workspace, você pode configurar facilmente uma conexão com seu repositório a fim de confirmar e sincronizar alterações. Para configurar a conexão, consulte Introdução à integração do Git. Depois de se conectar, você pode ver seus itens, como definições de trabalhos do Spark, no painel de controle de versão .
Depois de fazer commit da definição do trabalho do Spark no repositório Git, a estrutura de pastas da definição do trabalho aparece no repositório.
Representação de definição de funções Spark no Git
A imagem a seguir mostra um exemplo da estrutura de arquivos para cada item de definição de trabalho do Spark no repositório:
Quando você faz commit do item de definição de trabalho do Spark no repositório, uma pasta Git é criada para cada item e nomeada de acordo com este esquema: <Nome> do item + "SparkJobDefinition". Não renomeie a pasta, porque ela é usada para rastrear o item no workspace. Por exemplo, se o nome do item for "sjd1", o nome da pasta Git é "sjd1SparkJobDefinition".
A pasta Git contém duas subpastas: main e reference. A pasta principal contém o arquivo principal de definição, e a pasta de referência contém o arquivo de referência.
Além dos arquivos principais e de referência, há também um arquivo SparkJobDefinitionV1.json. Ele contém os metadados para o item de definição de trabalho do Spark, portanto, não o modifique. O arquivo .platform contém as informações da plataforma relacionadas à configuração do Git. Também não modifique esse arquivo.
Observação
- Se você escolher Java ou Scala como linguagem, os arquivos principal e de referência não são comprometidos quando enviados como um arquivo .jar.
- O ambiente anexado persiste em uma definição de trabalho do Spark após a sincronização do repositório para um espaço de trabalho do Fabric. Atualmente, não há suporte para ambientes de referência entre workspaces. Você deve anexar-se manualmente a um novo ambiente ou usar as configurações padrão do espaço de trabalho para executar a definição da tarefa.
- A definição de trabalho do Spark mantém o ID padrão do lakehouse durante a sincronização do repositório para um espaço de trabalho do Fabric. Se você fizer commit de um notebook com o lakehouse padrão, precisará referenciar manualmente um item de lakehouse recém-criado. Para obter mais informações, consulte a integração do Git do Lakehouse.