Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Este artigo explica como funciona a integração do Git para definições de trabalhos Spark (SJD) no Microsoft Fabric. Saiba como configurar uma conexão de repositório, gerenciar alterações de definição de trabalho do Spark por meio do controle do código-fonte e implantá-las em vários espaços de trabalho.
Quando ativas a integração com o Git para definições de trabalhos do Spark no Azure DevOps, podes acompanhar as alterações através do histórico completo do Git. Se selecionares PySpark ou SparkR, o ficheiro principal de definição e o ficheiro de referência são incluídos como parte do commit. A integração com o Git também acompanha alterações ao código-fonte dentro destes ficheiros.
Importante
Este recurso está em pré-visualização.
Configurar uma ligação
Nas configurações do espaço de trabalho, você pode facilmente configurar uma conexão com o repositório para confirmar e sincronizar alterações. Para configurar a conexão, consulte Introdução à integração com o Git. Depois de estabelecer ligação, pode ver os seus itens, como as definições de tarefas do Spark, no painel Controlo de código-fonte.
Depois de submeteres a definição da tarefa do Spark ao repositório Git, a estrutura de pastas da definição da tarefa aparece no repositório.
Representação da definição de funções Spark no Git
A imagem seguinte mostra um exemplo da estrutura do ficheiro para cada item de definição de trabalho Spark no repositório:
Quando efetua o commit do item de definição de tarefa do Spark no repositório, é criada uma pasta Git para cada item com o nome de acordo com este esquema: <Nome do item> + "SparkJobDefinition". Não renomeies a pasta, porque é usada para rastrear o item no espaço de trabalho. Por exemplo, se o nome do item for "sjd1", o nome da pasta Git é "sjd1SparkJobDefinition".
A pasta Git contém duas subpastas: main e reference. A pasta principal contém o ficheiro principal de definição, e a pasta de referência contém o ficheiro de referência.
Além dos arquivos principal e de referência, há também um arquivo SparkJobDefinitionV1.json . Ele contém os metadados para o item de definição de trabalho do Spark, portanto, não o modifique. O ficheiro .platform contém a informação da plataforma relacionada com a configuração do Git. Também não modifiquem este ficheiro.
Nota
- Se escolheres Java ou Scala como linguagem, os ficheiros principal e de referência não são comprometidos quando carregados como ficheiros .jar.
- O ambiente associado mantém-se numa definição de tarefa do Spark após a sincronização do repositório para um espaço de trabalho do Fabric. Atualmente, não há suporte para ambientes de referência entre espaços de trabalho. Tem de se anexar manualmente a um novo ambiente ou utilizar as predefinições do espaço de trabalho para executar a definição da tarefa.
- A definição da tarefa do Spark mantém o ID predefinido do lakehouse ao sincronizar-se do repositório para uma área de trabalho do Fabric. Se efetuares commit de um bloco de notas com o lakehouse predefinido, tens de referenciar manualmente um item de lakehouse recém-criado. Para obter mais informações, consulte Lakehouse Git integration.