Integrazione con Git della definizione del processo Spark

Questo articolo spiega come funziona l'integrazione di Git per le definizioni di job di Spark (SJD) in Microsoft Fabric. Informazioni su come configurare una connessione al repository, gestire le modifiche alle definizioni processo Spark tramite il controllo del codice sorgente e distribuirle in varie aree di lavoro.

Quando abiliti l'integrazione di Git per le definizioni di job di Spark in Azure DevOps, puoi tracciare le modifiche tramite la cronologia completa di Git. Se selezioni PySpark o SparkR, il file principale di definizione e il file di riferimento sono inclusi come parte del commit. L'integrazione con git tiene traccia anche delle modifiche al codice sorgente all'interno di questi file.

Importante

Questa funzionalità è in anteprima.

Configurare una connessione

Dalle impostazioni dell'area di lavoro è possibile configurare facilmente una connessione al repository per eseguire il commit e la sincronizzazione delle modifiche. Per configurare la connessione, vedere Introduzione all'integrazione con Git. Dopo esserti connesso, puoi visualizzare i tuoi elementi, come le definizioni dei processi Spark, nel pannello Controllo del codice sorgente.

Screenshot del pannello di controllo del codice sorgente dell'area di lavoro.

Dopo aver effettuato il commit della definizione del lavoro Spark nel repository Git, la struttura delle cartelle della definizione del lavoro appare nel repository.

Rappresentazione della definizione del lavoro Spark in Git

L'immagine seguente mostra un esempio della struttura dei file per ogni elemento di definizione del lavoro Spark nel repository:

Schermata della struttura dei file del repository Git di sjd.

Quando si effettua il commit dell'elemento di definizione del lavoro Spark nel repository, viene creata una cartella Git per ogni elemento che viene chiamata secondo questo schema: <Nome> dell'oggetto + "SparkJobDefinition". Non rinominare la cartella, perché viene usata per tracciare l'oggetto nello spazio di lavoro. Ad esempio, se il nome dell'elemento è "sjd1", il nome della cartella Git è "sjd1SparkJobDefinition".

La cartella Git contiene due sottocartelle: main e reference. La cartella principale contiene il file principale di definizione, mentre la cartella di riferimento contiene il file di riferimento.

Oltre ai file principali e di riferimento, è presente anche un file SparkJobDefinitionV1.json. Contiene i metadati per l'elemento di definizione del processo Spark, quindi non modificarlo. Il file .platform contiene le informazioni della piattaforma relative alla configurazione di Git. Non modificare nemmeno questo file.

Nota

  • Se scegli Java o Scala come linguaggio, i file principali e di riferimento non vengono attivati quando vengono caricati come file .jar.
  • L'ambiente allegato rimane in una definizione di processo Spark dopo la sincronizzazione dal repository a un'area di lavoro Fabric. Attualmente, gli ambienti di riferimento tra aree di lavoro non sono supportati. Per eseguire la definizione del processo, è necessario connettersi manualmente a un nuovo ambiente oppure utilizzare le impostazioni predefinite dello spazio di lavoro.
  • La definizione del processo Spark mantiene l'ID predefinito del lakehouse durante la sincronizzazione dal repository a un'area di lavoro Fabric. Se esegui il commit di un notebook con il lakehouse predefinito, devi fare riferimento manualmente a un nuovo elemento lakehouse creato. Per altre informazioni, vedere Integrazione di Git di Lakehouse.