Git-integrering för Spark-jobbdefinition

Den här artikeln förklarar hur Git-integration för Spark-jobbdefinitioner (SJD) i Microsoft Fabric fungerar. Lär dig hur du konfigurerar en lagringsplatsanslutning, hanterar Definitionsändringar för Spark-jobb via källkontroll och distribuerar dem på olika arbetsytor.

När du aktiverar Git-integration för Spark-jobbdefinitioner i Azure DevOps kan du följa ändringar via hela Git-historiken. Om du väljer PySpark eller SparkR ingår huvuddefinitionsfilen och referensfilen som en del av commiten. Git-integration spårar också ändringar i källkoden i dessa filer.

Viktigt!

Den här funktionen är i förhandsversion.

Konfigurera en anslutning

Från inställningarna för din arbetsyta kan du enkelt upprätta en anslutning till ditt repo för att checka in och synkronisera ändringar. För att konfigurera anslutningen, se Kom igång med Git-integrering. Efter att du har anslutit kan du se dina objekt, såsom definitioner av Spark-jobb, i Source-kontrollpanelen .

Skärmbild av kontrollpanelen för arbetsytans källa.

Efter att du committar Spark-jobbdefinitionen till Git-repo visas mappstrukturen för jobbdefinitionen i arkivet.

Spark-jobbdefinitionsrepresentation i Git

Följande bild visar ett exempel på filstrukturen för varje Spark-jobbdefinitionsobjekt i repoet:

Skärmbild av sjd Git-lagringsplatsens filstruktur.

När du committar Spark-jobbdefinitionsobjektet till repot skapas en Git-mapp för varje objekt och namnges enligt detta schema: <Item name> + "SparkJobDefinition". Byt inte namn på mappen, eftersom den används för att spåra objektet i arbetsytan. Till exempel, om objektnamnet är "sjd1", är Git-mappens namn "sjd1SparkJobDefinition".

Git-mappen innehåller två undermappar: huvudmappen och referensmappen. Huvudmappen innehåller huvuddefinitionsfilen, och referensmappen innehåller referensfilen.

Förutom huvud- och referensfilerna finns det också en SparkJobDefinitionV1.json fil. Den innehåller metadata för Spark-jobbdefinitionsobjektet, så ändra det inte. .platform-filen innehåller plattformsinformation relaterad till Git-installation. Ändra inte den här filen heller.

Kommentar

  • Om du väljer Java eller Scala som språk är huvud- och referensfilerna inte committerade när de laddas upp som en .jar fil.
  • Den bifogade miljön kvarstår i en Spark-jobbdefinition efter synkronisering från lagringsplatsen till en Fabric-arbetsyta. För närvarande stöds inte referensmiljöer för flera arbetsytor. Du måste ansluta till en ny miljö manuellt eller använda standardinställningarna för arbetsytan för att köra jobbdefinitionen.
  • Spark-jobbdefinitionen behåller standard-lakehouse-ID:t vid synkronisering från repozitoriet till en Fabric-arbetsyta. Om du committar en anteckningsbok med standardlakehouse måste du manuellt referera till ett nyskapat lakehouse-objekt. Mer information finns i Lakehouse Git-integrering.