Git-integrasjon med Spark-jobbdefinisjon

Denne artikkelen forklarer hvordan Git-integrasjon for Spark-jobbdefinisjoner (SJD) i Microsoft Fabric fungerer. Lær hvordan du konfigurerer en repositoriumtilkobling, administrerer endringer i Spark-jobbdefinisjon gjennom kildekontroll og distribuerer dem på tvers av ulike arbeidsområder.

Når du aktiverer Git-integrasjon for Spark-jobbdefinisjoner i Azure DevOps, kan du spore endringer via hele Git-historikken. Hvis du velger PySpark eller SparkR, inkluderes hoveddefinisjonsfilen og referansefilen som en del av commiten. Git-integrasjon sporer også endringer i kildekoden i disse filene.

Viktig

Denne funksjonen er i forhåndsvisning.

Konfigurere en tilkobling

Fra innstillingene for arbeidsområdet kan du enkelt konfigurere en tilkobling til repo for å utføre og synkronisere endringer. Hvis du vil konfigurere tilkoblingen, kan du se Komme i gang med Git-integrasjon. Etter at du har koblet til, kan du se elementene dine, som Spark-jobbdefinisjoner, i Source-kontrollpanelet .

Skjermbilde av kontrollpanelet for kilde for arbeidsområde.

Etter at du committer Spark-jobbdefinisjonen til Git-repoet, vises mappestrukturen for jobbdefinisjonen i repositoriet.

Spark-jobbdefinisjonsrepresentasjon i Git

Følgende bilde viser et eksempel på filstrukturen for hvert Spark-jobbdefinisjonselement i repoet:

Skjermbilde av filstrukturen sjd Git-repositorium.

Når du commiter Spark-jobbdefinisjonselementet til repoet, opprettes en Git-mappe for hvert element og navngis etter dette skjemaet: <Item name> + "SparkJobDefinition". Ikke gi mappen nytt navn, fordi den brukes til å spore elementet i arbeidsområdet. For eksempel, hvis elementnavnet er "sjd1", er Git-mappen navnet "sjd1SparkJobDefinition".

Git-mappen inneholder to undermapper: hovedmappen og referansemappen. Hovedmappen inneholder hoveddefinisjonsfilen, og referansemappen inneholder referansefilen.

I tillegg til hoved- og referansefilene finnes det også en SparkJobDefinitionV1.json fil. Den inneholder metadataene for Spark-jobbdefinisjonselementet, så ikke endre det. .platform-filen inneholder plattforminformasjon relatert til Git-oppsett. Ikke endre denne filen heller.

Merk

  • Hvis du velger Java eller Scala som språk, blir ikke hoved- og referansefilene forpliktet når de lastes opp som en .jar-fil.
  • Det vedlagte miljøet vedvarer i en Spark-jobbdefinisjon etter synkronisering fra repositoriet til et Fabric-arbeidsområde. Referansemiljøer på tvers av arbeidsområder støttes for øyeblikket ikke. Du må legge til et nytt miljø manuelt eller bruke standardinnstillingene for arbeidsområdet for å kjøre jobbdefinisjonen.
  • Spark-jobbdefinisjonen beholder standard lakehouse-ID når du synkroniserer fra repositoriet til et Fabric-arbeidsområde. Hvis du committer en notatbok med standard lakehouse, må du manuelt referere til et nyopprettet lakehouse-element. Hvis du vil ha mer informasjon, kan du se Lakehouse Git-integrasjon.