Git-integratie van Spark-taakdefinitie

Dit artikel legt uit hoe Git-integratie voor Spark-jobdefinities (SJD) in Microsoft Fabric werkt. Meer informatie over het instellen van een opslagplaatsverbinding, het beheren van wijzigingen in spark-taakdefinities via broncodebeheer en het implementeren ervan in verschillende werkruimten.

Wanneer je Git-integratie inschakelt voor Spark-taakdefinities in Azure DevOps, kun je wijzigingen volgen via de volledige Git-geschiedenis. Als je PySpark of SparkR selecteert, worden het hoofddefinitiebestand en referentiebestand opgenomen als onderdeel van de commit. Git-integratie volgt ook wijzigingen in de broncode binnen deze bestanden.

Belangrijk

Deze functie is beschikbaar als preview-versie.

Een verbinding instellen

Vanuit uw werkruimte-instellingen kunt u eenvoudig een verbinding met uw opslagplaats instellen om wijzigingen door te voeren en te synchroniseren. Zie Aan de slag met Git-integratie om de verbinding in te stellen. Nadat je verbinding hebt gemaakt, kun je je items, zoals Spark-jobdefinities, in het Source-bedieningspaneel zien.

Schermopname van het configuratiescherm van de werkruimtebron.

Nadat je de Spark-taakdefinitie hebt gecommit in de Git-repository, verschijnt de mappenstructuur van de taakdefinitie in de repository.

Weergave van Spark-jobdefinitie in Git

De volgende afbeelding toont een voorbeeld van de bestandsstructuur voor elk Spark-taakdefinitie-item in de repo:

Schermopname van de structuur van het Sjd Git-opslagplaatsbestand.

Wanneer je het Spark-taakdefinitie-item committeert naar de repository, wordt er voor elk item een Git-map aangemaakt die volgens het volgende schema wordt genoemd: <Itemnaam> + "SparkJobDefinition". Hernoem de map niet, want die wordt gebruikt om het item in de werkruimte bij te houden. Als bijvoorbeeld de itemnaam "sjd1" is, is de naam van de Git-map "sjd1SparkJobDefinition".

De Git-map bevat twee submappen: hoofdmap en referentiemap. De hoofdmap bevat het hoofddefinitiebestand, en de referentiemap bevat het referentiebestand.

Naast de hoofd- en referentiebestanden is er ook een SparkJobDefinitionV1.json bestand. Het bevat de metagegevens voor het Spark-taakdefinitie-item, dus wijzig het niet. Het .platform-bestand bevat de platforminformatie met betrekking tot de Git-setup. Verander dit bestand ook niet.

Notitie

  • Als je Java of Scala als programmeertaal kiest, worden de hoofd- en referentiebestanden niet opgeslagen wanneer ze als .jar-bestand worden geüpload.
  • De gekoppelde omgeving blijft behouden in een Spark-jobdefinitie nadat deze vanuit de repository naar een Fabric-werkruimte is gesynchroniseerd. Op dit moment worden referentieomgevingen voor meerdere werkruimten niet ondersteund. U moet handmatig koppelen aan een nieuwe omgeving of de standaardinstellingen van de werkruimte gebruiken om de taakdefinitie uit te voeren.
  • De Spark-taakdefinitie behoudt de standaard lakehouse-ID bij het synchroniseren vanuit het repository naar een Fabric-werkruimte. Als je een notebook commit met het standaardlakehouse, moet je handmatig een verwijzing opnemen naar een nieuw aangemaakt lakehouse-item. Zie De Git-integratie van Lakehouse voor meer informatie.