Notitie
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen u aan te melden of de directory te wijzigen.
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen de mappen te wijzigen.
Dit artikel legt uit hoe Git-integratie voor Spark-jobdefinities (SJD) in Microsoft Fabric werkt. Meer informatie over het instellen van een opslagplaatsverbinding, het beheren van wijzigingen in spark-taakdefinities via broncodebeheer en het implementeren ervan in verschillende werkruimten.
Wanneer je Git-integratie inschakelt voor Spark-taakdefinities in Azure DevOps, kun je wijzigingen volgen via de volledige Git-geschiedenis. Als je PySpark of SparkR selecteert, worden het hoofddefinitiebestand en referentiebestand opgenomen als onderdeel van de commit. Git-integratie volgt ook wijzigingen in de broncode binnen deze bestanden.
Belangrijk
Deze functie is beschikbaar als preview-versie.
Een verbinding instellen
Vanuit uw werkruimte-instellingen kunt u eenvoudig een verbinding met uw opslagplaats instellen om wijzigingen door te voeren en te synchroniseren. Zie Aan de slag met Git-integratie om de verbinding in te stellen. Nadat je verbinding hebt gemaakt, kun je je items, zoals Spark-jobdefinities, in het Source-bedieningspaneel zien.
Nadat je de Spark-taakdefinitie hebt gecommit in de Git-repository, verschijnt de mappenstructuur van de taakdefinitie in de repository.
Weergave van Spark-jobdefinitie in Git
De volgende afbeelding toont een voorbeeld van de bestandsstructuur voor elk Spark-taakdefinitie-item in de repo:
Wanneer je het Spark-taakdefinitie-item committeert naar de repository, wordt er voor elk item een Git-map aangemaakt die volgens het volgende schema wordt genoemd: <Itemnaam> + "SparkJobDefinition". Hernoem de map niet, want die wordt gebruikt om het item in de werkruimte bij te houden. Als bijvoorbeeld de itemnaam "sjd1" is, is de naam van de Git-map "sjd1SparkJobDefinition".
De Git-map bevat twee submappen: hoofdmap en referentiemap. De hoofdmap bevat het hoofddefinitiebestand, en de referentiemap bevat het referentiebestand.
Naast de hoofd- en referentiebestanden is er ook een SparkJobDefinitionV1.json bestand. Het bevat de metagegevens voor het Spark-taakdefinitie-item, dus wijzig het niet. Het .platform-bestand bevat de platforminformatie met betrekking tot de Git-setup. Verander dit bestand ook niet.
Notitie
- Als je Java of Scala als programmeertaal kiest, worden de hoofd- en referentiebestanden niet opgeslagen wanneer ze als .jar-bestand worden geüpload.
- De gekoppelde omgeving blijft behouden in een Spark-jobdefinitie nadat deze vanuit de repository naar een Fabric-werkruimte is gesynchroniseerd. Op dit moment worden referentieomgevingen voor meerdere werkruimten niet ondersteund. U moet handmatig koppelen aan een nieuwe omgeving of de standaardinstellingen van de werkruimte gebruiken om de taakdefinitie uit te voeren.
- De Spark-taakdefinitie behoudt de standaard lakehouse-ID bij het synchroniseren vanuit het repository naar een Fabric-werkruimte. Als je een notebook commit met het standaardlakehouse, moet je handmatig een verwijzing opnemen naar een nieuw aangemaakt lakehouse-item. Zie De Git-integratie van Lakehouse voor meer informatie.