Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Dieser Artikel erklärt, wie die Git-Integration für Spark-Job-Definitionen (SJD) in Microsoft Fabric funktioniert. Hier erfahren Sie, wie Sie eine Repositoryverbindung einrichten, Änderungen von Spark-Auftragsdefinitionen über die Quellcodeverwaltung verwalten und in verschiedenen Arbeitsbereichen bereitstellen können.
Wenn Sie die Git-Integration für Spark-Job-Definitionen in Azure DevOps aktivieren, können Sie Änderungen über die gesamte Git-Historie verfolgen. Wenn du PySpark oder SparkR auswählst, sind die Hauptdefinitionsdatei und die Referenzdatei Teil des Commit enthalten. Die Git-Integration verfolgt auch Änderungen am Quellcode innerhalb dieser Dateien.
Wichtig
Dieses Feature befindet sich in der Vorschauphase.
Herstellen einer Verbindung
Über Ihre Arbeitsbereichseinstellungen können Sie ganz einfach eine Verbindung mit Ihrem Repository einrichten, um Änderungen zu committen und zu synchronisieren. Informationen zum Einrichten der Verbindung finden Sie unter Erste Schritte mit der Git-Integration. Nachdem du dich verbunden hast, kannst du deine Elemente, wie z. B. Spark-Job-Definitionen, im Quellcode-Kontrollpanel sehen.
Nachdem du die Definition des Spark-Jobs in das Git-Repository committet hast, erscheint die Ordnerstruktur der Job-Definition im Repository.
Spark-Job-Definitionsrepräsentation in Git
Das folgende Bild zeigt ein Beispiel für die Dateistruktur jedes Spark-Job-Definitionselements im Repo:
Wenn du das Spark-Job-Definitionselement im Repository committest, wird für jedes Element ein Git-Ordner erstellt und entsprechend folgendem Schema benannt: <Itemname> + "SparkJobDefinition". Benenne den Ordner nicht um, da er verwendet wird, um das Element im Arbeitsbereich zu identifizieren. Wenn zum Beispiel der Itemname "sjd1" ist, lautet der Git-Ordner "sjd1SparkJobDefinition".
Der Git-Ordner enthält zwei Unterordner: Hauptordner und Referenzordner. Der Hauptordner enthält die Hauptdefinitionsdatei, und der Referenzordner enthält die Referenzdatei.
Neben der Haupt- und Referenzdatei gibt es auch eine Datei SparkJobDefinitionV1.json. Sie enthält die Metadaten für das Spark-Auftragsdefinitionselement und darf deshalb nicht geändert werden. Die .platform-Datei enthält die Plattforminformationen zur Git-Einrichtung. Ändern Sie diese Datei auch nicht.
Hinweis
- Wenn du Java oder Scala als Sprache wählst, werden die Hauptdatei und die Referenzdateien beim Hochladen als .jar-Datei nicht eingecheckt.
- Die zugeordnete Umgebung bleibt nach der Synchronisierung aus dem Repository in einen Fabric-Arbeitsbereich in der Spark-Jobdefinition erhalten. Derzeit werden arbeitsbereichsübergreifende Verweisumgebungen nicht unterstützt. Sie müssen zum Ausführen der Auftragsdefinition manuell eine neue Umgebung anfügen oder Standardeinstellungen für einen Arbeitsbereich verwenden.
- Beim Synchronisieren vom Repository mit einem Fabric-Arbeitsbereich behält die Spark-Auftragsdefinition die Standard-Lakehouse-ID. Wenn du ein Notebook mit dem standardmäßigen Lakehouse eincheckst, musst du ein neu erstelltes Lakehouse-Element manuell referenzieren. Weitere Informationen finden Sie unter Lakehouse Git-Integration.