Definicja zadania platformy Spark integracja z Gitem

Ten artykuł wyjaśnia, jak działa integracja Git dla definicji zadań Spark (SJD) w Microsoft Fabric. Dowiedz się, jak skonfigurować połączenie repozytorium, zarządzać zmianami definicji zadań platformy Spark za pomocą kontroli źródła i wdrażać je w różnych obszarach roboczych.

Gdy włączysz integrację z Gitem dla definicji zadań Spark w Azure DevOps, możesz śledzić zmiany w pełnej historii Gita. Jeśli wybierzesz PySpark lub SparkR, główny plik definicji i plik referencyjny są dołączone do commitu. Integracja z Gitem śledzi także zmiany w kodzie źródłowym w tych plikach.

Ważne

Ta funkcja jest dostępna w wersji zapoznawczej.

Konfigurowanie połączenia

Z poziomu ustawień obszaru roboczego można łatwo skonfigurować połączenie z repozytorium w celu zatwierdzania i synchronizowania zmian. Aby skonfigurować połączenie, zobacz Wprowadzenie do integracji z usługą Git. Po połączeniu możesz zobaczyć swoje elementy, takie jak definicje zadań Spark, w panelu kontroli wersji źródłowej .

Zrzut ekranu przedstawiający panel sterowania źródła obszaru roboczego.

Po zatwierdzeniu definicji zadania Spark do repozytorium Git, struktura folderu z definicją pracy pojawia się w repozytorium.

Reprezentacja definicji stanowisk Spark w Git

Poniższy obraz przedstawia przykład struktury pliku dla każdego elementu definicji zadania Spark w repozytorium:

Zrzut ekranu przedstawiający strukturę plików repozytorium Git sjd.

Gdy zatwierdzasz element definicji zadania Spark do repozytorium, dla każdego elementu tworzy się folder Git i nazywa go według tego schematu: <Item name> + "SparkJobDefinition". Nie zmieniaj nazwy folderu, bo służy do śledzenia przedmiotu w przestrzeni roboczej. Na przykład, jeśli nazwa elementu to "sjd1", nazwa folderu Git to "sjd1SparkJobDefinition".

Folder Git zawiera dwa podfoldery: main i reference. Główny folder zawiera główny plik definicji, a folder referencyjny zawiera plik referencyjny.

Oprócz plików głównych i referencyjnych istnieje również plik SparkJobDefinitionV1.json . Przechowuje metadane elementu definicji zadania platformy Spark, więc nie modyfikuj go. Plik .platform zawiera informacje o platformie związane z konfiguracją Gita. Nie modyfikuj też tego pliku.

Uwaga

  • Jeśli wybierzesz Java lub Scalę jako język, główny i referencyjny pliki nie zostaną zatwierdzone po przesłaniu jako plik .jar.
  • Dołączone środowisko pozostaje w definicji zadania Spark po synchronizacji z repozytorium do obszaru roboczego Fabric. Obecnie środowiska referencyjne między obszarami roboczymi nie są obsługiwane. Aby uruchomić definicję zadania, musisz ręcznie dołączyć do nowego środowiska lub użyć domyślnych ustawień obszaru roboczego.
  • Definicja zadania Spark zachowuje domyślny identyfikator elementu Lakehouse podczas synchronizacji z repozytorium do obszaru roboczego usługi Fabric. Jeśli zapisujesz notes z domyślnym elementem lakehouse, musisz ręcznie odwołać się do nowo utworzonego elementu lakehouse. Aby uzyskać więcej informacji, zobacz integrację usługi Lakehouse z usługą Git.