Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Ten artykuł wyjaśnia, jak działa integracja Git dla definicji zadań Spark (SJD) w Microsoft Fabric. Dowiedz się, jak skonfigurować połączenie repozytorium, zarządzać zmianami definicji zadań platformy Spark za pomocą kontroli źródła i wdrażać je w różnych obszarach roboczych.
Gdy włączysz integrację z Gitem dla definicji zadań Spark w Azure DevOps, możesz śledzić zmiany w pełnej historii Gita. Jeśli wybierzesz PySpark lub SparkR, główny plik definicji i plik referencyjny są dołączone do commitu. Integracja z Gitem śledzi także zmiany w kodzie źródłowym w tych plikach.
Ważne
Ta funkcja jest dostępna w wersji zapoznawczej.
Konfigurowanie połączenia
Z poziomu ustawień obszaru roboczego można łatwo skonfigurować połączenie z repozytorium w celu zatwierdzania i synchronizowania zmian. Aby skonfigurować połączenie, zobacz Wprowadzenie do integracji z usługą Git. Po połączeniu możesz zobaczyć swoje elementy, takie jak definicje zadań Spark, w panelu kontroli wersji źródłowej .
Po zatwierdzeniu definicji zadania Spark do repozytorium Git, struktura folderu z definicją pracy pojawia się w repozytorium.
Reprezentacja definicji stanowisk Spark w Git
Poniższy obraz przedstawia przykład struktury pliku dla każdego elementu definicji zadania Spark w repozytorium:
Gdy zatwierdzasz element definicji zadania Spark do repozytorium, dla każdego elementu tworzy się folder Git i nazywa go według tego schematu: <Item name> + "SparkJobDefinition". Nie zmieniaj nazwy folderu, bo służy do śledzenia przedmiotu w przestrzeni roboczej. Na przykład, jeśli nazwa elementu to "sjd1", nazwa folderu Git to "sjd1SparkJobDefinition".
Folder Git zawiera dwa podfoldery: main i reference. Główny folder zawiera główny plik definicji, a folder referencyjny zawiera plik referencyjny.
Oprócz plików głównych i referencyjnych istnieje również plik SparkJobDefinitionV1.json . Przechowuje metadane elementu definicji zadania platformy Spark, więc nie modyfikuj go. Plik .platform zawiera informacje o platformie związane z konfiguracją Gita. Nie modyfikuj też tego pliku.
Uwaga
- Jeśli wybierzesz Java lub Scalę jako język, główny i referencyjny pliki nie zostaną zatwierdzone po przesłaniu jako plik .jar.
- Dołączone środowisko pozostaje w definicji zadania Spark po synchronizacji z repozytorium do obszaru roboczego Fabric. Obecnie środowiska referencyjne między obszarami roboczymi nie są obsługiwane. Aby uruchomić definicję zadania, musisz ręcznie dołączyć do nowego środowiska lub użyć domyślnych ustawień obszaru roboczego.
- Definicja zadania Spark zachowuje domyślny identyfikator elementu Lakehouse podczas synchronizacji z repozytorium do obszaru roboczego usługi Fabric. Jeśli zapisujesz notes z domyślnym elementem lakehouse, musisz ręcznie odwołać się do nowo utworzonego elementu lakehouse. Aby uzyskać więcej informacji, zobacz integrację usługi Lakehouse z usługą Git.