Spark-työmäärityksen Git-integrointi

Tässä artikkelissa selitetään, miten Git-integraatio Spark-työmäärittelyille (SJD) toimii Microsoft Fabric -ohjelmassa. Opi määrittämään säilön yhteys, hallitsemaan Spark-työmäärityksen muutoksia lähteen hallinnan avulla ja ottamaan ne käyttöön eri työtiloissa.

Kun otat Git-integraation käyttöön Spark-työtehtävien määrittelyissä Azure DevOps:ssa, voit seurata muutoksia koko Git-historian kautta. Jos valitset PySparkin tai SparkR:n, päämäärittelytiedosto ja viitetiedosto sisältyvät commitiin. Git-integraatio seuraa myös näiden tiedostojen lähdekoodin muutoksia.

Tärkeä

Tämä ominaisuus on esikatselutilassa.

Yhteyden määrittäminen

Työtilan asetuksista voit helposti määrittää yhteyden säilöön vahvistusta ja muutosten synkronointiaksi. Yhteyden määrittämiseksi katso Git-integroinnin aloittamisen aloittaminen. Kun yhdistät, näet kohteesi, kuten Spark-tehtävien määritelmät, Lähdekoodin ohjauspaneelissa .

Näyttökuva työtilan lähteen ohjauspaneelista.

Kun olet sitoutunut Spark-tehtävän määritelmän Git-repositorioon, työmäärittelykansion rakenne ilmestyy repositorioon.

Spark-työn määrittelyn esitys Gitissä

Seuraava kuva näyttää esimerkin tiedostorakenteesta jokaiselle Spark-tehtävän määrittelykohteelle repossa:

Näyttökuva sjd Git -säilön tiedostorakenteesta.

Kun sitoudut Spark-työmäärittelykohteen repoon, jokaiselle kohteelle luodaan Git-kansio, joka nimetään tämän skeeman mukaan: <Item name> + "SparkJobDefinition". Älä nimeä kansiota uudelleen, sillä sitä käytetään kohteen seuraamiseen työtilassa. Esimerkiksi, jos kohteen nimi on "sjd1", Git-kansion nimi on "sjd1SparkJobDefinition".

Git-kansiossa on kaksi alikansiota: pääkansio ja viite. Pääkansio sisältää päämäärittelytiedoston ja viitekansio viitetiedoston.

Pää- ja viitetiedostojen lisäksi mukana on myös SparkJobDefinitionV1.json-tiedosto . Se sisältää Spark-työn määrityskohteen metatiedot, joten älä muokkaa sitä. .platform-tiedosto sisältää alustan tiedot Git-asennuksesta. Älä muokkaa tätä tiedostoa myöskään.

Muistiinpano

  • Jos valitset kieleksi Java tai Scalan, pää- ja viitetiedostot eivät ole sitoutuneita, kun ne ladataan .jar-tiedostona.
  • Liitetty ympäristö säilyy Spark-työmäärityksessä, kun se on synkronoitu säilöstä Fabric-työtilaan. Tällä hetkellä työtilojen välistä viiteympäristöä ei tueta. Sinun täytyy liittää manuaalisesti uuteen ympäristöön tai käyttää työtilan oletusasetuksia työn määrityksen suorittamiseen.
  • Spark-työmääritelmä säilyttää oletus lakehouse-tunnuksen synkronoitaessa säilöstä Fabric-työtilaan. Jos sitoudut muistikirjaan oletusjärvitalolla, sinun täytyy manuaalisesti viitata juuri luotuun järvitalon kohteeseen. Lisätietoja on kohdassa Lakehouse Git -integrointi.