การรวม Git ข้อกําหนดงานของ Spark

บทความนี้อธิบายวิธีการทํางานของการผสานรวม Git สําหรับคํานิยามงาน Spark (SJD) ใน Microsoft Fabric เรียนรู้วิธีการตั้งค่าการเชื่อมต่อที่เก็บ จัดการการเปลี่ยนแปลงข้อกําหนดงาน Spark ผ่านการควบคุมแหล่งข้อมูล และปรับใช้ข้ามพื้นที่ทํางานต่าง ๆ

เมื่อคุณเปิดใช้งานการผสานรวม Git สําหรับการกําหนดงาน Spark ใน Azure DevOps คุณจะสามารถติดตามการเปลี่ยนแปลงผ่านประวัติ Git ทั้งหมดได้ หากคุณเลือก PySpark หรือ SparkR ไฟล์คําจํากัดความหลักและไฟล์อ้างอิงจะถูกรวมอยู่ในคอมมิต การผสานรวม Git ยังติดตามการเปลี่ยนแปลงของซอร์สโค้ดภายในไฟล์เหล่านี้ด้วย

สำคัญ

คุณลักษณะนี้อยู่ในตัวอย่าง

ตั้งค่าการเชื่อมต่อ

จากการตั้งค่าพื้นที่ทํางานของคุณ คุณสามารถตั้งค่าการเชื่อมต่อไปยัง repo ของคุณเพื่อบันทึกและซิงค์การเปลี่ยนแปลงได้อย่างง่ายดาย หากต้องการตั้งค่าการเชื่อมต่อ โปรดดู เริ่มต้นใช้งานการรวม Git หลังจากเชื่อมต่อแล้ว คุณจะเห็นรายการของคุณ เช่น คํานิยามงานของ Spark ในแผงควบคุมต้นทาง

สกรีนช็อตของแผงควบคุมแหล่งที่มาของพื้นที่ทํางาน

หลังจากที่คุณ commit การกําหนดงาน Spark ไปยัง repo Git โครงสร้างโฟลเดอร์ job definition จะปรากฏใน repository

การแทนคํานิยามงานของ Spark ใน Git

ภาพต่อไปนี้แสดงตัวอย่างโครงสร้างไฟล์สําหรับแต่ละรายการกําหนดงาน Spark ในรีโป:

สกรีนช็อตของโครงสร้างไฟล์ของ git git sjd

เมื่อคุณ commit รายการ Spark job definition ไปยัง repo จะมีการสร้างโฟลเดอร์ Git สําหรับแต่ละรายการและตั้งชื่อตามสคีมานี้: <Item name> + "SparkJobDefinition" อย่าเปลี่ยนชื่อโฟลเดอร์ เพราะโฟลเดอร์นี้ใช้ติดตามรายการใน workspace ตัวอย่างเช่น หากชื่อรายการคือ "sjd1" ชื่อโฟลเดอร์ Git คือ "sjd1SparkJobDefinition"

โฟลเดอร์ Git ประกอบด้วยซับโฟลเดอร์สองตัว คือ โฟลเดอร์หลักและโฟลเดอร์อ้างอิง โฟลเดอร์ หลัก มีไฟล์คําจํากัดความหลัก และโฟลเดอร์ อ้างอิง จะมีไฟล์อ้างอิง

นอกจากไฟล์หลักและไฟล์อ้างอิงแล้ว ยังมี ไฟล์ SparkJobDefinitionV1.json อีกด้วย ซึ่งมีเมตาดาต้าสําหรับรายการข้อกําหนดงาน Spark ดังนั้นอย่าปรับเปลี่ยน ไฟล์ .platform มีข้อมูลแพลตฟอร์มที่เกี่ยวข้องกับการตั้งค่า Git อย่าแก้ไขไฟล์นี้เช่นกัน

หมายเหตุ

  • ถ้าคุณเลือก Java หรือ Scala เป็นภาษา ไฟล์หลักและไฟล์อ้างอิงจะไม่ถูกบันทึกเมื่ออัปโหลดเป็นไฟล์ .jar
  • สภาพแวดล้อมที่แนบมายังคงอยู่ในข้อกําหนดงาน Spark หลังจากการซิงค์จากที่เก็บกับพื้นที่ทํางาน Fabric ในขณะนี้ ยังไม่รองรับสภาพแวดล้อมการอ้างอิงข้ามพื้นที่ทํางาน คุณต้องแนบกับสภาพแวดล้อมใหม่ด้วยตนเอง หรือใช้การตั้งค่าเริ่มต้นของพื้นที่ทํางานเพื่อเรียกใช้ข้อกําหนดงาน
  • ข้อกําหนดงาน Spark ยังคงเป็น ID ของ lakehouse ค่าเริ่มต้นเมื่อซิงค์จากที่เก็บไปยังพื้นที่ทํางาน Fabric ถ้าคุณ commit สมุดบันทึกที่มี lakehouse เริ่มต้น คุณต้องอ้างอิงรายการ lakehouse ที่สร้างใหม่ด้วยตนเอง สําหรับข้อมูลเพิ่มเติม ดู การรวมของ Lakehouse Git