หมายเหตุ
การเข้าถึงหน้านี้ต้องได้รับการอนุญาต คุณสามารถลอง ลงชื่อเข้าใช้หรือเปลี่ยนไดเรกทอรีได้
การเข้าถึงหน้านี้ต้องได้รับการอนุญาต คุณสามารถลองเปลี่ยนไดเรกทอรีได้
บทความนี้อธิบายวิธีการทํางานของการผสานรวม Git สําหรับคํานิยามงาน Spark (SJD) ใน Microsoft Fabric เรียนรู้วิธีการตั้งค่าการเชื่อมต่อที่เก็บ จัดการการเปลี่ยนแปลงข้อกําหนดงาน Spark ผ่านการควบคุมแหล่งข้อมูล และปรับใช้ข้ามพื้นที่ทํางานต่าง ๆ
เมื่อคุณเปิดใช้งานการผสานรวม Git สําหรับการกําหนดงาน Spark ใน Azure DevOps คุณจะสามารถติดตามการเปลี่ยนแปลงผ่านประวัติ Git ทั้งหมดได้ หากคุณเลือก PySpark หรือ SparkR ไฟล์คําจํากัดความหลักและไฟล์อ้างอิงจะถูกรวมอยู่ในคอมมิต การผสานรวม Git ยังติดตามการเปลี่ยนแปลงของซอร์สโค้ดภายในไฟล์เหล่านี้ด้วย
สำคัญ
คุณลักษณะนี้อยู่ในตัวอย่าง
ตั้งค่าการเชื่อมต่อ
จากการตั้งค่าพื้นที่ทํางานของคุณ คุณสามารถตั้งค่าการเชื่อมต่อไปยัง repo ของคุณเพื่อบันทึกและซิงค์การเปลี่ยนแปลงได้อย่างง่ายดาย หากต้องการตั้งค่าการเชื่อมต่อ โปรดดู เริ่มต้นใช้งานการรวม Git หลังจากเชื่อมต่อแล้ว คุณจะเห็นรายการของคุณ เช่น คํานิยามงานของ Spark ในแผงควบคุมต้นทาง
หลังจากที่คุณ commit การกําหนดงาน Spark ไปยัง repo Git โครงสร้างโฟลเดอร์ job definition จะปรากฏใน repository
การแทนคํานิยามงานของ Spark ใน Git
ภาพต่อไปนี้แสดงตัวอย่างโครงสร้างไฟล์สําหรับแต่ละรายการกําหนดงาน Spark ในรีโป:
เมื่อคุณ commit รายการ Spark job definition ไปยัง repo จะมีการสร้างโฟลเดอร์ Git สําหรับแต่ละรายการและตั้งชื่อตามสคีมานี้: <Item name> + "SparkJobDefinition" อย่าเปลี่ยนชื่อโฟลเดอร์ เพราะโฟลเดอร์นี้ใช้ติดตามรายการใน workspace ตัวอย่างเช่น หากชื่อรายการคือ "sjd1" ชื่อโฟลเดอร์ Git คือ "sjd1SparkJobDefinition"
โฟลเดอร์ Git ประกอบด้วยซับโฟลเดอร์สองตัว คือ โฟลเดอร์หลักและโฟลเดอร์อ้างอิง โฟลเดอร์ หลัก มีไฟล์คําจํากัดความหลัก และโฟลเดอร์ อ้างอิง จะมีไฟล์อ้างอิง
นอกจากไฟล์หลักและไฟล์อ้างอิงแล้ว ยังมี ไฟล์ SparkJobDefinitionV1.json อีกด้วย ซึ่งมีเมตาดาต้าสําหรับรายการข้อกําหนดงาน Spark ดังนั้นอย่าปรับเปลี่ยน ไฟล์ .platform มีข้อมูลแพลตฟอร์มที่เกี่ยวข้องกับการตั้งค่า Git อย่าแก้ไขไฟล์นี้เช่นกัน
หมายเหตุ
- ถ้าคุณเลือก Java หรือ Scala เป็นภาษา ไฟล์หลักและไฟล์อ้างอิงจะไม่ถูกบันทึกเมื่ออัปโหลดเป็นไฟล์ .jar
- สภาพแวดล้อมที่แนบมายังคงอยู่ในข้อกําหนดงาน Spark หลังจากการซิงค์จากที่เก็บกับพื้นที่ทํางาน Fabric ในขณะนี้ ยังไม่รองรับสภาพแวดล้อมการอ้างอิงข้ามพื้นที่ทํางาน คุณต้องแนบกับสภาพแวดล้อมใหม่ด้วยตนเอง หรือใช้การตั้งค่าเริ่มต้นของพื้นที่ทํางานเพื่อเรียกใช้ข้อกําหนดงาน
- ข้อกําหนดงาน Spark ยังคงเป็น ID ของ lakehouse ค่าเริ่มต้นเมื่อซิงค์จากที่เก็บไปยังพื้นที่ทํางาน Fabric ถ้าคุณ commit สมุดบันทึกที่มี lakehouse เริ่มต้น คุณต้องอ้างอิงรายการ lakehouse ที่สร้างใหม่ด้วยตนเอง สําหรับข้อมูลเพิ่มเติม ดู การรวมของ Lakehouse Git