กระบวนการผสานรวมและปรับใช้ใน Git สําหรับการทดลองและโมเดลการเรียนรู้ของเครื่อง (ตัวอย่าง)

การทดลองและโมเดลการเรียนรู้ของเครื่องใน Microsoft Fabric ผสานรวมกับกระบวนการบูรณาการและการปรับใช้ Git ความสามารถเหล่านี้จะติดตามและส่งเสริมเมตาดาต้าของการทดลองและโมเดล ในขณะที่การทดลองและเวอร์ชันโมเดลจะอยู่ในที่เก็บข้อมูล workspace และไม่ได้รับเวอร์ชันหรือโปรโมท

สําหรับภาพรวมของกระบวนการปล่อยเวอร์ชันที่กว้างขึ้น โปรดดูที่ การจัดการวงจรชีวิตใน Microsoft Fabric คืออะไร?

สําคัญ

คุณลักษณะนี้อยู่ในตัวอย่าง

การทดลองและโมเดลการเรียนรู้ของเครื่อง การรวม Git

การทดลองและแบบจําลองแมชชีนเลิร์นนิง (ML) มีทั้งข้อมูลเมตาและข้อมูล การทดลอง ML มี runs, ในขณะที่โมเดล ML มี model versions. จากมุมมองของเวิร์กโฟลว์การพัฒนา สมุดบันทึก อาจอ้างอิงถึงการทดลองหรือโมเดล ML

ข้อมูลไม่ได้ถูกเก็บไว้ใน Git;มีเพียงเมตาดาต้าของอาร์ติแฟกต์เท่านั้นที่ถูกติดตาม โดยค่าเริ่มต้น จะจัดการการทดลองและโมเดล ML ผ่านกระบวนการซิงค์และอัปเดต Git แต่experiment runsmodel versionsไม่ได้ถูกติดตามหรือมีเวอร์ชันใน Git ข้อมูลของพวกเขายังคงอยู่ในพื้นที่จัดเก็บ การอ้างอิงการพึ่งพาที่รองรับอาจผูกกับพื้นที่ทํางานต่าง ๆ เมื่อ Fabric แสดงด้วย Logical ID แบบพกพา พฤติกรรมการผูกขึ้นอยู่กับประเภทของรายการและรูปแบบการอ้างอิง

การไหลของวงจรชีวิต

  1. การผสานรวม Git จะทําการลําดับข้อมูลเมตาของการทดลองและโมเดลเพื่อให้สามารถซิงโครไนซ์และปรับเวอร์ชันได้
  2. การซิงโครไนซ์ Git จะเปลี่ยนแปลงเมตาดาต้าระหว่างที่เก็บข้อมูลที่เชื่อมต่อและพื้นที่ทํางาน
  3. Deployment pipeline ส่งเสริมข้อมูลเมตาของอาร์ติแฟกต์ที่รองรับระหว่างพื้นที่ทํางานสําหรับการพัฒนา ทดสอบ และการผลิต
  4. การรันการทดลองและเวอร์ชันโมเดลจะยังคงอยู่ในพื้นที่จัดเก็บพื้นที่ทํางานและไม่ได้รวมอยู่ในเส้นทางการซิงโครไนซ์ทั้งสองเส้นทาง

การเป็นตัวแทน Git

พื้นที่ทํางานที่เชื่อมต่อ Git สําหรับการทดลองและโมเดลการเรียนรู้ของเครื่องจะทําการลําดับและติดตามข้อมูลดังต่อไปนี้:

  • ชื่อที่แสดง
  • เวอร์ชัน. ฟิลด์นี้ version ระบุเวอร์ชันของรูปแบบไฟล์ระบบที่ควบคุมแหล่งที่มา มันไม่ใช่เวอร์ชันของโมเดล ML
  • การระบุเหตุผล ค่านี้เป็นlogicalIdตัวระบุข้ามพื้นที่ทํางานที่สร้างขึ้นโดยอัตโนมัติซึ่ง Fabric ใช้เชื่อมโยงรายการกับตัวแทนควบคุมต้นทาง สําหรับข้อมูลเพิ่มเติม ดูที่ Logical ID ใน Fabric
  • การพึ่งพา การอ้างอิงการพึ่งพาที่รองรับอาจผูกกับพื้นที่ทํางานที่เชื่อมต่อ Git ได้ การผูกขึ้นอยู่กับประเภทรายการและรูปแบบการอ้างอิง การอ้างอิงที่ยังคงใช้รหัสเฉพาะพื้นที่ทํางานอาจต้องการการอัปเดตด้วยตนเองหรือการกําหนดพารามิเตอร์

สําคัญ

เฉพาะการทดสอบแมชชีนเลิร์นนิงและข้อมูลเมตาของสิ่งประดิษฐ์แบบจําลองเท่านั้นที่จะถูกติดตามใน Git ในประสบการณ์ปัจจุบัน การเรียกใช้การทดสอบ และ เวอร์ชันของแบบจําลอง (ผลลัพธ์การเรียกใช้และข้อมูลแบบจําลอง) จะไม่ถูกจัดเก็บหรือกําหนดเวอร์ชันใน Git ข้อมูลของพวกเขายังคงอยู่ในที่เก็บข้อมูลพื้นที่ทํางาน

ความสามารถในการรวม Git

ความสามารถต่อไปนี้พร้อมใช้งาน:

  • อนุกรมการทดสอบ ML และข้อมูลเมตาของสิ่งประดิษฐ์แบบจําลองเป็นการแสดง JSON ที่ติดตามโดย Git
  • รองรับพื้นที่ทํางานหลายรายการที่เชื่อมโยงกับสาขา Git เดียวกัน ทําให้ข้อมูลเมตาที่ติดตามสามารถซิงค์ระหว่างพื้นที่ทํางานได้ แต่ละพื้นที่ทํางานสามารถเชื่อมต่อกับสาขาได้เพียงสาขาเดียวในแต่ละครั้ง
  • อนุญาตให้ใช้การอัปเดตโดยตรงหรือควบคุมผ่านคําขอดึงข้อมูลเพื่อจัดการการเปลี่ยนแปลงระหว่างพื้นที่ทํางาน/สาขาต้นน้ําและปลายน้ํา
  • ติดตามการเปลี่ยนชื่อของการทดสอบและแบบจําลองใน Git เพื่อรักษาข้อมูลประจําตัวในพื้นที่ทํางาน
  • ไม่มีการดําเนินการใดๆ กับ experiment runs หรือ model versions; ข้อมูลของพวกเขาจะถูกเก็บรักษาไว้ในที่เก็บข้อมูลพื้นที่ทํางาน และไม่ได้จัดเก็บหรือเขียนทับโดย Git

การทดลองและแบบจําลองการเรียนรู้ของเครื่องในไปป์ไลน์การปรับใช้

กระบวนการติดตั้ง Microsoft Fabric รองรับการทดลองและโมเดลการเรียนรู้ของเครื่อง (ML) พวกเขาช่วยให้คุณแบ่งกลุ่มสภาพแวดล้อมสําหรับการพัฒนา ทดสอบ และการผลิต สําหรับคําแนะนํา โปรดดูแนวทางปฏิบัติที่ดีที่สุดสําหรับการจัดการวงจรชีวิต

สําคัญ

ปัจจุบัน Deployment pipeline จะปรับใช้เฉพาะข้อมูลเมตาที่รองรับสําหรับการทดลองและโมเดล machine learning เท่านั้น การทดลอง และ เวอร์ชันโมเดล ไม่ใช่ payload สําหรับการติดตั้ง การติดตั้งเมตาดาต้าจะไม่ซิงโครไนซ์หรือเขียนทับข้อมูลของพวกมัน

ความสามารถในการรวมไปป์ไลน์การปรับใช้การทดลองและโมเดล ML:

  • รองรับการปรับใช้การทดลองและโมเดล ML ในพื้นที่ทํางานการพัฒนา การทดสอบ และการผลิต
  • การปรับใช้จะซิงโครไนซ์เฉพาะเมตาดาต้าอาร์ติแฟกต์ที่รองรับเท่านั้น experiment runs และ model versions ไม่ได้ซิงโครไนซ์ระหว่างพื้นที่ทํางาน
  • การเปลี่ยนชื่อของการทดสอบและแบบจําลองจะถูกเผยแพร่ทั่วพื้นที่ทํางานเมื่อรวมอยู่ในไปป์ไลน์การปรับใช้
  • การอ้างอิงการพึ่งพาที่รองรับระหว่างสมุดบันทึก การทดลอง และโมเดล อาจเชื่อมโยงกันข้ามพื้นที่ทํางานระหว่างการปรับใช้ท่อส่งข้อมูล การผูกขึ้นอยู่กับประเภทรายการและรูปแบบการอ้างอิง