การปรับปรุงรูบริกใน Copilot Agent Kit

การปรับปรุงรูบริกใน Copilot Agent Kit ช่วยให้คุณสร้าง ทดสอบ และปรับปรุงมาตรฐานการประเมินผลที่นํากลับมาใช้ซ้ําได้ (rubrics) สําหรับคําตอบที่สร้างโดย AI คุณลักษณะนี้ช่วยให้มั่นใจว่าการไล่ระดับ AI ของการตอบสนองของตัวแทนของคุณสอดคล้องกับการตัดสินของมนุษย์และมาตรฐานคุณภาพองค์กร

การประเมินตัวแทนและระบบผู้ตัดสิน AI

ผู้พิพากษา AI เป็นรูปแบบภาษาขนาดใหญ่ (LLM) ที่ประเมินคุณภาพของการตอบสนองของตัวแทนของคุณโดยใช้รูเบิลที่คุณกําหนด AI พิพากษาเลียนแบบสิ่งที่นักประเมินของมนุษย์ทําเมื่อประเมินคุณภาพการตอบสนอง แต่จะทํางานโดยอัตโนมัติและในระดับมาตราส่วน

ความแม่นยําของการไล่ระดับขึ้นอยู่กับว่ารูบิกจับมาตรฐานคุณภาพของคุณได้ดีเพียงใด หากไม่มีวิธีการที่เป็นระบบในการปรับปรุงเกณฑ์การประเมินผล องค์กรจะต้องต่อสู้กับ:

  • กําหนดมาตรฐานการประเมินผลที่ชัดเจนเฉพาะโดเมน
  • เปรียบเทียบการไล่ระดับด้วย AI กับความคาดหวังของมนุษย์
  • ระบุส่วนที่คำแนะนำในเกณฑ์การประเมินไม่สามารถครอบคลุมเกณฑ์คุณภาพตามที่ตั้งใจไว้ได้
  • สร้างความน่าเชื่อถือในผลลัพธ์การประเมิน AI สําหรับกรณีการใช้งานขององค์กรที่สําคัญ

การปรับแต่งรูบิคส์เน้นความท้าทายเหล่านี้โดยให้เวิร์กโฟลว์แบบซ้ํา ๆ ที่ทําให้การไล่ระดับ AI สอดคล้องกับการตัดสินของมนุษย์

ประโยชน์

  • มาตรฐานการประเมินผลที่นํามาใช้ใหม่ได้: กําหนดรูบิวต์หนึ่งครั้งและนํากลับมาใช้ใหม่ในตัวแทนหลายแห่งและทดสอบการทํางาน
  • สอดคล้องกับการตัดสินของมนุษย์: ลดความไม่สอดคล้องกันระหว่าง AI และผู้ประเมินที่เป็นระบบ
  • การประกันคุณภาพ: สร้างสินทรัพย์ขององค์กรที่ทนทานซึ่งเข้ารหัสมาตรฐานคุณภาพขององค์กร
  • ความเชื่อมั่นในการประเมิน AI: สร้างความน่าเชื่อถือในการไล่ระดับสีอัตโนมัติผ่านการปรับแต่งแบบโปร่งใสและวนซ้ํา

เกณฑ์การประเมินเป็นมาตรฐานในการประเมิน

รูบิคเป็นชุดที่มีโครงสร้างของคําแนะนําในการไล่ระดับภาษาธรรมชาติที่ผู้พิพากษา AI ใช้เพื่อประเมินคุณภาพของการตอบสนองของตัวแทน เกณฑ์การประเมินรวมถึง:

  • คําอธิบาย "คําตอบที่ดีเป็นอย่างไร"
  • คํานิยามเกรดสําหรับมาตราส่วน 5 จุด (เช่น 5 สําหรับตัวอย่าง 1 สําหรับการปรับปรุงความต้องการ)
  • ตัวอย่างที่ดีและไม่ดีที่เป็นทางเลือกที่แสดงมาตรฐานคุณภาพ

การไล่ระดับด้วย AI เทียบกับการไล่ระดับของมนุษย์

  • การให้คะแนน AI: ผู้พิพากษา AI (LLM) ใช้รูบิคเพื่อประเมินคําตอบ จะสร้างเกรด (1-5) และเหตุผลซึ่งอธิบายการประเมิน
  • การไล่ระดับของมนุษย์: นักประเมินของมนุษย์ (ผู้สร้าง) ประเมินการตอบสนองเดียวกัน พวกเขาให้เกรดของตัวเอง (1-5) และให้เหตุผล
  • การเปรียบเทียบ: โดยการเปรียบเทียบการประเมินสองรายการนี้ คุณระบุตําแหน่งที่รูบิกต้องการการปรับปรุง

การจัดแนวและความไม่สอดคล้อง

  • การจัดแนว: เมื่อคะแนนจาก AI ตรงกับคะแนนจากมนุษย์ rubric จะทำงานได้ตามที่ตั้งใจไว้
  • ความไม่สอดคล้อง: เมื่อเกรดของ AI แตกต่างจากเกรดของมนุษย์ เกณฑ์การประเมินต้องการการปรับปรุง

กระบวนการกลั่นซ้ํา

การปรับแต่งรูบิคเป็นกระบวนการทําซ้ํา ทำตามขั้นตอนเหล่านี้:

  1. กําหนด rubric เริ่มต้นด้วยเกณฑ์การประเมิน
  2. เรียกใช้การทดสอบโดยใช้รูบิกเพื่อสร้างเกรด AI
  3. ตรวจสอบการตอบสนองของตัวแทนและให้เกรดของมนุษย์
  4. เปรียบเทียบการประเมิน AI และมนุษย์เพื่อระบุความไม่ตรงกัน
  5. ทําเครื่องหมายตัวอย่างที่ดีและไม่ดีเพื่อแนะนําการปรับแต่ง
  6. ปรับแต่งเกณฑ์โดยใช้การวิเคราะห์ AI ของรูปแบบที่ไม่สอดคล้อง
  7. เรียกใช้การทดสอบอีกครั้งด้วยรูบิคที่อัปเดตแล้ว
  8. ทําซ้ําจนกว่าการจัดแนวจะยอมรับได้

เป้าหมายหลัก

เป้าหมายของการปรับแต่งรูบริกไม่ใช่เพื่อให้การตอบสนองทั้งหมดได้คะแนน 5 (ยอดเยี่ยม) เป้าหมายคือการลดความไม่ตรงกันระหว่าง AI และนักเรียนระดับประถมศึกษา

การเพิ่มประสิทธิภาพการตอบสนอง—จริง ๆ แล้วปรับปรุงคุณภาพคําตอบของตัวแทนของคุณ —เกิดขึ้นใน Copilot Studio เอง การปรับแต่งรูบิคมุ่งเน้นเพียงเพื่อให้มั่นใจว่าเกณฑ์การประเมินของคุณสะท้อนการตัดสินของมนุษย์อย่างถูกต้องดังนั้นคุณสามารถไว้วางใจผลลัพธ์การไล่ระดับสีอัตโนมัติ

โหมดของการใช้งานรูบิค

เกณฑ์การตรวจใน Copilot Agent Kit มีวัตถุประสงค์สองประการที่แตกต่างกัน:

  • โหมดการทดสอบ (ระดับกรณีทดสอบ)

    • วัตถุประสงค์: การทดสอบอัตโนมัติทั่วไปที่มีเกณฑ์การไล่ระดับแบบกําหนดเอง
    • การกําหนดค่า: กําหนด rubric ที่ระดับกรณีการทดสอบแต่ละรายการ
    • กรณีการใช้งาน: การรับประกันคุณภาพอย่างต่อเนื่องสําหรับกรณีทดสอบ Generative Answer
    • ผ่าน/ล้มเหลว: เกรดมากกว่าหรือเท่ากับค่าเกณฑ์เกรดส่งผ่าน (ค่าเริ่มต้น: 5)
  • โหมดการปรับปรุง (ระดับการเรียกใช้การทดสอบ)

    • วัตถุประสงค์: ปรับแต่งและปรับปรุงรูบริคอย่างต่อเนื่อง
    • การกําหนดค่า: กําหนด rubric ที่ระดับการเรียกใช้การทดสอบ
    • กรณีการใช้งาน: เวิร์กโฟลว์การปรับแต่งเกณฑ์การประเมินโดยเฉพาะ
      • ผ่าน / ล้มเหลว: เกรดที่ผ่านเป็นเพียงข้อมูลเพื่อการแจ้งเท่านั้น เป้าหมายคือการทำให้สอดคล้องกัน ไม่ใช่แค่คะแนนที่ผ่านเกณฑ์
    • ความแตกต่างที่สําคัญ: AI ให้เหตุผลโดยละเอียด (มีราคาแพงกว่า) เพื่อสนับสนุนการวิเคราะห์

ใครควรใช้การปรับปรุงเกณฑ์การประเมิน

การปรับแต่งรูบริคเหมาะสําหรับ:

  • ทีมประกันคุณภาพ: กําหนดมาตรฐานการประเมินที่สอดคล้องกันทั่วทั้งตัวแทน
  • ผู้สร้าง: สร้างการทดสอบอัตโนมัติที่เชื่อถือได้โดยใช้คําตอบที่สร้าง
  • องค์กรองค์กร: กําหนดมาตรฐานคุณภาพระดับองค์กรเฉพาะโดเมน
  • ทุกคนที่ต้องการความไว้วางใจในการประเมิน AI: ทีมที่ต้องการความมั่นใจในการไล่ระดับอัตโนมัติสําหรับกรณีการใช้งานที่สําคัญ

มีอะไรรวมอยู่ในการเผยแพร่นี้บ้าง

  • การจัดการรูบิคที่สมบูรณ์ (สร้าง ดู แก้ไข ทําซ้ํา ลบ)
  • การกําหนด Rubric ที่ระดับการเรียกใช้การทดสอบ (สําหรับการปรับแต่ง) และระดับกรณีการทดสอบ (สําหรับการทดสอบ)
  • เลือกเกรดผ่านการกำหนดที่แตกต่างอย่างชัดเจนระหว่างโหมดการทดสอบกับการปรับปรุง
  • มุมมองการปรับแต่งสองแบบ: มาตรฐาน (เกรด AI ที่ซ่อนอยู่เพื่อหลีกเลี่ยงอคติ) และแบบเต็ม (มองเห็นเกรด AI)
  • มุมมองโดยละเอียดสําหรับการให้คะแนนคําตอบที่ยาวขึ้น
  • ความสามารถในการทําเครื่องหมายกรณีทดสอบเป็นตัวอย่างที่ดีหรือไม่ดี
  • การปรับแต่งรูบิคที่ขับเคลื่อนด้วย AI ตามการวิเคราะห์การจัดแนว
  • บันทึกและบันทึกเป็นตัวเลือกสําหรับการรักษาเวอร์ชัน rubric
  • การสนับสนุนสำหรับเวิร์กโฟลว์การปรับแต่งแบบวนซ้ำ

มีการวางแผนสําหรับการเผยแพร่ในอนาคตอย่างไร

  • สร้างชุดการทดสอบโดยอัตโนมัติจากบทสนทนาการสนทนา
  • การวินิจฉัยและการวิเคราะห์ที่ปรับปรุงประสิทธิภาพแล้ว
  • การกำกับดูแลการใช้งานของ Rubric รวมถึงกระบวนการอนุมัติ วงจรชีวิต และการเผยแพร่
  • อินเทอร์เฟซการปรับปรุงเกณฑ์การให้คะแนนแบบเฉพาะที่ดีขึ้น

เริ่มต้นใช้งาน

การเริ่มใช้การปรับแต่งหลักเกณฑ์:

  1. สร้าง rubric ที่กําหนดมาตรฐานคุณภาพของคุณ
  2. เตรียมกรณีการทดสอบด้วยชนิดการทดสอบคําตอบที่สร้าง
  3. กําหนดค่าการทดสอบการเรียกใช้ เพื่อการปรับปรุงรูบิก
  4. ทำตาม เวิร์กโฟลว์การปรับเกณฑ์ เพื่อให้ AI สอดคล้องกับการตัดสินของมนุษย์

ขั้นตอนต่อไป