หมายเหตุ
การเข้าถึงหน้านี้ต้องได้รับการอนุญาต คุณสามารถลอง ลงชื่อเข้าใช้หรือเปลี่ยนไดเรกทอรีได้
การเข้าถึงหน้านี้ต้องได้รับการอนุญาต คุณสามารถลองเปลี่ยนไดเรกทอรีได้
การปรับปรุงรูบริกใน Copilot Agent Kit ช่วยให้คุณสร้าง ทดสอบ และปรับปรุงมาตรฐานการประเมินผลที่นํากลับมาใช้ซ้ําได้ (rubrics) สําหรับคําตอบที่สร้างโดย AI คุณลักษณะนี้ช่วยให้มั่นใจว่าการไล่ระดับ AI ของการตอบสนองของตัวแทนของคุณสอดคล้องกับการตัดสินของมนุษย์และมาตรฐานคุณภาพองค์กร
การประเมินตัวแทนและระบบผู้ตัดสิน AI
ผู้พิพากษา AI เป็นรูปแบบภาษาขนาดใหญ่ (LLM) ที่ประเมินคุณภาพของการตอบสนองของตัวแทนของคุณโดยใช้รูเบิลที่คุณกําหนด AI พิพากษาเลียนแบบสิ่งที่นักประเมินของมนุษย์ทําเมื่อประเมินคุณภาพการตอบสนอง แต่จะทํางานโดยอัตโนมัติและในระดับมาตราส่วน
ความแม่นยําของการไล่ระดับขึ้นอยู่กับว่ารูบิกจับมาตรฐานคุณภาพของคุณได้ดีเพียงใด หากไม่มีวิธีการที่เป็นระบบในการปรับปรุงเกณฑ์การประเมินผล องค์กรจะต้องต่อสู้กับ:
- กําหนดมาตรฐานการประเมินผลที่ชัดเจนเฉพาะโดเมน
- เปรียบเทียบการไล่ระดับด้วย AI กับความคาดหวังของมนุษย์
- ระบุส่วนที่คำแนะนำในเกณฑ์การประเมินไม่สามารถครอบคลุมเกณฑ์คุณภาพตามที่ตั้งใจไว้ได้
- สร้างความน่าเชื่อถือในผลลัพธ์การประเมิน AI สําหรับกรณีการใช้งานขององค์กรที่สําคัญ
การปรับแต่งรูบิคส์เน้นความท้าทายเหล่านี้โดยให้เวิร์กโฟลว์แบบซ้ํา ๆ ที่ทําให้การไล่ระดับ AI สอดคล้องกับการตัดสินของมนุษย์
ประโยชน์
- มาตรฐานการประเมินผลที่นํามาใช้ใหม่ได้: กําหนดรูบิวต์หนึ่งครั้งและนํากลับมาใช้ใหม่ในตัวแทนหลายแห่งและทดสอบการทํางาน
- สอดคล้องกับการตัดสินของมนุษย์: ลดความไม่สอดคล้องกันระหว่าง AI และผู้ประเมินที่เป็นระบบ
- การประกันคุณภาพ: สร้างสินทรัพย์ขององค์กรที่ทนทานซึ่งเข้ารหัสมาตรฐานคุณภาพขององค์กร
- ความเชื่อมั่นในการประเมิน AI: สร้างความน่าเชื่อถือในการไล่ระดับสีอัตโนมัติผ่านการปรับแต่งแบบโปร่งใสและวนซ้ํา
เกณฑ์การประเมินเป็นมาตรฐานในการประเมิน
รูบิคเป็นชุดที่มีโครงสร้างของคําแนะนําในการไล่ระดับภาษาธรรมชาติที่ผู้พิพากษา AI ใช้เพื่อประเมินคุณภาพของการตอบสนองของตัวแทน เกณฑ์การประเมินรวมถึง:
- คําอธิบาย "คําตอบที่ดีเป็นอย่างไร"
- คํานิยามเกรดสําหรับมาตราส่วน 5 จุด (เช่น 5 สําหรับตัวอย่าง 1 สําหรับการปรับปรุงความต้องการ)
- ตัวอย่างที่ดีและไม่ดีที่เป็นทางเลือกที่แสดงมาตรฐานคุณภาพ
การไล่ระดับด้วย AI เทียบกับการไล่ระดับของมนุษย์
- การให้คะแนน AI: ผู้พิพากษา AI (LLM) ใช้รูบิคเพื่อประเมินคําตอบ จะสร้างเกรด (1-5) และเหตุผลซึ่งอธิบายการประเมิน
- การไล่ระดับของมนุษย์: นักประเมินของมนุษย์ (ผู้สร้าง) ประเมินการตอบสนองเดียวกัน พวกเขาให้เกรดของตัวเอง (1-5) และให้เหตุผล
- การเปรียบเทียบ: โดยการเปรียบเทียบการประเมินสองรายการนี้ คุณระบุตําแหน่งที่รูบิกต้องการการปรับปรุง
การจัดแนวและความไม่สอดคล้อง
- การจัดแนว: เมื่อคะแนนจาก AI ตรงกับคะแนนจากมนุษย์ rubric จะทำงานได้ตามที่ตั้งใจไว้
- ความไม่สอดคล้อง: เมื่อเกรดของ AI แตกต่างจากเกรดของมนุษย์ เกณฑ์การประเมินต้องการการปรับปรุง
กระบวนการกลั่นซ้ํา
การปรับแต่งรูบิคเป็นกระบวนการทําซ้ํา ทำตามขั้นตอนเหล่านี้:
- กําหนด rubric เริ่มต้นด้วยเกณฑ์การประเมิน
- เรียกใช้การทดสอบโดยใช้รูบิกเพื่อสร้างเกรด AI
- ตรวจสอบการตอบสนองของตัวแทนและให้เกรดของมนุษย์
- เปรียบเทียบการประเมิน AI และมนุษย์เพื่อระบุความไม่ตรงกัน
- ทําเครื่องหมายตัวอย่างที่ดีและไม่ดีเพื่อแนะนําการปรับแต่ง
- ปรับแต่งเกณฑ์โดยใช้การวิเคราะห์ AI ของรูปแบบที่ไม่สอดคล้อง
- เรียกใช้การทดสอบอีกครั้งด้วยรูบิคที่อัปเดตแล้ว
- ทําซ้ําจนกว่าการจัดแนวจะยอมรับได้
เป้าหมายหลัก
เป้าหมายของการปรับแต่งรูบริกไม่ใช่เพื่อให้การตอบสนองทั้งหมดได้คะแนน 5 (ยอดเยี่ยม) เป้าหมายคือการลดความไม่ตรงกันระหว่าง AI และนักเรียนระดับประถมศึกษา
การเพิ่มประสิทธิภาพการตอบสนอง—จริง ๆ แล้วปรับปรุงคุณภาพคําตอบของตัวแทนของคุณ —เกิดขึ้นใน Copilot Studio เอง การปรับแต่งรูบิคมุ่งเน้นเพียงเพื่อให้มั่นใจว่าเกณฑ์การประเมินของคุณสะท้อนการตัดสินของมนุษย์อย่างถูกต้องดังนั้นคุณสามารถไว้วางใจผลลัพธ์การไล่ระดับสีอัตโนมัติ
โหมดของการใช้งานรูบิค
เกณฑ์การตรวจใน Copilot Agent Kit มีวัตถุประสงค์สองประการที่แตกต่างกัน:
โหมดการทดสอบ (ระดับกรณีทดสอบ)
- วัตถุประสงค์: การทดสอบอัตโนมัติทั่วไปที่มีเกณฑ์การไล่ระดับแบบกําหนดเอง
- การกําหนดค่า: กําหนด rubric ที่ระดับกรณีการทดสอบแต่ละรายการ
- กรณีการใช้งาน: การรับประกันคุณภาพอย่างต่อเนื่องสําหรับกรณีทดสอบ Generative Answer
- ผ่าน/ล้มเหลว: เกรดมากกว่าหรือเท่ากับค่าเกณฑ์เกรดส่งผ่าน (ค่าเริ่มต้น: 5)
โหมดการปรับปรุง (ระดับการเรียกใช้การทดสอบ)
- วัตถุประสงค์: ปรับแต่งและปรับปรุงรูบริคอย่างต่อเนื่อง
- การกําหนดค่า: กําหนด rubric ที่ระดับการเรียกใช้การทดสอบ
-
กรณีการใช้งาน: เวิร์กโฟลว์การปรับแต่งเกณฑ์การประเมินโดยเฉพาะ
- ผ่าน / ล้มเหลว: เกรดที่ผ่านเป็นเพียงข้อมูลเพื่อการแจ้งเท่านั้น เป้าหมายคือการทำให้สอดคล้องกัน ไม่ใช่แค่คะแนนที่ผ่านเกณฑ์
- ความแตกต่างที่สําคัญ: AI ให้เหตุผลโดยละเอียด (มีราคาแพงกว่า) เพื่อสนับสนุนการวิเคราะห์
ใครควรใช้การปรับปรุงเกณฑ์การประเมิน
การปรับแต่งรูบริคเหมาะสําหรับ:
- ทีมประกันคุณภาพ: กําหนดมาตรฐานการประเมินที่สอดคล้องกันทั่วทั้งตัวแทน
- ผู้สร้าง: สร้างการทดสอบอัตโนมัติที่เชื่อถือได้โดยใช้คําตอบที่สร้าง
- องค์กรองค์กร: กําหนดมาตรฐานคุณภาพระดับองค์กรเฉพาะโดเมน
- ทุกคนที่ต้องการความไว้วางใจในการประเมิน AI: ทีมที่ต้องการความมั่นใจในการไล่ระดับอัตโนมัติสําหรับกรณีการใช้งานที่สําคัญ
มีอะไรรวมอยู่ในการเผยแพร่นี้บ้าง
- การจัดการรูบิคที่สมบูรณ์ (สร้าง ดู แก้ไข ทําซ้ํา ลบ)
- การกําหนด Rubric ที่ระดับการเรียกใช้การทดสอบ (สําหรับการปรับแต่ง) และระดับกรณีการทดสอบ (สําหรับการทดสอบ)
- เลือกเกรดผ่านการกำหนดที่แตกต่างอย่างชัดเจนระหว่างโหมดการทดสอบกับการปรับปรุง
- มุมมองการปรับแต่งสองแบบ: มาตรฐาน (เกรด AI ที่ซ่อนอยู่เพื่อหลีกเลี่ยงอคติ) และแบบเต็ม (มองเห็นเกรด AI)
- มุมมองโดยละเอียดสําหรับการให้คะแนนคําตอบที่ยาวขึ้น
- ความสามารถในการทําเครื่องหมายกรณีทดสอบเป็นตัวอย่างที่ดีหรือไม่ดี
- การปรับแต่งรูบิคที่ขับเคลื่อนด้วย AI ตามการวิเคราะห์การจัดแนว
- บันทึกและบันทึกเป็นตัวเลือกสําหรับการรักษาเวอร์ชัน rubric
- การสนับสนุนสำหรับเวิร์กโฟลว์การปรับแต่งแบบวนซ้ำ
มีการวางแผนสําหรับการเผยแพร่ในอนาคตอย่างไร
- สร้างชุดการทดสอบโดยอัตโนมัติจากบทสนทนาการสนทนา
- การวินิจฉัยและการวิเคราะห์ที่ปรับปรุงประสิทธิภาพแล้ว
- การกำกับดูแลการใช้งานของ Rubric รวมถึงกระบวนการอนุมัติ วงจรชีวิต และการเผยแพร่
- อินเทอร์เฟซการปรับปรุงเกณฑ์การให้คะแนนแบบเฉพาะที่ดีขึ้น
เริ่มต้นใช้งาน
การเริ่มใช้การปรับแต่งหลักเกณฑ์:
- สร้าง rubric ที่กําหนดมาตรฐานคุณภาพของคุณ
- เตรียมกรณีการทดสอบด้วยชนิดการทดสอบคําตอบที่สร้าง
- กําหนดค่าการทดสอบการเรียกใช้ เพื่อการปรับปรุงรูบิก
- ทำตาม เวิร์กโฟลว์การปรับเกณฑ์ เพื่อให้ AI สอดคล้องกับการตัดสินของมนุษย์