หมายเหตุ
การเข้าถึงหน้านี้ต้องได้รับการอนุญาต คุณสามารถลอง ลงชื่อเข้าใช้หรือเปลี่ยนไดเรกทอรีได้
การเข้าถึงหน้านี้ต้องได้รับการอนุญาต คุณสามารถลองเปลี่ยนไดเรกทอรีได้
หลังจากที่คุณตีความคะแนนการประเมินและระบุประเด็นโฟกัสแล้ว ให้พิจารณาว่าเหตุใดกรณีทดสอบแต่ละกรณีจึงล้มเหลวและใครต้องดำเนินการ
บทความนี้ให้แนวทางที่มีโครงสร้างสำหรับการวินิจฉัยความล้มเหลวในระดับกรณีทดสอบ ช่วยให้คุณจำแนกสาเหตุรากเหง้า แยกแยะระหว่างปัญหาเอเจนต์ การประเมิน และโครงสร้างพื้นฐาน และเลือกการดำเนินการถัดไปที่เหมาะสม
ก่อนที่คุณเริ่มต้น
ก่อนที่คุณจะเริ่มการวิเคราะห์และจัดลำดับความสำคัญของความล้มเหลว:
- ทำการตีความคะแนนและการประเมินความพร้อม และระบุว่าชุดการประเมินใดที่ต้องให้ความสนใจ
- มุ่งเน้นไปที่ความล้มเหลวที่มีลำดับความสำคัญสูงสุดโดยพิจารณาจากความพร้อมและความเสี่ยง
สำคัญ
หากคุณข้ามขั้นตอนนี้ คุณอาจใช้เวลากับปัญหาที่มีผลกระทบต่ำหรือไม่เป็นอุปสรรค
การตรวจสอบก่อนการคัดแยก: ตรวจสอบสุขภาพของโครงสร้างพื้นฐาน:
ก่อนจะวินิจฉัยความล้มเหลวแต่ละกรณี ให้ยืนยันว่าระบบหรือบริการที่ต้องพึ่งพาอยู่ในสภาพปกติระหว่างการประเมินผล ปัญหาโครงสร้างพื้นฐานอาจทำให้เกิดความล้มเหลวที่ดูเหมือนเป็นปัญหาของเอเจนต์หรือระบบประเมินผล ทั้งที่จริงแล้วไม่ได้เกี่ยวข้องกัน
ตรวจสอบเงื่อนไขต่อไปนี้:
- แหล่งความรู้ต้องเข้าถึงได้และผ่านการจัดทำดัชนีอย่างสมบูรณ์
- แบ็กเอนด์หรือตัวเชื่อมต่อ API ต้องไม่ส่งคืนข้อผิดพลาด การหมดเวลา หรือการตอบสนองแบบจำกัดอัตรา
- โทเค็นรับรองความถูกต้องต้องมีผลตลอดการรัน
- สภาพแวดล้อมการประเมินตรงกับการตั้งค่าคอนฟิกของเอเจนต์ที่กำหนดไว้
หากส่วนที่ต้องพึ่งพาขัดข้อง ให้แก้ไขปัญหาและเรียกใช้การประเมินอีกครั้งก่อนดำเนินการต่อ การคัดแยกผลลัพธ์จากการประเมินที่มีปัญหาอาจนำไปสู่ข้อสรุปที่ไม่ถูกต้อง
ขั้นตอนที่ 0: จัดลำดับความสำคัญของความล้มเหลว:
ก่อนที่คุณจะคัดแยกกรณีทดสอบ ให้ตัดสินใจว่าจะเน้นที่ใดก่อน
จัดลำดับความสำคัญของความล้มเหลวตามลำดับนี้:
| ลำดับความสำคัญ | คัดแยกก่อน | เหตุผล |
|---|---|---|
| 1 | ความล้มเหลวในด้านความปลอดภัยและการปฏิบัติตามกฎระเบียบ | ผลกระทบสูงสุด แก้ไขความล้มเหลวเหล่านี้ก่อนการปรับใช้ |
| 2 | ความล้มเหลวของสถานการณ์ทางธุรกิจหลัก | ส่งผลโดยตรงต่อข้อเสนอคุณค่าของเอเจนต์ |
| 3 | ความล้มเหลวในชุดการประเมินที่มีคะแนนต่ำสุด | น่าจะเป็นปัญหาเชิงระบบ การแก้ไขสาเหตุที่แท้จริงอาจแก้ไขความล้มเหลวหลายกรณี |
| 4 | ความล้มเหลวที่เกิดซ้ำในหลายรอบการทดสอบ | ความล้มเหลวที่สม่ำเสมอจะวินิจฉัยได้ง่ายกว่า |
| 5 | ความล้มเหลวของสถานการณ์ความสามารถ | สำคัญ แต่โดยทั่วไปแล้วผลกระทบจะต่ำกว่า |
หากคุณมีความล้มเหลวจำนวนมาก (เช่น มากกว่า 15 ครั้ง) อย่าตรวจสอบแต่ละกรณีทีละรายการ เริ่มต้นด้วยชุดการประเมินที่ให้คะแนนต่ำสุดและตรวจสอบความล้มเหลวด้วยตนเองสักสองสามรายการ หากปัญหาเหล่านั้นเกิดจากสาเหตุเดียวกัน การแก้ไขสาเหตุนั้นจะสามารถแก้ไขความล้มเหลวจำนวนมากได้ในคราวเดียว
ระบุสัญญาณคุณภาพสำหรับการทดสอบที่ล้มเหลว
หากผลการประเมินแสดงกรณีทดสอบที่ล้มเหลวแต่ไม่ชี้ชัดถึงสัญญาณคุณภาพ ให้ใช้ชุดการประเมินและวิธีการให้คะแนนเพื่ออนุมานสัญญาณคุณภาพนั้น
ตัวอย่างเช่น
- ชุดการประเมินจะระบุขอบเขตความสามารถ เช่น ความปลอดภัย การอ้างอิงข้อเท็จจริง หรือการใช้เครื่องมือ
- วิธีการให้คะแนน เช่น การจับคีย์เวิร์ดหรือการให้คะแนนตามรูบริก จะให้ข้อมูลบริบทเพิ่มเติม
การระบุสัญญาณคุณภาพที่ตั้งใจไว้ช่วยให้คุณเลือกคำถามสำหรับการวิเคราะห์ที่เกี่ยวข้องมากที่สุด
ขั้นตอนที่ 1: ตรวจสอบการตั้งค่าการประเมิน:
สำคัญ
เริ่มต้นจากที่นี่ก่อนเสมอ ก่อนที่จะตรวจสอบเอเจนต์ ให้ตรวจสอบว่าการตั้งค่าการประเมินถูกต้อง
สำหรับความล้มเหลวแต่ละครั้ง ให้ตรวจสอบการตอบที่แท้จริงของเอเจนต์ด้วยตนเองควบคู่ไปกับค่าที่คาดหวังและวิธีการให้คะแนน
ทำตามคำถามต่อไปนี้ตามลำดับ หยุดเมื่อคุณได้ผลลัพธ์
การตอบของตัวแทนเป็นที่ยอมรับหรือไม่ ผู้ใช้จริงจะพอใจกับคำตอบนี้แม้ว่าจะไม่ผ่านการประเมินหรือไม่
- ถ้าใช่ การตั้งค่าการประเมินมีปัญหา: เกรดเดอร์หรือค่าที่คาดไว้ไม่ถูกต้อง
- ถ้าไม่ ให้ดำเนินการต่อในคำถามถัดไป
คำตอบที่คาดหวังเป็นปัจจุบันและถูกต้องตามแหล่งที่มาหรือไม่
- ถ้าใช่ ให้ดำเนินการต่อในคำถามถัดไป
- ถ้าไม่ การตั้งค่าการประเมินมีปัญหา: คำตอบที่คาดหวังเป็นข้อมูลเก่าหรือผิดพลาด
กรณีทดสอบสอดคล้องกับการป้อนข้อมูลของผู้ใช้ที่สมจริงหรือไม่
- ถ้าใช่ ให้ดำเนินการต่อในคำถามถัดไป
- ถ้าไม่ แสดงว่าการตั้งค่าการประเมินมีปัญหา: กรณีทดสอบไม่สมจริง
ทางเลือกในการตอบที่สมเหตุสมผลอาจถูกต้องได้หรือไม่ แต่เกรดเดอร์ไม่อนุญาต
- ถ้าใช่ การตั้งค่าการประเมินมีปัญหา: เกรดเดอร์เข้มงวดเกินไปและไม่คำนึงถึงคำตอบที่หลากหลายที่ถูกต้อง
- ถ้าไม่ ให้ดำเนินการต่อในคำถามถัดไป
วิธีการประเมินเหมาะสมกับสิ่งที่คุณกำลังทดสอบหรือไม่
- ถ้าใช่ การประเมินถือว่าถูกต้อง ดำเนินการต่อไปยังขั้นตอนที่ 2: วินิจฉัยเอเจนต์
- ถ้าไม่ แสดงว่าการตั้งค่าการประเมินมีปัญหา: วิธีการประเมินไม่เหมาะกับสัญญาณคุณภาพนี้
การพิจารณาความเหมาะสมของการตอบสนอง
ใช้สัญญาณต่อไปนี้เพื่อช่วยพิจารณาว่าการตอบสนองของเอเจนต์เป็นที่ยอมรับหรือไม่:
- ข้อเท็จจริงสำคัญเดียวกัน ถ้อยคำต่างกัน → มักเป็นที่ยอมรับ (เกรดเดอร์อาจเข้มงวดเกินไป)
- ขาดข้อมูลสำคัญที่พบในแหล่งที่มา → มักไม่เป็นที่ยอมรับ
- เกณฑ์ "ดีพอ" ที่คลุมเครือ → เกณฑ์การยอมรับอาจไม่ชัดเจน (ตั้งค่าสถานะสำหรับขั้นตอนที่ 4)
หากคุณไม่แน่ใจ ให้เปรียบเทียบเนื้อหากับแหล่งที่มาดั้งเดิม ไม่ใช่แค่คำตอบที่คาดหวัง
สัญญาณเหล่านี้ช่วยประกอบการตัดสินใจของคุณ แต่ไม่สามารถมาแทนที่การตัดสินใจของคุณได้
ประเภทความล้มเหลวที่พบได้บ่อยในการตั้งค่าการประเมิน
| ชนิดความล้มเหลว | คำอธิบาย | ตัวอย่าง |
|---|---|---|
| คำตอบที่คาดหวังล้าสมัย | เนื้อหาต้นฉบับเปลี่ยนไป แต่คำตอบที่คาดหวังไม่ได้รับการอัปเดต | นโยบายอัปเดตเป็น 15 วัน แต่การประเมินยังคงคาดหวัง "กรอบเวลาการคืนสินค้า 30 วัน" |
| เกรดเดอร์ที่เข้มงวดเกินไป | การจับคู่คีย์เวิร์ดล้มเหลวเมื่อใช้คำพ้องหรือการปรับถ้อยคำ | คาดหวังว่าเป็น "น้ำเย็น" แต่เอเจนต์การตอบว่า "น้ำเย็น 30 องศาเซลเซียส" ซึ่งถือว่าถูกต้องในทางความหมาย |
| กรณีทดสอบที่ไม่สมจริง | สถานการณ์ทดสอบไม่เป็นตัวแทนของลักษณะการทำงานของผู้ใช้จริง | ทดสอบคำถามที่มีความยาว 4 ย่อหน้า ในขณะที่ผู้ใช้จริงมักพิมพ์เพียง 5-10 คำ |
| วิธีการประเมินไม่ถูกต้อง | วิธีการประเมินไม่สอดคล้องกับสิ่งที่คุณกำลังทดสอบ | การใช้ Keyword match (All) กับคำถามสังเคราะห์ ซึ่งควรใช้ Compare meaning แทน |
| ข้อผิดพลาดด้านข้อเท็จจริงของผู้ให้คะแนน | โมเดลภาษาในฐานะผู้ตัดสินสร้างเหตุผลความล้มเหลวที่ไม่มีอยู่จริง (ข้อผิดพลาดเฉพาะกรณี) | เกรดเดอร์โมเดลภาษา กล่าวว่า "การตอบไม่ได้กล่าวถึงนโยบายการคืนสินค้า" ทั้งที่มีการกล่าวถึงอย่างชัดเจน |
| อคติเชิงระบบของเกรดเดอร์ | โมเดลภาษาในฐานะผู้ตัดสินใช้มาตรฐานที่ไม่สอดคล้องกันในกรณีทดสอบ (ปัญหาการสอบเทียบ) | ผู้ให้คะแนนให้ผ่านสำหรับคำตอบสั้นๆ แต่ล้มเหลวในการให้ผ่านคำตอบยาวๆ ที่มีสัญญาณคุณภาพเดียวกันโดยไม่สนใจเนื้อหา |
| เกณฑ์การยอมรับที่ไม่ชัดเจน | ค่าที่คาดหวังสามารถตีความได้หลากหลายวิธี | "ควรรวมข้อมูลราคา" รายเดือนใช่ไหม รายปีใช่ไหม ต่อผู้ใช้ใช่ไหม |
การตรวจสอบความน่าเชื่อถือของเกรดเดอร์
ความน่าเชื่อถือของเกรดเดอร์เป็นข้อกำหนดเบื้องต้นสำหรับการคัดแยกที่เชื่อถือได้ หากผู้ให้คะแนนเชื่อถือไม่ได้ คุณจะวินิจฉัยทุกความล้มเหลวที่เกี่ยวข้องผิดพลาด
เพื่อยืนยันความน่าเชื่อถือของเกรดเดอร์:
- เลือกกรณีทดสอบ 5-10 กรณีที่คุณทราบผลลัพธ์การผ่าน/ไม่ผ่านที่ถูกต้องจากการตรวจสอบด้วยตนเอง
- ดำเนินการประเมินและเปรียบเทียบผลลัพธ์ของเกรดเดอร์กับคำตัดสินจากการตรวจสอบด้วยตนเอง
- หากผู้ให้คะแนนไม่เห็นด้วยกับกรณีมากกว่า 20% ให้ปรับเทียบผู้ให้คะแนนใหม่ก่อนที่จะดีบักเอเจนต์
สัญญาณที่ผู้ให้คะแนนต้องให้ความสนใจ:
- กรณีทดสอบเดียวกันให้คำตัดสินที่แตกต่างกันในแต่ละการรัน
- คลัสเตอร์ความล้มเหลวในชุดการประเมินที่ใช้การให้คะแนนตามโมเดลในขณะที่วิธีการกำหนดผ่าน
- ผู้ให้คะแนนแจ้งปัญหาที่คุณไม่สามารถทำซ้ำได้โดยการตรวจสอบการตอบของเอเจนต์
ตัวเลือกการปรับเทียบเกรดเดอร์:
- ใช้วิธีการแบบกำหนดแน่นอนเมื่อเป็นไปได้
- เพิ่มตัวอย่าง "ยอมรับได้" และ "ยอมรับไม่ได้" ที่ชัดเจนลงในเกณฑ์การให้คะแนน
- ขยายชุดคำสำคัญเพื่อรวมคำพ้องความหมายและถ้อยคำที่แตกต่างแต่ถูกต้อง
- ใช้ เปรียบเทียบความหมาย แทน การจับคู่คำสำคัญ (ALL) เพื่อการตรวจสอบความสมมูลทางความหมาย
ขั้นตอนที่ 2: วินิจฉัยเอเจนต์
ในขั้นตอนนี้ การประเมินผลถือว่าถูกต้อง และเอเจนต์ได้สร้างการตอบที่ไม่ถูกต้อง วินิจฉัยว่าเกิดมีอะไรผิดพลาดในการกำหนดค่าเอเจนต์
เคล็ดลับ
คำถามการวินิจฉัยบางข้อจำเป็นต้องเข้าถึงกระบวนการภายในที่เอเจนต์ดำเนินการ (เช่น แหล่งความรู้ที่ถูกเรียกใช้ เครื่องมือที่ถูกเรียก หรือหัวข้อที่ถูกกระตุ้น) ใช้บันทึกการติดตาม การถอดความ หรือข้อมูลการวิเคราะห์การทดสอบเมื่อมีให้ใช้งาน หากแพลตฟอร์มของคุณไม่เปิดเผยรายละเอียดเหล่านี้ ให้สันนิษฐานจากการตอบ (ตัวอย่างเช่น เนื้อหาที่ปรากฏเฉพาะในแหล่งข้อมูล A ก็น่าจะมาจากแหล่งข้อมูล A)
ตรวจสอบความถูกต้องตามข้อเท็จจริงและความล้มเหลวในการเชื่อมโยงกับแหล่งความรู้
| คำถาม | ถ้าใช่ → สาเหตุที่แท้จริง |
|---|---|
| เอเจนต์ดึงข้อมูลจากแหล่งความรู้ที่ไม่ถูกต้องหรือไม่ | การกำหนดค่าแหล่งความรู้ จัดทำดัชนีหรือจัดลำดับความสำคัญของแหล่งที่มาไม่ถูกต้อง |
| เอเจนต์ดึงแหล่งข้อมูลที่ถูกต้องแต่สกัดข้อมูลที่ผิดหรือไม่ | ช่องว่างของพร้อมท์หรือคำแนะนำ โมเดลต้องการคำแนะนำในการสกัด |
| เนื้อหาในแหล่งข้อมูลนั้นไม่ถูกต้องหรือล้าสมัยหรือไม่ | เนื้อหาแหล่งความรู้ อัปเดตเอกสารต้นฉบับ |
| เอเจนต์ตอบโดยไม่ใช้แหล่งความรู้ (แต่งคำตอบขึ้นมาเอง) หรือไม่ | การช่วยสำหรับการเข้าถึงแหล่งที่มา แหล่งที่มาไม่ได้รับการจัดทำดัชนี หรือการตั้งคำถามไม่ตรงกับคำศัพท์ของแหล่งที่มา |
| เอเจนต์ขัดแย้งกับข้อมูลที่อยู่ในแหล่งที่มาหรือไม่ | ข้อมูลไม่ถูกต้อง เพิ่มคำแนะนำในการเชื่อมโยงกับข้อมูลต้นทางอย่างชัดเจน |
ตรวจสอบความล้มเหลวในการเรียกใช้เครื่องมือ
| คำถาม | ถ้าใช่ → สาเหตุที่แท้จริง |
|---|---|
| เครื่องมือทำงานไม่ถูกต้องหรือไม่ | ความคลุมเครือของคำอธิบายเครื่องมือ คำอธิบายทับซ้อนกันระหว่างเครื่องมือ |
| เครื่องมือที่ถูกต้องถูกเรียกใช้งานด้วยพารามิเตอร์ที่ไม่ถูกต้องหรือไม่ | ข้อกำหนดพารามิเตอร์ สคีมาหรือคำอธิบายไม่ชัดเจน |
| เครื่องมือไม่ถูกเรียกใช้งานเลยหรือไม่ | เงื่อนไขทริกเกอร์ อินพุตไม่ตรงตามเกณฑ์การเรียกใช้ |
| เครื่องมือถูกเรียกใช้เมื่อไม่ควรหรือไม่ | ขาดการป้องกันเชิงลบ ไม่มีคำแนะนำว่าเมื่อใดที่ไม่ควรเรียกเครื่องมือ |
| เครื่องมือทำงานอย่างถูกต้อง แต่การตอบนำผลลัพธ์ไปใช้ผิดหรือไม่ | คำแนะนำการตอบกลับ เอเจนต์ต้องการคำแนะนำเกี่ยวกับการจัดรูปแบบเอาต์พุตของเครื่องมือ |
| เครื่องมือถูกเรียกใช้งานอย่างถูกต้อง แต่ตัวเครื่องมือเองล้มเหลว (เกิดข้อผิดพลาด หมดเวลา ข้อมูลไม่ถูกต้อง) หรือไม่ | ปัญหาเกี่ยวกับเครื่องมือหรือการเชื่อมต่อ ความล้มเหลวเกิดขึ้นในระบบแบ็กเอนด์ ไม่ใช่กับตัวเอเจนต์ แก้ไขเครื่องมือ ไม่ใช่เอเจนต์ |
ตรวจสอบความล้มเหลวในการกำหนดเส้นทางทริกเกอร์
| คำถาม | ถ้าใช่ → สาเหตุที่แท้จริง |
|---|---|
| หัวข้อทำงานไม่ถูกต้องหรือไม่ | ทริกเกอร์หัวข้อซ้อนทับกัน ทริกเกอร์มีความกำกวมระหว่างหัวข้อ |
| ไม่มีการเริ่มต้นหัวข้อ (แสดงหัวข้อสำรอง) หรือไม่ | ช่องว่างในการครอบคลุมหัวข้อ ไม่มีหัวข้อใดรองรับอินพุตประเภทนี้ |
| มีหัวข้อหลายหัวข้อที่ตรงกันแต่มีการแยกแยะความหมายที่ไม่ถูกต้องหรือไม่ | ตรรกะการแก้ไขความกำกวม โฟลว์การจัดลำดับความสำคัญหรือการชี้แจงถูกตั้งค่าผิดพลาด |
ตรวจสอบข้อผิดพลาดด้านน้ำเสียงและคุณภาพการตอบ
| คำถาม | ถ้าใช่ → สาเหตุที่แท้จริง |
|---|---|
| น้ำเสียงของเอเจนต์ไม่สอดคล้องกับคำแนะนำจากพร้อมท์ของระบบหรือไม่ | ช่องว่างของคำแนะนำด้านโทนเสียง แก้ไขคำแนะนำที่ขาดหายไปหรือขัดแย้งกัน |
| การตอบยาวเกินไปหรือกระชับเกินไปสำหรับคำถามหรือไม่ | คำแนะนำเกี่ยวกับรูปแบบ เพิ่มคำแนะนำเกี่ยวกับความยาวหรือโครงสร้าง |
| เอเจนต์ขาดความเห็นอกเห็นใจในบริบทที่ละเอียดอ่อนหรือไม่ | ขาดคำแนะนำเกี่ยวกับความเห็นอกเห็นใจ เพิ่มคำแนะนำที่ชัดเจนสำหรับการป้อนข้อมูลทางอารมณ์ |
| การตอบมีปัญหาเรื่องโครงสร้างหรือไม่ (ข้อความยาวติดกัน ไม่มีการแบ่งตอน) | คำแนะนำเกี่ยวกับรูปแบบ เพิ่มข้อกำหนดเกี่ยวกับการจัดรูปแบบ |
ตรวจสอบปัญหาด้านความปลอดภัยและข้อผิดพลาดเกี่ยวกับขอบเขต
| คำถาม | ถ้าใช่ → สาเหตุที่แท้จริง |
|---|---|
| เอเจนต์เปิดเผยข้อมูลระบบหรือไม่ | การป้องกันพร้อมท์ของระบบ เพิ่มคำแนะนำ "ห้ามเปิดเผย" |
| เอเจนต์ออกจากขอบเขตหรือไม่ | ช่องว่างในการกำหนดขอบเขต กำหนดขอบเขตให้ชัดเจนยิ่งขึ้น |
| เอเจนต์ปฏิบัติตามการฉีดพร้อมท์หรือไม่ | คำแนะนำเกี่ยวกับความปลอดภัย เพิ่มแนวทางการรับมือการโจมตีแบบปฏิปักษ์ |
| เอเจนต์จัดการข้อมูลส่วนบุคคลอย่างไม่ถูกต้องหรือไม่ | กฎการจัดการ PII เพิ่มคำแนะนำเกี่ยวกับการปกป้องข้อมูล |
ตรวจสอบการเลื่อนระดับและความล้มเหลวแบบเหมาะสม
| คำถาม | ถ้าใช่ → สาเหตุที่แท้จริง |
|---|---|
| เอเจนต์ไม่สามารถเลื่อนระดับเมื่อควรทำหรือไม่ | ตัวกระตุ้นการเลื่อนระดับ ไม่ได้กำหนดเกณฑ์หรือแคบเกินไป |
| เอเจนต์เลื่อนระดับเร็วกว่าที่ควรหรือไม่ | เกณฑ์การเลื่อนระดับ เกณฑ์ที่ละเอียดอ่อนเกินไป |
| การยกระดับทำให้สูญเสียบริบทการสนทนาหรือไม่ | การกำหนดค่าการส่งต่อ ไม่ได้ตั้งค่าการรักษาบริบท |
| เอเจนต์วนซ้ำโดยไม่ยอมรับความล้มเหลวหรือไม่ | ตรรกะสำรอง ยังไม่ได้ตั้งค่าขีดจำกัดการลองใหม่หรือลักษณะการทำงานแบบสำรอง |
หลังจากวินิจฉัยแล้ว จับคู่รูปแบบข้อผิดพลาดกับกลยุทธ์การแก้ไขตามสาเหตุหลัก
ขั้นตอนที่ 3: ระบุข้อจำกัดของแพลตฟอร์ม:
หากการประเมินถูกต้องและการปรับเปลี่ยนการตั้งค่าที่สมเหตุสมผลไม่ช่วยปรับปรุงผลลัพธ์ ปัญหาอาจเกิดจากข้อจำกัดของแพลตฟอร์ม
ตัวบ่งชี้ข้อจำกัดของแพลตฟอร์ม
| ตัวบ่งชี้ | สิ่งที่แนะนำ |
|---|---|
| ความล้มเหลวเดียวกันยังคงเกิดขึ้นแม้จะมีการเปลี่ยนพร้อมท์และการตั้งค่าหลายครั้ง | ไม่มีปัญหาการกำหนดค่า |
| กระบวนการดึงข้อมูลให้ผลลัพธ์เอกสารผิดอย่างต่อเนื่อง แม้จะตั้งค่าต้นทางถูกต้องแล้ว | ข้อจำกัดการจัดอันดับการดึงข้อมูล |
| เอเจนต์ไม่สามารถปฏิบัติการวิเคราะห์ที่จำเป็นได้แม้จะมีคำแนะนำที่ชัดเจน | ขอบเขตความสามารถของโมเดล |
| รูปแบบการประสานงานที่จำเป็นไม่ได้รับการสนับสนุนโดยตัวเลือกการกำหนดค่าใด ๆ | ข้อจำกัดตรรกะการประสานการทำงาน |
| เกรดเดอร์ตามโมเดลให้ผลผิดอย่างสม่ำเสมอแม้จะมีการปรับเกณฑ์การให้คะแนน | ข้อจำกัดโมเดลของผู้ให้คะแนน |
เส้นทางการดำเนินการสำหรับข้อจำกัดของแพลตฟอร์ม
- จัดทำเอกสารข้อจำกัดอย่างชัดเจน (สิ่งที่ล้มเหลว, สิ่งที่คุณพยายาม, และหลักฐานว่าไม่เกี่ยวข้องกับการกำหนดค่า)
- ใช้วิธีแก้ไขชั่วคราวเมื่อเป็นไปได้ (เช่น ปรับโครงสร้างเอกสารต้นฉบับเพื่อปรับปรุงการดึงข้อมูล)
- ทำเครื่องหมายกรณีทดสอบเป็นข้อจำกัดที่ทราบ หรือปรับเกณฑ์เพื่อไม่ให้ขัดขวางการดำเนินการอื่น ๆ
- เลื่อนระดับไปยังทีมแพลตฟอร์มพร้อมหลักฐาน
- ติดตามรายการในบันทึกความล้มเหลวสำหรับการประเมินใหม่เมื่ออัปเดตความสามารถของแพลตฟอร์ม
หลังจากจัดประเภทแล้ว ให้ตรวจสอบวิธีแก้ปัญหาชั่วคราวและคำแนะนำในการยกระดับเพื่อตอบสนองต่อข้อจำกัดของแพลตฟอร์ม
เมื่อความล้มเหลวไม่ตรงกับกรอบการทำงาน
ความล้มเหลวบางอย่างไม่สามารถระบุสาเหตุหลักได้อย่างชัดเจนเพียงสาเหตุเดียว ตัวอย่างทั่วไปคือ:
- ปัญหาคุณภาพข้อมูลฝั่งแบ็กเอนด์: เนื้อหาของแหล่งความรู้ถูกต้องในเชิงเทคนิคแต่เขียนอย่างคลุมเครือ ทำให้ทั้งตัวเอเจนต์และการประเมินไม่ถือว่าผิด
- ปัญหาโครงสร้างพื้นฐานที่เกิดขึ้นเป็นระยะ ๆ: การหมดเวลาของเครือข่าย, การจำกัดอัตรา API, และปัญหาตัวเชื่อมต่อที่ไม่สามารถทำซ้ำได้อย่างสม่ำเสมอ
- การเปลี่ยนแปลงเวอร์ชันของโมเดล: ลักษณะการทำงานของเอเจนต์เปลี่ยนไปหลังจากการอัปเดตแบบจำลองแพลตฟอร์มที่คุณไม่ได้เริ่มต้น
- กรณีทดสอบที่คลุมเครือ: สถานการณ์มีความคลุมเครือ และผู้ประเมินที่มีเหตุผลอาจมีความเห็นต่างกันเกี่ยวกับคำตอบที่ถูกต้อง
แนวทางปฏิบัติที่แนะนำ: บันทึกสิ่งที่คุณสังเกตเห็น (ข้อผิดพลาด, การตอบของเอเจนต์, และสิ่งที่คุณตรวจสอบ) บันทึกรายการเป็น "ไม่ได้จัดประเภท" ในบันทึกความล้มเหลว หากความล้มเหลวเกิดขึ้นซ้ำ มักจะสามารถจัดประเภทได้โดยใช้หลักฐานเพิ่มเติม
การจัดการสาเหตุร่วม
ความล้มเหลวเพียงหนึ่งครั้งสามารถมีรากเหง้าสาเหตุหลายประการร่วมกันได้ ตัวอย่างเช่น
- ตัวอย่างความล้มเหลวด้านความถูกต้องตามข้อเท็จจริง โดยคำตอบที่คาดหวังล้าสมัยเล็กน้อย (การตั้งค่าการประเมิน) และแหล่งความรู้ก็ไม่สมบูรณ์ (การตั้งค่าเอเจนต์)
- ความล้มเหลวในการเรียกใช้เครื่องมือที่เกิดขึ้นเมื่อคำอธิบายเครื่องมือไม่ชัดเจน (การกำหนดค่าเอเจนต์) และระบบออร์เคสเตรชันไม่รองรับการเรียกใช้เครื่องมือแบบมีเงื่อนไข (ข้อจำกัดของแพลตฟอร์ม)
แนวทางที่แนะนำ: ดำเนินการคัดแยกอย่างครบถ้วนสำหรับความล้มเหลวแต่ละครั้ง หากมีสาเหตุหลักหลายประเภท ให้แก้ไขตามลำดับความสำคัญ:
- แก้ไขการประเมินก่อน เพื่อรับข้อมูลที่ชัดเจนว่าการปรับเปลี่ยนเอเจนต์ช่วยได้จริงหรือไม่
- แก้ไขการกำหนดค่าเอเจนต์เพื่อพิจารณาว่าความล้มเหลวที่เหลืออยู่เป็นปัญหาของแพลตฟอร์มจริงหรือไม่
- จัดทำเอกสารข้อจำกัดของแพลตฟอร์มหลังจากแก้ไขข้อ 1 และ 2 แล้วเท่านั้น:
เรียกใช้กรณีทดสอบที่ได้รับผลกระทบอีกครั้งหลังจากการเปลี่ยนแปลงแต่ละครั้งก่อนดำเนินการต่อ
การจัดการความล้มเหลวในการสนทนาแบบหลายเทิร์น
สำหรับสถานการณ์แบบหลายเทิร์น ความล้มเหลวจะเกิดขึ้นเฉพาะระหว่างแต่ละเทิร์นเท่านั้น
เมื่อใดที่ควรสงสัยว่ามีปัญหาแบบหลายเทิร์น
- เอเจนต์ตอบถูกต้องในช่วงแรก ๆ แต่ขัดแย้งกับตัวเองในภายหลัง
- เอเจนต์สูญเสียบริบทจากการเรียกใช้เครื่องมือหรือการดึงข้อมูลความรู้ก่อนหน้าในเทิร์นถัดไป
- จังหวะเวลาการเลื่อนระดับจะสมเหตุสมผลก็ต่อเมื่อพิจารณาประวัติการสนทนาทั้งหมด
- น้ำเสียงของเอเจนต์แย่ลงเรื่อย ๆ เมื่อการสนทนายาวขึ้น
- เอเจนต์ขอข้อมูลที่ผู้ใช้ให้ไว้แล้ว
เคล็ดลับ
ความล้มเหลวอาจปรากฏในเทิร์นหลัง ในขณะที่สาเหตุที่แท้จริงเกิดขึ้นตั้งแต่ก่อนหน้า ย้อนกลับไปเพื่อหาจุดแรกที่การสนทนาเริ่มเปลี่ยนทิศทาง
คำถามวินิจฉัยเพิ่มเติม
| คำถาม | ถ้าใช่ → สาเหตุที่แท้จริง |
|---|---|
| ความล้มเหลวขึ้นอยู่กับข้อมูลจากเทิร์นก่อนหน้านี้ที่สูญหายหรือไม่ | ปัญหาการจัดการบริบท; สถานะการสนทนาไม่ถูกเก็บรักษาไว้ระหว่างรอบการสนทนา |
| เอเจนต์ขัดแย้งกับสิ่งที่พูดในรอบก่อนหน้าหรือไม่ | ขาดแนวทางในการรักษาความสอดคล้อง; ไม่มีคำแนะนำในการคงความต่อเนื่องระหว่างแต่ละเทิร์น |
| เอเจนต์ขอข้อมูลที่ผู้ใช้ให้ไว้แล้วอีกครั้งหรือไม่ | ปัญหาการดึงบริบท เอเจนต์ไม่อ้างอิงการสนทนาก่อนหน้านี้ |
| ความล้มเหลวเกิดขึ้นหลังจากหลายเทิร์น (5+) เท่านั้นหรือไม่ | ความยาวบริบทเกินขีดจำกัด |
คำแนะนำการแก้ไขสำหรับปัญหาแบบหลายรอบ
- การสูญเสียบริบท: ตรวจสอบการกำหนดค่าสถานะการสนทนา ตรวจสอบให้แน่ใจว่าผลลัพธ์ของเครื่องมือและข้อเท็จจริงสำคัญถูกเก็บรักษาไว้ในแต่ละเทิร์นของการสนทนา
- ความขัดแย้ง: เพิ่มคำแนะนำที่สอดคล้องกัน เช่น "รักษาความสอดคล้องกับคำตอบก่อนหน้าของคุณในการสนทนานี้"
- ถามซ้ำ: ตรวจสอบการกำหนดค่าหน่วยความจำการสนทนาของแพลตฟอร์ม
- การเสื่อมสภาพของการสนทนาที่ยาวนาน: พิจารณาการสรุปการสนทนาหรือกลยุทธ์การตัดแต่งบริบท
การตรวจสอบความถูกต้องของกรณีทดสอบที่ผ่าน (การตรวจสอบผลลัพธ์ที่ผิด)
เฟรมเวิร์กนี้มุ่งเน้นกรณีทดสอบที่ล้มเหลว อย่างไรก็ตาม กรณีทดสอบที่ผ่านอย่างไม่ถูกต้องสามารถสร้างช่องว่างด้านคุณภาพที่ซ่อนอยู่ได้
แนวทางปฏิบัติที่แนะนำ: ตรวจสอบด้วยตนเอง 5-10% ของกรณีทดสอบที่ผ่านต่อการประเมิน โดยเฉพาะอย่างยิ่งสำหรับ:
- การให้คะแนนด้วยโมเดล (มีความเสี่ยงสูงต่อผลบวกปลอม)
- ตัวชี้วัดเชิงอัตนัย (น้ำเสียง, ความเป็นประโยชน์)
- กรณีทดสอบที่เคยล้มเหลวแต่ตอนนี้ผ่านหลังจากการเปลี่ยนแปลง
หากคุณพบผลบวกปลอม ให้ปรับเทียบเกรดเดอร์
ขั้นตอนถัดไป
หลังจากเสร็จสิ้นการคัดแยกความล้มเหลว:
- ใช้เลเยอร์ 3: จับคู่รูปแบบความล้มเหลวกับกลยุทธ์การแก้ไขปัญหา
- ใช้เลเยอร์ 4: วิเคราะห์รูปแบบ เพื่อระบุปัญหาเชิงระบบ
- ทบทวนตัวอย่างที่ใช้งานได้จริง ซึ่งแสดงให้เห็นว่าชั้นต่าง ๆ ของเฟรมเวิร์กทำงานร่วมกันอย่างไรในสถานการณ์จริง