ชั้นที่ 2: ความล้มเหลวของเอเจนต์คัดกรอง

หลังจากที่คุณตีความคะแนนการประเมินและระบุประเด็นโฟกัสแล้ว ให้พิจารณาว่าเหตุใดกรณีทดสอบแต่ละกรณีจึงล้มเหลวและใครต้องดำเนินการ

บทความนี้ให้แนวทางที่มีโครงสร้างสำหรับการวินิจฉัยความล้มเหลวในระดับกรณีทดสอบ ช่วยให้คุณจำแนกสาเหตุรากเหง้า แยกแยะระหว่างปัญหาเอเจนต์ การประเมิน และโครงสร้างพื้นฐาน และเลือกการดำเนินการถัดไปที่เหมาะสม

ก่อนที่คุณเริ่มต้น

ก่อนที่คุณจะเริ่มการวิเคราะห์และจัดลำดับความสำคัญของความล้มเหลว:

  1. ทำการตีความคะแนนและการประเมินความพร้อม และระบุว่าชุดการประเมินใดที่ต้องให้ความสนใจ
  2. มุ่งเน้นไปที่ความล้มเหลวที่มีลำดับความสำคัญสูงสุดโดยพิจารณาจากความพร้อมและความเสี่ยง

สำคัญ

หากคุณข้ามขั้นตอนนี้ คุณอาจใช้เวลากับปัญหาที่มีผลกระทบต่ำหรือไม่เป็นอุปสรรค

การตรวจสอบก่อนการคัดแยก: ตรวจสอบสุขภาพของโครงสร้างพื้นฐาน:

ก่อนจะวินิจฉัยความล้มเหลวแต่ละกรณี ให้ยืนยันว่าระบบหรือบริการที่ต้องพึ่งพาอยู่ในสภาพปกติระหว่างการประเมินผล ปัญหาโครงสร้างพื้นฐานอาจทำให้เกิดความล้มเหลวที่ดูเหมือนเป็นปัญหาของเอเจนต์หรือระบบประเมินผล ทั้งที่จริงแล้วไม่ได้เกี่ยวข้องกัน

ตรวจสอบเงื่อนไขต่อไปนี้:

  • แหล่งความรู้ต้องเข้าถึงได้และผ่านการจัดทำดัชนีอย่างสมบูรณ์
  • แบ็กเอนด์หรือตัวเชื่อมต่อ API ต้องไม่ส่งคืนข้อผิดพลาด การหมดเวลา หรือการตอบสนองแบบจำกัดอัตรา
  • โทเค็นรับรองความถูกต้องต้องมีผลตลอดการรัน
  • สภาพแวดล้อมการประเมินตรงกับการตั้งค่าคอนฟิกของเอเจนต์ที่กำหนดไว้

หากส่วนที่ต้องพึ่งพาขัดข้อง ให้แก้ไขปัญหาและเรียกใช้การประเมินอีกครั้งก่อนดำเนินการต่อ การคัดแยกผลลัพธ์จากการประเมินที่มีปัญหาอาจนำไปสู่ข้อสรุปที่ไม่ถูกต้อง

ขั้นตอนที่ 0: จัดลำดับความสำคัญของความล้มเหลว:

ก่อนที่คุณจะคัดแยกกรณีทดสอบ ให้ตัดสินใจว่าจะเน้นที่ใดก่อน

จัดลำดับความสำคัญของความล้มเหลวตามลำดับนี้:

ลำดับความสำคัญ คัดแยกก่อน เหตุผล
1 ความล้มเหลวในด้านความปลอดภัยและการปฏิบัติตามกฎระเบียบ ผลกระทบสูงสุด แก้ไขความล้มเหลวเหล่านี้ก่อนการปรับใช้
2 ความล้มเหลวของสถานการณ์ทางธุรกิจหลัก ส่งผลโดยตรงต่อข้อเสนอคุณค่าของเอเจนต์
3 ความล้มเหลวในชุดการประเมินที่มีคะแนนต่ำสุด น่าจะเป็นปัญหาเชิงระบบ การแก้ไขสาเหตุที่แท้จริงอาจแก้ไขความล้มเหลวหลายกรณี
4 ความล้มเหลวที่เกิดซ้ำในหลายรอบการทดสอบ ความล้มเหลวที่สม่ำเสมอจะวินิจฉัยได้ง่ายกว่า
5 ความล้มเหลวของสถานการณ์ความสามารถ สำคัญ แต่โดยทั่วไปแล้วผลกระทบจะต่ำกว่า

หากคุณมีความล้มเหลวจำนวนมาก (เช่น มากกว่า 15 ครั้ง) อย่าตรวจสอบแต่ละกรณีทีละรายการ เริ่มต้นด้วยชุดการประเมินที่ให้คะแนนต่ำสุดและตรวจสอบความล้มเหลวด้วยตนเองสักสองสามรายการ หากปัญหาเหล่านั้นเกิดจากสาเหตุเดียวกัน การแก้ไขสาเหตุนั้นจะสามารถแก้ไขความล้มเหลวจำนวนมากได้ในคราวเดียว

ระบุสัญญาณคุณภาพสำหรับการทดสอบที่ล้มเหลว

หากผลการประเมินแสดงกรณีทดสอบที่ล้มเหลวแต่ไม่ชี้ชัดถึงสัญญาณคุณภาพ ให้ใช้ชุดการประเมินและวิธีการให้คะแนนเพื่ออนุมานสัญญาณคุณภาพนั้น

ตัวอย่างเช่น

  • ชุดการประเมินจะระบุขอบเขตความสามารถ เช่น ความปลอดภัย การอ้างอิงข้อเท็จจริง หรือการใช้เครื่องมือ
  • วิธีการให้คะแนน เช่น การจับคีย์เวิร์ดหรือการให้คะแนนตามรูบริก จะให้ข้อมูลบริบทเพิ่มเติม

การระบุสัญญาณคุณภาพที่ตั้งใจไว้ช่วยให้คุณเลือกคำถามสำหรับการวิเคราะห์ที่เกี่ยวข้องมากที่สุด

ขั้นตอนที่ 1: ตรวจสอบการตั้งค่าการประเมิน:

สำคัญ

เริ่มต้นจากที่นี่ก่อนเสมอ ก่อนที่จะตรวจสอบเอเจนต์ ให้ตรวจสอบว่าการตั้งค่าการประเมินถูกต้อง

สำหรับความล้มเหลวแต่ละครั้ง ให้ตรวจสอบการตอบที่แท้จริงของเอเจนต์ด้วยตนเองควบคู่ไปกับค่าที่คาดหวังและวิธีการให้คะแนน

ทำตามคำถามต่อไปนี้ตามลำดับ หยุดเมื่อคุณได้ผลลัพธ์

  1. การตอบของตัวแทนเป็นที่ยอมรับหรือไม่ ผู้ใช้จริงจะพอใจกับคำตอบนี้แม้ว่าจะไม่ผ่านการประเมินหรือไม่

    • ถ้าใช่ การตั้งค่าการประเมินมีปัญหา: เกรดเดอร์หรือค่าที่คาดไว้ไม่ถูกต้อง
    • ถ้าไม่ ให้ดำเนินการต่อในคำถามถัดไป
  2. คำตอบที่คาดหวังเป็นปัจจุบันและถูกต้องตามแหล่งที่มาหรือไม่

    • ถ้าใช่ ให้ดำเนินการต่อในคำถามถัดไป
    • ถ้าไม่ การตั้งค่าการประเมินมีปัญหา: คำตอบที่คาดหวังเป็นข้อมูลเก่าหรือผิดพลาด
  3. กรณีทดสอบสอดคล้องกับการป้อนข้อมูลของผู้ใช้ที่สมจริงหรือไม่

    • ถ้าใช่ ให้ดำเนินการต่อในคำถามถัดไป
    • ถ้าไม่ แสดงว่าการตั้งค่าการประเมินมีปัญหา: กรณีทดสอบไม่สมจริง
  4. ทางเลือกในการตอบที่สมเหตุสมผลอาจถูกต้องได้หรือไม่ แต่เกรดเดอร์ไม่อนุญาต

    • ถ้าใช่ การตั้งค่าการประเมินมีปัญหา: เกรดเดอร์เข้มงวดเกินไปและไม่คำนึงถึงคำตอบที่หลากหลายที่ถูกต้อง
    • ถ้าไม่ ให้ดำเนินการต่อในคำถามถัดไป
  5. วิธีการประเมินเหมาะสมกับสิ่งที่คุณกำลังทดสอบหรือไม่

    • ถ้าใช่ การประเมินถือว่าถูกต้อง ดำเนินการต่อไปยังขั้นตอนที่ 2: วินิจฉัยเอเจนต์
    • ถ้าไม่ แสดงว่าการตั้งค่าการประเมินมีปัญหา: วิธีการประเมินไม่เหมาะกับสัญญาณคุณภาพนี้

การพิจารณาความเหมาะสมของการตอบสนอง

ใช้สัญญาณต่อไปนี้เพื่อช่วยพิจารณาว่าการตอบสนองของเอเจนต์เป็นที่ยอมรับหรือไม่:

  • ข้อเท็จจริงสำคัญเดียวกัน ถ้อยคำต่างกัน → มักเป็นที่ยอมรับ (เกรดเดอร์อาจเข้มงวดเกินไป)
  • ขาดข้อมูลสำคัญที่พบในแหล่งที่มา → มักไม่เป็นที่ยอมรับ
  • เกณฑ์ "ดีพอ" ที่คลุมเครือ → เกณฑ์การยอมรับอาจไม่ชัดเจน (ตั้งค่าสถานะสำหรับขั้นตอนที่ 4)

หากคุณไม่แน่ใจ ให้เปรียบเทียบเนื้อหากับแหล่งที่มาดั้งเดิม ไม่ใช่แค่คำตอบที่คาดหวัง

สัญญาณเหล่านี้ช่วยประกอบการตัดสินใจของคุณ แต่ไม่สามารถมาแทนที่การตัดสินใจของคุณได้

ประเภทความล้มเหลวที่พบได้บ่อยในการตั้งค่าการประเมิน

ชนิดความล้มเหลว คำอธิบาย ตัวอย่าง
คำตอบที่คาดหวังล้าสมัย เนื้อหาต้นฉบับเปลี่ยนไป แต่คำตอบที่คาดหวังไม่ได้รับการอัปเดต นโยบายอัปเดตเป็น 15 วัน แต่การประเมินยังคงคาดหวัง "กรอบเวลาการคืนสินค้า 30 วัน"
เกรดเดอร์ที่เข้มงวดเกินไป การจับคู่คีย์เวิร์ดล้มเหลวเมื่อใช้คำพ้องหรือการปรับถ้อยคำ คาดหวังว่าเป็น "น้ำเย็น" แต่เอเจนต์การตอบว่า "น้ำเย็น 30 องศาเซลเซียส" ซึ่งถือว่าถูกต้องในทางความหมาย
กรณีทดสอบที่ไม่สมจริง สถานการณ์ทดสอบไม่เป็นตัวแทนของลักษณะการทำงานของผู้ใช้จริง ทดสอบคำถามที่มีความยาว 4 ย่อหน้า ในขณะที่ผู้ใช้จริงมักพิมพ์เพียง 5-10 คำ
วิธีการประเมินไม่ถูกต้อง วิธีการประเมินไม่สอดคล้องกับสิ่งที่คุณกำลังทดสอบ การใช้ Keyword match (All) กับคำถามสังเคราะห์ ซึ่งควรใช้ Compare meaning แทน
ข้อผิดพลาดด้านข้อเท็จจริงของผู้ให้คะแนน โมเดลภาษาในฐานะผู้ตัดสินสร้างเหตุผลความล้มเหลวที่ไม่มีอยู่จริง (ข้อผิดพลาดเฉพาะกรณี) เกรดเดอร์โมเดลภาษา กล่าวว่า "การตอบไม่ได้กล่าวถึงนโยบายการคืนสินค้า" ทั้งที่มีการกล่าวถึงอย่างชัดเจน
อคติเชิงระบบของเกรดเดอร์ โมเดลภาษาในฐานะผู้ตัดสินใช้มาตรฐานที่ไม่สอดคล้องกันในกรณีทดสอบ (ปัญหาการสอบเทียบ) ผู้ให้คะแนนให้ผ่านสำหรับคำตอบสั้นๆ แต่ล้มเหลวในการให้ผ่านคำตอบยาวๆ ที่มีสัญญาณคุณภาพเดียวกันโดยไม่สนใจเนื้อหา
เกณฑ์การยอมรับที่ไม่ชัดเจน ค่าที่คาดหวังสามารถตีความได้หลากหลายวิธี "ควรรวมข้อมูลราคา" รายเดือนใช่ไหม รายปีใช่ไหม ต่อผู้ใช้ใช่ไหม

การตรวจสอบความน่าเชื่อถือของเกรดเดอร์

ความน่าเชื่อถือของเกรดเดอร์เป็นข้อกำหนดเบื้องต้นสำหรับการคัดแยกที่เชื่อถือได้ หากผู้ให้คะแนนเชื่อถือไม่ได้ คุณจะวินิจฉัยทุกความล้มเหลวที่เกี่ยวข้องผิดพลาด

เพื่อยืนยันความน่าเชื่อถือของเกรดเดอร์:

  1. เลือกกรณีทดสอบ 5-10 กรณีที่คุณทราบผลลัพธ์การผ่าน/ไม่ผ่านที่ถูกต้องจากการตรวจสอบด้วยตนเอง
  2. ดำเนินการประเมินและเปรียบเทียบผลลัพธ์ของเกรดเดอร์กับคำตัดสินจากการตรวจสอบด้วยตนเอง
  3. หากผู้ให้คะแนนไม่เห็นด้วยกับกรณีมากกว่า 20% ให้ปรับเทียบผู้ให้คะแนนใหม่ก่อนที่จะดีบักเอเจนต์

สัญญาณที่ผู้ให้คะแนนต้องให้ความสนใจ:

  • กรณีทดสอบเดียวกันให้คำตัดสินที่แตกต่างกันในแต่ละการรัน
  • คลัสเตอร์ความล้มเหลวในชุดการประเมินที่ใช้การให้คะแนนตามโมเดลในขณะที่วิธีการกำหนดผ่าน
  • ผู้ให้คะแนนแจ้งปัญหาที่คุณไม่สามารถทำซ้ำได้โดยการตรวจสอบการตอบของเอเจนต์

ตัวเลือกการปรับเทียบเกรดเดอร์:

  • ใช้วิธีการแบบกำหนดแน่นอนเมื่อเป็นไปได้
  • เพิ่มตัวอย่าง "ยอมรับได้" และ "ยอมรับไม่ได้" ที่ชัดเจนลงในเกณฑ์การให้คะแนน
  • ขยายชุดคำสำคัญเพื่อรวมคำพ้องความหมายและถ้อยคำที่แตกต่างแต่ถูกต้อง
  • ใช้ เปรียบเทียบความหมาย แทน การจับคู่คำสำคัญ (ALL) เพื่อการตรวจสอบความสมมูลทางความหมาย

ขั้นตอนที่ 2: วินิจฉัยเอเจนต์

ในขั้นตอนนี้ การประเมินผลถือว่าถูกต้อง และเอเจนต์ได้สร้างการตอบที่ไม่ถูกต้อง วินิจฉัยว่าเกิดมีอะไรผิดพลาดในการกำหนดค่าเอเจนต์

เคล็ดลับ

คำถามการวินิจฉัยบางข้อจำเป็นต้องเข้าถึงกระบวนการภายในที่เอเจนต์ดำเนินการ (เช่น แหล่งความรู้ที่ถูกเรียกใช้ เครื่องมือที่ถูกเรียก หรือหัวข้อที่ถูกกระตุ้น) ใช้บันทึกการติดตาม การถอดความ หรือข้อมูลการวิเคราะห์การทดสอบเมื่อมีให้ใช้งาน หากแพลตฟอร์มของคุณไม่เปิดเผยรายละเอียดเหล่านี้ ให้สันนิษฐานจากการตอบ (ตัวอย่างเช่น เนื้อหาที่ปรากฏเฉพาะในแหล่งข้อมูล A ก็น่าจะมาจากแหล่งข้อมูล A)

ตรวจสอบความถูกต้องตามข้อเท็จจริงและความล้มเหลวในการเชื่อมโยงกับแหล่งความรู้

คำถาม ถ้าใช่ → สาเหตุที่แท้จริง
เอเจนต์ดึงข้อมูลจากแหล่งความรู้ที่ไม่ถูกต้องหรือไม่ การกำหนดค่าแหล่งความรู้ จัดทำดัชนีหรือจัดลำดับความสำคัญของแหล่งที่มาไม่ถูกต้อง
เอเจนต์ดึงแหล่งข้อมูลที่ถูกต้องแต่สกัดข้อมูลที่ผิดหรือไม่ ช่องว่างของพร้อมท์หรือคำแนะนำ โมเดลต้องการคำแนะนำในการสกัด
เนื้อหาในแหล่งข้อมูลนั้นไม่ถูกต้องหรือล้าสมัยหรือไม่ เนื้อหาแหล่งความรู้ อัปเดตเอกสารต้นฉบับ
เอเจนต์ตอบโดยไม่ใช้แหล่งความรู้ (แต่งคำตอบขึ้นมาเอง) หรือไม่ การช่วยสำหรับการเข้าถึงแหล่งที่มา แหล่งที่มาไม่ได้รับการจัดทำดัชนี หรือการตั้งคำถามไม่ตรงกับคำศัพท์ของแหล่งที่มา
เอเจนต์ขัดแย้งกับข้อมูลที่อยู่ในแหล่งที่มาหรือไม่ ข้อมูลไม่ถูกต้อง เพิ่มคำแนะนำในการเชื่อมโยงกับข้อมูลต้นทางอย่างชัดเจน

ตรวจสอบความล้มเหลวในการเรียกใช้เครื่องมือ

คำถาม ถ้าใช่ → สาเหตุที่แท้จริง
เครื่องมือทำงานไม่ถูกต้องหรือไม่ ความคลุมเครือของคำอธิบายเครื่องมือ คำอธิบายทับซ้อนกันระหว่างเครื่องมือ
เครื่องมือที่ถูกต้องถูกเรียกใช้งานด้วยพารามิเตอร์ที่ไม่ถูกต้องหรือไม่ ข้อกำหนดพารามิเตอร์ สคีมาหรือคำอธิบายไม่ชัดเจน
เครื่องมือไม่ถูกเรียกใช้งานเลยหรือไม่ เงื่อนไขทริกเกอร์ อินพุตไม่ตรงตามเกณฑ์การเรียกใช้
เครื่องมือถูกเรียกใช้เมื่อไม่ควรหรือไม่ ขาดการป้องกันเชิงลบ ไม่มีคำแนะนำว่าเมื่อใดที่ไม่ควรเรียกเครื่องมือ
เครื่องมือทำงานอย่างถูกต้อง แต่การตอบนำผลลัพธ์ไปใช้ผิดหรือไม่ คำแนะนำการตอบกลับ เอเจนต์ต้องการคำแนะนำเกี่ยวกับการจัดรูปแบบเอาต์พุตของเครื่องมือ
เครื่องมือถูกเรียกใช้งานอย่างถูกต้อง แต่ตัวเครื่องมือเองล้มเหลว (เกิดข้อผิดพลาด หมดเวลา ข้อมูลไม่ถูกต้อง) หรือไม่ ปัญหาเกี่ยวกับเครื่องมือหรือการเชื่อมต่อ ความล้มเหลวเกิดขึ้นในระบบแบ็กเอนด์ ไม่ใช่กับตัวเอเจนต์ แก้ไขเครื่องมือ ไม่ใช่เอเจนต์

ตรวจสอบความล้มเหลวในการกำหนดเส้นทางทริกเกอร์

คำถาม ถ้าใช่ → สาเหตุที่แท้จริง
หัวข้อทำงานไม่ถูกต้องหรือไม่ ทริกเกอร์หัวข้อซ้อนทับกัน ทริกเกอร์มีความกำกวมระหว่างหัวข้อ
ไม่มีการเริ่มต้นหัวข้อ (แสดงหัวข้อสำรอง) หรือไม่ ช่องว่างในการครอบคลุมหัวข้อ ไม่มีหัวข้อใดรองรับอินพุตประเภทนี้
มีหัวข้อหลายหัวข้อที่ตรงกันแต่มีการแยกแยะความหมายที่ไม่ถูกต้องหรือไม่ ตรรกะการแก้ไขความกำกวม โฟลว์การจัดลำดับความสำคัญหรือการชี้แจงถูกตั้งค่าผิดพลาด

ตรวจสอบข้อผิดพลาดด้านน้ำเสียงและคุณภาพการตอบ

คำถาม ถ้าใช่ → สาเหตุที่แท้จริง
น้ำเสียงของเอเจนต์ไม่สอดคล้องกับคำแนะนำจากพร้อมท์ของระบบหรือไม่ ช่องว่างของคำแนะนำด้านโทนเสียง แก้ไขคำแนะนำที่ขาดหายไปหรือขัดแย้งกัน
การตอบยาวเกินไปหรือกระชับเกินไปสำหรับคำถามหรือไม่ คำแนะนำเกี่ยวกับรูปแบบ เพิ่มคำแนะนำเกี่ยวกับความยาวหรือโครงสร้าง
เอเจนต์ขาดความเห็นอกเห็นใจในบริบทที่ละเอียดอ่อนหรือไม่ ขาดคำแนะนำเกี่ยวกับความเห็นอกเห็นใจ เพิ่มคำแนะนำที่ชัดเจนสำหรับการป้อนข้อมูลทางอารมณ์
การตอบมีปัญหาเรื่องโครงสร้างหรือไม่ (ข้อความยาวติดกัน ไม่มีการแบ่งตอน) คำแนะนำเกี่ยวกับรูปแบบ เพิ่มข้อกำหนดเกี่ยวกับการจัดรูปแบบ

ตรวจสอบปัญหาด้านความปลอดภัยและข้อผิดพลาดเกี่ยวกับขอบเขต

คำถาม ถ้าใช่ → สาเหตุที่แท้จริง
เอเจนต์เปิดเผยข้อมูลระบบหรือไม่ การป้องกันพร้อมท์ของระบบ เพิ่มคำแนะนำ "ห้ามเปิดเผย"
เอเจนต์ออกจากขอบเขตหรือไม่ ช่องว่างในการกำหนดขอบเขต กำหนดขอบเขตให้ชัดเจนยิ่งขึ้น
เอเจนต์ปฏิบัติตามการฉีดพร้อมท์หรือไม่ คำแนะนำเกี่ยวกับความปลอดภัย เพิ่มแนวทางการรับมือการโจมตีแบบปฏิปักษ์
เอเจนต์จัดการข้อมูลส่วนบุคคลอย่างไม่ถูกต้องหรือไม่ กฎการจัดการ PII เพิ่มคำแนะนำเกี่ยวกับการปกป้องข้อมูล

ตรวจสอบการเลื่อนระดับและความล้มเหลวแบบเหมาะสม

คำถาม ถ้าใช่ → สาเหตุที่แท้จริง
เอเจนต์ไม่สามารถเลื่อนระดับเมื่อควรทำหรือไม่ ตัวกระตุ้นการเลื่อนระดับ ไม่ได้กำหนดเกณฑ์หรือแคบเกินไป
เอเจนต์เลื่อนระดับเร็วกว่าที่ควรหรือไม่ เกณฑ์การเลื่อนระดับ เกณฑ์ที่ละเอียดอ่อนเกินไป
การยกระดับทำให้สูญเสียบริบทการสนทนาหรือไม่ การกำหนดค่าการส่งต่อ ไม่ได้ตั้งค่าการรักษาบริบท
เอเจนต์วนซ้ำโดยไม่ยอมรับความล้มเหลวหรือไม่ ตรรกะสำรอง ยังไม่ได้ตั้งค่าขีดจำกัดการลองใหม่หรือลักษณะการทำงานแบบสำรอง

หลังจากวินิจฉัยแล้ว จับคู่รูปแบบข้อผิดพลาดกับกลยุทธ์การแก้ไขตามสาเหตุหลัก

ขั้นตอนที่ 3: ระบุข้อจำกัดของแพลตฟอร์ม:

หากการประเมินถูกต้องและการปรับเปลี่ยนการตั้งค่าที่สมเหตุสมผลไม่ช่วยปรับปรุงผลลัพธ์ ปัญหาอาจเกิดจากข้อจำกัดของแพลตฟอร์ม

ตัวบ่งชี้ข้อจำกัดของแพลตฟอร์ม

ตัวบ่งชี้ สิ่งที่แนะนำ
ความล้มเหลวเดียวกันยังคงเกิดขึ้นแม้จะมีการเปลี่ยนพร้อมท์และการตั้งค่าหลายครั้ง ไม่มีปัญหาการกำหนดค่า
กระบวนการดึงข้อมูลให้ผลลัพธ์เอกสารผิดอย่างต่อเนื่อง แม้จะตั้งค่าต้นทางถูกต้องแล้ว ข้อจำกัดการจัดอันดับการดึงข้อมูล
เอเจนต์ไม่สามารถปฏิบัติการวิเคราะห์ที่จำเป็นได้แม้จะมีคำแนะนำที่ชัดเจน ขอบเขตความสามารถของโมเดล
รูปแบบการประสานงานที่จำเป็นไม่ได้รับการสนับสนุนโดยตัวเลือกการกำหนดค่าใด ๆ ข้อจำกัดตรรกะการประสานการทำงาน
เกรดเดอร์ตามโมเดลให้ผลผิดอย่างสม่ำเสมอแม้จะมีการปรับเกณฑ์การให้คะแนน ข้อจำกัดโมเดลของผู้ให้คะแนน

เส้นทางการดำเนินการสำหรับข้อจำกัดของแพลตฟอร์ม

  1. จัดทำเอกสารข้อจำกัดอย่างชัดเจน (สิ่งที่ล้มเหลว, สิ่งที่คุณพยายาม, และหลักฐานว่าไม่เกี่ยวข้องกับการกำหนดค่า)
  2. ใช้วิธีแก้ไขชั่วคราวเมื่อเป็นไปได้ (เช่น ปรับโครงสร้างเอกสารต้นฉบับเพื่อปรับปรุงการดึงข้อมูล)
  3. ทำเครื่องหมายกรณีทดสอบเป็นข้อจำกัดที่ทราบ หรือปรับเกณฑ์เพื่อไม่ให้ขัดขวางการดำเนินการอื่น ๆ
  4. เลื่อนระดับไปยังทีมแพลตฟอร์มพร้อมหลักฐาน
  5. ติดตามรายการในบันทึกความล้มเหลวสำหรับการประเมินใหม่เมื่ออัปเดตความสามารถของแพลตฟอร์ม

หลังจากจัดประเภทแล้ว ให้ตรวจสอบวิธีแก้ปัญหาชั่วคราวและคำแนะนำในการยกระดับเพื่อตอบสนองต่อข้อจำกัดของแพลตฟอร์ม

เมื่อความล้มเหลวไม่ตรงกับกรอบการทำงาน

ความล้มเหลวบางอย่างไม่สามารถระบุสาเหตุหลักได้อย่างชัดเจนเพียงสาเหตุเดียว ตัวอย่างทั่วไปคือ:

  • ปัญหาคุณภาพข้อมูลฝั่งแบ็กเอนด์: เนื้อหาของแหล่งความรู้ถูกต้องในเชิงเทคนิคแต่เขียนอย่างคลุมเครือ ทำให้ทั้งตัวเอเจนต์และการประเมินไม่ถือว่าผิด
  • ปัญหาโครงสร้างพื้นฐานที่เกิดขึ้นเป็นระยะ ๆ: การหมดเวลาของเครือข่าย, การจำกัดอัตรา API, และปัญหาตัวเชื่อมต่อที่ไม่สามารถทำซ้ำได้อย่างสม่ำเสมอ
  • การเปลี่ยนแปลงเวอร์ชันของโมเดล: ลักษณะการทำงานของเอเจนต์เปลี่ยนไปหลังจากการอัปเดตแบบจำลองแพลตฟอร์มที่คุณไม่ได้เริ่มต้น
  • กรณีทดสอบที่คลุมเครือ: สถานการณ์มีความคลุมเครือ และผู้ประเมินที่มีเหตุผลอาจมีความเห็นต่างกันเกี่ยวกับคำตอบที่ถูกต้อง

แนวทางปฏิบัติที่แนะนำ: บันทึกสิ่งที่คุณสังเกตเห็น (ข้อผิดพลาด, การตอบของเอเจนต์, และสิ่งที่คุณตรวจสอบ) บันทึกรายการเป็น "ไม่ได้จัดประเภท" ในบันทึกความล้มเหลว หากความล้มเหลวเกิดขึ้นซ้ำ มักจะสามารถจัดประเภทได้โดยใช้หลักฐานเพิ่มเติม

การจัดการสาเหตุร่วม

ความล้มเหลวเพียงหนึ่งครั้งสามารถมีรากเหง้าสาเหตุหลายประการร่วมกันได้ ตัวอย่างเช่น

  • ตัวอย่างความล้มเหลวด้านความถูกต้องตามข้อเท็จจริง โดยคำตอบที่คาดหวังล้าสมัยเล็กน้อย (การตั้งค่าการประเมิน) และแหล่งความรู้ก็ไม่สมบูรณ์ (การตั้งค่าเอเจนต์)
  • ความล้มเหลวในการเรียกใช้เครื่องมือที่เกิดขึ้นเมื่อคำอธิบายเครื่องมือไม่ชัดเจน (การกำหนดค่าเอเจนต์) และระบบออร์เคสเตรชันไม่รองรับการเรียกใช้เครื่องมือแบบมีเงื่อนไข (ข้อจำกัดของแพลตฟอร์ม)

แนวทางที่แนะนำ: ดำเนินการคัดแยกอย่างครบถ้วนสำหรับความล้มเหลวแต่ละครั้ง หากมีสาเหตุหลักหลายประเภท ให้แก้ไขตามลำดับความสำคัญ:

  1. แก้ไขการประเมินก่อน เพื่อรับข้อมูลที่ชัดเจนว่าการปรับเปลี่ยนเอเจนต์ช่วยได้จริงหรือไม่
  2. แก้ไขการกำหนดค่าเอเจนต์เพื่อพิจารณาว่าความล้มเหลวที่เหลืออยู่เป็นปัญหาของแพลตฟอร์มจริงหรือไม่
  3. จัดทำเอกสารข้อจำกัดของแพลตฟอร์มหลังจากแก้ไขข้อ 1 และ 2 แล้วเท่านั้น:

เรียกใช้กรณีทดสอบที่ได้รับผลกระทบอีกครั้งหลังจากการเปลี่ยนแปลงแต่ละครั้งก่อนดำเนินการต่อ

การจัดการความล้มเหลวในการสนทนาแบบหลายเทิร์น

สำหรับสถานการณ์แบบหลายเทิร์น ความล้มเหลวจะเกิดขึ้นเฉพาะระหว่างแต่ละเทิร์นเท่านั้น

เมื่อใดที่ควรสงสัยว่ามีปัญหาแบบหลายเทิร์น

  • เอเจนต์ตอบถูกต้องในช่วงแรก ๆ แต่ขัดแย้งกับตัวเองในภายหลัง
  • เอเจนต์สูญเสียบริบทจากการเรียกใช้เครื่องมือหรือการดึงข้อมูลความรู้ก่อนหน้าในเทิร์นถัดไป
  • จังหวะเวลาการเลื่อนระดับจะสมเหตุสมผลก็ต่อเมื่อพิจารณาประวัติการสนทนาทั้งหมด
  • น้ำเสียงของเอเจนต์แย่ลงเรื่อย ๆ เมื่อการสนทนายาวขึ้น
  • เอเจนต์ขอข้อมูลที่ผู้ใช้ให้ไว้แล้ว

เคล็ดลับ

ความล้มเหลวอาจปรากฏในเทิร์นหลัง ในขณะที่สาเหตุที่แท้จริงเกิดขึ้นตั้งแต่ก่อนหน้า ย้อนกลับไปเพื่อหาจุดแรกที่การสนทนาเริ่มเปลี่ยนทิศทาง

คำถามวินิจฉัยเพิ่มเติม

คำถาม ถ้าใช่ → สาเหตุที่แท้จริง
ความล้มเหลวขึ้นอยู่กับข้อมูลจากเทิร์นก่อนหน้านี้ที่สูญหายหรือไม่ ปัญหาการจัดการบริบท; สถานะการสนทนาไม่ถูกเก็บรักษาไว้ระหว่างรอบการสนทนา
เอเจนต์ขัดแย้งกับสิ่งที่พูดในรอบก่อนหน้าหรือไม่ ขาดแนวทางในการรักษาความสอดคล้อง; ไม่มีคำแนะนำในการคงความต่อเนื่องระหว่างแต่ละเทิร์น
เอเจนต์ขอข้อมูลที่ผู้ใช้ให้ไว้แล้วอีกครั้งหรือไม่ ปัญหาการดึงบริบท เอเจนต์ไม่อ้างอิงการสนทนาก่อนหน้านี้
ความล้มเหลวเกิดขึ้นหลังจากหลายเทิร์น (5+) เท่านั้นหรือไม่ ความยาวบริบทเกินขีดจำกัด

คำแนะนำการแก้ไขสำหรับปัญหาแบบหลายรอบ

  • การสูญเสียบริบท: ตรวจสอบการกำหนดค่าสถานะการสนทนา ตรวจสอบให้แน่ใจว่าผลลัพธ์ของเครื่องมือและข้อเท็จจริงสำคัญถูกเก็บรักษาไว้ในแต่ละเทิร์นของการสนทนา
  • ความขัดแย้ง: เพิ่มคำแนะนำที่สอดคล้องกัน เช่น "รักษาความสอดคล้องกับคำตอบก่อนหน้าของคุณในการสนทนานี้"
  • ถามซ้ำ: ตรวจสอบการกำหนดค่าหน่วยความจำการสนทนาของแพลตฟอร์ม
  • การเสื่อมสภาพของการสนทนาที่ยาวนาน: พิจารณาการสรุปการสนทนาหรือกลยุทธ์การตัดแต่งบริบท

การตรวจสอบความถูกต้องของกรณีทดสอบที่ผ่าน (การตรวจสอบผลลัพธ์ที่ผิด)

เฟรมเวิร์กนี้มุ่งเน้นกรณีทดสอบที่ล้มเหลว อย่างไรก็ตาม กรณีทดสอบที่ผ่านอย่างไม่ถูกต้องสามารถสร้างช่องว่างด้านคุณภาพที่ซ่อนอยู่ได้

แนวทางปฏิบัติที่แนะนำ: ตรวจสอบด้วยตนเอง 5-10% ของกรณีทดสอบที่ผ่านต่อการประเมิน โดยเฉพาะอย่างยิ่งสำหรับ:

  • การให้คะแนนด้วยโมเดล (มีความเสี่ยงสูงต่อผลบวกปลอม)
  • ตัวชี้วัดเชิงอัตนัย (น้ำเสียง, ความเป็นประโยชน์)
  • กรณีทดสอบที่เคยล้มเหลวแต่ตอนนี้ผ่านหลังจากการเปลี่ยนแปลง

หากคุณพบผลบวกปลอม ให้ปรับเทียบเกรดเดอร์

ขั้นตอนถัดไป

หลังจากเสร็จสิ้นการคัดแยกความล้มเหลว: