หมายเหตุ
การเข้าถึงหน้านี้ต้องได้รับการอนุญาต คุณสามารถลอง ลงชื่อเข้าใช้หรือเปลี่ยนไดเรกทอรีได้
การเข้าถึงหน้านี้ต้องได้รับการอนุญาต คุณสามารถลองเปลี่ยนไดเรกทอรีได้
ขั้นตอนการดำเนินงานแบบครบวงจรเหล่านี้แสดงให้เห็นว่าเลเยอร์ของกรอบการคัดแยกการประเมินผลทำงานร่วมกันในทางปฏิบัติอย่างไร แต่ละการเดินทางเริ่มต้นจากสถานการณ์การประเมินที่แตกต่างกัน และดำเนินไปตามกระบวนการวินิจฉัยเฉพาะ
ขั้นตอนการดำเนินงานแสดงวิธีการใช้เฟรมเวิร์กทีละขั้นตอน ใช้ตัวอย่างเหล่านี้เพื่อทำความเข้าใจวิธีการย้ายจากผลการประเมินไปสู่การวินิจฉัย การแก้ไข และการตรวจสอบความถูกต้องในสถานการณ์การประเมินเอเจนต์ในโลกแห่งความเป็นจริง
เคล็ดลับ
ก่อนศึกษาตัวอย่างเหล่านี้ ทบทวนเป้าหมายของกรอบการประเมิน รวมถึงแนวคิดหลักและหลักการ
| การเดินทาง | สถานการณ์เริ่มต้น | สิ่งที่แสดงให้เห็น |
|---|---|---|
| การเดินทาง 1 | การประเมินครั้งแรก | โฟลว์แบบครบวงจร: ตีความ→จัดลำดับความสำคัญ→คัดแยก→แก้ไข→ตรวจสอบความถูกต้อง |
| การเดินทาง 2 | คะแนนคงที่หลังจากประเมินหลายรอบ | การวิเคราะห์รูปแบบ การจัดประเภทใหม่ และทางแก้ข้อจำกัดแพลตฟอร์ม |
| การเดินทาง 3 | คะแนนถดถอยหลังจากการเปลี่ยนแปลง | การตรวจหาการถดถอย การวินิจฉัยความขัดแย้งของคำสั่ง และการแก้ไขการแลกเปลี่ยน |
หมายเหตุ
ตัวอย่างเหล่านี้เป็นการสาธิตและอ้างอิงรูปแบบที่พบได้บ่อยจากการประเมินลูกค้าหลายครั้ง กรณีทดสอบ คะแนน และรายละเอียดของเอเจนต์เป็นข้อมูลสังเคราะห์ที่สะท้อนภาพรวม ไม่ใช่ข้อมูลจากการมีส่วนร่วมเพียงครั้งเดียว แนวทางการวินิจฉัยและกลยุทธ์การแก้ไขที่แสดงอ้างอิงจากแนวทางปฏิบัติที่ใช้จริงในภาคสนาม
สถานการณ์ที่ 1: การประเมินครั้งแรก
คุณเรียกใช้ชุดการประเมินผลของคุณเป็นครั้งแรกกับเอเจนต์การสนับสนุนลูกค้า ต่อไปนี้คือผลลัพธ์:
| ชุดการประเมิน | อัตราผ่าน |
|---|---|
| ความปลอดภัยและข้อมูลส่วนบุคคล | 100% |
| คำถามและคำตอบทางธุรกิจหลัก | 87% |
| การเชื่อมโยงกับแหล่งความรู้ | 71% |
| การเรียกใช้เครื่องมือ | 92% |
| การกำหนดเส้นทางทริกเกอร์ | 88% |
| โทนและคุณภาพ | 83% |
| การเลื่อนระดับ | 90% |
| โดยรวม | 85% |
ขั้นตอนที่ 1: ตีความคะแนน (เลเยอร์ 1)
ใช้ ตารางการตีความคะแนนเพื่อปรับเทียบเกณฑ์และระบุว่าชุดการประเมินใดต่ำกว่าเกณฑ์การบล็อก
| ชุดการประเมิน | คะแนน | ค่าเกณฑ์ | สถานะ |
|---|---|---|---|
| ความปลอดภัยและข้อมูลส่วนบุคคล | 100% | การบล็อก 95% | ผ่าน |
| คำถามและคำตอบทางธุรกิจหลัก | 87% | การบล็อก 80% | ผ่าน |
| การเชื่อมโยงกับแหล่งความรู้ | 71% | การบล็อก 80% | ต่ำกว่าค่าบล็อก |
| การเรียกใช้เครื่องมือ | 92% | การบล็อก 85% | ผ่าน |
| การกำหนดเส้นทางทริกเกอร์ | 88% | การบล็อก 80% | ผ่าน |
| โทนและคุณภาพ | 83% | การบล็อก 75% | ผ่าน |
| การเลื่อนระดับ | 90% | การบล็อก 85% | ผ่าน |
การประเมินความพร้อม: ทำซ้ำ การอ้างอิงความรู้ต่ำกว่าค่าเกณฑ์สำหรับการบล็อก มุ่งเน้นการแก้ไขในจุดนั้น
ขั้นตอนที่ 2: จัดลำดับความสำคัญของความล้มเหลว (เลเยอร์ 2 ขั้นตอนที่ 0)
สถานการณ์: การเชื่อมโยงแหล่งความรู้มีกรณีการทดสอบ 7 กรณี กรณีการทดสอบ 2 กรณีล้มเหลว: KG-003 และ KG-005 กรณีทดสอบทั้งสองอยู่ในชุดการประเมินธุรกิจหลัก จึงจัดให้เป็นลำดับความสำคัญระดับ 2 เนื่องจากมีเพียงสองรายการ ให้คัดกรองทั้งคู่
ข้อมูลอ้างอิง: จัดลำดับความสำคัญของความล้มเหลว (Layer 2, Step 0)
ขั้นตอนที่ 3: ดำเนินการคัดกรอง KG-003 (เลเยอร์ 2 ขั้นตอนที่ 1-2)
กรณีการทดสอบ KG-003:
- ตัวอย่างคำถาม: "นโยบายการคืนสินค้าของคุณคืออะไร"
- คำตอบที่คาดหวัง: "เราเสนอระยะเวลาคืนสินค้า 30 วันสำหรับการซื้อทั้งหมด"
- การตอบของเอเจนต์: "นโยบายการคืนสินค้าของเราอนุญาตให้คืนสินค้าภายใน 15 วันทำการนับจากวันที่ซื้อ"
- วิธีการประเมิน: การจับคู่คำสำคัญ
- ผลลัพธ์: ล้มเหลว (คาดหวัง "30 วัน" แต่เอเจนต์ตอบว่า "15 วันทำการ")
ตรวจสอบการตั้งค่าการประเมิน (ขั้นตอนที่ 1 ของชั้นที่ 2):
| คำถาม | รับสาย | ผลลัพธ์ |
|---|---|---|
| การตอบของตัวแทนเป็นที่ยอมรับหรือไม่ | ต้องตรวจสอบเอกสารต้นฉบับ | ตรวจสอบแหล่งที่มาก่อน |
| คำตอบที่คาดหวังยังเป็นปัจจุบันอยู่หรือไม่ | เอกสารต้นฉบับระบุว่า "15 วันทำการ" นโยบายได้รับการอัปเดตแล้ว | ไม่ คำตอบที่คาดหวังล้าสมัย |
การจำแนกประเภท: ปัญหาการตั้งค่าการประเมิน คำตอบที่คาดหวังล้าสมัย เอเจนต์ถูกต้อง การประเมินไม่ถูกต้อง
ขั้นตอนที่ 4: ดำเนินการคัดกรอง KG-005 (เลเยอร์ 2 ขั้นตอนที่ 1-2)
กรณีการทดสอบ KG-005:
- ตัวอย่างข้อมูล: "แผน Premium มีการรับประกันเพิ่มเติมหรือไม่"
- คำตอบที่คาดหวัง: "แผน Premium มีการรับประกันมาตรฐานสองปี ตัวเลือกการรับประกันเพิ่มเติมสามารถซื้อแยกต่างหากได้"
- การตอบของเอเจนต์: "ใช่ แผนพรีเมียมรวมการรับประกันแบบขยายเวลาสามปีที่ครอบคลุมทุกชิ้นส่วนและค่าแรงทั้งหมด"
- วิธีการประเมิน: เปรียบเทียบความหมาย
- ผลลัพธ์: ล้มเหลว (รายละเอียดการรับประกันที่เอเจนต์ประดิษฐ์ขึ้น)
ตรวจสอบการตั้งค่าการประเมิน (ขั้นตอนที่ 1 ของชั้นที่ 2):
| คำถาม | รับสาย | ผลลัพธ์ |
|---|---|---|
| การตอบของตัวแทนเป็นที่ยอมรับหรือไม่ | ไม่ "การรับประกันแบบขยายเวลาสามปี" เป็นข้อมูลที่ถูกแต่งขึ้น | ดำเนินการต่อ |
| คำตอบที่คาดหวังเป็นปัจจุบันหรือไม่ | ใช่ แหล่งที่มายืนยันการรับประกันมาตรฐานสองปี | ดำเนินการต่อ |
| กรณีการทดสอบนี้สมจริงหรือไม่ | ใช่ คำถามทั่วไปของลูกค้า | ดำเนินการต่อ |
| การตอบอื่นอาจถูกต้องหรือไม่ | ไม่ รายละเอียดการรับประกันเป็นข้อเท็จจริง | ดำเนินการต่อ |
| วิธีการประเมินเหมาะสมหรือไม่ | ใช่เปรียบเทียบความหมายถูกต้องด้านความหมาย | การประเมินถูกต้อง |
วินิจฉัยเอเจนต์ (ขั้นตอนที่ 2 ของเลเยอร์ 2):
| คำถาม | รับสาย |
|---|---|
| เนื้อหาต้นฉบับไม่ถูกต้องหรือไม่ | ไม่ ต้นฉบับกล่าวว่า "การรับประกันมาตรฐานสองปี" |
| เอเจนต์ขัดแย้งกับข้อมูลในแหล่งที่มาหรือไม่ | ใช่ แหล่งที่มากล่าวว่า "การรับประกันมาตรฐานสองปี" แต่เอเจนต์กล่าวว่า "ขยายการรับประกันสามปี" |
| เอเจนต์ตอบโดยไม่ได้อ้างอิงแหล่งที่มาใช่หรือไม่ | น่าจะใช่ รายละเอียด "ขยายการรับประกันสามปีครอบคลุมชิ้นส่วนและค่าแรงทั้งหมด" ไม่พบในแหล่งที่มาใด ๆ |
ประเภท: ปัญหาการกำหนดค่าเอเจนต์ ช่องว่างในการเชื่อมโยงกับแหล่งความรู้ เอเจนต์สร้างรายละเอียดการรับประกันที่ไม่พบในแหล่งความรู้ที่กำหนดไว้
ขั้นตอนที่ 5: แก้ไข (เลเยอร์ 3)
KG-003 (การแก้ไขการตั้งค่าการประเมินผล):
- เปลี่ยนแปลง: ปรับค่าที่กำหนดไว้จาก "กรอบเวลาการคืนสินค้า 30 วัน" เป็น "15 วันทำการ"
- ดำเนินการซ้ำ: เฉพาะ KG-003
- คาดหวัง: ผ่าน
KG-005 (การแก้ไขการกำหนดค่าเอเจนต์):
- การเปลี่ยนแปลง: เพิ่มคำสั่งการเชื่อมโยงกับแหล่งความรู้ในพร้อมท์ของระบบ: "ตอบตามข้อมูลที่พบในแหล่งข้อมูลความรู้ของคุณเท่านั้น หากไม่มีข้อมูล ให้พูดอย่างนั้น"
- ดำเนินการซ้ำ: ชุดการประเมินการยึดโยงความรู้แบบเต็ม (การเปลี่ยนแปลงการตั้งค่าเอเจนต์อาจส่งผลกระทบในวงกว้าง)
- ผลลัพธ์ที่คาดหวังคือ: KG-005 ผ่าน กรณีทดสอบอื่น ๆ ไม่ควรเกิดการถดถอย
ขั้นตอนที่ 6: ตรวจสอบความถูกต้อง
หลังจากการเปลี่ยนแปลงทั้งสอง ให้เรียกใช้ชุดการประเมินการยึดโยงความรู้อีกครั้ง:
| ก่อน | หลัง |
|---|---|
| 71% (ผ่าน 5/7) | 86% (ผ่าน 6/7) |
การประเมิน: การยึดโยงความรู้ขณะนี้อยู่เหนือเกณฑ์ปิดกั้น 80% แล้ว ความล้มเหลวหนึ่งรายการ (KG-007) ยังคงอยู่และไม่ขัดขวางความพร้อม ตรวจสอบในรอบถัดไป
ขั้นตอนที่ 7: บันทึก (เลเยอร์ 4)
บันทึกในบันทึกความล้มเหลว:
| กรณีทดสอบ | ชนิดสาเหตุหลัก | ปัญหาที่พบ | การเปลี่ยนแปลงที่ดำเนินการ | แก้ไขแล้ว |
|---|---|---|---|---|
| KG-003 | การตั้งค่าการประเมิน | คำตอบที่คาดหวังล้าสมัย (นโยบายเปลี่ยนจาก 30 วันเป็น 15 วัน ทำการ) | อัปเดตค่าที่คาดหวัง | ใช่ |
| KG-005 | การกำหนดค่าเอเจนต์ | รายละเอียดการรับประกันที่ไม่ถูกต้องและไม่ได้ปรากฏในแหล่งที่มาใด ๆ | เพิ่มคำสั่งการเชื่อมโยงข้อมูลต้นทางให้กับพร้อมท์ของระบบ | ใช่ |
หมายเหตุรูปแบบ: ตรวจสอบค่าที่คาดหวังกับเอกสารต้นทางก่อนแต่ละรอบการประเมิน เพิ่มขั้นตอนนี้ในรายการตรวจสอบก่อนประเมิน
ตรวจสอบความพร้อมอีกครั้ง: ขณะนี้ชุดการประเมินทั้งหมดอยู่เหนือเกณฑ์การบล็อกแล้ว
การประเมินความพร้อม: ปรับใช้เอเจนต์ที่มีช่องว่างที่ทราบ (ช่องว่างที่ทราบถูกบันทึกไว้ใน KG-007 และมีแผนการตรวจสอบแล้ว)
อ้างอิง: เลเยอร์ 4: วิเคราะห์รูปแบบและปรับปรุงเอเจนต์ของคุณอย่างต่อเนื่อง
การเดินทาง 2: ภาวะคะแนนนิ่ง
สถานการณ์: คุณดำเนินการวนซ้ำสี่ครั้งบนเอเจนต์การสนับสนุนผลิตภัณฑ์ ความแม่นยำตามข้อเท็จจริงอยู่ที่ 78% ในทั้งสี่รอบ คุณทำการเปลี่ยนแปลงพร้อมท์หลังจากแต่ละรัน แต่ไม่เห็นการปรับปรุง
ขั้นตอนที่ 1: ตรวจสอบรูปแบบ (เลเยอร์ 4)
ตรวจทานบันทึกความล้มเหลวในการวนซ้ำทั้งสี่ครั้ง:
| การทำซ้ำ | คะแนน | การเปลี่ยนแปลงที่ดำเนินการ | ผลลัพธ์ |
|---|---|---|---|
| 1 | 78% | (เกณฑ์พื้นฐาน) | — |
| 2 | 79% | เพิ่ม "แม่นยำเกี่ยวกับข้อมูลจำเพาะของผลิตภัณฑ์" | ไม่มีการเปลี่ยนแปลงที่มีความหมาย |
| 3 | 77% | ปรับโครงสร้างพร้อมท์เพื่อให้คำแนะนำเกี่ยวกับความถูกต้องอยู่ลำดับแรก | ไม่มีการเปลี่ยนแปลงที่มีความหมาย |
| 4 | 78% | เพิ่มตัวอย่างการทำงานของคำตอบของผลิตภัณฑ์ที่ถูกต้อง | ไม่มีการเปลี่ยนแปลงที่มีความหมาย |
แนวโน้ม: คงที่ การแก้ไขไม่ได้มุ่งเป้าไปที่สาเหตุที่แท้จริง
อ้างอิง: เลเยอร์ 4: วิเคราะห์รูปแบบและปรับปรุงเอเจนต์ของคุณอย่างต่อเนื่อง
ขั้นตอนที่ 2: วิเคราะห์กรณีทดสอบที่ล้มเหลว:
ตรวจสอบความล้มเหลวแบบถาวรหกแบบในการทำซ้ำทั้งหมด
| กรณีทดสอบ | ล้มเหลวตั้งแต่ | ปัญหาที่พบ |
|---|---|---|
| FA-002 | การทำซ้ำ 1 | เอเจนต์อ้างถึงหน้าคำถามที่พบบ่อยแทนคู่มือผลิตภัณฑ์ |
| FA-005 | การทำซ้ำ 1 | เอเจนต์อ้างถึงหน้าคำถามที่พบบ่อยแทนคู่มือผลิตภัณฑ์ |
| FA-008 | การทำซ้ำ 1 | เอเจนต์อ้างถึงหน้าคำถามที่พบบ่อยแทนคู่มือผลิตภัณฑ์ |
| FA-011 | การทำซ้ำ 1 | เอเจนต์อ้างถึงหน้าคำถามที่พบบ่อยแทนคู่มือผลิตภัณฑ์ |
| FA-014 | การทำซ้ำ 1 | เอเจนต์อ้างถึงหน้าคำถามที่พบบ่อยแทนคู่มือผลิตภัณฑ์ |
| FA-019 | การทำซ้ำ 2 | เอเจนต์ให้คำตอบบางส่วนจากคำถามที่ถามบ่อย แต่ขาดรายละเอียดจากคู่มือสินค้า |
การวิเคราะห์การกระจุกตัว: ความล้มเหลวห้าครั้งจากทั้งหมดหกครั้ง (83%) มีสาเหตุหลักเดียวกัน: เอเจนต์ดึงข้อมูลจากหน้าคำถามที่พบบ่อยแทนที่จะเป็นคู่มือสินค้า
ขั้นตอนที่ 3: การคัดกรองซ้ำ (เลเยอร์ 2)
ในขั้นต้น ให้จัดประเภทความล้มเหลวเป็นปัญหาการกำหนดค่าเอเจนต์: ดึงข้อมูลจากแหล่งที่ไม่ถูกต้อง
ปรับเปลี่ยนการกำหนดค่าเอเจนต์หลายรายการ รวมถึงการปรับคำพร้อมท์ใหม่ การจัดลำดับใหม่ และการเพิ่มตัวอย่าง การเปลี่ยนแปลงเหล่านี้ไม่ได้ส่งผลให้เกิดการปรับปรุงที่วัดผลได้ ณ จุดนี้ ให้ตรวจสอบความล้มเหลวกับตัวบ่งชี้ข้อจำกัดของแพลตฟอร์ม
| ตัวบ่งชี้ | เช็ค |
|---|---|
| ความล้มเหลวยังคงมีอยู่แม้จะมีการปรับเปลี่ยนพร้อมท์หรือการกำหนดค่าหลายครั้ง | ใช่ ดำเนินการสี่รอบโดยไม่มีการเปลี่ยนแปลง |
| ระบบดึงข้อมูลส่งคืนเอกสารที่ไม่ถูกต้องอย่างต่อเนื่องแม้จะมีการกำหนดค่าแหล่งที่มาถูกต้อง | ใช่ คำถามที่พบบ่อยจะถูกดึงมาอย่างสม่ำเสมอแทนคู่มือผลิตภัณฑ์ |
การจัดประเภทใหม่: ปัญหานี้เป็นข้อจำกัดของแพลตฟอร์มที่เกี่ยวข้องกับการจัดอันดับการดึงข้อมูล แพลตฟอร์มจะจัดลำดับความสำคัญของคำถามที่พบบ่อยมากกว่าคู่มือผลิตภัณฑ์สำหรับคำถามเหล่านี้อย่างสม่ำเสมอ และการเปลี่ยนแปลงพร้อมท์หรือคำแนะนำเพิ่มเติมจะไม่ส่งผลต่อลักษณะการทำงานการดึงข้อมูล
ข้อมูลอ้างอิง: ชั้นที่ 2: ความล้มเหลวของเอเจนต์คัดกรอง
ขั้นตอนที่ 4: แก้ไข (เลเยอร์ 3—ข้อจำกัดของแพลตฟอร์ม)
เมื่อคุณจัดประเภทความล้มเหลวว่าเป็นข้อจำกัดของแพลตฟอร์ม ให้เน้นการแก้ไขด้วยวิธีแก้ไขชั่วคราวและการจัดทำเอกสารแทนการเปลี่ยนแปลงการกำหนดค่าเอเจนต์
อ้างอิง: การตอบสนองข้อจำกัดของแพลตฟอร์ม
กลยุทธ์การแก้ไขปัญหาชั่วคราว: ใช้วิธีการบรรเทาผลกระทบต่อไปนี้อย่างน้อยหนึ่งวิธีเพื่อลดผลกระทบ:
- ปรับปรุงคู่มือผลิตภัณฑ์โดยใช้หัวข้อที่ชัดเจนและตรงกับคำค้นหาที่ผู้ใช้ใช้
- คัดลอกข้อมูลจำเพาะของผลิตภัณฑ์ที่สำคัญจากคู่มือไปไว้ในคำถามที่พบบ่อยเพื่อสร้างเส้นทางการดึงข้อมูลที่ซ้ำซ้อน
- ปรับปรุงเนื้อหาคู่มือโดยให้แต่ละส่วนตอบคำถามที่ชัดเจนและเฉพาะเจาะจง เพื่อเพิ่มประสิทธิภาพในการจับคู่ชิ้นข้อมูลสำหรับการดึงข้อมูล
แนวทางเหล่านี้ถูกออกแบบมาเพื่อมีอิทธิพลต่อลักษณะการทำงานการดึงข้อมูลโดยไม่ต้องพึ่งพาการเปลี่ยนแปลงพร้อมท์หรือคำสั่ง
การยกระดับและการติดตาม: หากข้อจำกัดยังคงอยู่ ให้จัดทำเอกสารและส่งต่อปัญหาไปยังทีมแพลตฟอร์ม
- จัดทำเอกสารข้อจำกัดดังนี้: "คิวรีสำหรับ <product specifications> จะดึงหน้าคำถามที่พบบ่อยอย่างสม่ำเสมอ (อัปเดตล่าสุด: <date>, <n> หน้า) แทนคู่มือผลิตภัณฑ์ (อัปเดตล่าสุด: <date>, <N> หน้า) แม้ว่าคู่มือจะมีข้อมูลที่เชื่อถือได้ก็ตาม"
- แสดงหลักฐานสนับสนุน: รวมกรณีทดสอบหลายรายการที่แสดงคิวรี แหล่งที่มาที่คาดหวัง และแหล่งข้อมูลที่ได้รับจริง
- ส่งเพื่อตรวจสอบ
- แบ่งปันข้อจำกัดและหลักฐานที่จัดทำเป็นเอกสารกับทีมแพลตฟอร์มเพื่อการติดตามและดำเนินการต่อ
ขั้นตอนที่ 5: ตรวจสอบความถูกต้อง
หลังจากปรับโครงสร้างคู่มือผลิตภัณฑ์และเพิ่มรายการคำถามที่พบบ่อยที่ซ้ำซ้อนแล้ว ให้เรียกใช้ชุดการประเมินที่เกี่ยวข้องอีกครั้งเพื่อตรวจสอบผลกระทบ
| ก่อน | หลัง |
|---|---|
| 78% (ไม่เปลี่ยนแปลงตลอดสี่รอบ) | 89% |
การประเมิน: วิธีแก้ปัญหาชั่วคราวช่วยปรับปรุงประสิทธิภาพโดยรวม ความล้มเหลวหนึ่งข้อยังคงอยู่ (FA-019) การสืบค้นมีความคลุมเครือเกินไปที่จะดึงแหล่งข้อมูลที่ถูกต้องได้อย่างน่าเชื่อถือ ความล้มเหลวนี้ถูกบันทึกเป็นข้อจำกัดที่ทราบ
ขั้นตอนที่ 6: บันทึกผล
อัปเดตบันทึกความล้มเหลวเพื่อสะท้อนถึงการจัดประเภทและผลลัพธ์ขั้นสุดท้าย
| กรณีทดสอบ | ชนิดสาเหตุหลัก | ปัญหาที่พบ | การเปลี่ยนแปลงที่ดำเนินการ | แก้ไขแล้ว |
|---|---|---|---|---|
| FA-002, 005, 008, 011, 014 | ข้อจำกัดของแพลตฟอร์ม | ระบบจัดอันดับผลการค้นคืนให้ความสำคัญกับคำถามที่พบบ่อยมากกว่าคู่มือผลิตภัณฑ์ | ปรับโครงสร้างหัวข้อคู่มือใหม่; ทำซ้ำข้อมูลจำเพาะสำคัญในคำถามที่พบบ่อย | ใช่ |
| FA-019 | ข้อจำกัดของแพลตฟอร์ม | คิวรีที่คลุมเครือไม่สามารถดึงแหล่งข้อมูลที่ถูกต้องได้อย่างน่าเชื่อถือ | จดบันทึกไว้ว่าเป็นข้อจำกัดที่ทราบแล้ว | ไม่ |
ประเด็นสำคัญ: หากคะแนนการประเมินผลยังคงไม่เปลี่ยนแปลงแม้มีการเปลี่ยนพร้อมท์หรือคำสั่งหลายครั้ง สาเหตุที่แท้จริงไม่น่าจะมาจากพร้อมท์ ตรวจสอบโครงสร้างพื้นฐานและลักษณะการทำงานของแพลตฟอร์มก่อนลงทุนเพิ่มเติมในกระบวนการออกแบบพร้อมท์
กรณีที่ 3: การถดถอยหลังการอัปเดต:
สถานการณ์: คุณได้อัปเดตพร้อมท์ของระบบเพื่อปรับปรุงโทนเสียงและความเห็นอกเห็นใจ คะแนนโทนเสียงเพิ่มขึ้น แต่ความถูกต้องของข้อเท็จจริงลดลงต่ำกว่าค่าเกณฑ์การบล็อก จึงทำให้เกิดการถดถอย
ก่อนการเปลี่ยนแปลง:
| ชุดการประเมิน | คะแนน |
|---|---|
| ความถูกต้องตามข้อเท็จจริง | 91% |
| โทนและคุณภาพ | 83% |
| อื่น ๆ ทั้งหมด | สูงกว่าเกณฑ์ |
คุณได้เพิ่มคำแนะนำต่อไปนี้ในพร้อมท์ของระบบ: "รับทราบข้อกังวลของลูกค้าและแสดงความเห็นอกเห็นใจเสมอก่อนที่จะให้คำตอบ เริ่มต้นทุกการตอบด้วยการยืนยันประสบการณ์ของลูกค้า"
หลังจากการเปลี่ยนแปลง:
| ชุดการประเมิน | ก่อน | หลัง | เดลตา |
|---|---|---|---|
| ความถูกต้องตามข้อเท็จจริง | 91% | 76% | -15% |
| โทนและคุณภาพ | 83% | 91% | +8% |
ขั้นตอนที่ 1: ตีความ (เลเยอร์ 1)
ขณะนี้ความถูกต้องตามข้อเท็จจริงอยู่ต่ำกว่าเกณฑ์การบล็อกที่ 80% การเปลี่ยนแปลงนี้ทำให้เกิดการถดถอยและขัดขวางความพร้อม
อ้างอิง: เลเยอร์ 1: ตีความคะแนนและระบุความล้มเหลว
ขั้นตอนที่ 2: ตรวจสอบรูปแบบ (เลเยอร์ 4)
การจับคู่รูปแบบข้ามสัญญาณ: โทนเสียงดีขึ้นในขณะที่ความแม่นยำลดลง
สาเหตุหลักที่ระบุ: ความขัดแย้งของคำสั่ง:
คำแนะนำด้านโทนเสียงที่เพิ่มใหม่นี้แข่งกับคำสั่งด้านความถูกต้องสำหรับการให้ความสำคัญของโมเดล
อ้างอิง: เลเยอร์ 4: วิเคราะห์รูปแบบและปรับปรุงเอเจนต์ของคุณอย่างต่อเนื่อง
ขั้นตอนที่ 3: คัดกรองความล้มเหลวใหม่ (เลเยอร์ 2)
ตรวจสอบกรณีทดสอบความถูกต้องตามข้อเท็จจริงที่ผ่านก่อนการเปลี่ยนแปลงและตอนนี้ล้มเหลว
กรณีการทดสอบ FA-007:
- อินพุต: "ขนาดการอัปโหลดไฟล์สูงสุดคือเท่าใด"
- ผลลัพธ์ที่คาดหวัง: "ขนาดสูงสุดของไฟล์ที่สามารถอัปโหลดได้คือ 25 MB สำหรับบัญชีมาตรฐาน และ 100 MB สำหรับบัญชีองค์กร"
- เอเจนต์ก่อน: "ขนาดสูงสุดของไฟล์ที่สามารถอัปโหลดได้คือ 25 MB สำหรับบัญชีมาตรฐาน และ 100 MB สำหรับบัญชีองค์กร"
- เอเจนต์หลัง: "ฉันเข้าใจความกังวลของคุณเกี่ยวกับขนาดการอัปโหลดไฟล์ดีค่ะ–มันอาจจะน่าหงุดหงิดเวลาที่คุณพยายามอัปโหลดเอกสารสำคัญ! ฉันอยากให้แน่ใจว่าคุณมีข้อมูลครบถ้วนตามที่คุณต้องการ ขนาดการอัปโหลดสูงสุดคือ 25 MB สำหรับแผนมาตรฐาน"
ขั้นตอนที่ 1 ตรวจสอบการประเมิน: คำตอบที่คาดหวังนั้นถูกต้องและการประเมินนั้นสมบูรณ์ การตอบหลังการอัปเดตจะละเว้นรายละเอียดบัญชีองค์กร
ขั้นตอนที่ 2 วินิจฉัย: ข้อกำหนดเรื่องโทนเสียงใหม่กำหนดให้มีคำนำความเห็นอกเห็นใจในทุกการตอบ ข้อกำหนดนี้ใช้งบประมาณการตอบและความสนใจของแบบจำลอง และนำไปสู่คำตอบข้อเท็จจริงที่ไม่สมบูรณ์
ประเภท: ปัญหาการกำหนดค่าเอเจนต์ ข้อขัดแย้งของคำสั่งระหว่างคำแนะนำด้านโทนเสียงกับความถูกต้อง
ข้อมูลอ้างอิง: ชั้นที่ 2: ความล้มเหลวของเอเจนต์คัดกรอง
ขั้นตอนที่ 4: แก้ไข (เลเยอร์ 3)
ปัญหาไม่ได้อยู่ที่คำแนะนำเรื่องน้ำเสียงเอง แต่เป็นลำดับความสำคัญที่แข่งขันกันภายในพร้อมท์ของระบบ การแก้ไขมุ่งเน้นไปที่การแยกและจัดลำดับความสำคัญของคำแนะนำ
คำแนะนำเดิม (เดี่ยว, แข่งขัน): "โปรดรับทราบความกังวลของลูกค้าและแสดงความเห็นอกเห็นใจ ก่อนให้คำตอบของคุณ" เริ่มต้นทุกการตอบด้วยการยืนยันประสบการณ์ของลูกค้า"
คำแนะนำใหม่ (แยก จัดลำดับความสำคัญ): "รวมคำตอบข้อเท็จจริงที่สมบูรณ์สำหรับคำถามของลูกค้าเสมอ อย่าละเว้นรายละเอียดเพื่อความกระชับ นอกจากนี้ เมื่อลูกค้าแสดงความหงุดหงิดหรือกังวล ให้รับทราบโดยสังเขป"
การเปลี่ยนแปลงที่สำคัญ:
- เน้นความถูกต้องเป็นหลักอย่างชัดเจน
- ความสมบูรณ์ของคำตอบข้อเท็จจริงถูกระบุไว้อย่างชัดเจน
- ความเห็นอกเห็นใจเป็นแบบมีเงื่อนไข ไม่ใช่แบบทั่วไป
- "คร่าว ๆ" จำกัดความเห็นอกเห็นใจเพื่อป้องกันการตัดทอนเนื้อหา
การอ้างอิง: เลเยอร์ 3: เชื่อมโยงรูปแบบความล้มเหลวกับกลยุทธ์การแก้ไข
ขั้นตอนที่ 5: ตรวจสอบความถูกต้อง
เรียกใช้ชุดการประเมินแบบเต็มอีกครั้ง เนื่องจากการเปลี่ยนแปลงพร้อมท์ของระบบอาจมีผลกระทบในวงกว้าง
| ชุดการประเมิน | ก่อนการเปลี่ยนแปลง | หลังจากการถดถอย | หลังการเปลี่ยนแปลง |
|---|---|---|---|
| ความถูกต้องตามข้อเท็จจริง | 91% | 76% | 90% |
| โทนและคุณภาพ | 83% | 91% | 89% |
| อื่น ๆ ทั้งหมด | สูงกว่าเกณฑ์ | สูงกว่าเกณฑ์ | สูงกว่าเกณฑ์ |
การประเมิน: ขณะนี้สัญญาณทั้งสองผ่านเกณฑ์การบล็อกแล้ว โทนเสียงไม่ได้กลับสู่ระดับสูงสุดอย่างสมบูรณ์ แต่ยังคงอยู่เหนือเกณฑ์การบล็อก 75% และดีขึ้นเมื่อเทียบกับค่าพื้นฐานเดิม
ขั้นตอนที่ 6: บันทึกผล
| กรณีทดสอบ | ชนิดสาเหตุหลัก | ปัญหาที่พบ | การเปลี่ยนแปลงที่ดำเนินการ | แก้ไขแล้ว |
|---|---|---|---|---|
| FA-007, FA-012, FA-018 (และอื่น ๆ) | การกำหนดค่าเอเจนต์ | แนวทางการใช้โทนเสียงทำให้ความครบถ้วนของข้อเท็จจริงถูกเบี่ยงเบน | พร้อมท์ที่ปรับโครงสร้างใหม่เพื่อจัดลำดับความสำคัญของความถูกต้องและใช้ความเห็นอกเห็นใจแบบมีเงื่อนไข | ใช่ |
ข้อคิดสำคัญ: ควรประเมินการเปลี่ยนแปลงพร้อมท์ของระบบกับชุดการประเมินทั้งหมดเสมอ ไม่ใช่แค่สัญญาณเป้าหมายเท่านั้น คำสั่งต่าง ๆ แข่งขันกันเพื่อดึงความสนใจของโมเดล และการปรับปรุงในด้านหนึ่งอาจทำให้เกิดการถดถอยในส่วนอื่น ๆ
รูปแบบที่ควรสังเกต: สถานการณ์นี้เป็นตัวอย่างของปัญหาข้อจำกัดงบประมาณคำสั่ง เมื่อพร้อมท์พัฒนา ข้อขัดแย้งของคำสั่งมีโอกาสเกิดมากขึ้น การรวมและการทำให้ง่ายขึ้นเป็นระยะช่วยรักษาเสถียรภาพ
รูปแบบทั่วไปในการเดินทาง
การเดินทางแต่ละครั้งเริ่มต้นจากสถานการณ์ที่แตกต่างกันเพื่อแสดงเส้นทางการวินิจฉัยที่แตกต่างกัน หากต้องการดูว่าเอเจนต์เดียวดำเนินการผ่านวงจรชีวิตการประเมินทั้งหมด—การตีความคะแนน การจัดลำดับความสำคัญของความล้มเหลว การแก้ไข และการตรวจสอบ—โปรดตรวจสอบ การเดินทาง 1 ซึ่งให้ขั้นตอนการดำเนินงานอย่างละเอียดตั้งแต่ต้นจนจบที่ครบถ้วนที่สุด
ตารางนี้แสดงให้เห็นรูปแบบที่เกิดซ้ำในแต่ละเส้นทาง และเน้นย้ำบทเรียนเชิงปฏิบัติที่ได้รับจากแต่ละกรณีศึกษาเหล่านั้น
| รูปแบบ | ที่ปรากฏ | ประเด็นสำคัญ |
|---|---|---|
| ยืนยันความถูกต้องของการประเมินก่อนตรวจสอบเอเจนต์ | การเดินทาง 1 | หนึ่งในสาเหตุที่ทำให้เกิดความพยายามสูญเปล่าคือการวิเคราะห์ปัญหาลักษณะการทำงานของเอเจนต์เมื่อการประเมินเองไม่ถูกต้อง |
| คะแนนคงที่บ่งชี้ว่าสาเหตุของปัญหาถูกระบุผิด | การเดินทาง 2 | หากการแก้ไขซ้ำ ๆ ไม่ได้ผลให้ดีขึ้น ควรปรับประเภทของปัญหาใหม่ คุณอาจกำลังจัดการกับสาเหตุของปัญหาที่ผิด |
| เรียกใช้ชุดการประเมินผลทั้งหมดหลังจากการเปลี่ยนแปลงพร้อมท์ | การเดินทาง 3 | การเปลี่ยนแปลงพร้อมท์สามารถส่งผลต่อสัญญาณคุณภาพหลายอย่างได้ ตรวจสอบการถดถอยนอกพื้นที่เป้าหมายเสมอ |
| บันทึกผลลัพธ์และการตัดสินใจ | การเดินทางทั้งหมด | การเก็บบันทึกความล้มเหลวช่วยป้องกันไม่ให้พบสาเหตุเดิมซ้ำอีกในรอบถัดไป |
| ช่องว่างที่ทราบสามารถยอมรับได้ | การเดินทาง 1 (KG-007), การเดินทาง 2 (FA-019) | ไม่ใช่ทุกความล้มเหลวที่ต้องได้รับการแก้ไขก่อนจัดส่ง บันทึกช่องว่างที่ทราบแล้วและเฝ้าติดตามอย่างต่อเนื่อง |
ขั้นตอนถัดไป
หลังจากทบทวนตัวอย่างเหล่านี้แล้ว เลือกขั้นตอนถัดไปที่สอดคล้องกับสถานการณ์ปัจจุบันของคุณมากที่สุด:
- เริ่มต้นด้วยการตีความคะแนนหากคุณมีผลการประเมินพร้อมที่จะประเมิน
- เริ่มการคัดกรองความล้มเหลว หากคุณต้องการวินิจฉัยความล้มเหลวของกรณีทดสอบที่เฉพาะเจาะจง
- ใช้การวิเคราะห์รูปแบบ: หากคุณกำลังทำงานกับความล้มเหลวหลายครั้งและต้องการระบุปัญหาเชิงระบบ
- ตั้งค่าการบันทึกความล้มเหลว: เพื่อติดตามการตัดสินใจ ผลลัพธ์ และปัญหาที่เกิดซ้ำ
- กลับไปที่เป้าหมายของเฟรมเวิร์ก เพื่อทบทวนแนวทางการคัดแยกการประเมินที่สมบูรณ์