หมายเหตุ
การเข้าถึงหน้านี้ต้องได้รับการอนุญาต คุณสามารถลอง ลงชื่อเข้าใช้หรือเปลี่ยนไดเรกทอรีได้
การเข้าถึงหน้านี้ต้องได้รับการอนุญาต คุณสามารถลองเปลี่ยนไดเรกทอรีได้
ส่วนต่อไปนี้ใช้กับทุกการเปลี่ยนแปลงรุ่น ไม่ว่าจะเป็นการอัปเกรดเชิงรุกหรือการตอบสนองต่อการเกษียณ กําหนดเกตก่อน เก็บข้อมูลพื้นฐานจากโมเดลปัจจุบัน แล้วค่อยดําเนินการตามแต่ละขั้นตอน
กําหนดประตูรับการย้ายข้อมูล
กําหนดเกณฑ์การยอมรับก่อนประเมินโมเดลผู้สมัคร เพื่อให้ การประเมินตัวแทน ได้ผลการตัดสินใจ ไม่ใช่แค่ชุดคะแนนเท่านั้น รวม:
- อัตราการผ่านโดยรวมขั้นต่ํา
- อัตราการผ่านที่จําเป็นสําหรับสถานการณ์ที่สําคัญต่อธุรกิจ
- ความล้มเหลวร้ายแรงที่บล็อกการย้ายข้อมูลไม่ว่าจะมีคะแนนรวมเท่าใด
- ความแปรปรวนของความหน่วงและความน่าเชื่อถือที่อนุญาต
- ความปลอดภัย การปฏิบัติตามข้อกําหนด และการอนุมัติการประมวลผลในระดับภูมิภาค
- การใช้พลังงานหรือผลกระทบต่อต้นทุนที่ยอมรับได้
- การอนุมัติจากเจ้าของและผู้อนุมัติการปล่อยสิทธิ์ที่จําเป็น
เปรียบเทียบโมเดลปัจจุบันและโมเดลผู้สมัครโดยใช้การกําหนดค่าเอเจนต์ ข้อมูลทดสอบ ชุดทดสอบ โปรไฟล์ผู้ใช้ และสมมติฐานสภาพแวดล้อมเดียวกัน ศึกษาการถดถอยแต่ละรายการแทนที่จะพึ่งพาคะแนนเฉลี่ยเพียงอย่างเดียว
ผลลัพธ์ของโมเดลเป็นแบบความน่าจะเป็น รันสถานการณ์สําคัญมากกว่าหนึ่งครั้งเมื่อความแปรปรวนส่งผลต่อการตัดสินใจ
กําหนดมาตรฐานการประเมินที่นํากลับมาใช้ใหม่ได้
ก่อนที่คุณจะเปลี่ยนโมเดล ให้สร้างชุดทดสอบที่แสดงถึงสถานการณ์ที่สําคัญทางธุรกิจและความถี่สูงของเอเจนต์ รันชุดทดสอบกับโมเดลการผลิตปัจจุบันเพื่อสร้างค่าพื้นฐาน
ใช้ทั้งแชททดสอบและการประเมินเอเจนต์:
- ใช้แชททดสอบเพื่อสํารวจบทสนทนาทั้งหมดและตรวจสอบการจัดเรียงเพลงด้วยแผนที่กิจกรรม
- ใช้ การประเมินตัวแทน เพื่อ รันชุดทดสอบที่ทําซ้ําได้ วัดผลลัพธ์ และเปรียบเทียบการรันตามเวลา
วิธีการทดสอบที่คุณมีขึ้นอยู่กับ สายรัดของตัวแทน ดังนั้นควรตรวจสอบให้แน่ใจก่อนออกแบบชุดทดสอบ ดูข้อมูลเพิ่มเติมในส่วน ยืนยันวิธีการทดสอบที่เอเจนต์ของคุณรองรับ
ประเมินพฤติกรรมของเอเจนต์ทั้งหมด
อย่าอนุมัติรุ่นทดแทนเพียงเพราะอัตราการผ่านรวมใกล้เคียงกับรุ่นปัจจุบัน
ครอบคลุมพื้นที่ดังต่อไปนี้ แต่ละอย่างเป็นพฤติกรรมที่มักจะเปลี่ยนแปลงเมื่อโมเดลเปลี่ยนแปลง ดังนั้นชุดทดสอบที่ละเว้นพื้นที่ใดพื้นที่หนึ่งจะไม่สามารถตรวจจับการถดถอยในนั้นได้
| พื้นที่ประเมินผล | การเปลี่ยนแปลงโมเดลสามารถทําลายอะไรได้ | วิธีตรวจสอบ |
|---|---|---|
| คุณภาพของคําตอบ | ความเกี่ยวข้อง ความครบถ้วน ความถูกต้อง ความชัดเจน และความสม่ําเสมอในคําถามที่เจ้าหน้าที่ได้รับบ่อยที่สุด | คุณภาพทั่วไป |
| ความมั่นคงและความรู้ | โมเดลจะตอบจากข้อมูลฝึกสอนแทนแหล่งความรู้ที่กําหนดค่าไว้ ตัดการอ้างอิง หรือจัดการแหล่งข้อมูลที่ไม่สมบูรณ์หรือขัดแย้งกันแตกต่างออกไป | คุณภาพทั่วไป |
| การงดออกเสียง | โมเดลนี้ตอบคําถามที่อยู่นอกขอบเขตแทนที่จะปฏิเสธหรือยกระดับ | คุณภาพทั่วไป หรือแบบสั่งทําพร้อมป้ายตอบกลับและปฏิเสธ |
| คําแนะนําต่อไปนี้ | คําแนะนําที่โมเดลปฏิบัติตามอย่างน่าเชื่อถือจะถูกข้ามไป เช่น กฎการยกระดับ ขอบเขต พฤติกรรมต้องห้าม หรือข้อจํากัดความรับผิดชอบที่บังคับใช้ | จับคู่คีย์เวิร์ดในวลีที่ต้องการ หรือ Custom พร้อมป้ายกํากับเฉพาะคําสั่ง |
| ค่าคงที่และรูปแบบผลลัพธ์ | ค่าที่แม่นยํา เช่น หมายเลขโทรศัพท์ รหัส หรือ ID จะถูกนํามาปรับเปลี่ยนหรือประดิษฐ์ขึ้น หรือรูปร่างผลลัพธ์จะเปลี่ยนแปลงและทําให้ตัวแยกวิเคราะห์หรือการรวมช่องทางด้านล่างเสียหาย | ตรงกันเป๊ะ หรือ Keyword match ตามรูปแบบที่ต้องการ |
| การเลือกเครื่องมือและการควบคุม | โมเดลจะเลือกเครื่องมืออื่น เรียกใช้ none หรือเรียกใช้เครื่องมือเมื่อไม่ต้องการเครื่องมือ | การใช้เครื่องมือโดยกําหนดเครื่องมือหรือหัวข้อที่คาดหวัง พร้อมการตรวจสอบแผนที่กิจกรรม |
| อินพุตเครื่องมือและการจัดลําดับ | พารามิเตอร์จะถูกดึงออกมา จัดรูปแบบ หรือกําหนดค่าเริ่มต้นแตกต่างกัน หรือขั้นตอนในงานมัลติทูลถูกจัดเรียงใหม่ รวม หรือยกเลิก | การใช้เครื่องมือกับเครื่องมือที่คาดหวังทั้งหมด พร้อมคุณภาพโดยรวม |
| การยืนยันและการจัดการความล้มเหลว | โมเดลจะหยุดถามยืนยันก่อนการดําเนินการที่ตามมา หรือแสดงข้อผิดพลาดของเครื่องมือในรูปแบบที่ต่างออกไปแทนที่จะรายงาน | กําหนดเองพร้อมป้ายยืนยัน พร้อมการจับคู่คําสําคัญในภาษาข้อผิดพลาดที่คาดไว้ |
| พฤติกรรมหลายรอบ | บริบทจากเทิร์นก่อนหน้าหายไปหรือถูกตีความใหม่ หรือการชี้แจง การเปลี่ยนหัวข้อ และการกู้คืนถูกจัดการแตกต่างกัน | คุณภาพโดยรวมของชุดทดสอบสนทนา |
| ข้อมูลที่ยุ่งเหยิงและขัดแย้งกัน | การจัดการคําผิด ชิ้นส่วน และเจตนาที่ไม่ชัดเจน หรือการตอบสนองที่แตกต่างต่อการฉีดพรอมต์และการแทนที่บทบาท | คุณภาพโดยรวม พร้อมฉลากสั่งทําพิเศษพร้อมฉลากปฏิเสธและฉลากที่ปฏิบัติตาม |
| ความปลอดภัยและการปฏิบัติตาม | การจัดการเนื้อหาที่เป็นอันตราย การเข้าถึงข้อมูล สิทธิ์ การประมวลผลระดับภูมิภาค และข้อกําหนด AI อย่างรับผิดชอบ | ป้ายกํากับแบบกําหนดเอง พร้อมการตรวจสอบ AI อย่างรับผิดชอบ |
| ความหน่วงและความน่าเชื่อถือ | เวลาตอบสนอง, เวลาหมด, ความแปรปรวน, การโทรล้มเหลว และการลองใหม่ภายใต้เงื่อนไขที่เป็นตัวแทน | ไม่ได้รายงานโดยการประเมิน วัดผลในแชททดสอบและการตรวจสอบการผลิต |
| การใช้พลังงานและต้นทุน | Copilot การใช้เครดิตหรือค่าใช้จ่ายอื่น ๆ ที่เกี่ยวข้องกับโมเดลสําหรับสถานการณ์ที่เป็นตัวแทน | ไม่ได้รายงานโดยการประเมิน วัดผลจากการรายงานความจุและการบริโภค |
| ภาษาและช่อง | คุณภาพและพฤติกรรมข้ามภาษาที่รองรับ โปรไฟล์ผู้ใช้ และช่องทางการปรับใช้ | รันชุดทดสอบสําหรับแต่ละภาษา โปรไฟล์ผู้ใช้ และช่องทางที่สําคัญ |
ให้ความสนใจเป็นพิเศษกับการปฏิบัติตามคําสั่งและความหน่วงเวลา โมเดลผู้สมัครสามารถปรับปรุงคุณภาพคําตอบได้ แต่จะทําให้เกิดการตอบสนองที่ช้าลง พฤติกรรมการเลือกเครื่องมือที่แตกต่างกัน หรือความล้มเหลวในคําสั่งที่เคยเชื่อถือได้ในโมเดลก่อนหน้า
ยืนยันวิธีการทดสอบที่เอเจนต์ของคุณรองรับ
วิธีการทดสอบที่ตัวแทนของคุณมีขึ้นอยู่กับสายรัดของมัน
เรียนรู้เพิ่มเติมใน:
สร้างและดูแลชุดทดสอบ
- ครอบคลุมเส้นทางที่มีความสําคัญต่อธุรกิจและคําขอที่มีปริมาณมากก่อน จากนั้นจึงเป็นกรณีที่ยาก เช่น กรณีขอบ อินพุตที่เป็นฝ่ายตรงข้าม คําขอที่ควรถูกปฏิเสธหรือยกระดับ เครื่องมือล้มเหลว การสนทนาที่ยาวนาน และคําขอหลายภาษา
- เริ่มจากจราจรจริง ธีมการวิเคราะห์และการสนทนาที่บันทึกไว้สร้างกรณีทดสอบที่เป็นตัวแทนมากกว่ากรณีที่คิดขึ้นมา
- ให้ความสําคัญกับการปกปิดมากกว่าการขัดเกลา กรณีที่ไม่สมบูรณ์จํานวนมากจะพบการถดถอยมากกว่าชุดกรณีที่เขียนได้สมบูรณ์แบบจํานวนน้อย
- ให้คะแนนโมเดลปัจจุบันก่อน แล้วค่อยประเมินผู้สมัคร การเปรียบเทียบ ไม่ใช่ตัวเลขที่แน่นอน จะบอกคุณว่าการย้ายข้อมูลปลอดภัยหรือไม่
- เก็บชุดไว้กับ agent ในระบบควบคุมซอร์สโค้ด และรันซ้ําโดยไม่เปลี่ยนแปลงทุกครั้งที่เปลี่ยนโมเดล
- แบ่งชุดโดยแบ่งตามพื้นที่ความเสี่ยง ชุดทดสอบที่ใช้ฮาร์เนสมาตรฐานสามารถบรรจุกรณีทดสอบได้สูงสุด 100 กรณี ดังนั้นควรใช้ชุดแยกสําหรับความแม่นยําของความรู้ พฤติกรรมเครื่องมือ และสถานการณ์ที่คํานึงถึงความปลอดภัย
- ส่งออกผลลัพธ์ ผลการประเมินจะถูกเก็บไว้เป็นเวลา 89 วัน ดังนั้นส่งออกเป็น CSV เพื่อบันทึกคะแนนของแต่ละโมเดลในช่วงเวลาย้ายข้อมูล
- แปลงเหตุการณ์ในการผลิตและข้อเสนอแนะจากผู้ใช้ให้เป็นการทดสอบถดถอยใหม่
เรียนรู้เพิ่มเติมเกี่ยวกับการออกแบบและการใช้งานการประเมินเอเจนต์
Note
การประเมินตัวแทนวัดความถูกต้องและประสิทธิภาพ ไม่ใช่จริยธรรมของ AI หรือปัญหาด้านความปลอดภัย เจ้าหน้าที่สามารถผ่านทุกกรณีทดสอบแล้วยังให้คําตอบที่ไม่เหมาะสมได้ ใช้ การตรวจสอบ AI อย่างรับผิดชอบ และตัวกรองความปลอดภัยของเนื้อหาควบคู่ไปกับการประเมิน
อัตโนมัติการประเมินผลซ้ํา
Copilot Studio รองรับการรันการประเมินผลผ่าน Power Platform API เพื่อให้คุณสามารถผสานการตรวจสอบโมเดลเข้ากับเวิร์กโฟลว์การปล่อยและกระบวนการบูรณาการอย่างต่อเนื่อง สําหรับทรัพย์สินของตัวแทนขนาดใหญ่ ระบบอัตโนมัติคือสิ่งที่ทําให้การทดสอบผู้สมัครซ้ํา ๆ เป็นไปอย่างยั่งยืนแทนที่จะเป็นการทดสอบด้วยมือ เรียนรู้เพิ่มเติมได้ที่ อัตโนมัติการประเมินผลด้วย Power Platform API
อัปเดตอาร์ติแฟกต์เอเจนต์ที่การเปลี่ยนแปลงโมเดลมีผล
การเปลี่ยนแปลงโมเดลแทบจะไม่ส่งผลเฉพาะกับการตั้งค่าโมเดลเท่านั้น แปลคําแนะนําผู้ให้บริการที่เกี่ยวข้องเป็นอาร์ติแฟกต์ตัวแทนที่คุณควบคุม จากนั้นตรวจสอบความถูกต้องของการเปลี่ยนแปลงทุกครั้งตามค่าพื้นฐานการประเมินของคุณ การฟื้นฟูที่ไม่ได้รับการทดสอบซ้ําเป็นแค่การคาดเดา
| ของโบราณ | การเปลี่ยนแปลงทั่วไป |
|---|---|
| คำสั่งสำหรับเอเจนต์ | ทําให้ความคาดหวังโดยนัยชัดเจน ลบวิธีแก้ไขที่เขียนไว้สําหรับโมเดลก่อนหน้า ย้ําขอบเขตและกฎการยกระดับและพฤติกรรมต้องห้ามอย่างชัดเจน แก้ไขคําสั่งที่ขัดแย้งกัน และปรับเทียบว่าเจ้าหน้าที่ควรดําเนินการอย่างอิสระมากน้อยเพียงใด |
| คําแนะนําหัวข้อและโหนด | ใช้วิธีเดียวกันในระดับหัวข้อ และตรวจสอบว่าโหนดคําตอบเชิงสร้างสรรค์ยังคงทํางานตามที่คาดหวัง |
| คําอธิบายเครื่องมือและการดําเนินการ | เขียนใหม่เพื่อความชัดเจน คําอธิบายนี้คือสิ่งที่โมเดลอ่านเพื่อตัดสินใจว่าจะเรียกใช้เครื่องมือเมื่อใดและหรือไม่ และคําอธิบายที่คลุมเครือจะทําให้เกิดการเรียกเกินและเรียกน้อยเกินไป |
| คําอธิบายพารามิเตอร์อินพุตและเอาต์พุต | ปรับรูปแบบ หน่วย ตัวอย่าง และความหมายที่จําเป็นหรือทางเลือกให้แน่นขึ้น เพื่อให้การสร้างพารามิเตอร์ยังคงถูกต้อง |
| การกําหนดค่าแหล่งความรู้ | ตรวจสอบคําแนะนําการเลือกแหล่งที่มา ขอบเขต และการต่อสาย และตรวจสอบพฤติกรรมการอ้างอิง |
| คําแนะนําการจัดรูปแบบการตอบกลับ | กรุณาระบุโครงสร้าง ความยาว ข้อจํากัดความรับผิดชอบ และค่าที่แน่นอนอย่างชัดเจน เพราะรุ่นใหม่จะเปลี่ยนความยาวเริ่มต้น |
| ประตูยืนยันและประตูนิรภัย | ยืนยันข้อกําหนดการยืนยันอย่างชัดเจนก่อนดําเนินการตามมา |
| ผู้บริโภคปลายน้ํา | อัปเดตโฟลว์ Power Automate, การ์ดแบบปรับเปลี่ยน, การผสานรวมช่องทาง และตัววิเคราะห์ใด ๆ ที่อ่านผลลัพธ์ของเอเจนต์ |
| ชุดทดสอบเอง | เพิ่มรูปแบบความล้มเหลวใหม่ที่ค้นพบระหว่างการย้ายข้อมูล |
ระยะการย้ายถิ่น
ขั้นตอนต่อไปนี้จะจัดลําดับการดําเนินการในส่วนก่อนหน้า ใช้เป็นแผนการทํางานสําหรับการเปลี่ยนแปลงโมเดลของตัวแทนคนเดียว ไม่ว่าจะเป็นการเปลี่ยนแปลงเชิงรุกหรือขับเคลื่อนด้วยการเกษียณ
ขั้นตอนที่ 0: เตรียมตัว
- ยืนยันว่าโมเดลที่สมัครเหมาะสม กับ เงื่อนไขเบื้องต้น: พร้อมใช้งานทั่วไปหรือค่าเริ่มต้น, พร้อมใช้งานในภูมิภาค, สถานะข้ามภูมิภาคที่ยอมรับได้, เปิดใช้งานโดยผู้ดูแลระบบ และหมวดหมู่การใช้งานที่เหมาะสมสําหรับวัตถุประสงค์ของเอเจนต์
- อ่านคําแนะนําการอัปเกรดของผู้ให้บริการโมเดล และจดบันทึกคําแนะนําและการเปลี่ยนแปลงเครื่องมือที่สื่อถึง
- ระบุตัวแทนที่ได้รับผลกระทบ จากคลังสินค้า สภาพแวดล้อมการบันทึก เจ้าของ และความวิกฤต
- ยืนยันวิธีการทดสอบการประเมินที่สายรัดของเอเจนต์รองรับ
- กําหนดและอนุมัติประตูการยอมรับการย้ายข้อมูล
ขั้นตอนที่ 1: กําหนดมาตรฐานของโมเดลปัจจุบัน
- สร้างหรือปรับปรุงชุดทดสอบถดถอย ให้ครอบคลุมสถานการณ์ที่สําคัญต่อธุรกิจและสถานการณ์ที่มีความถี่สูง
- รันชุดทดสอบกับโมเดลการผลิตปัจจุบัน เพื่อกําหนดค่าพื้นฐาน ทําเช่นนี้ในขณะที่โมเดลปัจจุบันยังอยู่ เพราะหลังจากโมเดลเปลี่ยน baseline จะไม่สามารถสร้างใหม่ได้
- บันทึกความหน่วงและการใช้เครดิต Copilot แยกกัน การประเมินผลไม่ได้รายงานพวกเขา
- ส่งออกผลลัพธ์เป็น CSV เพื่อเก็บบันทึกไว้เกินช่วงเวลาการเก็บรักษา
ขั้นตอนที่ 2: ประเมินผู้สมัครในสภาพแวดล้อมที่ไม่ใช่การผลิต
เตรียมสําเนาเอเจนต์ที่ไม่ใช่การผลิตจริง ตามคําแนะนําของ Copilot Studio สําหรับการจัดการวงจรชีวิตแอปพลิเคชันและการทดสอบเอเจนต์ กําหนดค่าสภาพแวดล้อมให้แทนการผลิต:
- ใช้คําแนะนําเอเจนต์ หัวข้อ การตั้งค่าความรู้ เครื่องมือ โฟลว์ ตัวเชื่อมต่อ ภาษา และสมมติฐานความปลอดภัยเดียวกัน
- ใช้ตัวตนและการเชื่อมต่อที่เป็นตัวแทนของการทดสอบ
- ใช้นโยบายข้อมูลเดียวกันและการควบคุมผู้ดูแลระบบที่เกี่ยวข้อง
- ยืนยันความพร้อมใช้งานในแต่ละภูมิภาคและตรวจสอบว่าจําเป็นต้องย้ายข้อมูลข้ามภูมิภาคหรือไม่
- บันทึกความแตกต่างระหว่างการทดสอบและการผลิตที่อาจส่งผลต่อผลลัพธ์
เปลี่ยนโมเดล ไปที่หน้าภาพรวมของเอเจนต์และเลือกโมเดลหลักที่เป็นไปได้ในส่วนโมเดล มีการตั้งค่าแยกต่างหากสําหรับการให้เหตุผลเชิงลึก การตอบสนองเชิงสร้างสรรค์ และตัวสร้างพรอมต์ ดังนั้นตรวจสอบว่าเอเจนต์ใช้ความสามารถเหล่านั้นหรือไม่ และจําเป็นต้องเปลี่ยนแปลงด้วย
รันชุดทดสอบเดียวกันใหม่โดยไม่เปลี่ยนแปลงกับโมเดลผู้สมัคร
เปรียบเทียบการวิ่งสองครั้ง นี้กับประตูการยอมรับเพื่อระบุการปรับปรุงและการถดถอย
ตรวจสอบการจัดการเชิงคุณภาพ ในแชททดสอบ โดยใช้แผนที่กิจกรรมเพื่อยืนยันว่าเครื่องมือใดถูกเลือก ลําดับใด และด้วยพารามิเตอร์ใด
วัดความหน่วงและการบริโภค ของผู้สมัคร แล้วเปรียบเทียบกับค่าพื้นฐาน
ขั้นตอนที่ 3: แก้ไข
- อัปเดตอาร์ติแฟกต์ของเอเจนต์ที่การเปลี่ยนแปลงโมเดลได้รับผลกระทบ จากนั้นรันชุดทดสอบใหม่กับเอเจนต์ที่แก้ไขแล้ว เรียนรู้เพิ่มเติมได้ที่ ปรับปรุงเจ้าหน้าที่โดยใช้การคัดกรองและแก้ไขที่ขับเคลื่อนด้วยการประเมินผล
- ทําซ้ําจนกว่าจะถึงเกณฑ์การยอมรับ หรือสรุปว่าโมเดลผู้สมัครไม่เหมาะสมและบันทึกเหตุผล การตัดสินใจไม่อัปเกรดเป็นผลลัพธ์ที่ถูกต้องและมีหลักฐานรองรับ
ขั้นตอนที่ 4: อนุมัติและติดตั้ง
- ขออนุมัติ จากเจ้าของตัวแทนและผู้อนุมัติการปล่อยสิทธิ์ในขั้นตอนการยอมรับ รวมถึงการอนุมัติด้านความปลอดภัยและการปฏิบัติตามข้อกําหนดเมื่อมีการใช้โมเดลข้ามภูมิภาคหรือภายนอก
- ติดตั้งผ่านกระบวนการ ALM ที่กําหนดไว้ โดยส่งเสริม โซลูชัน ตั้งแต่การทดสอบจนถึงการผลิต อย่าแก้ไขเอเจนต์ผลิตด้วยตนเอง
- จัดขั้นตอนการเปิดตัว เมื่อช่องสัญญาณอนุญาต เผยแพร่ไปยังกลุ่มเป้าหมายนําร่องหรือช่องทางเดียวก่อน สังเกตผลลัพธ์ แล้วขยายขอบเขต
ขั้นตอนที่ 5: ตรวจสอบและปิด
- ตรวจสอบพฤติกรรมการผลิต ตามประตูการยอมรับ
- เพิ่มรูปแบบความล้มเหลวที่ค้นพบใหม่ลงในชุดทดสอบถดถอย
- ปิดการย้ายข้อมูลก็ต่อเมื่อเกณฑ์การยอมรับยังคงเป็นไปตาม ข้อกําหนดในการผลิต
- เก็บรักษาหลักฐานการประเมินและบันทึกการตัดสินใจย้าย ข้อมูลเพื่อการตรวจสอบและเหตุการณ์วงจรชีวิตถัดไป
Important
เส้นทางย้อนกลับสําหรับการเปลี่ยนแปลงโมเดลคือการนําเวอร์ชันโซลูชันที่ผ่านการตรวจสอบก่อนหน้านี้มาปรับใช้ใหม่ ซึ่งช้ากว่าการสลับการตั้งค่า ความแตกต่างนี้ทําให้ประตูประเมินผลใน เฟส 2 มีความสําคัญมาก การจับการถดถอยก่อนการใช้งานมีต้นทุนน้อยกว่าการย้อนกลับหลังจากนั้น
ตรวจสอบหลังการย้ายข้อมูล
งานวงจรชีวิตของโมเดลจะดําเนินต่อไปหลังจากการปรับใช้ การตรวจสอบ:
- ผลการประเมินตัวแทนและอัตราการผ่านสถานการณ์วิกฤต
- การวิเคราะห์การผลิต, บันทึกการสนทนา, กิจกรรม, ข้อผิดพลาด และข้อเสนอแนะจากผู้ใช้
- ความล้มเหลวในการปฏิบัติตามคําสั่งและการเลือกเครื่องมือ
- ความหน่วง, เวลาหมด และความน่าเชื่อถือ
- การบริโภคเปลี่ยนแปลง
- ความปลอดภัย การปฏิบัติตามข้อกําหนด และข้อกังวลเกี่ยวกับการประมวลผลในระดับภูมิภาค
เมื่อการตรวจสอบการผลิตพบรูปแบบความล้มเหลวใหม่ ให้เพิ่มกรณีตัวอย่างลงในชุดทดสอบถดถอย แนวปฏิบัตินี้ช่วยปรับปรุงการประเมินโมเดลถัดไปและเปลี่ยนการเรียนรู้จากการผลิตให้เป็นมาตรฐานคุณภาพที่ยั่งยืน
เทเลเมทรีระดับสภาพแวดล้อม ปล่อย OpenTelemetry GenAI ไปจนถึง Application Insights รวมถึงโมเดลที่ใช้สําหรับการเรียกใช้งานแต่ละครั้ง ใช้เพื่อยืนยันว่าการใช้งานจริงของโมเดลใดทํางานอยู่ และเปรียบเทียบการเลือกเครื่องมือและความน่าเชื่อถือก่อนและหลังการย้ายข้อมูล