รันและตรวจสอบความถูกต้องของการย้ายโมเดล AI สําหรับเอเจนต์ Copilot Studio

ส่วนต่อไปนี้ใช้กับทุกการเปลี่ยนแปลงรุ่น ไม่ว่าจะเป็นการอัปเกรดเชิงรุกหรือการตอบสนองต่อการเกษียณ กําหนดเกตก่อน เก็บข้อมูลพื้นฐานจากโมเดลปัจจุบัน แล้วค่อยดําเนินการตามแต่ละขั้นตอน

กําหนดประตูรับการย้ายข้อมูล

กําหนดเกณฑ์การยอมรับก่อนประเมินโมเดลผู้สมัคร เพื่อให้ การประเมินตัวแทน ได้ผลการตัดสินใจ ไม่ใช่แค่ชุดคะแนนเท่านั้น รวม:

  • อัตราการผ่านโดยรวมขั้นต่ํา
  • อัตราการผ่านที่จําเป็นสําหรับสถานการณ์ที่สําคัญต่อธุรกิจ
  • ความล้มเหลวร้ายแรงที่บล็อกการย้ายข้อมูลไม่ว่าจะมีคะแนนรวมเท่าใด
  • ความแปรปรวนของความหน่วงและความน่าเชื่อถือที่อนุญาต
  • ความปลอดภัย การปฏิบัติตามข้อกําหนด และการอนุมัติการประมวลผลในระดับภูมิภาค
  • การใช้พลังงานหรือผลกระทบต่อต้นทุนที่ยอมรับได้
  • การอนุมัติจากเจ้าของและผู้อนุมัติการปล่อยสิทธิ์ที่จําเป็น

เปรียบเทียบโมเดลปัจจุบันและโมเดลผู้สมัครโดยใช้การกําหนดค่าเอเจนต์ ข้อมูลทดสอบ ชุดทดสอบ โปรไฟล์ผู้ใช้ และสมมติฐานสภาพแวดล้อมเดียวกัน ศึกษาการถดถอยแต่ละรายการแทนที่จะพึ่งพาคะแนนเฉลี่ยเพียงอย่างเดียว

ผลลัพธ์ของโมเดลเป็นแบบความน่าจะเป็น รันสถานการณ์สําคัญมากกว่าหนึ่งครั้งเมื่อความแปรปรวนส่งผลต่อการตัดสินใจ

กําหนดมาตรฐานการประเมินที่นํากลับมาใช้ใหม่ได้

ก่อนที่คุณจะเปลี่ยนโมเดล ให้สร้างชุดทดสอบที่แสดงถึงสถานการณ์ที่สําคัญทางธุรกิจและความถี่สูงของเอเจนต์ รันชุดทดสอบกับโมเดลการผลิตปัจจุบันเพื่อสร้างค่าพื้นฐาน

ใช้ทั้งแชททดสอบและการประเมินเอเจนต์:

วิธีการทดสอบที่คุณมีขึ้นอยู่กับ สายรัดของตัวแทน ดังนั้นควรตรวจสอบให้แน่ใจก่อนออกแบบชุดทดสอบ ดูข้อมูลเพิ่มเติมในส่วน ยืนยันวิธีการทดสอบที่เอเจนต์ของคุณรองรับ

ประเมินพฤติกรรมของเอเจนต์ทั้งหมด

อย่าอนุมัติรุ่นทดแทนเพียงเพราะอัตราการผ่านรวมใกล้เคียงกับรุ่นปัจจุบัน

ครอบคลุมพื้นที่ดังต่อไปนี้ แต่ละอย่างเป็นพฤติกรรมที่มักจะเปลี่ยนแปลงเมื่อโมเดลเปลี่ยนแปลง ดังนั้นชุดทดสอบที่ละเว้นพื้นที่ใดพื้นที่หนึ่งจะไม่สามารถตรวจจับการถดถอยในนั้นได้

พื้นที่ประเมินผล การเปลี่ยนแปลงโมเดลสามารถทําลายอะไรได้ วิธีตรวจสอบ
คุณภาพของคําตอบ ความเกี่ยวข้อง ความครบถ้วน ความถูกต้อง ความชัดเจน และความสม่ําเสมอในคําถามที่เจ้าหน้าที่ได้รับบ่อยที่สุด คุณภาพทั่วไป
ความมั่นคงและความรู้ โมเดลจะตอบจากข้อมูลฝึกสอนแทนแหล่งความรู้ที่กําหนดค่าไว้ ตัดการอ้างอิง หรือจัดการแหล่งข้อมูลที่ไม่สมบูรณ์หรือขัดแย้งกันแตกต่างออกไป คุณภาพทั่วไป
การงดออกเสียง โมเดลนี้ตอบคําถามที่อยู่นอกขอบเขตแทนที่จะปฏิเสธหรือยกระดับ คุณภาพทั่วไป หรือแบบสั่งทําพร้อมป้ายตอบกลับและปฏิเสธ
คําแนะนําต่อไปนี้ คําแนะนําที่โมเดลปฏิบัติตามอย่างน่าเชื่อถือจะถูกข้ามไป เช่น กฎการยกระดับ ขอบเขต พฤติกรรมต้องห้าม หรือข้อจํากัดความรับผิดชอบที่บังคับใช้ จับคู่คีย์เวิร์ดในวลีที่ต้องการ หรือ Custom พร้อมป้ายกํากับเฉพาะคําสั่ง
ค่าคงที่และรูปแบบผลลัพธ์ ค่าที่แม่นยํา เช่น หมายเลขโทรศัพท์ รหัส หรือ ID จะถูกนํามาปรับเปลี่ยนหรือประดิษฐ์ขึ้น หรือรูปร่างผลลัพธ์จะเปลี่ยนแปลงและทําให้ตัวแยกวิเคราะห์หรือการรวมช่องทางด้านล่างเสียหาย ตรงกันเป๊ะ หรือ Keyword match ตามรูปแบบที่ต้องการ
การเลือกเครื่องมือและการควบคุม โมเดลจะเลือกเครื่องมืออื่น เรียกใช้ none หรือเรียกใช้เครื่องมือเมื่อไม่ต้องการเครื่องมือ การใช้เครื่องมือโดยกําหนดเครื่องมือหรือหัวข้อที่คาดหวัง พร้อมการตรวจสอบแผนที่กิจกรรม
อินพุตเครื่องมือและการจัดลําดับ พารามิเตอร์จะถูกดึงออกมา จัดรูปแบบ หรือกําหนดค่าเริ่มต้นแตกต่างกัน หรือขั้นตอนในงานมัลติทูลถูกจัดเรียงใหม่ รวม หรือยกเลิก การใช้เครื่องมือกับเครื่องมือที่คาดหวังทั้งหมด พร้อมคุณภาพโดยรวม
การยืนยันและการจัดการความล้มเหลว โมเดลจะหยุดถามยืนยันก่อนการดําเนินการที่ตามมา หรือแสดงข้อผิดพลาดของเครื่องมือในรูปแบบที่ต่างออกไปแทนที่จะรายงาน กําหนดเองพร้อมป้ายยืนยัน พร้อมการจับคู่คําสําคัญในภาษาข้อผิดพลาดที่คาดไว้
พฤติกรรมหลายรอบ บริบทจากเทิร์นก่อนหน้าหายไปหรือถูกตีความใหม่ หรือการชี้แจง การเปลี่ยนหัวข้อ และการกู้คืนถูกจัดการแตกต่างกัน คุณภาพโดยรวมของชุดทดสอบสนทนา
ข้อมูลที่ยุ่งเหยิงและขัดแย้งกัน การจัดการคําผิด ชิ้นส่วน และเจตนาที่ไม่ชัดเจน หรือการตอบสนองที่แตกต่างต่อการฉีดพรอมต์และการแทนที่บทบาท คุณภาพโดยรวม พร้อมฉลากสั่งทําพิเศษพร้อมฉลากปฏิเสธและฉลากที่ปฏิบัติตาม
ความปลอดภัยและการปฏิบัติตาม การจัดการเนื้อหาที่เป็นอันตราย การเข้าถึงข้อมูล สิทธิ์ การประมวลผลระดับภูมิภาค และข้อกําหนด AI อย่างรับผิดชอบ ป้ายกํากับแบบกําหนดเอง พร้อมการตรวจสอบ AI อย่างรับผิดชอบ
ความหน่วงและความน่าเชื่อถือ เวลาตอบสนอง, เวลาหมด, ความแปรปรวน, การโทรล้มเหลว และการลองใหม่ภายใต้เงื่อนไขที่เป็นตัวแทน ไม่ได้รายงานโดยการประเมิน วัดผลในแชททดสอบและการตรวจสอบการผลิต
การใช้พลังงานและต้นทุน Copilot การใช้เครดิตหรือค่าใช้จ่ายอื่น ๆ ที่เกี่ยวข้องกับโมเดลสําหรับสถานการณ์ที่เป็นตัวแทน ไม่ได้รายงานโดยการประเมิน วัดผลจากการรายงานความจุและการบริโภค
ภาษาและช่อง คุณภาพและพฤติกรรมข้ามภาษาที่รองรับ โปรไฟล์ผู้ใช้ และช่องทางการปรับใช้ รันชุดทดสอบสําหรับแต่ละภาษา โปรไฟล์ผู้ใช้ และช่องทางที่สําคัญ

ให้ความสนใจเป็นพิเศษกับการปฏิบัติตามคําสั่งและความหน่วงเวลา โมเดลผู้สมัครสามารถปรับปรุงคุณภาพคําตอบได้ แต่จะทําให้เกิดการตอบสนองที่ช้าลง พฤติกรรมการเลือกเครื่องมือที่แตกต่างกัน หรือความล้มเหลวในคําสั่งที่เคยเชื่อถือได้ในโมเดลก่อนหน้า

ยืนยันวิธีการทดสอบที่เอเจนต์ของคุณรองรับ

วิธีการทดสอบที่ตัวแทนของคุณมีขึ้นอยู่กับสายรัดของมัน

เรียนรู้เพิ่มเติมใน:

สร้างและดูแลชุดทดสอบ

  • ครอบคลุมเส้นทางที่มีความสําคัญต่อธุรกิจและคําขอที่มีปริมาณมากก่อน จากนั้นจึงเป็นกรณีที่ยาก เช่น กรณีขอบ อินพุตที่เป็นฝ่ายตรงข้าม คําขอที่ควรถูกปฏิเสธหรือยกระดับ เครื่องมือล้มเหลว การสนทนาที่ยาวนาน และคําขอหลายภาษา
  • เริ่มจากจราจรจริง ธีมการวิเคราะห์และการสนทนาที่บันทึกไว้สร้างกรณีทดสอบที่เป็นตัวแทนมากกว่ากรณีที่คิดขึ้นมา
  • ให้ความสําคัญกับการปกปิดมากกว่าการขัดเกลา กรณีที่ไม่สมบูรณ์จํานวนมากจะพบการถดถอยมากกว่าชุดกรณีที่เขียนได้สมบูรณ์แบบจํานวนน้อย
  • ให้คะแนนโมเดลปัจจุบันก่อน แล้วค่อยประเมินผู้สมัคร การเปรียบเทียบ ไม่ใช่ตัวเลขที่แน่นอน จะบอกคุณว่าการย้ายข้อมูลปลอดภัยหรือไม่
  • เก็บชุดไว้กับ agent ในระบบควบคุมซอร์สโค้ด และรันซ้ําโดยไม่เปลี่ยนแปลงทุกครั้งที่เปลี่ยนโมเดล
  • แบ่งชุดโดยแบ่งตามพื้นที่ความเสี่ยง ชุดทดสอบที่ใช้ฮาร์เนสมาตรฐานสามารถบรรจุกรณีทดสอบได้สูงสุด 100 กรณี ดังนั้นควรใช้ชุดแยกสําหรับความแม่นยําของความรู้ พฤติกรรมเครื่องมือ และสถานการณ์ที่คํานึงถึงความปลอดภัย
  • ส่งออกผลลัพธ์ ผลการประเมินจะถูกเก็บไว้เป็นเวลา 89 วัน ดังนั้นส่งออกเป็น CSV เพื่อบันทึกคะแนนของแต่ละโมเดลในช่วงเวลาย้ายข้อมูล
  • แปลงเหตุการณ์ในการผลิตและข้อเสนอแนะจากผู้ใช้ให้เป็นการทดสอบถดถอยใหม่

เรียนรู้เพิ่มเติมเกี่ยวกับการออกแบบและการใช้งานการประเมินเอเจนต์

Note

การประเมินตัวแทนวัดความถูกต้องและประสิทธิภาพ ไม่ใช่จริยธรรมของ AI หรือปัญหาด้านความปลอดภัย เจ้าหน้าที่สามารถผ่านทุกกรณีทดสอบแล้วยังให้คําตอบที่ไม่เหมาะสมได้ ใช้ การตรวจสอบ AI อย่างรับผิดชอบ และตัวกรองความปลอดภัยของเนื้อหาควบคู่ไปกับการประเมิน

อัตโนมัติการประเมินผลซ้ํา

Copilot Studio รองรับการรันการประเมินผลผ่าน Power Platform API เพื่อให้คุณสามารถผสานการตรวจสอบโมเดลเข้ากับเวิร์กโฟลว์การปล่อยและกระบวนการบูรณาการอย่างต่อเนื่อง สําหรับทรัพย์สินของตัวแทนขนาดใหญ่ ระบบอัตโนมัติคือสิ่งที่ทําให้การทดสอบผู้สมัครซ้ํา ๆ เป็นไปอย่างยั่งยืนแทนที่จะเป็นการทดสอบด้วยมือ เรียนรู้เพิ่มเติมได้ที่ อัตโนมัติการประเมินผลด้วย Power Platform API

อัปเดตอาร์ติแฟกต์เอเจนต์ที่การเปลี่ยนแปลงโมเดลมีผล

การเปลี่ยนแปลงโมเดลแทบจะไม่ส่งผลเฉพาะกับการตั้งค่าโมเดลเท่านั้น แปลคําแนะนําผู้ให้บริการที่เกี่ยวข้องเป็นอาร์ติแฟกต์ตัวแทนที่คุณควบคุม จากนั้นตรวจสอบความถูกต้องของการเปลี่ยนแปลงทุกครั้งตามค่าพื้นฐานการประเมินของคุณ การฟื้นฟูที่ไม่ได้รับการทดสอบซ้ําเป็นแค่การคาดเดา

ของโบราณ การเปลี่ยนแปลงทั่วไป
คำสั่งสำหรับเอเจนต์ ทําให้ความคาดหวังโดยนัยชัดเจน ลบวิธีแก้ไขที่เขียนไว้สําหรับโมเดลก่อนหน้า ย้ําขอบเขตและกฎการยกระดับและพฤติกรรมต้องห้ามอย่างชัดเจน แก้ไขคําสั่งที่ขัดแย้งกัน และปรับเทียบว่าเจ้าหน้าที่ควรดําเนินการอย่างอิสระมากน้อยเพียงใด
คําแนะนําหัวข้อและโหนด ใช้วิธีเดียวกันในระดับหัวข้อ และตรวจสอบว่าโหนดคําตอบเชิงสร้างสรรค์ยังคงทํางานตามที่คาดหวัง
คําอธิบายเครื่องมือและการดําเนินการ เขียนใหม่เพื่อความชัดเจน คําอธิบายนี้คือสิ่งที่โมเดลอ่านเพื่อตัดสินใจว่าจะเรียกใช้เครื่องมือเมื่อใดและหรือไม่ และคําอธิบายที่คลุมเครือจะทําให้เกิดการเรียกเกินและเรียกน้อยเกินไป
คําอธิบายพารามิเตอร์อินพุตและเอาต์พุต ปรับรูปแบบ หน่วย ตัวอย่าง และความหมายที่จําเป็นหรือทางเลือกให้แน่นขึ้น เพื่อให้การสร้างพารามิเตอร์ยังคงถูกต้อง
การกําหนดค่าแหล่งความรู้ ตรวจสอบคําแนะนําการเลือกแหล่งที่มา ขอบเขต และการต่อสาย และตรวจสอบพฤติกรรมการอ้างอิง
คําแนะนําการจัดรูปแบบการตอบกลับ กรุณาระบุโครงสร้าง ความยาว ข้อจํากัดความรับผิดชอบ และค่าที่แน่นอนอย่างชัดเจน เพราะรุ่นใหม่จะเปลี่ยนความยาวเริ่มต้น
ประตูยืนยันและประตูนิรภัย ยืนยันข้อกําหนดการยืนยันอย่างชัดเจนก่อนดําเนินการตามมา
ผู้บริโภคปลายน้ํา อัปเดตโฟลว์ Power Automate, การ์ดแบบปรับเปลี่ยน, การผสานรวมช่องทาง และตัววิเคราะห์ใด ๆ ที่อ่านผลลัพธ์ของเอเจนต์
ชุดทดสอบเอง เพิ่มรูปแบบความล้มเหลวใหม่ที่ค้นพบระหว่างการย้ายข้อมูล

ระยะการย้ายถิ่น

ขั้นตอนต่อไปนี้จะจัดลําดับการดําเนินการในส่วนก่อนหน้า ใช้เป็นแผนการทํางานสําหรับการเปลี่ยนแปลงโมเดลของตัวแทนคนเดียว ไม่ว่าจะเป็นการเปลี่ยนแปลงเชิงรุกหรือขับเคลื่อนด้วยการเกษียณ

ขั้นตอนที่ 0: เตรียมตัว

  1. ยืนยันว่าโมเดลที่สมัครเหมาะสม กับ เงื่อนไขเบื้องต้น: พร้อมใช้งานทั่วไปหรือค่าเริ่มต้น, พร้อมใช้งานในภูมิภาค, สถานะข้ามภูมิภาคที่ยอมรับได้, เปิดใช้งานโดยผู้ดูแลระบบ และหมวดหมู่การใช้งานที่เหมาะสมสําหรับวัตถุประสงค์ของเอเจนต์
  2. อ่านคําแนะนําการอัปเกรดของผู้ให้บริการโมเดล และจดบันทึกคําแนะนําและการเปลี่ยนแปลงเครื่องมือที่สื่อถึง
  3. ระบุตัวแทนที่ได้รับผลกระทบ จากคลังสินค้า สภาพแวดล้อมการบันทึก เจ้าของ และความวิกฤต
  4. ยืนยันวิธีการทดสอบการประเมินที่สายรัดของเอเจนต์รองรับ
  5. กําหนดและอนุมัติประตูการยอมรับการย้ายข้อมูล

ขั้นตอนที่ 1: กําหนดมาตรฐานของโมเดลปัจจุบัน

  1. สร้างหรือปรับปรุงชุดทดสอบถดถอย ให้ครอบคลุมสถานการณ์ที่สําคัญต่อธุรกิจและสถานการณ์ที่มีความถี่สูง
  2. รันชุดทดสอบกับโมเดลการผลิตปัจจุบัน เพื่อกําหนดค่าพื้นฐาน ทําเช่นนี้ในขณะที่โมเดลปัจจุบันยังอยู่ เพราะหลังจากโมเดลเปลี่ยน baseline จะไม่สามารถสร้างใหม่ได้
  3. บันทึกความหน่วงและการใช้เครดิต Copilot แยกกัน การประเมินผลไม่ได้รายงานพวกเขา
  4. ส่งออกผลลัพธ์เป็น CSV เพื่อเก็บบันทึกไว้เกินช่วงเวลาการเก็บรักษา

ขั้นตอนที่ 2: ประเมินผู้สมัครในสภาพแวดล้อมที่ไม่ใช่การผลิต

  1. เตรียมสําเนาเอเจนต์ที่ไม่ใช่การผลิตจริง ตามคําแนะนําของ Copilot Studio สําหรับการจัดการวงจรชีวิตแอปพลิเคชันและการทดสอบเอเจนต์ กําหนดค่าสภาพแวดล้อมให้แทนการผลิต:

    • ใช้คําแนะนําเอเจนต์ หัวข้อ การตั้งค่าความรู้ เครื่องมือ โฟลว์ ตัวเชื่อมต่อ ภาษา และสมมติฐานความปลอดภัยเดียวกัน
    • ใช้ตัวตนและการเชื่อมต่อที่เป็นตัวแทนของการทดสอบ
    • ใช้นโยบายข้อมูลเดียวกันและการควบคุมผู้ดูแลระบบที่เกี่ยวข้อง
    • ยืนยันความพร้อมใช้งานในแต่ละภูมิภาคและตรวจสอบว่าจําเป็นต้องย้ายข้อมูลข้ามภูมิภาคหรือไม่
    • บันทึกความแตกต่างระหว่างการทดสอบและการผลิตที่อาจส่งผลต่อผลลัพธ์
  2. เปลี่ยนโมเดล ไปที่หน้าภาพรวมของเอเจนต์และเลือกโมเดลหลักที่เป็นไปได้ในส่วนโมเดล มีการตั้งค่าแยกต่างหากสําหรับการให้เหตุผลเชิงลึก การตอบสนองเชิงสร้างสรรค์ และตัวสร้างพรอมต์ ดังนั้นตรวจสอบว่าเอเจนต์ใช้ความสามารถเหล่านั้นหรือไม่ และจําเป็นต้องเปลี่ยนแปลงด้วย

  3. รันชุดทดสอบเดียวกันใหม่โดยไม่เปลี่ยนแปลงกับโมเดลผู้สมัคร

  4. เปรียบเทียบการวิ่งสองครั้ง นี้กับประตูการยอมรับเพื่อระบุการปรับปรุงและการถดถอย

  5. ตรวจสอบการจัดการเชิงคุณภาพ ในแชททดสอบ โดยใช้แผนที่กิจกรรมเพื่อยืนยันว่าเครื่องมือใดถูกเลือก ลําดับใด และด้วยพารามิเตอร์ใด

  6. วัดความหน่วงและการบริโภค ของผู้สมัคร แล้วเปรียบเทียบกับค่าพื้นฐาน

ขั้นตอนที่ 3: แก้ไข

  1. อัปเดตอาร์ติแฟกต์ของเอเจนต์ที่การเปลี่ยนแปลงโมเดลได้รับผลกระทบ จากนั้นรันชุดทดสอบใหม่กับเอเจนต์ที่แก้ไขแล้ว เรียนรู้เพิ่มเติมได้ที่ ปรับปรุงเจ้าหน้าที่โดยใช้การคัดกรองและแก้ไขที่ขับเคลื่อนด้วยการประเมินผล
  2. ทําซ้ําจนกว่าจะถึงเกณฑ์การยอมรับ หรือสรุปว่าโมเดลผู้สมัครไม่เหมาะสมและบันทึกเหตุผล การตัดสินใจไม่อัปเกรดเป็นผลลัพธ์ที่ถูกต้องและมีหลักฐานรองรับ

ขั้นตอนที่ 4: อนุมัติและติดตั้ง

  1. ขออนุมัติ จากเจ้าของตัวแทนและผู้อนุมัติการปล่อยสิทธิ์ในขั้นตอนการยอมรับ รวมถึงการอนุมัติด้านความปลอดภัยและการปฏิบัติตามข้อกําหนดเมื่อมีการใช้โมเดลข้ามภูมิภาคหรือภายนอก
  2. ติดตั้งผ่านกระบวนการ ALM ที่กําหนดไว้ โดยส่งเสริม โซลูชัน ตั้งแต่การทดสอบจนถึงการผลิต อย่าแก้ไขเอเจนต์ผลิตด้วยตนเอง
  3. จัดขั้นตอนการเปิดตัว เมื่อช่องสัญญาณอนุญาต เผยแพร่ไปยังกลุ่มเป้าหมายนําร่องหรือช่องทางเดียวก่อน สังเกตผลลัพธ์ แล้วขยายขอบเขต

ขั้นตอนที่ 5: ตรวจสอบและปิด

  1. ตรวจสอบพฤติกรรมการผลิต ตามประตูการยอมรับ
  2. เพิ่มรูปแบบความล้มเหลวที่ค้นพบใหม่ลงในชุดทดสอบถดถอย
  3. ปิดการย้ายข้อมูลก็ต่อเมื่อเกณฑ์การยอมรับยังคงเป็นไปตาม ข้อกําหนดในการผลิต
  4. เก็บรักษาหลักฐานการประเมินและบันทึกการตัดสินใจย้าย ข้อมูลเพื่อการตรวจสอบและเหตุการณ์วงจรชีวิตถัดไป

Important

เส้นทางย้อนกลับสําหรับการเปลี่ยนแปลงโมเดลคือการนําเวอร์ชันโซลูชันที่ผ่านการตรวจสอบก่อนหน้านี้มาปรับใช้ใหม่ ซึ่งช้ากว่าการสลับการตั้งค่า ความแตกต่างนี้ทําให้ประตูประเมินผลใน เฟส 2 มีความสําคัญมาก การจับการถดถอยก่อนการใช้งานมีต้นทุนน้อยกว่าการย้อนกลับหลังจากนั้น

ตรวจสอบหลังการย้ายข้อมูล

งานวงจรชีวิตของโมเดลจะดําเนินต่อไปหลังจากการปรับใช้ การตรวจสอบ:

  • ผลการประเมินตัวแทนและอัตราการผ่านสถานการณ์วิกฤต
  • การวิเคราะห์การผลิต, บันทึกการสนทนา, กิจกรรม, ข้อผิดพลาด และข้อเสนอแนะจากผู้ใช้
  • ความล้มเหลวในการปฏิบัติตามคําสั่งและการเลือกเครื่องมือ
  • ความหน่วง, เวลาหมด และความน่าเชื่อถือ
  • การบริโภคเปลี่ยนแปลง
  • ความปลอดภัย การปฏิบัติตามข้อกําหนด และข้อกังวลเกี่ยวกับการประมวลผลในระดับภูมิภาค

เมื่อการตรวจสอบการผลิตพบรูปแบบความล้มเหลวใหม่ ให้เพิ่มกรณีตัวอย่างลงในชุดทดสอบถดถอย แนวปฏิบัตินี้ช่วยปรับปรุงการประเมินโมเดลถัดไปและเปลี่ยนการเรียนรู้จากการผลิตให้เป็นมาตรฐานคุณภาพที่ยั่งยืน

เทเลเมทรีระดับสภาพแวดล้อม ปล่อย OpenTelemetry GenAI ไปจนถึง Application Insights รวมถึงโมเดลที่ใช้สําหรับการเรียกใช้งานแต่ละครั้ง ใช้เพื่อยืนยันว่าการใช้งานจริงของโมเดลใดทํางานอยู่ และเปรียบเทียบการเลือกเครื่องมือและความน่าเชื่อถือก่อนและหลังการย้ายข้อมูล