[本文章是發行前版本文件,且隨時可能變更。]
新 Agent 體驗中的評估索引標籤為您的 Agent 提供結構化且可重複的測試。 利用評估來衡量各測試案例中的客服品質,追蹤隨時間的改進,並在發布前驗證客服的行為。
Important
- 此為生產就緒型預覽功能。
- 生產就緒型預覽受補充使用規定規範限制。
什麼是經紀人評估?
Agent 評估讓您能夠系統性地測試 Agent 的回覆是否達到品質標準。 與其在 預覽 標籤中手動測試每個情境,不如建立包含測試對話的評估,定義如何衡量回應,並執行評估以取得量化結果。
評估幫助你回答以下問題:
- 代理程式是否能在各種可預期的情境下正確回答?
- 設定變更是提升還是降低回覆品質?
- 代理程式是否會在應該呼叫工具時呼叫工具?
關鍵概念
以下概念在 Copilot Studio 中執行評估時非常重要:
對話
每個交談都是一個測試案例,用以代表 Agent 需要處理的特定情境。 每個交談都包含使用者訊息,以及選用的預期 Agent 回覆。 將對話整理為評估。 您可以手動建立對話、用 AI 生成對話,或從 CSV 檔案上傳。
Evaluations
評估是將對話與測試方法結合的已命名測試集。 您可以在評估索引標籤中建立評估,將交談新增至評估,然後執行評估以產生評分結果。
測試方法
測試方法定義 Agent 回覆的評分方式。 目前唯一可用的測試方法是通用 品質(General quality),這是一種基於 AI 的評估,用來評估回答是否符合相關性與完整性等品質標準。
Note
一般品質測試方法不會比較回覆與預期答案。
使用者個人檔案
評估會根據已登入的使用者設定檔進行。 若要使用不同的使用者設定檔,請先登出,然後在開始評估前用該設定檔的帳號登入。
信用使用情況
在測試過程中評估 Surface 預估的 Copilot 信用使用情況,讓您在執行大型測試套件前,了解測試品質的成本。 你可以查看哪些體驗會使用點數、每次評估執行的預估總點數、生成回應與評分回應的點數明細,以及個別測試案例層級的點數使用情況。 在 了解預估信用使用量的部分了解更多。
評估工作流程
請依照以下步驟評估代理人:
- 建立評估:在評估索引標籤上,開啟新的評估。 在 為代理人建立測試集中了解更多。
- 新增交談:可透過手動寫入、AI 生成、或上傳 CSV 檔案來新增測試交談。
- 設定:命名評估、選擇測試方法及選擇代理版本。
- 執行評估:選擇 評估 以執行測試並等待結果。 在 「為代理人進行評估」中了解更多。
- 審查結果:分析分數並找出改進空間。 了解更多請參閱 查看代理人的評估結果。
- 反覆調整:調整經紀人的指示、知識或工具,然後再次執行評估以衡量影響。
Limitations
評估只支援設定為無認證或使用 Microsoft 驗證的代理程式。 設定為 手動驗證身分 的代理程式不受支援。