エージェントの最適化は公開後も終わりではありません。 Copilot Studio は、ユーザーがエージェントとどのようにやり取りしているか、会話がどこで成功したり失敗したりするか、エージェントがツールや知識をどの程度効果的に活用しているかを理解するのに役立つ豊富な分析を提供します。 この記事では、エージェントを継続的に評価・改善するための体系的なチェックリストやベスト プラクティスを紹介します。
改善および分析準備状況を検証する
これらの質問は、スプリント レビュー、月次最適化、リリース前の準備など、定期的なレビューで活用しましょう。
テーマとユーザー意図パターン
| サインアップできましたか? |
タスク |
| ✓ |
テーマを見直して、ユーザーの質問のクラスターや新たな意図を特定していますか? |
| ✓ |
今後の改善のために、よく使われるテーマをバックログに追加していますか? |
会話の結果
| サインアップできましたか? |
タスク |
| ✓ |
解決済み、エスカレーションされた、放棄された、未対応の会話を分析して改善点を見つけていますか? |
| ✓ |
会話が「会話の終了」トピックで終了し、結果が正しく記録されていることを確認していますか? |
| ✓ |
放棄されたセッションの急増を調査し、曖昧な応答やロジックの不足を特定していますか? |
| ✓ |
エスカレーション パスが適切なタイミングでトリガーされることを検証していますか? |
生成された回答の評価と品質
| サインアップできましたか? |
タスク |
| ✓ |
生成された回答率を確認して、知識のギャップやカバー不足を特定しますか? |
| ✓ |
完全性、根拠性、関連性などの回答の質の指標をチェックしますか? |
| ✓ |
質の低い回答を見直し、分析で示された理由に対処していますか? |
| サインアップできましたか? |
タスク |
| ✓ |
ツールやアクションがどのくらいの使用頻度で呼び出され、成功または失敗するかを監視していますか? |
| ✓ |
利用頻度が低い、またはエラーが多発するツールを特定し、最適化または削除するかどうか判断していますか? |
| ✓ |
生成オーケストレーションで使われるツールが確実に動作することを検証していますか? |
| サインアップできましたか? |
タスク |
| ✓ |
すべてのサポート情報ソースの使用状況とエラー率を確認していますか? |
| ✓ |
エラー率が高い、または結果が一貫していないサポート情報ソースに対して更新を優先しますか? |
| ✓ |
正しいサポート情報ソースが意図されたシナリオをサポートしているか確認していますか? |
満足度とユーザー フィードバック
| サインアップできましたか? |
タスク |
| ✓ |
サムズアップ/サムズダウンや CSAT 調査を通じてユーザーの感情を収集していますか? |
| ✓ |
フィードバックの傾向を分析して、不明瞭な応答や会話の流れの弱さを検出していますか? |
| ✓ |
満足度の低い対話パターンを再設計のためにバックログに追加していますか? |
ベスト プラクティスのコールアウト
-
分析を継続的な改善サイクルとして捉える: 分析を活用して段階的な改善を進めましょう。 テーマ、不完全な回答、失敗パターンをスプリント計画に反映し、バックログ項目の優先順位を決定しましょう。
-
成果の質に重点を置き、量だけにこだわらない: 健全なシステムは、解決された会話を最大化し、エスカレーションや放棄を最小限に抑えます。 結果比率を明確さと効果の先行指標として活用します。
-
サポート情報ソースを積極的に強化する: 高いエラー率や低質な回答は、しばしばサポート情報ソースが不明瞭で時代遅れ、または不一致であることを示しています。 サポート情報ソースを頻繁に更新・再構成し、回答の根拠を強化します。
-
ツールの安定性と成功を最適化する: 信頼できないツールコールは信頼を損ないます。 成功率を追跡し、頻繁に失敗したり一貫性のないデータを返すアクションをリファクターします。
-
テーマを使って新たな機会を特定する: テーマは新たな意図を浮き彫りにします。 新しいトピック、サポート情報ソース、または統合ニーズの検討に役立てましょう。
-
会話が適切に終了するようにする: 必ず「会話の終わり」トピックを使用して、解決状況や CSAT を記録してください。 このトピックがなければ、分析は不完全で誤解を招きます。
-
自律型エージェントとユーザー主導型エージェントを別々に評価する: 自律型エージェントはトリガーやツール チェーンに大きく依存しています。 実行結果やトリガーは、ユーザー主導のフローとは別にレビューしてください。
-
時間経過によるセンチメントを追跡する: 個別のフィードバックは有用ですが、数週間にわたるセンチメント傾向はシステム的な問題を明らかにします。 持続的な低下を早めに調査します。