透明度に関するメモとは
AI システムには、テクノロジだけでなく、それを使用するユーザー、影響を受けるユーザー、デプロイされる環境も含まれます。 本来の目的に合ったシステムを作成するには、テクノロジのしくみ、その機能と制限事項、最適なパフォーマンスを実現する方法を理解する必要があります。 Microsoft の透明性に関するメモは、AI テクノロジのしくみ、システム所有者がシステムのパフォーマンスと動作に影響を与える選択肢、およびテクノロジ、ユーザー、環境を含むシステム全体について考えることの重要性を理解するのに役立ちます。 独自のシステムを開発または展開するときに透明性に関するメモを使用するか、システムを使用するユーザーやシステムの影響を受けるユーザーと共有します。
Microsoft の透明性に関するメモは、AI 原則を実践するための Microsoft の広範な取り組みの一環です。 詳細については、 Microsoft AI の原則を参照してください。
リアルタイムインテリジェンス オペレーションエージェントの基本
イントロダクション
Real-Time インテリジェンス操作エージェントは、データ ストリームを監視し、異常や条件を検出し、実際のイベントに基づいてアクションを推奨するエージェントを作成するためのプラットフォームです。 これらのエージェントは、タスクを自動化し、分析情報を提供し、タイムリーな意思決定をサポートします。 ビジネス目標、ナレッジ ソース、アクション、および指示を構成することで、エージェントは目標を追跡し、データを監視し、ルールを適用して条件を検出する計画を作成します。 エージェントは、適切な条件が発生した場合に推奨されるアクションをユーザーに通知します。
キーワード
ナレッジ ソース: エージェントがデータの検索と監視に使用できるデータベース接続。
ツール: エージェントが自然言語からの構造化クエリの生成、異常検出の実行、Microsoft Teamsまたは電子メール メッセージの送信などのタスクを実行できるようにする組み込み機能。
スレッド: エージェントとユーザーの間の会話セッション。 スレッドは メッセージ を格納し、コンテンツをモデルのコンテキストに合わせて切り捨てを自動的に処理します。
プレイブック: エージェントの操作マニュアルを形成するエンティティ、データ、ルール、および考えられるアクションの内部表現。
エンティティ: エージェントが監視しているビジネス内のオブジェクト。 たとえば、自転車レンタル事業では、自転車とドッキング ステーションが関連するエンティティである可能性があります。 空港管理では、チェックインライン、セキュリティ チェックポイント、および乗客は関連エンティティです。
インスタンス: エンティティの特定の出現 (
Bike 0451やFlight MS1234など)。ルール: 推奨事項を作成する前にエージェントが監視するデータ内の条件またはパターン。
自律ルール: エージェントが最初に人間の確認なしで実行できるアクションが関連付けられているルール。
能力
システムの動作
運用エージェントを作成するときは、ビジネス目標、ナレッジ ソース、考えられるアクション、および手順という設定を構成します。 これらの入力により、エージェントは大規模な言語モデル (LLM) を使用して、監視するエンティティ、マップされたデータ、およびルールのプレイブックを作成します。 目標と指示を調整することで、モデルを調整できます。 エージェントをアクティブ化すると、エージェントはバックグラウンドでデータを監視します。 条件がルールと一致すると、データが分析され、原因が特定され、ビジネス目標を達成するためのアクションが推奨されます。
エージェントは、自然言語アラートを使用して Teams を通じてあなたに通知し、最初の推奨事項について情報を提供します。 ルールを承認、拒否、または自律的にすることができます。これにより、エージェントはそれ以上の確認なしで動作できます。
エージェントは LLM を使用してエージェントのプレイブックを作成し、アクションを推奨するため、次のことを行う必要があります。
エージェントを開始する前に、動作モデルを慎重に確認してください。
エージェントの推奨事項を注意深く監視し、アクションを実行する前に推奨事項を作成するために使用する理由を確認します。
エージェントで作成する自律ルールを慎重に確認します。 これらのルールによってアクションが自動的に実行されます。
活用事例
使用目的
操作エージェントは、さまざまなシナリオで使用できます。 システムの使用目的には以下が含まれます。
自転車レンタル管理: リアルタイム データを使用して、さまざまなステーションで自転車の可用性を継続的に監視するように運用エージェントを構成できます。 自転車の可用性を確保するための目標を設定して、各ドッキング ステーションの値を追跡するための適切なクエリを見つけます。
風力タービンの最適化: このエージェントは、風力発電所からのデータを監視し、電力出力、ブレードの方向と角度などのメトリックを追跡します。 これは、電源出力の異常または低下を探し、動作パラメータの調整を推奨します。
倉庫在庫の分散: エージェントは、複数の倉庫の在庫レベルをリアルタイムで監視します。 最適な在庫配分を維持し、在庫切れや過剰在庫を回避する目標を設定します。
経費の監視: エージェントに経費要求とレポートに関するデータへのアクセス権を付与します。 一般的なルールに準拠しない経費にフラグを設定し、各従業員またはコスト センターの長期的なパターンで異常を特定するように依頼します。
インシデント対応の自動化: エージェントは、サービスの低下やセキュリティの異常の兆候がないか、IT インフラストラクチャのログとテレメトリを監視します。 その目標は、平均検出時間 (MTTD) と平均解決時間 (MTTR) を減らすことです。
その他のユース ケース選択時の考慮事項
革新的なソリューションまたはアプリケーションに運用エージェントを適用することをお勧めします。 ただし、エージェントが特定のユース ケースに適していることを確認するには、次の要因を考慮してください。
システムを使用または誤用すると、個人に重大な身体的または精神的損傷が生じる可能性があるシナリオを避けます。 たとえば、患者を診断したり、薬を処方したりするシナリオは、重大な害を引き起こす可能性があります。
システムの使用または誤用が、生命の機会や法的地位に結果的な影響を与える可能性があるシナリオは避けてください。 たとえば、AI システムまたはエージェントが個人の法的地位、法的権利、クレジット、教育、雇用、医療、住宅、保険、社会保障給付、サービス、機会、または提供される条件へのアクセスに影響を与える可能性があるシナリオが挙げられます。
害を及ぼす可能性のある高リスクのシナリオは避けてください。 エージェントで使用されるモデルには、トレーニング データに存在する特定の社会観、バイアス、その他の望ましくないコンテンツや、プロンプトで提供される例が反映されている場合があります。 その結果、不公平、信頼性の低い、または攻撃的な行動がコストがかかり、害を及ぼす可能性がある高リスクのシナリオでは、エージェントの使用には注意が必要です。
エージェントのアクションが元に戻せない、または結果が大きい、高いステークのドメインまたは業界では、ユース ケースを慎重に検討してください。 このような業界には、医療、医療、金融、法的分野が含まれますが、これらに限定されません。
法的および規制上の考慮事項。 組織は、AI サービスとソリューションを使用する際に、潜在的な特定の法的および規制上の義務を評価する必要があります。これは、すべての業界やシナリオでの使用に適していない可能性があります。 制限は、地域または地域の規制要件によって異なる場合があります。 さらに、AI サービスまたはソリューションは、該当するサービス条件および関連する行動規範で禁止されている方法で設計されておらず、使用されない場合があります。
制限事項
技術的な制限事項、運用上の要因、範囲
OpenAI による集中的なトレーニングと Microsoft による責任ある AI 制御の実装にもかかわらず、AI サービスはフォール可能で確率的です。 この制限により、不適切なコンテンツを包括的にブロックすることが困難になり、AI生成コンテンツに潜在的な偏りやステレオタイプ、根拠のなさが生じる可能性があります。 AI によって生成されるコンテンツの既知の制限の詳細については、「 Azure OpenAI の透明性に関するメモ」を参照してください。これには、運用エージェントの背後にある LLM への参照が含まれています。
運用エージェントには、さまざまな指示と目標を提供できます。 LLM 動作モデルの確率的性質は、エージェントを要件に合わせることができない可能性があることを意味します。 エージェントの動作モデルの説明も AI を使用して生成されるため、完全には正確ではない可能性があります。
運用エージェントを効果的に使用するには、サービスと効果的にやり取りしてメリットを得るトレーニングが必要です。
高度な AI モデルには大量の計算リソースが必要であり、パフォーマンスに影響を与える可能性があります。特に、リソースが制約された環境では影響を受けます。 ピーク使用時に待機時間やパフォーマンスの問題が発生する可能性があります。
エージェントは LLM と外部システムを組み合わせるので、クエリに応答するために特定のツールまたはツールの組み合わせを選択した理由を理解するのが難しい場合があります。 この課題により、エージェントの出力またはアクションの信頼と検証が複雑になります。
組織は、特に規制対象の業界で運用エージェントを使用する際に、特定の法的およびコンプライアンス上の義務を考慮する必要があります。 Microsoft は、テクノロジのプロバイダーとして Microsoft に適用される規制要件を調査し、継続的な改善のプロセスを通じて製品内で対処しています。
エージェントのユーザー エクスペリエンスを使用すると、いつでもエージェントを中断またはシャットダウンできます。 このアクションにより、新しいデータと、エージェントが推奨または実行する可能性がある新しいアクションの監視が停止されます。 エージェントが他のシステムで呼び出したアクション (Power Automate ワークフローの開始など) がすぐに停止しない場合があります。 エージェントは、これらの他の製品エクスペリエンスで管理する必要がある独立したプロセスとして、これらのアクションを起動します。
エージェントとユーザーの間のメッセージは、Teams 経由で配信されます。 エージェントにメッセージを送信すると、Azure Bot Service によってメッセージが処理されます。 Azure AI Bot Serviceの使用には、各ボットが 1 つのグローバル エンドポイントしか持てない技術的な制限があります。 Teams ファーストパーティ ボットの場合、要求はグローバル エンドポイントに送信され、ユーザーの近くのリージョン エンドポイントに再ルーティングされます。 運用エージェントは、EU にあるエンドポイントを使用します。つまり、ユーザー データは、処理のために地理的リージョン外に移動できます。
システム パフォーマンス
AI システムでは、パフォーマンスは多くの場合、精度にリンクされます (システムが正しい出力を提供する頻度)。 運用エージェントの場合、ユーザーが出力を解釈する方法が異なる可能性があるため、パフォーマンスの柔軟性が向上します。 通常、エラーは、エージェントがビジネス プロセスの目標、データ、または主要エンティティを誤解した場合に発生します。 エージェントが推奨事項を作成する場合、ユーザーはアクションを承認する前に、提供されたコンテキストを慎重に確認する必要があります。
システム パフォーマンスを向上させるためのベスト プラクティス
運用エージェントで最適な結果を得るには、詳細で適切に構造化されたプロンプトを作成することに重点を置きます。 提供する目標と手順は、エージェントが時間の経過に伴う変更を監視するための正しいデータ ポイントとルールを特定するのに役立ちます。 エージェントが監視する必要があるデータ値と条件を明示的に定義することで、精度を向上させます。 アクションが結果に与える影響と、監視対象の値がどのように変化することが予想されるかを明確に説明します。
高品質のデータも同様に重要です。 コード化された値ではなく、意味のある列名を使用して、データ構造が適切に整理されていることを確認します。 可能な限り、入れ子になったイベント データをフラット化します。 この構造により、エージェントは関連情報を効率的に見つけて監視しやすくなります。
運用エージェントの評価
評価方法
運用エージェント プラットフォームは、厳密なマルチステージ プロセスを使用して、精度、安全性、継続的な改善を評価します。 その中核となるのは、 トレース>評価>評価という 3 段階のサイクルです。 このサイクルは、計画、オントロジの形成、データの接地、ルールの生成、実行など、エージェントの意思決定プロセスを監視するためのテレメトリを実装することから始まります。 評価データセットは、実際のユース ケースと、変動性を生み出す合成データから取得されます。 開発から運用まで、エージェントのライフサイクル全体を通じて、正確性、収束率、故障率、安全性などのメトリックを測定します。
評価環境は、製造条件を反映し、開発パイプラインと評価パイプラインの分離を重視してバイアスを回避します。 初期データセットを手動でキュレーションし、予期されるオントロジと出力を事前に定義します。 後で、合成生成を使用してこれらのデータセットをスケーリングします。 データセットは、ビジネスの監視と意思決定に関連する運用上の目標に焦点を当てています。 これらは実際のシナリオを表していますが、より広範なユーザー集団や動的な目標構成はまだ含まれていません。 このアプローチでは、評価に焦点を当て、再現可能で、責任ある AI 原則に沿った状態を維持します。
評価結果
評価プロセスでは、構造化トレース>イテレート>評価手法が使用されます。 エージェントの意思決定ループの各段階で評価を埋め込みます。 これらの評価では、エージェントが一貫して正確なオントロジを生成し、有効で関連するクエリを生成し、ユーザーの目標に合わせて適切なアクションを選択することが確認されました。 これらの結果は、特に実際の運用コンテキストで期待どおりに実行されるようにする上で、アカウンタビリティの目標に対するシステムの連携をサポートします。
評価で使用されるトレーニング データセットとテスト データセットは、幅広い運用シナリオを反映するように慎重にキュレーションされました。 オントロジやクエリ結果など、明確に定義された出力を使用して、実際のユース ケースから初期データセットを手動で構築しました。 その後、合成生成を使用してこれらのデータセットを拡張し、変動性とカバレッジを高めます。 スキーマの複雑さ、データの可用性、ユーザーの意図のバリエーションなど、エージェントが予期する目標とデータ環境の種類を表すようにデータセットを設計しました。 このアプローチにより、評価によって代表的なさまざまな運用要因と設定がキャプチャされ、責任あるシステムの開発と展開がサポートされました。
評価結果は、システム内のいくつかの主要な設計上の制約に影響を与えます。 たとえば、クエリの最大サイズと最小オントロジの複雑さの制限を導入して、一貫性のあるパフォーマンスを確保し、エラー率を削減しました。 結果は多くの運用監視と意思決定サポートのシナリオに広く適用されますが、初期評価には、動的な目標の再構成やマルチエージェントコラボレーションなどの一部の領域は含まれていませんでした。 これらの領域は、将来のテストと開発の機会を表します。
使用する操作エージェントの評価と統合
エージェントの動作は、指定した指示、目標、データ、およびアクションによって形成されます。 正確なプロンプトと、直感的な列名で整理されたデータをクリーンにすることで、精度が向上し、エラーが減ります。
エージェントを構成したら、KQL クエリを確認してビジネス プロセスとの整合性を確保することで、エージェントの行動モデルとルールを検証します。 ルールベースの条件によってエージェントがトリガーされますが、LLM によって生成される推奨事項には不正確さが含まれている可能性があるため、動作する前に常に出力を確認してください。
応答性の高いエージェントは、過剰な通知や自動化されたアクションの過剰使用を招き、システムが不安定になる可能性があります。 リスクを軽減するには、ルールを調整し、定期的な監査を実施し、エッジ ケースをシミュレートし、透明性を高めるインターフェイスを設計します。 たとえば、推奨事項の信頼度スコアと明確な説明を表示します。