Azure SRE エージェントの Operations Hub

SRE Agent Operations Hub を使用すると、Azure SRE エージェントがインシデント、自動化、統合、運用の正常性を 1 か所で実行する方法をリアルタイムで可視化できます。 個々のスレッド、セットアップ ページ、自動化を個別にチェックする代わりに、エージェントの正常性、保留中のアクション、コネクタの準備、自動化の信頼性など、重要な統合シグナルが表示されます。

ヒント

重要なポイント:

  • 1 つのダッシュボードでインシデント分析、自動化の正常性、および毎日のメトリックを表示し、ページ間を切り替える必要はありません。
  • 概要 (メトリックとシステム正常性)、Incident Analytics (保存時間、解決率、軽減時間)、自動化 (タスクとトリガーの KPI) の 3 つのタブ。
  • 任意の KPI カードを選択して、詳細なグラフと内訳を詳しく調べてみます。
  • すべてのエージェントで使用できます。 サイドバーに自動的に表示されます。

Operations Hub とは

Operations Hub は、SRE エージェントに関する運用インテリジェンスを 3 つの重点を置いたダッシュボードに統合します。 中央ビューを使用しない場合、チームは個々のインシデント スレッドを開き、自動化を 1 つずつ確認し、個別のページ間で統合を確認することで、エージェントの状態を手動で再構築します。 この手動アプローチは、環境の拡大に合わせて管理できなくなります。 Operations Hub は、インシデント対応に影響を与える前に、問題の主要なインジケーターを表示することで、チームを事後対応型の調査からプロアクティブな管理に移行します。

Operations Hub ダッシュボードのしくみ

Operations Hub は、監視をサイドバーからアクセスできる 3 つのタブに結合します。 左側のサイドバーで [Operations Hub ] を選択して、ダッシュボードを開きます。

[Operations Hub の概要] タブのスクリーンショット。ステータス バー、メトリック グラフ、保留中のアクションと [システム正常性] セクションが表示されています。

[概要] タブ

質問: 今、私の注意が必要なものは何ですか?

既定のビューには、エージェントの操作状態が一目で表示されます。

セクション​​ 表示される内容
ステータス バー データ ソース接続の正常性、構成済みのコネクタ、および注意が必要なコネクタ。 [ セットアップの完了] を選択して、不足しているソースを直接構成します。
メトリック グラフ ソース別の日次ボリューム、毎日のアクティブ フロー消費量 (AAU)、または毎日のカスタム ツール呼び出し。 ドロップダウンから選択します。
保留中のアクション 承認、質問、インシデント入力、保留中のコマンド実行など、入力を待機している会話スレッドの数。
システム正常性 ライブ エージェント プロセスの状態とコネクタの正常性。

上部の 時間範囲 セレクターを使用して、レポート期間を調整します (既定値: 過去 7 日間)。 最新のデータを読み込むには、更新 を選択します。

[Incident Analytics]\(インシデント分析\) タブ

質問: エージェントは実際にインシデントの間に支援していますか?

インシデント分析は、アクティビティだけでなく、有効性を測定します。 4 つの KPI カードを含む対話型分析ダッシュボード:

カード 表示される内容
推定エンジニアリング時間の節約 エージェントが節約した合計時間(日別の内訳にドリルダウン可能)
エージェントでサポートされる解決率 解決されたインシデントの割合 (結果の内訳): エージェントの軽減、人間による軽減 (エージェント支援)、人間による軽減 (エージェントなし)、進行中
軽減時間の中央値 P50比較、エージェントの解決時間と人間の解決時間の比較
IntentMet 評価スコア エージェントがインシデントをどの程度効果的に解決したかに基づく品質評価 (星の視覚化による 1 から 5 のスケール)

[Incident Analytics]\(インシデント分析\) タブのスクリーンショット。保存時間、解決率、軽減時間の中央値、IntentMet スコアの 4 つの KPI カードが表示されています。

任意の KPI カードを選択して、詳細なグラフを含むドリルダウン ビューを展開します。 KPI カードの下の インシデント量と結果グラフには 、時間の経過に伴うインシデントの傾向が表示されます。

自動化タブ

質問: 定期的なイベントドリブン ワークフローは正常で信頼性が高いですか?

スケジュールされたタスクと HTTP トリガーを監視するためのダッシュボード:

カード 表示される内容
Total Automations スケジュールされたタスクとトリガーによって分割されたアクティブな自動化の数
合計実行数 前の期間との傾向比較を含む実行数
成功率 成功した実行の割合 (成功数/失敗数)
平均実行時間 中央値と P95 パーセンタイルの平均実行時間

4 つの KPI カードと、個々のオートメーション エントリを含む Automation の [概要] リストを示す [Automation] タブのスクリーンショット。

KPI カードの下にある Automation の [概要 ] セクションには、各オートメーションの種類 (スケジュールされたタスクまたは HTTP トリガー)、スケジュール、自律モード、実行回数、成功率が一覧表示されます。 カードを展開すると、AI によって生成された最近の実行の概要が表示されます。

特定のオートメーションを検索するには、[ 検索 ] ボックスと [種類] フィルターを使用します。

Operations Hub がプロアクティブ管理を改善する方法

Operations Hub は、チームを事後対応型の調査からプロアクティブな管理に移行します。 スレッドを開いた後に問題を検出したり、失敗したワークフローを確認したりする代わりに、早い段階で主要なインジケーターが表示されます。

  • 保留中のアクションの蓄積: 承認またはユーザー入力を待機しているアクション。
  • コネクタの低下: 統合の正常性が時間の経過と同時に低下する。
  • アクティビティ傾向の変化: エージェントの使用パターンの変化。
  • 自動化の信頼性の低下: 障害率または実行時間の増加。
  • インシデントの有効性の変化: インシデント対応への影響の軽減を示唆する変更。

このプロアクティブな可視性により、SRE エージェントに対する信頼が構築されます。 問題が発生した後だけでなく、エージェントの動作を一目で監視できる場合は、エージェントに自信を持って依存できます。

Operations Hub を使用する場合

次の操作が必要な場合は、Operations Hub を使用します。

  • エージェントの全体的な正常性を監視する: 個々のコンポーネントをチェックするのではなく、システム ビューを取得します。

  • インシデント対応の貢献度を追跡する: エージェントがインシデントの結果を改善するかどうかを測定します。

  • 自動化の信頼性を管理する: 障害が発生する前に、自動化のパフォーマンスのパターンを特定します。

  • 運用ベースラインを確立する: 異常を早期に特定するための通常の動作を理解します。

Operations Hub を使用する前と後

の前に 後の
エージェントの正常性の確認 複数のページにアクセスする: モニター、設定、個々のタスク Operations Hub を開く: 1 つのダッシュボード、3 つのタブ
インシデント分析 個別のメトリック ビューに移動し、手動で相互参照する KPI カードとドリルダウン グラフを含む [Incident Analytics] タブ
自動化の監視 スケジュールされた各タスクを個別に選択する [Automation]\(自動化\) タブには、正常性インジケーターを含むすべてのオートメーションが表示されます
AAU の使用 設定 > エージェント消費量 に移動します [概要] タブのメトリック グラフに AAU データが含まれている
承認待ち 入力を待機しているアイテムのチャット スレッドをスキャンする [概要] タブに表示される保留中のアクションの数

制限事項

  • Operations Hub では、既定で過去 30 日間のデータが表示されます。 この期間を超えて履歴データにアクセスするには、アーカイブ クエリが必要です。

  • 現在、Automation 分析では、Operations Hub UI からトリガーされる実行がサポートされています。 Webhook トリガーとプログラムによるトリガーは、初期リリースでは表示が制限されます。