デプロイされたモデルを監視する
ノーショー モデルをデプロイすると、運用環境に安全に移行されますが、運用環境では、モデルの実際の動作と表示されるデータは、データ サイエンス チームが設計したものから誤差が生じ始める可能性があります。 監視によってそれを検知できます。
エンドポイントの運用状態を監視する
Azure Machine Learningオンライン エンドポイントは、要求の待機時間、要求数、エラー率、デプロイのコンピューティングの CPU 使用率とメモリ使用率など、Azure Monitorにメトリックを出力します。 これらはAzure Machine Learning スタジオで表示するか、アラートとダッシュボードをAzure Monitorで直接作成します。 エンドポイントのエラー率の急上昇または待機時間が増加した場合、そのパターンは、モデルの予測がまだ正確かどうかとは別に、調査するインフラストラクチャまたはスコアリングの問題を指します。
Tip
オンライン エンドポイントの監視について詳しくは、こちらをご覧ください。
デプロイで要求のプロビジョニングまたはスコア付けの失敗が発生した場合は、まず、構成の問題とランタイムの問題を分離します。 可能であれば、モデルをローカルでテストし、デプロイの状態とエラーの詳細を確認し、コンテナー ログを調べます。 ログには、不足している依存関係、無効なスコア付け動作、イメージエラー、またはリソースとクォータの制約が表示される可能性があります。
Tip
オンライン エンドポイントのデプロイとスコアリングのトラブルシューティングの詳細について説明します。
モデルの予測の監視を設定する
メトリックは、エンドポイントが応答中であることを示します。実際のデータの変化に対して予測が保持されているかどうかは示されません。 Azure Machine Learningはそのためのモデル監視を提供しますが、構成する機能です。 デプロイでは、既定では予測品質は監視されません。 これを使用するには、まずオンライン デプロイでデータ収集を有効にして受信要求と応答がログに記録されるようにしてから、その運用データを参照データセット (通常はモデルがトレーニングまたは検証されたデータ) と比較するモニターを作成します。
モデル モニターは、定義したスケジュールに従って、次のようなシグナルを計算します。
| 信号 | 検出される内容 |
|---|---|
| データ ドリフト | 入力特徴量の分布は、参照データの分布からずれます。 |
| 予測の変動 | モデルの出力の分布は、時間の経過と同時に変化します。 |
| データ品質 | 欠損値、新しいカテゴリ、または範囲外の値は、運用データに表示されます。 |
| 機能の属性の誤差 | 特徴の相対的な重要性は、トレーニングと比較して変化します。 |
Tip
運用環境にデプロイされたモデルのパフォーマンスの監視の詳細について説明します。
調査または再トレーニングするタイミングを決定する
構成されたしきい値を超える監視シグナルは、自動修正ではなく、調査を求めるプロンプトです。 Proseware のノーショー モデルの場合、予定のリード タイムに関するデータ ドリフト アラートは、クリニックがスケジュール ポリシーを変更したことを意味する可能性があります。これは、再トレーニングが必要かどうかを判断する前に詳しく見る価値があります。 予測ドリフトのシグナルが継続しており、さらにクリニックのスタッフから、フラグが付いた予約は実際にはそれほど高リスクではないというフィードバックがある場合、これは、より新しいデータでモデルを再トレーニングし、このモジュールの前の方で自動化したのと同じパイプラインを通じて再デプロイするべき、より強い根拠になります。
ロールバックと再トレーニングの選択
ロールバックは、新しいデプロイで問題が発生し、前のモデルが正常なままである場合に適しています。 まず、保持されているデプロイにトラフィックをシフトしてから、新しいバージョンを調査します。 再トレーニングは、運用データまたは実際の動作が以前のモデルと同じ制限を持つほど変更された場合に適しています。 監視は決定の証拠を提供します。評価なしでどちらの応答もトリガーしないでください。