透明性ノートとは
AI システムには、テクノロジだけでなく、それを使う人、それによって影響を受ける人、それがデプロイされる環境も含まれます。 目的に合ったシステムを作成するには、テクノロジのしくみ、その機能と制限事項、および最適なパフォーマンスを実現する方法を理解する必要があります。
Microsoft では、AI テクノロジのしくみを理解するのに役立つ 透明性に 関するメモを提供しています。 これには、システム所有者がシステムのパフォーマンスと動作に影響を与える選択肢と、テクノロジ、人、環境など、システム全体について考えることの重要性が含まれます。 独自のシステムを開発または展開するときに透明性に関するメモを使用したり、システムを使用したり、システムの影響を受けるユーザーと共有したりできます。
透明性に関するメモは、AI 原則を実践するためのMicrosoftの広範な取り組みの一環です。
Phi Silica の概要
Phi Silica は、Windowsでのデバイス上の推論用に調整された小さな言語モデル (SLM) です。 これにより、クラウド接続を必要とせずに、テキスト生成、要約、書き換え、テキストからテーブルへの変換などのローカル生成 AI 機能が可能になります。 Phi Silica は、デバイス上で完全に実行することで、プロンプトと応答をローカルに維持することで、ユーザーのプライバシーをサポートします。
Phi Silica はもともと、専用 AI コンピューティングの 40 以上の TOPS を提供するニューラル処理装置 (NPU) を含む Windows Copilot+ PCs 専用に設計および最適化されました。 この拡張により、Phi Silica は non-Copilot+ PCs ( 専用の NPU がない標準の Windows デバイス) で使用できるようになりました。このデバイスでは、推論がデバイスの GPU を使用して実行されます。
主な用語
| 任期 | Definition |
|---|---|
| Copilot+ PC | 専用のニューラル処理装置 (NPU) を備えたWindows PC は、高速なオンデバイス AI ワークロード用に構築された、40 以上の TOPS しきい値を満たしています。 |
| Copilot+ PC 以外 | 専用 NPU を使用しない標準Windows PC (または NPU が Copilot+ しきい値を下回る)。 これらのデバイス上の Phi Silica 推論は GPU を介して実行されます。 |
| NPU (ニューラル処理装置) | 高効率で低消費電力で機械学習ワークロードを高速化するように設計された特殊なハードウェア。 |
| SLM (小言語モデル) | クラウド規模の大規模言語モデル (LLM) よりもパラメーター数が少ない、ローカルのオンデバイス実行用に最適化された言語モデル。 |
| 推測デコード | 小さいドラフト モデルを使用して複数のトークン シーケンスを提案する手法。その後、メイン モデルによって並列に検証され、テキスト生成が高速化されます。 |
| コンテンツ モデレーション | モデルの入力と出力で有害、不快、または安全でないコンテンツを検出してブロックするフィルター処理メカニズム。 |
能力
システムの動作
Phi Silica は、デバイス上で自然言語プロンプトを処理し、テキスト応答を生成します。 このモデルでは、次の機能がサポートされています。
- 自由形式のテキスト生成: 質問への回答、説明の提供、ユーザー プロンプトからのクリエイティブ コンテンツの生成。
- テキスト インテリジェンス スキル: 要約、書き換え (トーン調整付き)、テキストからテーブルへの書式設定などの組み込みの変換機能。
- ストリーミング応答: 部分的な結果は、応答性の高いユーザー エクスペリエンスのために徐々に返されます。
- コンテンツ モデレーション統合: 複数の重大度レベルでの 4 つのカテゴリ (暴力、ヘイト、性的コンテンツ、自傷行為) にわたる構成可能なコンテンツ フィルタリング。
Copilot+ PCsでは、Phi Silica は NPU ハードウェアを活用して、待機時間を短縮し、消費電力を削減して推論を最適化します。 Copilot+ PCs以外の場合、推論は GPU 上で実行されます。 基になるモデルとその機能は変わりません。ただし、運用特性は異なります ( 制限事項を参照)。
使用例
想定される用途
- アプリ内での文章作成支援: ドキュメントの要約、明確さやトーンを調整するための文章の書き換え、生産性向上アプリケーション内での下書きの生成。
- ローカル Q&A と情報の取得: ユーザー クエリをクラウド サービスに送信することなく、モデルのトレーニング データを使用して事実に関する質問に回答します。
- アクセシビリティ機能: 複雑なテキストの簡略化、説明の生成、AI 支援の読み書きを利用するユーザーのサポート。
- 開発者のプロトタイプ作成: アプリケーション開発者がテストおよび概念実証シナリオ用のローカル AI テキスト生成を統合できるようにします。
- プライバシーに依存するワークフロー: データ主権、オフライン操作、またはユーザーのプライバシー要件によってクラウドベースの AI サービスの使用が妨げるシナリオ。
ユース ケースを選択するときの考慮事項
- 人の監視なしに、高いリスクの意思決定には使用しないでください。 Phi Silica は、すべての言語モデルと同様に、不正確、不完全、または製造された情報 (幻覚) を生成する可能性があります。 医療、法律、財務、または安全に重要な意思決定を通知するアプリケーションには、意味のある人間のレビューが含まれている必要があります。
- 事実の真実の唯一の情報源として使用しないでください。 モデルのトレーニング データには知識のカットオフがあり、偏りや不正確さが含まれている可能性があります。 権限のあるソースからの重要な情報を確認するようユーザーに勧める。
- 機密性の高い個人データには注意してください。 デバイス上の処理によってプライバシーが強化されますが、開発者は、適切な保護措置が講じられている場合を除き、機密性の高い個人情報 (正常性レコード、財務情報など) を使用してモデルにプロンプトを表示するワークフローを設計しないようにする必要があります。
- 展開されたユーザー ベースについて考えてみましょう。 非Copilot+ PCsへの拡張により、さまざまなハードウェア機能を備えたデバイスや、多様な技術リテラシーを持つユーザーなど、ユーザーの人口が大幅に拡大します。 パフォーマンスの差異を適切に処理し、ユーザーに明確な期待を提供するようにアプリケーションを設計します。
Limitations
Copilot+ PCs以外に固有の技術的な制限事項
| 要因 | Copilot+ PC (NPU) | Copilot+ PC 以外の PC (GPU) |
|---|---|---|
| 推論の待機時間 | 最適化;NPU アクセラレーションと投機的デコードによる低遅延 | 待機時間が長くなります。推論速度は、GPU の生成、使用可能な VRAM、および現在の GPU 負荷によって異なります |
| 電力消費 | NPUは電力効率が良く、バッテリ駆動の使用に適しています | GPU 推論は、より多くの電力を消費します。ノート PC のバッテリ寿命に大きな影響を与える可能性があります |
| 同時実行ワークロード | NPU は独立して動作し、他のタスクへの影響を最小限に抑えます | GPU 推論は、コンピューティング リソースの他の GPU アクセラレーション アプリケーション (レンダリング、ビデオ再生、ゲーム) と競合します。システムの速度低下を引き起こす可能性があります |
| 熱影響 | 管理された熱を使用した継続的な AI ワークロード向けに設計された NPU | 拡張 GPU 推論により、GPU コンピューティング負荷が持続するように設計されていないデバイスで熱調整が発生する可能性がある |
| メモリ不足 | NPU メモリと共に管理されるモデルの読み込みと推論 | モデルは GPU VRAM (または共有 GPU メモリ) に読み込む必要があります。VRAM が制限されたデバイスでは、負荷が発生したり、低速の共有メモリにフォールバックしたりする可能性があります |
| プロンプト圧縮 | ✅ 使用可能。より長い有効なコンテキスト ウィンドウを有効にする | ❌ GPU では使用できません |
| 推測デコード | ✅ 利用 可能;下書きモデルを使用してテキストの生成を高速化する | ❌ GPU では使用できません |
| モデルの選択肢 | モデルはシステムによって管理されます | モデルは必要に応じてダウンロードされ、設定>System>AI コンポーネントを使用してユーザーが削除できます |
一般的な技術的制限事項
- 正確さと幻覚:Phiシリカは、もっともらしい音がするが、実際には間違った応答を生成する可能性があります。 モデルの出力品質は NPU と GPU の実行の間で変わりませんが、非Copilot+ PCsでの応答性が低下すると、ユーザーは重要なレビューなしで初期出力を受け入れる可能性があります。
- 言語サポート: Phi Silica の言語機能は、トレーニング データによって決定されます。 パフォーマンスは言語によって異なる場合があり、一部の言語はサポートされない場合があります。 Phi Silica の機能は、中国では使用できません。
- コンテキスト ウィンドウの制限事項: モデルには固定コンテキスト ウィンドウがあります。 長いプロンプトまたは複数ターンの会話がこのウィンドウを超え、以前のコンテキストが失われる可能性があります。
- バイアスと公平性: モデルは、性別、人種、民族性、宗教、またはその他の特性に関連するステレオタイプを含む、トレーニング データに存在するバイアスを反映している可能性があります。 開発者は、アプリケーションが対象とする各集団に対して公平であるかという観点から、その出力を評価する必要があります。
- 敵対的な入力: モデルは、プロンプトインジェクションやジェイルブレイクの試行に対して脆弱である可能性があります。 コンテンツ モデレーション フィルターは軽減されますが、このリスクは排除されません。
非Copilot+ PCsの運用要因
- Hardware の多様性: 非Copilot+ PCsは、さまざまな GPU 構成 (統合 GPU と個別 GPU、さまざまな VRAM 容量、さまざまな GPU アーキテクチャ) にまたがっています。 パフォーマンスは、このデバイスの範囲によって大きく異なります。
- ハードウェアの最小要件: Phi Silica を実行するには、デバイスが GPU とメモリの最小要件を満たしている必要があります。 グラフィックスまたは古いディスクリート GPU のみが搭載されたデバイスでは、パフォーマンスが低下したり、最小しきい値を満たしていない可能性があります。
- バックグラウンド リソースの競合: NPU ベースの実行とは異なり、GPU 推論は他の GPU 高速化ワークロードの影響を受けます。 グラフィックス集中型アプリケーション (ゲーム、ビデオ編集、3D レンダリング) を同時に実行しているユーザーは、モデルのパフォーマンスが低下する可能性があります。
- ソフトウェアの依存関係: Copilot+ PC以外の実行には、GPU 製造元 (NVIDIA または AMD) から直接インストールされた最新の IHV GPU ドライバーが必要です。 Windows Updateまたは OEM インストールの既定のドライバーでは不十分で、エラーやパフォーマンスの低下が発生する可能性があります。
システム パフォーマンス
非Copilot+ PCsのパフォーマンスについて
Phi Silica の出力品質 (精度、一貫性、関連性) は、同じモデルの重みとアーキテクチャが使用されるため、Copilot+ と非Copilot+ PCsで一貫しています。 主な違いは、 推論速度、 リソース消費、 ユーザー エクスペリエンスの応答性です。
開発者は次の手順を実行する必要があります。
- 代表的なハードウェアでのベンチマーク: 低スペック構成を含め、対象ユーザー層を反映した Copilot+ 以外のさまざまなデバイスでテストします。
- ユーザーの期待値を設定する: 応答時間はデバイスのハードウェアによって異なる可能性があることを明確に伝えます。 進行状況インジケーターを表示するか、部分的な結果をストリーミングすることを検討してください。
- タイムアウトとフォールバックを実装する: 応答時間が重要なシナリオでは、適切なタイムアウトを実装し、(ユーザーの同意を得て) クラウドベースのフォールバック オプションを提供することを検討してください。
- リソース使用量の監視: 推論中の GPU 使用率、VRAM 消費量、およびシステム メモリ使用量を追跡して、パフォーマンスのボトルネックを特定して対処します。
コンテンツ モデレーション
コンテンツ モデレーションは、Copilot+ と非Copilot+ PCsの両方で使用でき、強くお勧めします。
ContentFilterOptions API を使用すると、開発者は暴力、ヘイト、性的コンテンツ、自傷カテゴリの重大度しきい値を構成できます。 コンテンツ モデレーションの動作は、推論ハードウェアに関係なく同じです。
ベスト プラクティス:
- ユーザー向けアプリケーションのコンテンツ モデレーションを常に有効にします。
- ユーザーの人口に適した重大度レベルを構成します (たとえば、未成年者が使用するアプリケーションの設定が厳しくなります)。
- 自動コンテンツ モデレーションのみに依存しないでください。には、フラグ付きコンテンツのユーザー レポートと人間によるレビューのためのメカニズムが含まれています。
評価と統合のガイダンス
デプロイ前
ターゲット ユーザーを代表する非Copilot+ ハードウェア上のエンド ツー エンド テストを次に示します。
- アプリケーションのユース ケース全体にわたるモデル出力の機能テスト。
- 現実的なリソース競合シナリオでのパフォーマンス テスト。
- レッドチーミングを行って、潜在的な不正利用パターン、特に推論の遅延(例: 時間ベースのサイドチャネル リスク)を悪用する可能性があるものを特定します。
アプリケーションが提供するユーザー集団全体の公平性と偏りを評価します。 サポートされているすべての言語でプロンプトを使用してテストし、多様な人口統計を表します。
ローエンド デバイスでのユーザー エクスペリエンスを評価します。 パフォーマンスの低下によって、ユーザーのフラストレーション、破棄、不完全な出力への過剰な依存が発生しないようにします。
デプロイ後
テレメトリ (適用されるプライバシーに関する法律とポリシーに準拠) を監視して、次の情報を確認します。
- デバイスの種類間での推論待機時間の分布。
- コンテンツ モデレーション トリガーレート。
- 品質またはパフォーマンスの問題を示すユーザー フィードバック信号。
安全上の問題が検出された場合にモデルを無効または更新する機能を含むインシデント対応計画を維持します。
実際の使用パターン、ユーザーフィードバック、新たなコンテンツの安全性の脅威に基づいて、コンテンツ モデレーション設定を反復処理します。
アプリケーション エクスペリエンスでユーザー フィードバック メカニズムを直接提供することで、ユーザーは不正確、有害、または予期しない出力を報告できます。
非Copilot+ 拡張に対する責任ある AI に関する考慮事項
より広範な範囲、より広範な責任
Phi Silica を非Copilot+ PCsに拡張すると、より大規模で多様なユーザー集団がローカル AI 機能にアクセスできるようになります。 このリーチの増加は、利点とリスクの両方を増幅します。
- 民主化されたアクセス: より多くのユーザーが、特殊なハードウェアを購入することなく、デバイス上の AI の恩恵を受けることができます。 これにより、包括性と公平性がサポートされます。
- 誤用面の増加: ユーザー ベースが大きいほど、敵対的または有害な使用の統計的可能性が高くなります。 堅牢なコンテンツ モデレーションと不正使用の監視が不可欠です。
- デバイス コンテキスト: Copilot+ PCs以外のユーザーは、接続が制限された環境、古いハードウェア、または共有デバイスを使用している可能性があります。これらはすべて、AI のエクスペリエンスと悪用の可能性に影響します。
プライバシー
Phi Silica は、すべてのプロンプトを処理し、すべての応答をユーザーのデバイス上でローカルに生成します。 推論中に、ユーザープロンプトやモデル出力がMicrosoftまたは第三者に送信されることはありません。 このプライバシー アーキテクチャは、Copilot+ PCs以外でも保持されます。
Phi Silica を統合する開発者は、次の必要があります。
- AI 処理がデバイス上で発生することをユーザーに明確に開示します。
- ユーザーがインフォームド コンセントを提供していない限り、プロンプトと応答の収集やログ記録は避けてください。
- 収集されたテレメトリまたは診断データに関する適用されるプライバシーに関する法律、規制、およびMicrosoftのプライバシー ポリシーに従います。
透明 性
- AI によってコンテンツが生成されたときにユーザーに開示する。 AI で生成されたテキストを人間が作成したものとして表示しないでください。
- AI によってエラーが発生する可能性があることを伝え、重要な情報を確認するようユーザーに促します。
- Copilot+ PCs以外の場合は、パフォーマンスが Copilot 以降のハードウェアのパフォーマンスと異なる可能性があることをユーザーに通知します。
公平性
- 言語、文化、人口統計グループ間の潜在的な偏りについてモデルの出力を評価します。
- 異なるハードウェア構成間で異なるパフォーマンスや品質を監視し、公平なユーザー エクスペリエンスを確保します。
信頼性と安全性
- 対象ユーザー層に適した重大度レベルでコンテンツ モデレーションを実装してください。
- モデルの障害を適切に処理するようにアプリケーションを設計します (たとえば、モデルの使用不能、制約付きデバイスでのメモリ不足の状態など)。
- 安全性の問題が特定された場合に Phi シリカ機能を迅速に無効にするキル スイッチまたは機能フラグを指定します。
アカウンタビリティ
- AI 統合の決定、コンテンツ モデレーション構成、評価結果のドキュメントを保持します。
- AI 関連のインシデントの監視と対応について責任を負う個人またはチームを指定します。
ツールとリソース
- Phi Silica の概要 — Phi Silica API の主なドキュメント。
- Windows での応答可能なジェネレーティブ AI 開発 — プラクティスの管理、マップ、測定、管理に関するガイドライン。
- Microsoft Responsible AI Standard — 中核となる原則とアプローチ。
- Windows AI API を使用したContent Moderation — Phi Silica のコンテンツ フィルターの構成。
- AI 開発ギャラリー - サンプルとデモ。
この透明性に関するメモは、既存の Phi Silica ドキュメントと Responsible Generative AI Development on Windows ガイダンスを補足します。 テクノロジ、使用パターン、軽減策の進化に伴って更新されます。