Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Qu’est-ce qu’une note de transparence ?
Un système d’IA inclut non seulement la technologie, mais aussi les personnes qui l’utiliseront, les personnes qui seront affectées par elle et l’environnement dans lequel il est déployé. Créer un système adapté à l’objectif visé exige de bien comprendre comment la technologie fonctionne, de connaître ses capacités et ses limites et de savoir comment atteindre le meilleur niveau de performance.
Microsoft fournit des notes de transparence pour vous aider à comprendre le fonctionnement de notre technologie IA. Cela inclut les choix que les propriétaires du système peuvent faire qui influencent les performances et le comportement du système, ainsi que l’importance de réfléchir à l’ensemble du système, y compris la technologie, les personnes et l’environnement. Vous pouvez utiliser des notes de transparence lors du développement ou du déploiement de votre propre système, ou les partager avec les personnes qui utiliseront ou seront affectées par votre système.
Les notes de transparence font partie d’un effort plus large de Microsoft pour mettre en pratique nos principes AI.
Introduction à Phi Silicon
Phi Silicon est un petit modèle de langage (SLM) optimisé pour l’inférence sur appareil sur Windows. Il permet des fonctionnalités d’IA générative locales, notamment la génération de texte, le résumé, la réécriture et la transformation de texte à table, sans nécessiter de connexion cloud. Comme il fonctionne entièrement sur l’appareil, Phi Silica préserve la confidentialité des utilisateurs en conservant les requêtes et les réponses sur l’appareil.
Phi Silicon a été initialement conçu et optimisé exclusivement pour Windows Copilot+ PCs, qui incluent une unité de traitement neuronal (NPU) fournissant 40+ TOPS de calcul IA dédié. Avec cette extension, Phi Silicon est désormais disponible sur non-Copilot+ PCs — appareils standard Windows qui ne disposent pas d'un NPU dédié — où l'inférence est effectuée à l'aide du GPU de l'appareil.
Termes clés
| Terme | Definition |
|---|---|
| Copilot+ PC | Un PC Windows avec une unité de traitement neuronale dédiée (NPU) répondant au seuil 40+ TOPS, conçu à des fins pour accélérer les charges de travail IA sur appareil. |
| PC sans Copilot+ | Un PC standard Windows sans NPU dédié (ou avec un NPU inférieur au seuil Copilot+). L’inférence Phi Silicon sur ces appareils est effectuée via le GPU. |
| NPU (unité de traitement neuronal) | Matériel spécialisé conçu pour accélérer les charges de travail d’apprentissage automatique avec une grande efficacité et une faible consommation d’énergie. |
| SLM (Small Language Model) | Modèle de langage optimisé pour l’exécution locale et sur appareil avec un nombre de paramètres plus petit que les modèles de langage de grande taille à l’échelle du cloud ( LLMs). |
| Décodage spéculatif | Technique qui utilise un modèle brouillon plus petit pour proposer plusieurs séquences de jetons, qui sont ensuite validées en parallèle par le modèle principal pour accélérer la génération de texte. |
| Modération du contenu | Mécanismes de filtrage qui détectent et bloquent le contenu dangereux, offensant ou dangereux dans les entrées et sorties du modèle. |
Capabilities
Comportement du système
Phi Silicon traite les invites en langage naturel sur appareil et génère des réponses textuelles. Le modèle prend en charge :
- Génération de texte de forme libre : réponses aux questions, explications et génération de contenu créatif à partir d’invites utilisateur.
- Compétences d’intelligence de texte : fonctionnalités de transformation intégrées, y compris la synthèse, la réécriture (avec ajustement du ton) et la mise en forme de texte à table.
- Réponses en flux continu : résultats partiels renvoyés progressivement pour offrir une expérience utilisateur réactive.
- Intégration de la modération du contenu : filtrage de contenu configurable sur quatre catégories (violence, haine, contenu sexuel, auto-préjudice) à plusieurs niveaux de gravité.
Sur Copilot+ PCs, Phi Silicon tire parti du matériel NPU pour une inférence optimisée avec une latence inférieure et une consommation d’énergie réduite. Sur les PC non Copilot+, l’inférence s’effectue sur le GPU. Le modèle sous-jacent et ses fonctionnalités restent les mêmes ; toutefois, les caractéristiques opérationnelles diffèrent (voir Limitations).
Cas d’usage
Utilisations prévues
- Aide en écriture dans l’application : synthèse des documents, réécriture de texte pour plus de clarté ou de tonalité et génération de brouillons dans les applications de productivité.
- Récupération des informations et Q&A locales : réponse à des questions factuelles à l’aide des données d’apprentissage du modèle, sans transmettre de requêtes utilisateur à un service cloud.
- Fonctionnalités d’accessibilité : simplification du texte complexe, génération de descriptions et prise en charge des utilisateurs qui bénéficient de la lecture et de l’écriture assistées par l’IA.
- Prototypage pour les développeurs : permettre aux développeurs d’applications d’intégrer la génération de texte d’IA locale pour les scénarios de test et de preuve de concept.
- Flux de travail sensibles à la confidentialité : scénarios où la souveraineté des données, l’opération hors connexion ou les exigences de confidentialité des utilisateurs empêchent l’utilisation des services IA basés sur le cloud.
Considérations relatives au choix des cas d’usage
- Ne pas utiliser pour la prise de décision à haut enjeu sans surveillance humaine. Phi Silicon, comme tous les modèles linguistiques, peut produire des informations inexactes, incomplètes ou fabriquées (hallucinations). Les applications qui servent à éclairer des décisions médicales, juridiques, financières ou critiques en matière de sécurité doivent inclure une supervision humaine significative.
- Ne pas utiliser comme seule source de vérité factuelle. Les données d’apprentissage du modèle ont un découpage des connaissances et peuvent contenir des biais ou des inexactitudes. Encouragez les utilisateurs à vérifier les informations importantes provenant de sources faisant autorité.
- Soyez prudent avec les données personnelles sensibles. Bien que le traitement sur l’appareil améliore la confidentialité, les développeurs doivent éviter de concevoir des flux de travail qui soumettent au modèle des informations personnelles sensibles (par exemple, des dossiers médicaux, des détails financiers), sauf si des mesures de protection appropriées sont en place.
- Considérez la base d’utilisateurs élargie. L’expansion vers les non-Copilot+ PCs élargit considérablement la population des utilisateurs, y compris les appareils dotés de capacités matérielles variées et d’utilisateurs disposant d’une alphabétisation technique diversifiée. Concevez votre application pour gérer correctement la variance des performances et fournir des attentes claires aux utilisateurs.
Limitations
Limitations techniques spécifiques aux non-Copilot+ PCs
| Facteur | Pc Copilot+ (NPU) | PC sans Copilot+ (GPU) |
|---|---|---|
| Latence d’inférence | Optimisé ; faible latence grâce à l’accélération NPU et au décodage spéculatif | Latence plus élevée ; La vitesse d’inférence dépend de la génération du GPU, de la VRAM disponible et de la charge GPU actuelle |
| Consommation d’énergie | Le NPU est économe en puissance, adapté à l’utilisation de la batterie | L’inférence GPU consomme plus de puissance ; peut avoir un impact significatif sur la durée de vie de la batterie sur les ordinateurs portables |
| Charges de travail simultanées | Le NPU fonctionne indépendamment, ce qui réduit l’impact sur d’autres tâches | L’inférence GPU concurrence d’autres applications accélérées par GPU (rendu, lecture vidéo, jeu) pour les ressources de calcul ; peut entraîner des ralentissements du système |
| Impact thermique | NPU conçu pour des charges de travail d’IA soutenues avec une gestion thermique maîtrisée | Une utilisation prolongée de l’inférence GPU peut entraîner un bridage thermique sur des appareils non conçus pour des charges de calcul GPU prolongées |
| Pression de la mémoire | Chargement et inférence du modèle gérés en même temps que la mémoire NPU | Le modèle doit être chargé dans la VRAM du GPU (ou dans la mémoire GPU partagée) ; les appareils dotés d’une VRAM limitée peuvent subir une forte pression mémoire ou basculer vers une mémoire partagée plus lente |
| Compression de prompt | ✅ Disponible; active les fenêtres contextuelles plus longues | ❌ Non disponible sur GPU |
| Décodage spéculatif | ✅ Disponible ; accélère la génération de texte à l’aide d’un modèle d’ébauche | ❌ Non disponible sur GPU |
| Caractère facultatif du modèle | Le modèle est géré par le système | Le modèle est téléchargé à la demande et peut être supprimé par l’utilisateur dans Paramètres>Système>Composants IA |
Limitations techniques générales
- Précision et hallucinations : Phi Silicon peut générer des réponses plausibles mais factuelment incorrectes. La qualité de sortie du modèle ne change pas entre l'exécution du NPU et du GPU, mais la réactivité réduite sur les non-Copilot+ PCs peut amener les utilisateurs à accepter les sorties initiales sans révision critique.
- Prise en charge linguistique : les fonctionnalités linguistiques de Phi Silicon sont déterminées par ses données d’apprentissage. Les performances peuvent varier selon les langues, et certaines langues peuvent ne pas être prises en charge. Les caractéristiques de Phi Silicon ne sont pas disponibles en Chine.
- Limitations de la fenêtre de contexte : le modèle a une fenêtre contextuelle fixe. De longues requêtes ou des conversations à plusieurs tours peuvent dépasser cette fenêtre, ce qui peut entraîner la perte du contexte précédent.
- Biais et équité : le modèle peut refléter des préjugés présents dans ses données d’apprentissage, y compris les stéréotypes liés au sexe, à la race, à l’ethnicité, à la religion ou à d’autres caractéristiques. Les développeurs doivent évaluer les sorties pour assurer l’équité entre les populations que leur application sert.
- Entrées adversariales : le modèle peut être vulnérable à des attaques par injection d’invite ou à des tentatives de contournement des garde-fous (jailbreak). Les filtres de modération de contenu atténuent mais n’éliminent pas ce risque.
Facteurs opérationnels pour les PC non-Copilot+
- Diversité matérielle : les PC non Copilot+ couvrent un large éventail de configurations GPU (GPU intégrés ou dédiés, capacités de VRAM variables, différentes architectures de GPU). Les performances varient considérablement dans le spectre de cet appareil.
- Configuration matérielle minimale requise : les appareils doivent répondre aux exigences minimales de GPU et de mémoire pour exécuter Phi Silicon. Les appareils avec uniquement des graphiques intégrés ou des GPU discrets plus anciens peuvent rencontrer des performances détériorées ou ne respectent pas les seuils minimaux.
- Contention des ressources en arrière-plan : contrairement à l’exécution basée sur NPU, l’inférence GPU est affectée par d’autres charges de travail accélérées par GPU. Les utilisateurs exécutant des applications graphiques intensives (jeux, édition vidéo, rendu 3D) peuvent rencontrer simultanément de mauvaises performances de modèle.
- Dépendances logicielles : l’exécution non Copilot+ PC nécessite le dernier pilote GPU IHV installé directement à partir du fabricant du GPU (NVIDIA ou AMD). Les pilotes par défaut de Windows Update ou d’installations OEM peuvent ne pas être suffisants et peuvent entraîner des défaillances ou des performances détériorées.
Performances système
Comprendre les performances sur les PC qui ne sont pas des Copilot+ PC
La qualité des résultats de Phi Silica (précision, cohérence, pertinence) reste constante sur les PC Copilot+ et les PC non Copilot+, car les mêmes poids de modèle et la même architecture sont utilisés. Les principales différences sont la vitesse d’inférence, la consommation des ressources et la réactivité de l’expérience utilisateur.
Les développeurs doivent :
- Benchmark sur du matériel représentatif : testez sur une plage d’appareils non Copilot+ qui reflètent votre base d’utilisateurs cible, y compris les configurations de bas de gamme.
- Définir les attentes des utilisateurs : indiquez clairement que les temps de réponse peuvent varier en fonction du matériel de l’appareil. Envisagez d’afficher des indicateurs de progression ou de diffuser en continu des résultats partiels.
- Implémenter des délais d’expiration et des secours : pour les scénarios où le temps de réponse est critique, implémentez les délais d’expiration appropriés et envisagez d’offrir des options de secours basées sur le cloud (avec consentement de l’utilisateur).
- Surveiller l’utilisation des ressources : effectuez le suivi de l’utilisation du GPU, de la consommation VRAM et de l’utilisation de la mémoire système pendant l’inférence pour identifier et résoudre les goulots d’étranglement des performances.
Modération du contenu
La modération du contenu est disponible et fortement recommandée à la fois sur les Copilot+ et les non-Copilot+ PCs. L’API ContentFilterOptions permet aux développeurs de configurer des seuils de gravité pour les catégories de violence, de haine, de contenu sexuel et d’auto-préjudice. Le comportement de modération du contenu est identique, quel que soit le matériel d’inférence.
Meilleures pratiques :
- Activez toujours la modération de contenu pour les applications orientées utilisateur.
- Configurez les niveaux de gravité appropriés à votre population utilisateur (par exemple, des paramètres plus stricts pour les applications utilisées par des mineurs).
- Ne vous fiez pas uniquement à la modération de contenu automatisée ; incluez des mécanismes pour la création de rapports utilisateur et l’examen humain du contenu avec indicateur.
Conseils d’évaluation et d’intégration
Avant le déploiement
Effectuez des tests de bout en bout sur du matériel non Copilot+ représentatif de celui de vos utilisateurs cibles, notamment :
- Test fonctionnel des sorties de modèle dans les cas d’usage de votre application.
- Tests de performances dans des scénarios de contention de ressources réalistes.
- Exercices de red team pour identifier des schémas potentiels d’usage abusif, en particulier ceux susceptibles d’exploiter une inférence plus lente (par exemple, des risques de canal auxiliaire liés au temps).
Évaluez l’équité et le biais entre les populations utilisateur que votre application sert. Testez avec des requêtes dans toutes les langues prises en charge et représentatives de diverses catégories démographiques.
Évaluer l’expérience utilisateur sur les appareils inférieurs. Assurez-vous que les performances détériorées n’entraînent pas de frustration, d’abandon ou de dépendance excessive sur les sorties incomplètes.
Après le déploiement
Surveillez les données de télémétrie (conformément aux lois et stratégies applicables en matière de confidentialité) pour :
- Distributions de latence d’inférence entre les types d’appareils.
- Taux de déclenchement de modération du contenu.
- Les commentaires des utilisateurs signalent des problèmes de qualité ou de performances.
Conservez un plan de réponse aux incidents qui inclut la possibilité de désactiver ou de mettre à jour le modèle si un problème de sécurité est détecté.
Faites évoluer les paramètres de modération du contenu en fonction des schémas d’utilisation réels, des retours des utilisateurs et des menaces émergentes liées à la sûreté des contenus.
Fournissez des mécanismes de commentaires utilisateur directement dans l’expérience de l’application, ce qui permet aux utilisateurs de signaler des sorties inexactes, dangereuses ou inattendues.
Considérations relatives à l’IA responsable pour l’expansion sans Copilot+
Portée plus large, responsabilité plus large
L’extension de Phi Silica aux PC non Copilot+ rend les capacités d’IA locales accessibles à une population d’utilisateurs beaucoup plus vaste et diversifiée. Cette portée accrue amplifie à la fois les avantages et les risques :
- Accès démocratisé : d’autres utilisateurs peuvent bénéficier de l’IA sur appareil sans acheter de matériel spécialisé. Cela soutient l’inclusion et l’équité.
- Surface d’utilisation abusive accrue : une base d’utilisateurs plus grande augmente la probabilité statistique d’une utilisation contradictoire ou dangereuse. La modération de contenu robuste et la surveillance des abus sont essentielles.
- Divers contextes d’utilisation des appareils : les utilisateurs de PC non Copilot+ peuvent se trouver dans des environnements où la connectivité est limitée, avec du matériel plus ancien ou sur des appareils partagés, autant de facteurs qui influent sur la manière dont l’IA est utilisée et peut potentiellement faire l’objet d’un usage abusif.
Confidentialité
Phi Silicon traite toutes les invites et génère toutes les réponses localement sur l’appareil de l’utilisateur. Aucune invite utilisateur ou sortie de modèle n’est transmise à Microsoft ou à tout tiers pendant l’inférence. Cette architecture de confidentialité est préservée sur les PC non Copilot+.
Les développeurs qui intègrent Phi Silicon doivent :
- Indiquez clairement aux utilisateurs que le traitement de l’IA se produit sur l’appareil.
- Évitez de collecter ou de journaliser des invites et des réponses, sauf si l’utilisateur a fourni un consentement éclairé.
- Suivez les lois applicables en matière de confidentialité, les réglementations et les stratégies de confidentialité Microsoft concernant toutes les données de télémétrie ou de diagnostic collectées.
Transparence
- Divulguer aux utilisateurs quand le contenu est généré par l’IA. Ne présentez pas de texte généré par l’IA comme auteur humain.
- Communiquez que l’IA peut générer des erreurs et encourager les utilisateurs à vérifier des informations importantes.
- Sur des PC non-Copilot+, informez les utilisateurs que les performances peuvent différer de celles observées sur le matériel Copilot+.
Équité
- Évaluez les sorties du modèle pour les biais potentiels entre les langues, les cultures et les groupes démographiques.
- Surveillez les performances ou la qualité disparates entre différentes configurations matérielles pour garantir des expériences utilisateur équitables.
Sécurité et fiabilité
- Implémentez la modération du contenu avec des niveaux de gravité appropriés pour votre population utilisateur.
- Concevez votre application pour gérer correctement les défaillances de modèle (par exemple, l’indisponibilité du modèle, les conditions d’absence de mémoire sur les appareils contraints).
- Prévoyez un dispositif d’arrêt d’urgence ou un flag de fonctionnalité pour désactiver rapidement la fonctionnalité Phi Silica si un problème de sécurité est identifié.
Responsabilité
- Conservez la documentation de vos décisions d’intégration ia, des configurations de modération du contenu et des résultats d’évaluation.
- Désignez une personne responsable ou une équipe responsable de la surveillance et de la réponse aux incidents liés à l’IA.
Outils et ressources
- Vue d’ensemble de Phi Silicon : documentation principale pour les API Phi Silicon.
- Responsible Generative AI Development on Windows — Recommandations pour les pratiques de gouvernance, de mappage, de mesure et de gestion.
- Microsoft Standard d’IA responsable — Principes et approches fondamentaux.
- Content Moderation avec Windows API IA — Configuration des filtres de contenu pour Phi Silicon.
- Ai Dev Gallery : exemples et démonstrations.
Cette note de transparence complète la documentation existante de Phi Silicon et les conseils Responsible Generative AI Development on Windows. Elle sera mise à jour à mesure que la technologie, les modèles d’utilisation et les atténuations évolueront.