Transparantienotitie: PhiSilium op niet-Copilot+ PCs

Wat is een transparantienotitie?

Een AI-systeem omvat niet alleen de technologie, maar ook de mensen die het gebruiken, de personen die worden beïnvloed door het systeem en de omgeving waarin het wordt geïmplementeerd. Voor het maken van een systeem dat geschikt is voor het beoogde doel, moet u begrijpen hoe de technologie werkt, wat de mogelijkheden en beperkingen zijn en hoe u de beste prestaties kunt behalen.

Microsoft biedt transparency notes om u te helpen begrijpen hoe onze AI-technologie werkt. Dit omvat de keuzes die systeemeigenaren kunnen maken die invloed hebben op de prestaties en het gedrag van het systeem, en het belang van het nadenken over het hele systeem, waaronder de technologie, de mensen en de omgeving. U kunt opmerkingen over transparantie gebruiken bij het ontwikkelen of implementeren van uw eigen systeem of u kunt ze delen met de mensen die het systeem zullen gebruiken of die hierdoor beïnvloed zullen worden.

Transparantienota's maken deel uit van een bredere inspanning op Microsoft om onze AI-principes in de praktijk te brengen.


Inleiding tot PhiSilium

Phi Silica is een klein taalmodel (SLM) dat is afgestemd op inferentie op het apparaat zelf in Windows. Het maakt lokale generatieve AI-mogelijkheden mogelijk, waaronder het genereren, samenvatten, herschrijven en transformeren van tekst naar tabel, zonder dat hiervoor een cloudverbinding is vereist. Door volledig op het apparaat uit te voeren, ondersteunt PhiSilium de privacy van gebruikers door prompts en antwoorden lokaal te houden.

Phi Silica is oorspronkelijk uitsluitend ontworpen en geoptimaliseerd voor Windows Copilot+ PCs, die beschikken over een Neural Processing Unit (NPU) met 40+ TOPS aan speciale AI-rekenkracht. Met deze uitbreiding is Phi Silicium nu beschikbaar op non-Copilot+ PCs - standaard Windows apparaten die geen toegewezen NPU hebben, waarbij deductie wordt uitgevoerd met behulp van de GPU van het apparaat.

Belangrijke termen

Termijn Definition
Copilot+ PC Een Windows pc met een speciale NPU (Neural Processing Unit) die voldoet aan de drempelwaarde van 40+ TOPS, die speciaal is gebouwd voor versnelde AI-workloads op het apparaat.
PC zonder Copilot+ Een standaard Windows pc zonder een toegewezen NPU (of met een NPU onder de Copilot+ drempelwaarde). Phi Siliciumdeductie op deze apparaten wordt uitgevoerd via de GPU.
NPU (neurale verwerkingseenheid) Gespecialiseerde hardware die is ontworpen om machine learning-workloads te versnellen met een hoge efficiëntie en een laag energieverbruik.
SLM (Small Language Model) Een taalmodel dat is geoptimaliseerd voor lokale uitvoering op het apparaat met een kleiner aantal parameters dan grootschalige grote taalmodellen (LLM's) in de cloud.
Speculatieve decodering Een techniek die gebruikmaakt van een kleiner conceptmodel om meerdere tokenreeksen voor te stellen, die vervolgens parallel door het hoofdmodel worden gevalideerd om het genereren van tekst te versnellen.
Inhoudsbeheer Filtermechanismen waarmee schadelijke, aanstootgevende of onveilige inhoud in modelinvoer en -uitvoer wordt gedetecteerd en geblokkeerd.

Capabilities

Systeemgedrag

PhiSilium verwerkt aanwijzingen voor natuurlijke taal op het apparaat en genereert tekstreacties. Het model ondersteunt:

  • Vrije tekst genereren: vragen beantwoorden, uitleg geven en creatieve inhoud genereren op basis van gebruikersprompts.
  • Vaardigheden voor tekstintelligentie: ingebouwde transformatiemogelijkheden, waaronder samenvatting, herschrijven (met aanpassing van toon) en opmaak van tekst naar tabel.
  • Streaming-reacties: Gedeeltelijke resultaten worden stapsgewijs teruggestuurd voor een responsieve gebruikerservaring.
  • Integratie van inhoudsbeheer: Configureerbare inhoud filteren in vier categorieën (geweld, haat, seksuele inhoud, zelfschadiging) op meerdere ernstniveaus.

Op Copilot+ PCs maakt PhiSilium gebruik van NPU-hardware voor geoptimaliseerde deductie met lagere latentie en verminderd energieverbruik. Op niet-Copilot+ PCs wordt deductie uitgevoerd op de GPU. Het onderliggende model en de mogelijkheden blijven hetzelfde; operationele kenmerken verschillen echter (zie Beperkingen).

Gebruiksvoorbeelden

Beoogde gebruik

  • Schrijfassistentie in apps: documenten samenvatten, tekst herschrijven voor meer duidelijkheid of een andere toon, en conceptteksten opstellen in productiviteitsapps.
  • Lokale Q&A en het ophalen van gegevens: het beantwoorden van feitelijke vragen met behulp van de trainingsgegevens van het model, zonder dat gebruikersquery's naar een cloudservice worden verzonden.
  • Toegankelijkheidsfuncties: complexe tekst vereenvoudigen, beschrijvingen genereren en gebruikers ondersteunen die profiteren van ai-ondersteuning voor lezen en schrijven.
  • Prototypen van ontwikkelaars: ontwikkelaars van toepassingen in staat stellen om lokale AI-tekstgeneratie te integreren voor testen en proof-of-concept-scenario's.
  • Privacygevoelige werkstromen: scenario's waarbij gegevenssoevereiniteit, offlinebewerking of privacyvereisten van gebruikers het gebruik van AI-services in de cloud voorkomen.

Overwegingen bij het kiezen van use cases

  • Gebruik niet voor besluitvorming met grote belangen zonder menselijk toezicht. PhiSilium, zoals alle taalmodellen, kan onnauwkeurige, onvolledige of ge fabriceerde informatie produceren (halluinaties). Aanvragen die medische, juridische, financiële of veiligheidskritieke beslissingen informeren, moeten zinvolle menselijke beoordeling omvatten.
  • Gebruik niet als enige bron van feitelijke waarheid. De trainingsgegevens van het model hebben een kennisbeperking en kunnen vooroordelen of onnauwkeurigheden bevatten. Moedig gebruikers aan om belangrijke informatie uit gezaghebbende bronnen te verifiëren.
  • Wees voorzichtig met gevoelige persoonsgegevens. Hoewel de verwerking van apparaten de privacy verbetert, moeten ontwikkelaars voorkomen dat ze werkstromen ontwerpen die het model vragen om gevoelige persoonlijke gegevens (bijvoorbeeld gezondheidsrecords, financiële gegevens) tenzij er passende beveiligingsmaatregelen zijn.
  • Houd rekening met het uitgebreide gebruikersbestand. Uitbreiding tot niet-Copilot+ PCs vergroot de gebruikerspopulatie aanzienlijk, inclusief apparaten met verschillende hardwaremogelijkheden en gebruikers met diverse technische kennis. Ontwerp uw toepassing om prestatievariantie correct af te handelen en duidelijke verwachtingen te bieden aan gebruikers.

Limitations

Technische beperkingen die specifiek zijn voor niet-Copilot+ PCs

Kenmerk Copilot+ PC's (NPU) Niet-Copilot+ PCs (GPU)
Inferentielatentie Geoptimaliseerd; lage latentie via NPU-versnelling en speculatieve decodering Hogere latentie; deductiesnelheid is afhankelijk van gpu-generatie, beschikbare VRAM en huidige GPU-belasting
Stroomverbruik NPU is energie-efficiënt, geschikt voor gebruik op batterijen GPU-deductie verbruikt meer vermogen; kan de levensduur van de batterij op laptops aanzienlijk beïnvloeden
Gelijktijdige workloads NPU werkt onafhankelijk, waardoor de impact op andere taken wordt geminimaliseerd GPU-deductie concurreert met andere GPU-versnelde toepassingen (rendering, video afspelen, gaming) voor rekenresources; kan leiden tot vertragingen van het systeem
Thermisch effect NPU ontworpen voor duurzame AI-workloads met beheerde thermische gegevens Langdurige GPU-inferentie kan thermische throttling veroorzaken bij apparaten die niet zijn ontworpen voor langdurige GPU-rekenbelastingen
Geheugendruk Model laden en inferentie beheerd samen met NPU-geheugen Het model moet worden geladen in GPU VRAM (of gedeeld GPU-geheugen); apparaten met een beperkt VRAM kunnen te maken hebben met druk of terugvallen op trager gedeeld geheugen
Compressie van prompts ✅ Beschikbaar; maakt langere effectieve contextvensters mogelijk ❌ Niet beschikbaar op GPU
Speculatieve decodering ✅ Beschikbaar; versnelt het genereren van tekst met behulp van een conceptmodel ❌ Niet beschikbaar op GPU
Modelkeuze Het model wordt beheerd door het systeem Het model wordt op verzoek gedownload en kan door de gebruiker worden verwijderd via Instellingen>Systeem>AI-onderdelen

Algemene technische beperkingen

  • Nauwkeurigheid en halluïnaties: Phi Silicium kan plausibel klinkende maar feitelijk onjuiste reacties genereren. De uitvoerkwaliteit van het model verandert niet tussen NPU- en GPU-uitvoering, maar de verminderde reactiesnelheid op niet-Copilot+ PCs kan ertoe leiden dat gebruikers initiële uitvoer accepteren zonder kritieke beoordeling.
  • Taalondersteuning: de taalmogelijkheden van Phi Silicium worden bepaald door de trainingsgegevens. De prestaties kunnen per taal verschillen en sommige talen worden mogelijk niet ondersteund. Phi Silicium kenmerken zijn niet beschikbaar in China.
  • Beperkingen voor contextvensters: het model heeft een vast contextvenster. Lange prompts of gesprekken met meerdere beurten kunnen dit venster overschrijden, waardoor eerdere context verloren kan gaan.
  • Vooroordelen en billijkheid: Het model kan vooroordelen weerspiegelen die aanwezig zijn in de trainingsgegevens, waaronder stereotypen met betrekking tot geslacht, ras, etniciteit, religie of andere kenmerken. Ontwikkelaars moeten de uitvoer evalueren op eerlijkheid voor de populaties die hun toepassing bedient.
  • Adversariële invoer: Het model kan vatbaar zijn voor promptinjectie- of jailbreakpogingen. Filters voor inhoudsbeheer beperken maar elimineren dit risico niet.

Operationele factoren voor niet-Copilot+ PCs

  • Hardwarediversiteit: Niet-Copilot+ PCs omvatten een breed scala aan GPU-configuraties (geïntegreerd versus discrete GPU's, verschillende VRAM-capaciteiten, verschillende GPU-architecturen). De prestaties variëren aanzienlijk in dit apparaatspectrum.
  • Minimale hardwarevereisten: apparaten moeten voldoen aan minimale GPU- en geheugenvereisten om Phi Silicium uit te voeren. Apparaten met alleen geïntegreerde graphics of oudere discrete GPU's kunnen verminderde prestaties ervaren of voldoen mogelijk niet aan de minimumdrempels.
  • Concurrentie om achtergrondresources: In tegenstelling tot uitvoering via een NPU wordt GPU-inferentie beïnvloed door andere door de GPU-versnelde workloads. Gebruikers met grafische intensieve toepassingen (gaming, videobewerking, 3D-rendering) kunnen tegelijkertijd slechte modelprestaties ervaren.
  • Softwareafhankelijkheden: Niet-Copilot+ PC uitvoering vereist het meest recente IHV GPU-stuurprogramma dat rechtstreeks is geïnstalleerd vanaf de GPU-fabrikant (NVIDIA of AMD). Standaardstuurprogramma's van Windows Update- of OEM-installaties zijn mogelijk niet voldoende en kunnen fouten of verminderde prestaties veroorzaken.

Systeemprestaties

Inzicht in prestaties op niet-Copilot+ PCs

De uitvoerkwaliteit van PhiSilium (nauwkeurigheid, samenhang, relevantie) is consistent in Copilot+ en niet-Copilot+ PCs omdat dezelfde modelgewichten en architectuur worden gebruikt. De belangrijkste verschillen zijn deductiesnelheid, het resourceverbruik en de reactiesnelheid van de gebruikerservaring.

Ontwikkelaars moeten:

  • Voer benchmarks uit op representatieve hardware: Test op verschillende niet-Copilot+-apparaten die representatief zijn voor uw doelgroep, inclusief configuraties uit het lagere segment.
  • Stel de verwachtingen van gebruikers in: communiceer duidelijk dat reactietijden kunnen variëren op basis van apparaathardware. Overweeg voortgangsindicatoren weer te geven of gedeeltelijke resultaten te streamen.
  • Time-outs en terugvalbewerkingen implementeren: voor scenario's waarin reactietijd kritiek is, implementeert u de juiste time-outs en kunt u overwegen om cloudgebaseerde terugvalopties (met toestemming van de gebruiker) aan te bieden.
  • Resourcegebruik bewaken: Houd het GPU-gebruik, het VRAM-verbruik en het geheugengebruik van het systeem bij tijdens deductie om knelpunten in de prestaties te identificeren en op te pakken.

Inhoudsbeheer

Inhoudsbeheer is beschikbaar en wordt sterk aanbevolen voor zowel Copilot+ als niet-Copilot+ PCs. Met de ContentFilterOptions API kunnen ontwikkelaars ernstdrempels configureren voor geweld, haat, seksuele inhoud en zelfschadecategorieën. Gedrag van inhoudsbeheer is identiek, ongeacht de deductiehardware.

Aanbevolen praktijken:

  • Schakel inhoudsbeheer altijd in voor gebruikersgerichte toepassingen.
  • Configureer ernstniveaus die geschikt zijn voor uw gebruikerspopulatie (bijvoorbeeld strengere instellingen voor toepassingen die door minderjarigen worden gebruikt).
  • Vertrouw niet alleen op geautomatiseerde inhoudsbeheer; omvatten mechanismen voor gebruikersrapportage en menselijke beoordeling van gemarkeerde inhoud.

Richtlijnen voor evaluatie en integratie

Vóór implementatie

  1. Voer end-to-endtests uit op hardware zonder Copilot+ die representatief is voor uw beoogde gebruikers, waaronder:

    • Functionele tests van modeluitvoer in de use cases van uw toepassing.
    • Prestatietesten in realistische scenario's van concurrentie om resources.
    • Red teaming om mogelijke misbruikpatronen te identificeren, met name patronen die tragere inferentie kunnen uitbuiten (bijvoorbeeld tijdsgebaseerde side-channel-risico's).
  2. Evalueer redelijkheid en vooroordelen in de gebruikerspopulaties die uw toepassing dient. Test met invoerprompts in alle ondersteunde talen die diverse demografische groepen vertegenwoordigen.

  3. Beoordeel de gebruikerservaring op apparaten met een lager niveau. Zorg ervoor dat verminderde prestaties niet leiden tot gebruikersfrustratie, verlaten of te veel vertrouwen op onvolledige uitvoer.

Na implementatie

  1. Telemetrie bewaken (in overeenstemming met toepasselijke privacywetten en -beleidsregels) voor:

    • Verdeling van inferentielatentie per apparaattype.
    • Triggerpercentages voor inhoudsmoderatie.
    • Feedbacksignalen van gebruikers die kwaliteits- of prestatieproblemen aangeven.
  2. Onderhoud een reactieplan voor incidenten met de mogelijkheid om het model uit te schakelen of bij te werken als er een veiligheidsprobleem wordt gedetecteerd.

  3. Blijf de instellingen voor contentmoderatie verfijnen op basis van gebruikspatronen in de praktijk, gebruikersfeedback en nieuwe bedreigingen voor contentveiligheid.

  4. Gebruikersfeedbackmechanismen rechtstreeks in de toepassingservaring bieden, zodat gebruikers onnauwkeurige, schadelijke of onverwachte uitvoer kunnen rapporteren.


Verantwoordelijke AI-overwegingen voor de niet-Copilot+ uitbreiding

Breder bereik, bredere verantwoordelijkheid

Het uitbreiden van Phi Silicium naar niet-Copilot+ PCs maakt lokale AI-mogelijkheden toegankelijk voor een veel grotere en diversere gebruikerspopulatie. Dit verhoogde bereik versterkt zowel de voordelen als de risico's:

  • Ge democratiseerde toegang: Meer gebruikers kunnen profiteren van AI op het apparaat zonder gespecialiseerde hardware aan te schaffen. Dit ondersteunt inclusie en gelijkheid.
  • Toegenomen misbruikoppervlak: Een groter gebruikersbestand verhoogt de statistische kans op adversarial of schadelijk gebruik. Robuuste controle van inhoud en misbruikbewaking zijn essentieel.
  • Diverse apparaatcontexten: Gebruikers op niet-Copilot+ PCs kunnen zich in omgevingen bevinden met beperkte connectiviteit, oudere hardware of gedeelde apparaten, die allemaal van invloed zijn op de manier waarop de AI wordt ervaren en mogelijk misbruikt.

Geheimhouding

Phi Silicium verwerkt alle prompts en genereert alle reacties lokaal op het apparaat van de gebruiker. Er worden geen gebruikersprompts of modeluitvoer verzonden naar Microsoft of een derde partij tijdens deductie. Deze privacyarchitectuur blijft behouden op niet-Copilot+ PCs.

Ontwikkelaars die Phi Silicium integreren, moeten:

  • Maak duidelijk bekend aan gebruikers dat AI-verwerking plaatsvindt op het apparaat.
  • Vermijd het verzamelen of vastleggen van prompts en antwoorden, tenzij de gebruiker geïnformeerde toestemming heeft gegeven.
  • Volg toepasselijke privacywetten, regelgeving en Microsoft privacybeleid met betrekking tot alle verzamelde telemetrie- of diagnostische gegevens.

Doorzichtigheid

  • Openbaar maken aan gebruikers wanneer inhoud wordt gegenereerd door AI. Presenteer geen door AI gegenereerde tekst als door mensen geschreven.
  • Communiceer dat de AI fouten kan veroorzaken en moedig gebruikers aan om belangrijke informatie te verifiëren.
  • Informeer gebruikers bij niet-Copilot+ PCs dat de prestaties kunnen verschillen van die op Copilot+ hardware.

Eerlijkheid

  • Evalueer modeluitvoer voor mogelijke vooroordelen tussen talen, culturen en demografische groepen.
  • Controleer op verschillende prestaties of kwaliteit in verschillende hardwareconfiguraties om een rechtvaardige gebruikerservaring te garanderen.

Betrouwbaarheid en veiligheid

  • Implementeer inhoudsbeheer met ernstniveaus die geschikt zijn voor uw gebruikerspopulatie.
  • Ontwerp uw toepassing om modelfouten probleemloos af te handelen (bijvoorbeeld modelontschikbaarheid, onvoldoende geheugen op beperkte apparaten).
  • Geef een kill switch of functievlag op om Phi Silicium-functionaliteit snel uit te schakelen als er een veiligheidsprobleem wordt geïdentificeerd.

Verantwoordelijkheid

  • Documentatie bijhouden van uw beslissingen over AI-integratie, configuraties voor inhoudsbeheer en evaluatieresultaten.
  • Een verantwoordelijk persoon of team aanwijzen die verantwoordelijk is voor het bewaken en reageren op AI-gerelateerde incidenten.

Hulpmiddelen en bronnen


Deze transparantienota is een aanvulling op de bestaande documentatie voor Phi Silica en de leidraad Verantwoorde ontwikkeling van generatieve AI op Windows. Deze wordt bijgewerkt naarmate de technologie, gebruikspatronen en oplossingen zich ontwikkelen.