Nota sulla trasparenza: Phi Silica sui PC non Copilot+

Che cos'è la nota sulla trasparenza?

Un sistema di intelligenza artificiale include non solo la tecnologia, ma anche le persone che lo useranno, le persone che ne saranno interessate e l'ambiente in cui viene distribuito. La creazione di un sistema adatto allo scopo previsto richiede una comprensione del funzionamento della tecnologia, delle sue capacità e limitazioni e di come ottenere le migliori prestazioni.

Microsoft fornisce note sulla trasparenza per comprendere il funzionamento della tecnologia di intelligenza artificiale. Ciò include le scelte che i proprietari del sistema possono fare che influenzano le prestazioni e il comportamento del sistema, e l'importanza di pensare all'intero sistema, tra cui la tecnologia, le persone e l'ambiente. Puoi utilizzare le note sulla trasparenza durante lo sviluppo o la distribuzione del tuo sistema o condividerle con le persone che utilizzeranno il tuo sistema o che ne saranno coinvolte.

Le note sulla trasparenza fanno parte di un impegno più ampio Microsoft per mettere in pratica i nostri principi AI.


Introduzione a Phi Silica

Phi Silica è un piccolo modello linguistico (SLM) ottimizzato per l'inferenza su dispositivo in Windows. Consente funzionalità di intelligenza artificiale generative locali, tra cui generazione di testo, riepilogo, riscrittura e trasformazione da testo a tabella, senza richiedere una connessione cloud. Eseguendo interamente su dispositivo, Phi Silica supporta la privacy degli utenti mantenendo richieste e risposte locali.

Phi Silica è stato originariamente progettato e ottimizzato esclusivamente per Windows Copilot+ PCs, che includono un'unità di elaborazione neurale (NPU) che fornisce 40+ TOPS di calcolo di intelligenza artificiale dedicato. Con questa espansione, Phi Silica è ora disponibile in non Copilot+ PCs , dispositivi Windows standard che non dispongono di una NPU dedicata, in cui l'inferenza viene eseguita usando la GPU del dispositivo.

Termini chiave

Termine Definition
Copilot+ PC Un PC Windows con un'unità di elaborazione neurale dedicata (NPU) che soddisfa la soglia TOPS 40+, appositamente creata per i carichi di lavoro di intelligenza artificiale su dispositivo accelerati.
PC senza Copilot+ Un PC Windows standard senza una NPU dedicata (o con una NPU al di sotto della soglia Copilot+). L'inferenza Phi Silica in questi dispositivi viene eseguita tramite la GPU.
NPU (Neural Processing Unit) Hardware specializzato progettato per accelerare i carichi di lavoro di Machine Learning con un'elevata efficienza e un consumo ridotto di energia.
SLM (Small Language Model) Un modello linguistico ottimizzato per l'esecuzione locale su dispositivo con un numero di parametri inferiore rispetto ai modelli di linguaggio di grandi dimensioni su scala cloud.
Decodifica speculativa Tecnica che usa un modello bozza più piccolo per proporre più sequenze di token, che vengono quindi convalidate in parallelo dal modello principale per accelerare la generazione di testo.
Moderazione del contenuto Meccanismi di filtro che rilevano e bloccano contenuto dannoso, offensivo o non sicuro negli input e negli output del modello.

Capabilities

Comportamento del sistema

Phi Silica elabora richieste in linguaggio naturale sul dispositivo e genera risposte di testo. Il modello supporta:

  • Generazione di testo in formato libero: rispondere a domande, fornire spiegazioni e generare contenuti creativi dalle richieste degli utenti.
  • Competenze di Intelligence per il testo: funzionalità di trasformazione predefinite, tra cui riepilogo, riscrittura (con regolazione del tono) e formattazione da testo a tabella.
  • Risposte in streaming: risultati parziali restituiti progressivamente per le esperienze utente reattive.
  • Integrazione della moderazione del contenuto: filtro dei contenuti configurabili in quattro categorie (violenza, odio, contenuto sessuale, autolesionismo) a più livelli di gravità.

In Copilot+ PCs, Phi Silica sfrutta l'hardware NPU per ottimizzare l'inferenza con una latenza inferiore e un consumo di energia ridotto. Sui PC non-Copilot+, l'inferenza viene eseguita sulla GPU. Il modello sottostante e le relative funzionalità rimangono invariati; Tuttavia, le caratteristiche operative differiscono (vedere Limitazioni).

Casi d'uso

Usi previsti

  • Assistenza per la scrittura in-app: riepilogo dei documenti, riscrittura del testo per chiarezza o tono e generazione di bozze all'interno delle applicazioni di produttività.
  • Q&A locale e recupero delle informazioni: rispondere a domande fattuali utilizzando i dati di addestramento del modello, senza trasmettere le richieste dell’utente a un servizio cloud.
  • Funzionalità di accessibilità: semplificare il testo complesso, generare descrizioni e supportare gli utenti che traggono vantaggio dalla lettura e dalla scrittura assistita dall'intelligenza artificiale.
  • Creazione di prototipi per sviluppatori: consentire agli sviluppatori di applicazioni di integrare la generazione di testo di intelligenza artificiale locale per scenari di test e modello di verifica.
  • Flussi di lavoro sensibili alla privacy: scenari in cui la sovranità dei dati, l'operazione offline o i requisiti di privacy degli utenti impediscono l'uso dei servizi di intelligenza artificiale basati sul cloud.

Considerazioni sulla scelta dei casi d'uso

  • Non usare per prendere decisioni di alto livello senza supervisione umana. Phi Silica, come tutti i modelli linguistici, può produrre informazioni imprecise, incomplete o fabbricate (allucinazioni). Le applicazioni che informano decisioni mediche, legali, finanziarie o critiche per la sicurezza devono includere una revisione umana significativa.
  • Non usare come unica fonte di verità effettiva. I dati di addestramento del modello hanno un limite temporale delle conoscenze e possono contenere pregiudizi o imprecisioni. Incoraggiare gli utenti a verificare informazioni importanti da origini autorevoli.
  • Prestare attenzione ai dati personali sensibili. Mentre l'elaborazione su dispositivo migliora la privacy, gli sviluppatori devono evitare di progettare flussi di lavoro che richiedono al modello informazioni personali riservate (ad esempio, record di integrità, dettagli finanziari) a meno che non siano presenti misure di sicurezza appropriate.
  • Si consideri la base di utenti ampliata. L'espansione ai PC non Copilot+ amplia notevolmente la base di utenti, includendo dispositivi con capacità hardware diverse e utenti con diversi livelli di competenza tecnica. Progettare l'applicazione per gestire correttamente la varianza delle prestazioni e fornire aspettative chiare agli utenti.

Limitations

Limitazioni tecniche specifiche dei PC non Copilot+

Fattore Copilot+ PC (NPU) Non Copilot+ PCs (GPU)
Latenza di inferenza Ottimizzato; bassa latenza grazie all'accelerazione NPU e alla decodifica speculativa Latenza più elevata; la velocità di inferenza dipende dalla generazione della GPU, dalla VRAM disponibile e dal carico GPU corrente
Consumo energetico La NPU è efficiente per l'alimentazione, adatta per l'uso a batteria L'inferenza GPU consuma più potenza; può influire significativamente sulla durata della batteria sui portatili
Carichi di lavoro simultanei La NPU funziona in modo indipendente, riducendo al minimo l'impatto su altre attività L'inferenza GPU è in competizione con altre applicazioni con accelerazione GPU (rendering, riproduzione video, gioco) per le risorse di calcolo; può causare rallentamenti del sistema
Impatto termico NPU progettata per carichi di lavoro AI continuativi con gestione termica ottimizzata L'inferenza GPU estesa può causare limitazioni termiche nei dispositivi non progettati per carichi di calcolo GPU sostenuti
Utilizzo elevato di memoria Caricamento e inferenza del modello gestiti insieme alla memoria NPU Il modello deve essere caricato nella VRAM GPU (o nella memoria GPU condivisa); i dispositivi con VRAM limitato possono riscontrare una pressione o un fallback alla memoria condivisa più lenta
Compressione dei prompt ✅ Disponibile; abilita finestre di contesto più efficaci ❌ Non disponibile nella GPU
Decodifica speculativa ✅ Disponibile; accelera la generazione di testo usando un modello bozza ❌ Non disponibile nella GPU
Facoltatività del modello Il modello viene gestito dal sistema Il modello viene scaricato su richiesta e può essere rimosso dall'utente tramite Impostazioni>Sistema>Componenti AI

Limitazioni tecniche generali

  • Accuratezza e allucinazioni: Phi Silica può generare risposte plausibili ma effettivamente errate. La qualità dell'output del modello non cambia tra l'esecuzione su NPU e su GPU, ma la minore reattività sui PC non Copilot+ può indurre gli utenti ad accettare i risultati iniziali senza valutarli criticamente.
  • Supporto linguistico: le funzionalità linguistiche di Phi Silica sono determinate dai dati di training. Le prestazioni possono variare in base alle lingue e alcune lingue potrebbero non essere supportate. Le caratteristiche di Phi Silica non sono disponibili in Cina.
  • Limitazioni della finestra di contesto: il modello ha una finestra di contesto fissa. Le richieste lunghe o le conversazioni a più turni possono superare questa finestra, causando la perdita di contesto precedente.
  • Distorsione e equità: il modello può riflettere i pregiudizi presenti nei dati di training, inclusi gli stereotipi correlati a sesso, razza, etnia, religione o altre caratteristiche. Gli sviluppatori devono valutare gli output per l'equità tra le popolazioni che servono all'applicazione.
  • Input avversari: il modello può essere vulnerabile a tentativi di iniezione di prompt o di jailbreak. I filtri di moderazione del contenuto attenuano ma non eliminano questo rischio.

Fattori operativi per i PC non Copilot+

  • Diversità hardware: i PC non Copilot+ coprono un'ampia gamma di configurazioni delle GPU (GPU integrate o discrete, capacità di VRAM variabili, diverse architetture GPU). Le prestazioni variano in modo significativo in questo spettro di dispositivi.
  • Requisiti hardware minimi: i dispositivi devono soddisfare i requisiti minimi di GPU e memoria per eseguire Phi Silica. I dispositivi con solo grafica integrata o GPU discrete meno recenti possono riscontrare prestazioni ridotte o non soddisfare soglie minime.
  • Contesa di risorse in background: a differenza dell'esecuzione basata su NPU, l'inferenza GPU è influenzata da altri carichi di lavoro con accelerazione GPU. Gli utenti che eseguono applicazioni a elevato utilizzo di grafica (giochi, modifica video, rendering 3D) contemporaneamente potrebbero riscontrare prestazioni del modello scarse.
  • Dipendenze software: l'esecuzione su PC non Copilot+ richiede che sia installato il driver IHV della GPU più recente direttamente dal produttore della GPU (NVIDIA o AMD). I driver predefiniti di Windows Update o installazioni OEM potrebbero non essere sufficienti e possono causare errori o prestazioni ridotte.

Prestazioni del sistema

Comprendere le prestazioni sui PC non Copilot+

La qualità di output di Phi Silica (accuratezza, coerenza, pertinenza) è coerente tra Copilot+ e non Copilot+ PCs perché vengono usati gli stessi pesi e architetture del modello. Le differenze principali sono la velocità di inferenza, il consumo di risorse e la velocità di risposta dell'esperienza utente.

Gli sviluppatori devono:

  • Benchmark sull'hardware rappresentativo: eseguire test su un intervallo di dispositivi non Copilot+ che riflettono la base utente di destinazione, incluse le configurazioni di fascia inferiore.
  • Impostare le aspettative degli utenti: comunicare chiaramente che i tempi di risposta possono variare in base all'hardware del dispositivo. Valutare la possibilità di visualizzare indicatori di stato o di streaming di risultati parziali.
  • Implementare timeout e fallback: per scenari in cui il tempo di risposta è critico, implementare timeout appropriati e valutare la possibilità di offrire opzioni di fallback basate sul cloud (con il consenso dell'utente).
  • Monitorare l'utilizzo delle risorse: tenere traccia dell'utilizzo della GPU, del consumo di VRAM e dell'utilizzo della memoria di sistema durante l'inferenza per identificare e risolvere i colli di bottiglia delle prestazioni.

Moderazione del contenuto

La moderazione del contenuto è disponibile e fortemente consigliata sia in Copilot+ che non Copilot+ PCs. L'API ContentFilterOptions consente agli sviluppatori di configurare le soglie di gravità per le categorie di violenza, odio, contenuto sessuale e autolesionismo. Il comportamento della moderazione del contenuto è identico indipendentemente dall'hardware di inferenza.

Procedure consigliate:

  • Abilitare sempre la moderazione del contenuto per le applicazioni rivolte agli utenti.
  • Configurare i livelli di gravità appropriati per il popolamento degli utenti ,ad esempio impostazioni più rigide per le applicazioni usate dai minori.
  • Non basarsi esclusivamente sulla moderazione automatica del contenuto; includere meccanismi per la creazione di report degli utenti e la revisione umana del contenuto contrassegnato.

Linee guida per la valutazione e l'integrazione

Prima della distribuzione

  1. Esegui test end-to-end su hardware che non supporta Copilot+ rappresentativo dei tuoi utenti target, tra cui:

    • Test funzionali degli output del modello nei casi d'uso dell'applicazione.
    • Test delle prestazioni in scenari di contesa di risorse realistici.
    • Attività di red teaming per identificare potenziali schemi di uso improprio, in particolare quelli che potrebbero sfruttare un'inferenza più lenta (ad esempio, rischi di side-channel basati sui tempi).
  2. Valutare l'equità e la distorsione tra i popolamenti degli utenti utilizzati dall'applicazione. Eseguire il test con richieste in tutte le lingue supportate e rappresentare diversi dati demografici.

  3. Valutare l'esperienza utente nei dispositivi di fascia inferiore. Assicurarsi che le prestazioni ridotte non portino a frustrazione degli utenti, abbandono o eccessivo affidamento su risultati incompleti.

Dopo la distribuzione

  1. Monitorare i dati di telemetria (in conformità alle leggi e ai criteri sulla privacy applicabili) per:

    • Distribuzioni della latenza di inferenza tra i tipi di dispositivo.
    • Frequenza dei trigger di moderazione del contenuto.
    • Segnali di feedback degli utenti che indicano problemi di qualità o prestazioni.
  2. Gestire un piano di risposta agli eventi imprevisti che include la possibilità di disabilitare o aggiornare il modello se viene rilevato un problema di sicurezza.

  3. Scorrere le impostazioni di moderazione del contenuto in base a modelli di utilizzo reali, feedback degli utenti e minacce emergenti per la sicurezza dei contenuti.

  4. Fornire meccanismi di feedback degli utenti direttamente nell'esperienza dell'applicazione, consentendo agli utenti di segnalare output non accurati, dannosi o imprevisti.


Considerazioni sull'IA responsabile per l'estensione non Copilot+

Copertura più ampia, responsabilità più ampia

L'espansione di Phi Silica a non Copilot+ PCs rende le funzionalità di intelligenza artificiale locali accessibili a una popolazione di utenti molto più ampia e diversificata. Questo aumento della portata amplifica sia i vantaggi che i rischi:

  • Accesso democratizzato: altri utenti possono trarre vantaggio dall'intelligenza artificiale sul dispositivo senza acquistare hardware specializzato. Ciò supporta l'inclusività e l'equità.
  • Maggiore superficie di uso improprio: una maggiore base di utenti aumenta la probabilità statistica di uso antagonista o dannoso. Il monitoraggio affidabile della moderazione dei contenuti e degli abusi è essenziale.
  • Diversi contesti d’uso dei dispositivi: gli utenti che utilizzano PC non Copilot+ possono operare in contesti con connettività limitata, hardware meno recente o dispositivi condivisi — tutti fattori che influiscono sul modo in cui l’IA viene vissuta e potenzialmente utilizzata in modo improprio.

Riservatezza

Phi Silica elabora tutte le richieste e genera tutte le risposte in locale nel dispositivo dell'utente. Nessun prompt utente o output del modello viene trasmesso a Microsoft o a terze parti in fase di inferenza. Questa architettura di riservatezza viene preservata nei PC non Copilot+.

Gli sviluppatori che integrano Phi Silica devono:

  • Comunicare chiaramente agli utenti che l'elaborazione dell'intelligenza artificiale avviene nel dispositivo.
  • Evitare di raccogliere o registrare richieste e risposte, a meno che l'utente non abbia fornito il consenso informato.
  • Rispettare le leggi e le normative applicabili in materia di privacy, nonché i criteri sulla privacy di Microsoft, relativi agli eventuali dati di telemetria o dati diagnostici raccolti.

Trasparenza

  • Divulgare agli utenti quando il contenuto viene generato dall'intelligenza artificiale. Non presentare il testo generato dall'intelligenza artificiale come creato dall'utente.
  • Comunicare che l'intelligenza artificiale può generare errori e incoraggiare gli utenti a verificare informazioni importanti.
  • In caso di non Copilot+ PCs, informare gli utenti che le prestazioni possono differire da quelle nell'hardware Copilot+.

Equità

  • Valutare gli output del modello per potenziali distorsioni tra lingue, culture e gruppi demografici.
  • Monitorare prestazioni o qualità diverse in diverse configurazioni hardware per garantire un'esperienza utente equa.

Affidabilità e sicurezza

  • Implementa la moderazione dei contenuti con livelli di gravità appropriati per la tua base utenti.
  • Progettare l'applicazione per gestire correttamente gli errori del modello (ad esempio, la mancata disponibilità del modello, le condizioni di memoria insufficiente nei dispositivi vincolati).
  • Fornire un kill switch o un feature flag per disabilitare rapidamente la funzionalità di Phi Silica qualora venga identificato un problema di sicurezza.

Responsabilità

  • Gestire la documentazione delle decisioni di integrazione dell'intelligenza artificiale, delle configurazioni di moderazione del contenuto e dei risultati della valutazione.
  • Designare un individuo responsabile o un team responsabile responsabile per il monitoraggio e la risposta agli eventi imprevisti correlati all'IA.

Strumenti e risorse


Questa nota sulla trasparenza integra la documentazione di Phi Silica esistente e le linee guida Responsible Generative AI Development on Windows. Verrà aggiornato man mano che la tecnologia, i modelli di utilizzo e le mitigazioni si evolveranno.