Taal

Aan de slag met Phi Silicium

Belangrijk

De Phi Silicium-API's maken deel uit van een functie voor beperkte toegang (zie de klasse LimitedAccessFeatures). Gebruik het LAF-toegangstokenaanvraagformulier voor meer informatie of om een ontgrendelingstoken aan te vragen.

Belangrijk

PhiSilium wordt vervangen door Aion Instruct, een nieuw model op het apparaat. Begin nu met het plannen van uw overgang:

Begin oktober 2026 — Zelfstandig sideloadable pakket beschikbaar voor testen en LoRA-training. Download het pakket, valideer Aion Instruct voor uw app en train uw LoRA's opnieuw met Foundry Toolkit.

Oktober 2026 - Aion Instruct wordt geïmplementeerd op Windows Insider Preview-apparaten. PhiSilium blijft aanwezig; het actieve model wordt beheerd door een Windows Controlled Feature Rollout (CFR). Ontwikkelaars kunnen naast elkaar testen via een Windows registersleutel.

November 2026 — Aion Instruct wordt uitgerold naar detailhandelsapparaten en Phi Silicium wordt verwijderd.

Phi Silica is een krachtig, hardwareversneld lokaal taalmodel dat veel mogelijkheden biedt die je ook aantreft in grote taalmodellen (LLM's). Op apparaten met NPU's maakt het model gebruik van een techniek die speculatieve decodering wordt genoemd om het genereren van tekst te versnellen met behulp van een kleiner conceptmodel dat meerdere tokenreeksen kan voorstellen en parallel door het hoofdmodel kan worden gevalideerd.

Opmerking

Phi Silicium kenmerken zijn niet beschikbaar in China.

Phi Silicium is geoptimaliseerd voor efficiëntie en prestaties op Windows Copilot+ PCs (waar het wordt uitgevoerd op de NPU) en op niet-Copilot+ Windows 11 apparaten met een ondersteunde GPU, en kan worden geïntegreerd in uw Windows-apps via de Windows AI-API's in de Windows App SDK.

Dit optimalisatieniveau is niet beschikbaar in andere versies van Phi.

Ondersteunde hardware

Phi Silicium wordt uitgevoerd op de volgende hardware:

Hardware Status Details
NPU (Copilot+ PC) ✅ Beschikbaar Beste prestaties. Zie Copilot+ PCs ontwikkelaarshandleiding.
GPU — NVIDIA ✅ Beschikbaar GeForce RTX 30-serie en nieuwer met 6+ GB vRAM.
GPU — AMD ✅ Beschikbaar De Rx 9060 serie en nieuwer met 6+ GB vRAM.

Zie Vereisten voor GPU-stuurprogramma's voor vereisten voor GPU-stuurprogramma's.

Belangrijk

Voor het uitvoeren van Phi Silicium op GPU moet de ontwikkelaarsmodus zijn ingeschakeld. Ga naar Het instellingensysteem>>voor ontwikkelaarsmodus>.

GPU-vereisten:

  • Windows build: Windows Insider-programma Experimenteel kanaal, build 26300.8553 of hoger
  • Windows App SDK: versie 2.2.2-experimenteel9 (juni 2026 Experimenteel) of hoger

Vereisten voor GPU-stuurprogramma's

Voor het uitvoeren van Phi Silicium op GPU is het meest recente stuurprogramma vereist dat rechtstreeks van de GPU-fabrikant is geïnstalleerd. Standaardstuurprogramma's van Windows Update- of OEM-installaties zijn mogelijk niet voldoende en kunnen fouten of verminderde prestaties veroorzaken.

Download het nieuwste stuurprogramma voor uw hardware:

Opmerking

Door OEM geleverde stuurprogramma's (geleverd via Windows Update of het updatehulpprogramma van de pc-fabrikant) kunnen IHV-stuurprogramma's overschrijven die u eerder hebt geïnstalleerd. Als Phi Silicium niet meer werkt op GPU na een systeemupdate, installeert u het meest recente stuurprogramma opnieuw via de bovenstaande koppelingen.

Verschillen tussen GPU-functies

De volgende functies gedragen zich anders op GPU in vergelijking met NPU:

  • Promptcompressie: beschikbaar op NPU, maar niet beschikbaar op GPU. Toepassingen die voor langere contextvensters afhankelijk zijn van promptcompressie, moeten hier rekening mee houden wanneer ze op GPU-devices zijn gericht.
  • Speculatieve decodering: beschikbaar op NPU voor versnelde tekstgeneratie. Momenteel niet beschikbaar op de GPU, wat kan leiden tot een lagere token-doorvoer per seconde.
  • LoRA-afstemming: LoRA-adapters moeten worden getraind in de cloud met behulp van de Fine-Tuning Kit (FTK). Inferentie met je getrainde adapter kan lokaal worden getest met de AI Dev Gallery. Deze werkstroom is hetzelfde voor zowel NPU als GPU.

Beschikbaarheid van modellen en downloaden

In tegenstelling tot het NPU-model, dat vooraf is geïnstalleerd op Copilot+ PCs, wordt het Phi Silicium-model voor GPU niet vooraf geïnstalleerd op het apparaat van de gebruiker. In plaats daarvan wordt het model op aanvraag gedownload wanneer uw app EnsureReadyAsync voor het eerst aanroept. De download is enkele gigabytes en wordt op de achtergrond uitgevoerd via Windows Update.

Omdat het Phi Silicium GPU-model groot is, toont u een bevestigingsdialoogvenster voordat u belt EnsureReadyAsync , zodat de gebruiker toestemming kan geven voor zowel de opslagkosten als het downloaden op de achtergrond. Een typisch patroon:

  1. Roep GetReadyState aan en ga vervolgens verder op basis van de geretourneerde AIFeatureReadyState:

    • Ready — het model is geïnstalleerd; ga verder.
    • NotReady — geef uw toestemmingsdialoogvenster weer (zie hieronder) en roep EnsureReadyAsync alleen aan als de gebruiker akkoord gaat.
    • NotSupportedOnCurrentSystem — de hardware van de gebruiker voldoet niet aan de vereisten in ondersteunde hardware. Bied een terugvalervaring aan en geef, indien nodig, de hardwarevereisten aan zodat de gebruiker een weloverwogen upgradebeslissing kan nemen.
  2. Leg het volgende uit in uw toestemmingsdialoogvenster:

    • Er wordt een optioneel taalmodel gedownload (verschillende GB aan opslagruimte).
    • De download vindt plaats op de achtergrond via Windows Update.
    • De gebruiker kan de voortgang van het downloaden controleren op Settings>Windows Update.
    • De gebruiker kan het model later verwijderen bijSystem>AI Components> als ze het niet meer willen.

    Tip

    In gebruikersgerichte tekenreeksen (dialoogvenstertekst, statusberichten) verwijst u naar het model als het 'taalmodel' of 'optioneel AI-model' in plaats van 'Phi Silicium'. De meeste eindgebruikers zijn niet bekend met de merknaam en algemene termen communiceren duidelijker doel.

  3. Terwijl EnsureReadyAsync wordt uitgevoerd, toont u in uw app een voortgangsindicator. De geretourneerde bewerking maakt een statusoptie beschikbaar die een laadgebruikersinterface aanstuurt; zie Get gestart met Windows AI-API's voor meer informatie.

Nadat het model is geïnstalleerd

Het model blijft op het apparaat staan totdat de gebruiker het verwijdert. Gebruikers beheren geïnstalleerde modellen bij Settings>System>AI Components, waarbij het Phi Silicium GPU-model wordt weergegeven als 'AI LanguageModel'. Als de gebruiker het model later verwijdert, retourneert de volgende aanroep van uw app naar GetReadyStateNotReady en moet het toestemmings- en downloadproces worden herhaald.

Zie voor API-details:

PhiSilium integreren

Met een lokaal Phi Silicium-taalmodel kunt u tekstreacties genereren op gebruikersprompts. Zorg er eerst voor dat u beschikt over de vereisten en modellen die beschikbaar zijn op uw apparaat, zoals wordt beschreven in Aan de slag met Windows AI-API's.

Geef de vereiste naamruimten op

Als u PhiSilium wilt gebruiken, moet u ervoor zorgen dat u de vereiste naamruimten gebruikt:

using Microsoft.Windows.AI;
using Microsoft.Windows.AI.ContentSafety;
using Microsoft.Windows.AI.Text;
#include "winrt/Microsoft.Windows.AI.Text.h"
using namespace Microsoft::Windows::AI;
using namespace Microsoft::Windows::AI::Text;

Een antwoord genereren

In dit voorbeeld ziet u hoe u een antwoord genereert op een Q&A-prompt. Het tabblad C# laat ook zien hoe aangepaste opties voor inhoudsbeheer worden toegepast (zie Inhoudsbeheer met de Windows AI-API's).

  1. Zorg ervoor dat het taalmodel beschikbaar is door de GetReadyState-methode aan te roepen en te wachten tot de EnsureReadyAsync-methode succesvol is geretourneerd.

  2. Zodra het taalmodel beschikbaar is, maakt u een LanguageModel-object om ernaar te verwijzen.

  3. Verzend een tekenreeksprompt naar het model met behulp van de methode GenerateResponseAsync , die het volledige resultaat retourneert.

if (LanguageModel.GetReadyState() == AIFeatureReadyState.NotReady) 
{ 
   var op = await LanguageModel.EnsureReadyAsync(); 
} 

using LanguageModel languageModel = await LanguageModel.CreateAsync();

string prompt = "Provide the molecular formula for glucose.";

LanguageModelOptions options = new LanguageModelOptions();
ContentFilterOptions filterOptions = new ContentFilterOptions();
filterOptions.PromptMaxAllowedSeverityLevel.Violent = SeverityLevel.Minimum;
options.ContentFilterOptions = filterOptions;

var result = await languageModel.GenerateResponseAsync(prompt, options);
 
Console.WriteLine(result.Text);
if (LanguageModel::GetReadyState() == AIFeatureReadyState::NotReady)
{
    auto op = LanguageModel::EnsureReadyAsync().get();
}

auto languageModel = LanguageModel::CreateAsync().get();

const winrt::hstring prompt = L"Provide the molecular formula for glucose.";

LanguageModelResponseResult result = languageModel.GenerateResponseAsync(prompt).get();
std::cout << result.Text().c_str() << std::endl;

Het antwoord dat in dit voorbeeld wordt gegenereerd, is:

C6H12O6

Vaardigheden voor tekstintelligentie

Phi Silicium bevat ingebouwde mogelijkheden voor teksttransformatie (ook wel Text Intelligence Skills genoemd) die gestructureerde, beknopte en gebruiksvriendelijke antwoorden kunnen leveren via vooraf gedefinieerde opmaak met behulp van een lokaal taalmodel.

Ondersteunde vaardigheden zijn onder andere:

  • Tekst-naar-tabel: hiermee wordt het promptantwoord opgemaakt in een gestructureerde tabelindeling, indien van toepassing.
  • Samenvatten: retourneert een beknopt overzicht van de prompttekst.
  • Herschrijven: Herformuleert de prompttekst om de duidelijkheid, leesbaarheid en, indien opgegeven, toon (of stijl) te optimaliseren.

In de volgende stappen wordt beschreven hoe u Text Intelligence Skills gebruikt.

  1. Een LanguageModel-object maken
    Dit object verwijst naar het lokale Phi Silicium-taalmodel (vergeet niet om te bevestigen dat het Phi Silicium-model beschikbaar is op het apparaat).

  2. Het vaardigheidsspecifieke object instantiëren
    Kies de juiste klasse op basis van de vaardigheid die u wilt toepassen en geef het LanguageModel-exemplaar door als parameter.

  3. De methode aanroepen om de vaardigheid uit te voeren
    Elke vaardigheid maakt een asynchrone methode beschikbaar die de invoer verwerkt en een opgemaakt resultaat retourneert.

  4. Het antwoord verwerken
    Het resultaat wordt geretourneerd als een getypt object, dat u indien nodig kunt afdrukken of vastleggen.

In dit voorbeeld ziet u de vaardigheid voor het samenvatten van tekst.

  1. Maak een LanguageModel-exemplaar (languageModel).
  2. Geef dat LanguageModel door aan de TextSummarizer-constructor .
  3. Geef tekst door aan de methode SummarizeAsync en druk het resultaat af.
using Microsoft.Windows.AI.Text;

using LanguageModel languageModel = await LanguageModel.CreateAsync();

var textSummarizer = new TextSummarizer(languageModel);
string text = @"This is a large amount of text I want to have summarized.";
var result = await textSummarizer.SummarizeAsync(text);

Console.WriteLine(result.Text); 
using namespace Microsoft::Windows::AI::Text;

auto languageModel = LanguageModel::CreateAsync().get();
auto textSummarizer = TextSummarizer(languageModel);
std::string prompt = "This is a large amount of text I want to have summarized.";
auto result = textSummarizer.SummarizeAsync(prompt);

std::wcout << result.get().Text() << std::endl;

Verantwoorde AI

We hebben de belangrijkste principes en procedures gevolgd die worden beschreven in de Microsoft Responsible AI Standards om ervoor te zorgen dat deze API's betrouwbaar, veilig en op verantwoorde wijze zijn gebouwd. Zie Responsible Ative AI Development in Windows voor meer informatie over het implementeren van AI-functies in uw app.

Opmerkingen over GPU-transparantie

Zie de Transparency Note: Phi Silica op niet-Copilot+-pc's voor gedetailleerde informatie over de mogelijkheden, beperkingen en het verantwoorde gebruik van Phi Silica op niet-Copilot+-pc's (GPU).

Belangrijkste verschillen tussen NPU- en GPU-uitvoering:

Kenmerk Copilot+ PC's (NPU) Niet-Copilot+ PCs (GPU)
Inferentielatentie Geoptimaliseerd; lage latentie via NPU-versnelling en speculatieve decodering Hogere latentie; is afhankelijk van gpu-generatie, VRAM en huidige GPU-belasting
Stroomverbruik NPU is energie-efficiënt, geschikt voor gebruik op batterijen Hoger energieverbruik; kan de levensduur van de batterij op laptops beïnvloeden
Compressie van prompts ✅ Beschikbaar ❌ Niet beschikbaar op GPU
Speculatieve decodering ✅ Beschikbaar ❌ Niet beschikbaar op GPU
Modelkeuze Het model wordt beheerd door het systeem Het model wordt op verzoek gedownload en kan worden verwijderd via Instellingen>Systeem>AI-componenten
Operationele factoren voor niet-Copilot+ PCs
  • Hardwarediversiteit: Niet-Copilot+ PCs omvatten een breed scala aan GPU-configuraties. De prestaties variëren aanzienlijk in dit apparaatspectrum.
  • Minimale hardwarevereisten: apparaten moeten voldoen aan minimale GPU- en geheugenvereisten om Phi Silicium uit te voeren.
  • Software-afhankelijkheden: Voor uitvoering zonder Copilot+ PC is het meest recente IHV GPU-stuurprogramma vereist dat rechtstreeks vanaf de GPU-fabrikant (NVIDIA) is geïnstalleerd. Standaardstuurprogramma's van Windows Update- of OEM-installaties zijn mogelijk niet voldoende en kunnen fouten of verminderde prestaties veroorzaken.

Systeemprestaties

Inzicht in prestaties op niet-Copilot+ PCs

De uitvoerkwaliteit van PhiSilium (nauwkeurigheid, samenhang, relevantie) is consistent in Copilot+ en niet-Copilot+ PCs omdat dezelfde modelgewichten en architectuur worden gebruikt. De belangrijkste verschillen zijn deductiesnelheid, het resourceverbruik en de reactiesnelheid van de gebruikerservaring.

Ontwikkelaars moeten:

  • Voer benchmarks uit op representatieve hardware: Test op verschillende niet-Copilot+-apparaten die representatief zijn voor uw doelgroep, inclusief configuraties uit het lagere segment.
  • Stel de verwachtingen van gebruikers in: communiceer duidelijk dat reactietijden kunnen variëren op basis van apparaathardware. Overweeg voortgangsindicatoren weer te geven of gedeeltelijke resultaten te streamen.
  • Time-outs en terugvalbewerkingen implementeren: voor scenario's waarin reactietijd kritiek is, implementeert u de juiste time-outs en kunt u overwegen om cloudgebaseerde terugvalopties (met toestemming van de gebruiker) aan te bieden.
  • Resourcegebruik bewaken: Houd het GPU-gebruik, het VRAM-verbruik en het geheugengebruik van het systeem bij tijdens deductie om knelpunten in de prestaties te identificeren en op te pakken.

Zie ook