Idioma
Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Importante
As APIs Phi Silica fazem parte de um recurso de acesso limitado (consulte a classe LimitedAccessFeatures). Para obter mais informações ou solicitar um token de desbloqueio, use o Formulário de Solicitação de Token de Acesso LAF.
Importante
O Phi Silica está sendo substituído pelo Aion Instruct, um novo modelo no dispositivo. Comece a planejar sua transição agora:
- Experimente o Aion Instruct: https://aka.ms/tryaion
- Ler Expansão da IA no dispositivo em Microsoft Edge: novos modelos e APIs para a Web (blog do Microsoft Edge)
- Ao contrário do Phi Silica, os tokens LAF não são mais necessários com o Aion Instruct.
Início de outubro de 2026 – pacote sideload autônomo disponível para teste e treinamento de LoRA. Baixe o pacote, valide a Instrução de Aion para seu aplicativo e treine novamente seus LoRAs usando o Foundry Toolkit.
Outubro de 2026 – O Aion Instruct começa a ser distribuído para dispositivos Windows Insider Preview. Phi Silica continua presente; o modelo ativo é controlado por uma Distribuição Controlada de Recursos do Windows (CFR). Os desenvolvedores podem testar lado a lado por meio de uma chave do Registro Windows.
Novembro de 2026 — Aion Instruct chega aos dispositivos de varejo e Phi Silica é removido.
O Phi Silica é um poderoso modelo de linguagem local acelerada por hardware que fornece muitos recursos encontrados em LLMs (Modelos de Linguagem Grande). Em dispositivos equipados com NPU, o modelo emprega uma técnica chamada decodificação especulativa para acelerar a geração de texto usando um modelo de rascunho menor que pode propor várias sequências de token e ser validado em paralelo pelo modelo principal.
Observação
Os recursos do Phi Silica não estão disponíveis na China.
O Phi Silica é otimizado para eficiência e desempenho em PCs Windows Copilot+ (nos quais é executado na NPU) e em dispositivos com Windows 11 sem Copilot+ com uma GPU compatível, e pode ser integrado aos seus aplicativos do Windows por meio das APIs de IA do Windows no SDK do Aplicativo Windows.
Esse nível de otimização não está disponível em outras versões do Phi.
Hardware com suporte
O Phi Silica é executado no seguinte hardware:
| Hardware | Status | Detalhes |
|---|---|---|
| NPU (Copilot+ PC) | ✅ Disponível | Melhor desempenho. Consulte Copilot+ PCs guia do desenvolvedor. |
| GPU – NVIDIA | ✅ Disponível | GeForce RTX série 30 e mais recente com 6 GB de vRAM. |
| GPU — AMD | ✅ Disponível | Série Radeon RX 9060 e posteriores com 6 GB ou mais de vRAM. |
Para obter os requisitos de driver de GPU, consulte os requisitos de driver de GPU.
Importante
Executar o Phi Silica na GPU requer que o Modo de Desenvolvedor seja habilitado. Vá para Configurações>Sistema>Para desenvolvedores>Modo de Desenvolvedor.
Pré-requisitos de GPU:
- Compilação do Windows: Programa Windows Insider, Canal Experimental, compilação 26300.8553 ou superior
- SDK do Aplicativo Windows: versão 2.2.2-experimental9 (Experimental de junho de 2026) ou posterior
Requisitos do driver da GPU
Executar o Phi Silica na GPU requer o driver mais recente instalado diretamente do fabricante da GPU. Os drivers padrão de instalações de Windows Update ou OEM podem não ser suficientes e podem causar falhas ou desempenho degradado.
Baixe o driver mais recente para seu hardware:
- NVIDIA GeForce / RTX: driver NVIDIA GeForce 615.21 (beta)
- AMD Radeon: AmD Software: Driver Adrenalin Edition 26.10.2
Observação
Os drivers fornecidos pelo OEM (entregues por meio de Windows Update ou da ferramenta de atualização do fabricante do computador) podem substituir os drivers IHV instalados anteriormente. Se o Phi Silica parar de funcionar na GPU após uma atualização do sistema, reinstale o driver mais recente dos links acima.
Diferenças de recursos de GPU
Os seguintes recursos se comportam de forma diferente na GPU em comparação com a NPU:
- Compactação de prompt: disponível na NPU, mas não disponível na GPU. Os aplicativos que dependem da compactação de prompt para janelas de contexto mais longas devem levar isso em consideração ao ter como alvo dispositivos com GPU.
- Decodificação especulativa: disponível na NPU para geração acelerada de texto. Atualmente não disponível na GPU, o que pode resultar em uma taxa de transferência de tokens por segundo menor.
- Ajuste fino de LoRA: os adaptadores lora devem ser treinados na nuvem usando o FTK (Kit de Fine-Tuning). A inferência com seu adaptador treinado pode ser testada localmente com a AI Dev Gallery. Esse fluxo de trabalho é o mesmo para NPU e GPU.
Disponibilidade e download do modelo
Ao contrário do modelo de NPU — que é pré-instalado em Copilot+ PCs — o modelo Phi Silica para GPU é não pré-instalado no dispositivo do usuário. Em vez disso, o modelo é baixado sob demanda na primeira vez que seu aplicativo chama EnsureReadyAsync. O download é de vários gigabytes e é executado em segundo plano por meio de Windows Update.
Padrão de UX recomendado
Como o modelo de GPU Phi Silica é grande, mostre uma caixa de diálogo de confirmação antes de chamar EnsureReadyAsync para que o usuário possa consentir com o custo de armazenamento e o download em segundo plano. Um padrão típico:
Chame GetReadyState e faça a ramificação com base no AIFeatureReadyState retornado:
-
Ready— o modelo está instalado; Prosseguir. -
NotReady— mostre sua caixa de diálogo de consentimento (veja abaixo) e ligueEnsureReadyAsyncsomente se o usuário concordar. -
NotSupportedOnCurrentSystem— o hardware do usuário não atende aos requisitos no hardware com suporte. Ofereça uma experiência alternativa e, quando apropriado, exiba os requisitos de hardware para que o usuário possa tomar uma decisão informada sobre a atualização.
-
Na caixa de diálogo de consentimento, explique:
- Um modelo de idioma opcional será baixado (vários GB de armazenamento).
- O download ocorre em segundo plano por meio de Windows Update.
- O usuário pode monitorar o progresso do download em Settings>Windows Update.
- Posteriormente, o usuário poderá remover o modelo nosComponentes de IA do> de > se ele não quiser mais.
Dica
Em cadeias de caracteres voltadas para o usuário (texto da caixa de diálogo, mensagens de status), consulte o modelo como o "modelo de linguagem" ou "modelo de IA opcional" em vez de "Phi Silica". A maioria dos usuários finais não está familiarizada com o nome da marca e os termos genéricos comunicam a finalidade com mais clareza.
Enquanto
EnsureReadyAsyncestiver em andamento, mostre um indicador de progresso em seu aplicativo. A operação retornada disponibiliza uma opção de status que controla uma interface de carregamento; consulte Introdução às APIs de IA do Windows para obter detalhes.
Depois que o modelo é instalado
O modelo permanece no dispositivo até que o usuário o remova. Usuários gerenciam modelos instalados em Configurações>Sistema>Componentes de IA, onde o modelo de GPU Phi Silica aparece como "AI LanguageModel". Se o usuário remover o modelo posteriormente, a próxima chamada do seu aplicativo para GetReadyState retornará NotReady e o fluxo de consentimento e download deverá ser repetido.
Para obter detalhes da API, consulte:
Integrar Phi Silica
Com um modelo de linguagem Phi Silica local, você pode gerar respostas de texto para prompts do usuário. Primeiro, verifique se você tem os pré-requisitos e modelos disponíveis em seu dispositivo, conforme descrito em Introdução às APIs de IA do Windows.
Especificar os namespaces necessários
Para usar o Phi Silica, verifique se você está usando os namespaces necessários:
using Microsoft.Windows.AI;
using Microsoft.Windows.AI.ContentSafety;
using Microsoft.Windows.AI.Text;
#include "winrt/Microsoft.Windows.AI.Text.h"
using namespace Microsoft::Windows::AI;
using namespace Microsoft::Windows::AI::Text;
Gerar uma resposta
Este exemplo mostra como gerar uma resposta a um prompt de Q&A. A guia C# também demonstra a aplicação de opções personalizadas de moderação de conteúdo (consulte Moderação de Conteúdo com as APIs de IA do Windows).
Verifique se o modelo de idioma está disponível chamando o método GetReadyState e aguardando o método EnsureReadyAsync retornar com êxito.
Depois que o modelo de idioma estiver disponível, crie um objeto LanguageModel para referenciá-lo.
Envie um prompt de cadeia de caracteres para o modelo usando o método GenerateResponseAsync , que retorna o resultado completo.
if (LanguageModel.GetReadyState() == AIFeatureReadyState.NotReady)
{
var op = await LanguageModel.EnsureReadyAsync();
}
using LanguageModel languageModel = await LanguageModel.CreateAsync();
string prompt = "Provide the molecular formula for glucose.";
LanguageModelOptions options = new LanguageModelOptions();
ContentFilterOptions filterOptions = new ContentFilterOptions();
filterOptions.PromptMaxAllowedSeverityLevel.Violent = SeverityLevel.Minimum;
options.ContentFilterOptions = filterOptions;
var result = await languageModel.GenerateResponseAsync(prompt, options);
Console.WriteLine(result.Text);
if (LanguageModel::GetReadyState() == AIFeatureReadyState::NotReady)
{
auto op = LanguageModel::EnsureReadyAsync().get();
}
auto languageModel = LanguageModel::CreateAsync().get();
const winrt::hstring prompt = L"Provide the molecular formula for glucose.";
LanguageModelResponseResult result = languageModel.GenerateResponseAsync(prompt).get();
std::cout << result.Text().c_str() << std::endl;
A resposta gerada por este exemplo é:
C6H12O6
Habilidades de inteligência de texto
O Phi Silica inclui recursos de transformação de texto internos (conhecidos como Habilidades de Inteligência de Texto) que podem fornecer respostas estruturadas, concisas e amigáveis por meio da formatação predefinida usando um modelo de linguagem local.
As habilidades com suporte incluem:
- Texto em tabela: formata a resposta do prompt em um formato de tabela estruturado, quando apropriado.
- Resumir: retorna um resumo conciso do texto do prompt.
- Reformulação: Reformula o texto do prompt para otimizar a clareza, a legibilidade e, quando especificado, o tom (ou o estilo).
As etapas a seguir descrevem como usar as Habilidades de Inteligência de Texto.
Criar um objeto LanguageModel
Esse objeto faz referência ao modelo de linguagem Phi Silica local (lembre-se de confirmar que o modelo Phi Silica está disponível no dispositivo).Criar uma instância do objeto de habilidade específica
Escolha a classe apropriada com base na habilidade que você deseja aplicar e passe a instância LanguageModel como um parâmetro.Chamar o método para executar a habilidade
Cada habilidade expõe um método assíncrono que processa a entrada e retorna um resultado formatado.Manipular a resposta
O resultado é retornado como um objeto digitado, que você pode imprimir ou registrar como necessário.
Este exemplo demonstra a habilidade de resumo de texto.
- Criar uma instância de LanguageModel (
languageModel). - Passe esse LanguageModel para o construtor TextSummarizer .
- Passe algum texto para o método SummarizeAsync e imprima o resultado.
using Microsoft.Windows.AI.Text;
using LanguageModel languageModel = await LanguageModel.CreateAsync();
var textSummarizer = new TextSummarizer(languageModel);
string text = @"This is a large amount of text I want to have summarized.";
var result = await textSummarizer.SummarizeAsync(text);
Console.WriteLine(result.Text);
using namespace Microsoft::Windows::AI::Text;
auto languageModel = LanguageModel::CreateAsync().get();
auto textSummarizer = TextSummarizer(languageModel);
std::string prompt = "This is a large amount of text I want to have summarized.";
auto result = textSummarizer.SummarizeAsync(prompt);
std::wcout << result.get().Text() << std::endl;
IA responsável
Seguimos princípios e práticas fundamentais descritos nos Padrões de IA Responsável da Microsoft para garantir que essas APIs sejam confiáveis, seguras e criadas com responsabilidade. Para obter mais detalhes sobre como implementar recursos de IA em seu aplicativo, consulte Desenvolvimento responsável de IA do Generative no Windows.
Notas de transparência da GPU
Para obter informações detalhadas sobre os recursos, as limitações e o uso responsável do Phi Silica em PCs não Copilot+ (GPU), consulte a Nota de Transparência: Phi Silica em PCs não Copilot+.
Principais diferenças entre a execução de NPU e GPU:
| Fator | Copilot+ PCs (NPU) | PCs sem Copilot+ (GPU) |
|---|---|---|
| Latência de Inferência | Otimizado; baixa latência com aceleração de NPU e decodificação especulativa | Latência mais alta; depende da geração de GPU, da VRAM e da carga de GPU atual |
| Consumo de energia | A NPU é eficiente em termos de energia, adequada para uso alimentado por bateria | Maior consumo de energia; pode afetar a vida útil da bateria em laptops |
| Compressão de prompt | ✅ Disponível | ❌ Não disponível na GPU |
| Decodificação especulativa | ✅ Disponível | ❌ Não disponível na GPU |
| Opcionalidade do modelo | O modelo é gerenciado pelo sistema | O modelo é baixado sob demanda e pode ser removido em Configurações>Sistema>Componentes de IA |
Fatores operacionais para PCs sem Copilot+
- Diversidade de hardware: PCs sem Copilot+ abrangem uma ampla gama de configurações de GPU. O desempenho variará significativamente em todo esse espectro de dispositivos.
- Requisitos mínimos de hardware: os dispositivos devem atender aos requisitos mínimos de GPU e memória para executar o Phi Silica.
- Dependências de software: A execução em PCs sem Copilot+ requer o driver IHV da GPU mais recente, instalado diretamente do fabricante da GPU (NVIDIA). Os drivers padrão de instalações de Windows Update ou OEM podem não ser suficientes e podem causar falhas ou desempenho degradado.
Desempenho do sistema
Entendendo o desempenho em PCs que não são Copilot+
A qualidade da saída do Phi Silica (precisão, coerência e relevância) é consistente em PCs Copilot+ e não Copilot+, pois usam os mesmos pesos e a mesma arquitetura de modelo. As principais diferenças são a velocidade de inferência, o consumo de recursos e a capacidade de resposta da experiência do usuário.
Os desenvolvedores devem:
- Avaliação de desempenho em hardware representativo: teste em uma variedade de dispositivos sem Copilot+ que reflitam sua base de usuários-alvo, incluindo configurações mais básicas.
- Definir expectativas do usuário: comunique claramente que os tempos de resposta podem variar com base no hardware do dispositivo. Considere mostrar indicadores de progresso ou transmitir resultados parciais.
- Implementar tempos limite e fallbacks: para cenários em que o tempo de resposta é crítico, implemente tempos limite apropriados e considere oferecer opções de fallback baseadas em nuvem (com consentimento do usuário).
- Monitorar o uso de recursos: acompanhe a utilização de GPU, o consumo de VRAM e o uso de memória do sistema durante a inferência para identificar e solucionar gargalos de desempenho.