Nota de Transparência: Phi Silica em PCs sem Copilot+

O que é uma Nota de Transparência?

Um sistema de IA inclui não apenas a tecnologia, mas também as pessoas que a usarão, as pessoas que serão afetadas por ela e o ambiente em que ela é implantada. Criar um sistema adequado ao seu propósito requer compreender como a tecnologia funciona, as suas capacidades e limitações, e como alcançar o melhor desempenho.

A Microsoft fornece notas de transparência para ajudá-lo a entender como nossa tecnologia de IA funciona. Isto inclui as escolhas que os proprietários do sistema podem fazer que influenciam o desempenho e o comportamento do sistema, e a importância de pensar no sistema como um todo, incluindo a tecnologia, as pessoas e o ambiente. Pode usar notas de transparência ao desenvolver ou implementar o seu próprio sistema, ou partilhá-las com as pessoas que irão usar ou ser afetadas pelo seu sistema.

As notas de transparência fazem parte de um esforço mais amplo de Microsoft para pôr em prática os nossos princípios IA.


Introdução à Phi Silica

Phi Silica é um pequeno modelo de linguagem (SLM) ajustado para inferência no dispositivo no Windows. Permite capacidades locais de IA generativa — incluindo geração de texto, resumo, reescrita e transformação de texto para tabela — sem necessidade de ligação à cloud. Ao funcionar inteiramente no dispositivo, a Phi Silica apoia a privacidade do utilizador, mantendo os prompts e respostas locais.

A Phi Silica foi originalmente concebida e otimizada exclusivamente para Windows Copilot+ PCs, que incluem uma Unidade de Processamento Neural (NPU) que fornece 40+ TOPS de computação dedicada de IA. Com esta expansão, a Phi Silica está agora disponível em não-Copilot+ PCs — dispositivos Windows padrão que não têm uma NPU dedicada — onde a inferência é feita usando a GPU do dispositivo.

Indicações-chave

Term Definition
Copilot+ PC Um PC Windows com uma Unidade de Processamento Neural (NPU) dedicada, que cumpre o limiar de 40+ TOPS, concebido especificamente para cargas de trabalho aceleradas de IA no dispositivo.
PC sem Copilot+ Um PC Windows padrão sem uma NPU dedicada (ou com uma NPU abaixo do limiar do Copilot+). A inferência Phi Silica nestes dispositivos é feita através da GPU.
NPU (Unidade de Processamento Neural) Hardware especializado concebido para acelerar cargas de trabalho de aprendizagem automática com alta eficiência e baixo consumo energético.
SLM (Modelo de Linguagem Pequeno) Um modelo de linguagem otimizado para execução local, no dispositivo, com um número de parâmetros menor do que os grandes modelos de linguagem (LLMs) em escala cloud.
Decodificação Especulativa Uma técnica que utiliza um modelo de rascunho mais pequeno para propor múltiplas sequências de tokens, que são depois validadas em paralelo pelo modelo principal para acelerar a geração de texto.
Moderação de Conteúdos Mecanismos de filtragem que detetam e bloqueiam conteúdos nocivos, ofensivos ou inseguros nas entradas e saídas do modelo.

Capabilities

Comportamento do Sistema

A Phi Silica processa prompts em linguagem natural no dispositivo e gera respostas em texto. O modelo suporta:

  • Geração de texto livre: Responder a perguntas, fornecer explicações e gerar conteúdo criativo a partir de sugestões dos utilizadores.
  • Competências de Inteligência Textual: Capacidades integradas de transformação, incluindo resumo, reescrita (com ajuste de tom) e formatação text-to-table.
  • Respostas em streaming: Resultados parciais retornados progressivamente para experiências de utilizador responsivas.
  • Integração da moderação de conteúdos: Filtragem de conteúdo configurável em quatro categorias (violência, ódio, conteúdo sexual, autoagressão) em múltiplos níveis de gravidade.

Nos Copilot+ PCs, a Phi Silica aproveita hardware NPU para uma inferência otimizada com menor latência e menor consumo de energia. Em PCs sem Copilot+, a inferência é executada na GPU. O modelo subjacente e as suas capacidades mantêm-se iguais; no entanto, as características operacionais diferem (ver Limitações).

Casos de uso

Usos Pretendidos

  • Assistência na escrita dentro da aplicação: Resumir documentos, reescrever texto para maior clareza ou tom, e gerar rascunhos em aplicações de produtividade.
  • Perguntas e Respostas locais e recuperação de informação: Responder a perguntas factuais usando os dados de treino do modelo, sem transmitir consultas do utilizador para um serviço na cloud.
  • Funcionalidades de acessibilidade: Simplificar texto complexo, gerar descrições e apoiar utilizadores que beneficiam da leitura e escrita assistidas por IA.
  • Prototipagem para programadores: Permitir que desenvolvedores de aplicações integrem geração local de texto por IA para testes e cenários de prova de conceito.
  • Fluxos de trabalho sensíveis à privacidade: Cenários em que a soberania dos dados, a operação offline ou os requisitos de privacidade do utilizador impedem a utilização de serviços de IA baseados na cloud.

Considerações na Escolha dos Casos de Uso

  • Não use para decisões de alto risco sem supervisão humana. A Phi Silica, como todos os modelos de linguagem, pode produzir informação imprecisa, incompleta ou fabricada (alucinações). As aplicações que fundamentam decisões médicas, jurídicas, financeiras ou críticas para a segurança devem incluir supervisão humana significativa.
  • Não utilize como única fonte de informação factual. Os dados de treino do modelo têm um limite de conhecimento e podem conter vieses ou imprecisões. Incentive os utilizadores a verificar informações importantes de fontes autorizadas.
  • Tenha cuidado com dados pessoais sensíveis. Embora o processamento no dispositivo aumente a privacidade, os programadores devem evitar desenhar fluxos de trabalho que incentivem o modelo com informações pessoais sensíveis (por exemplo, registos de saúde, detalhes financeiros), a menos que existam salvaguardas adequadas.
  • Considere a base de utilizadores expandida. A expansão para PCs sem Copilot+ aumenta significativamente o número de utilizadores, incluindo dispositivos com diferentes capacidades de hardware e utilizadores com diferentes níveis de literacia técnica. Desenhe a sua aplicação para gerir de forma elegante a variação de desempenho e fornecer expectativas claras aos utilizadores.

Limitações

Limitações Técnicas Específicas dos PCs sem Copilot+

Fator Copilot+ PCs (NPU) PCs não Copilot+ (GPU)
Latência de Inferência Otimizado; baixa latência via aceleração NPU e decodificação especulativa Maior latência; a velocidade de inferência depende da geração da GPU, da VRAM disponível e da carga atual da GPU
Consumo de energia A NPU é eficiente em termos energéticos, adequada para uso alimentado por baterias A inferência de GPU consome mais energia; pode afetar significativamente a duração da bateria nos portáteis
Cargas de trabalho concorrentes A NPU opera de forma independente, minimizando o impacto noutras tarefas A inferência por GPU compete com outras aplicações aceleradas por GPU (renderização, reprodução de vídeo, jogos) por recursos de computação; pode causar desacelerações do sistema
Impacto Térmico NPU concebido para cargas de trabalho de IA prolongadas com gestão térmica A inferência prolongada na GPU pode causar limitação térmica em dispositivos não concebidos para cargas de computação sustentadas na GPU
Pressão de Memória Carregamento de modelos e inferência geridos em conjunto com a memória da NPU O modelo deve ser carregado na VRAM da GPU (ou memória partilhada da GPU); dispositivos com VRAM limitada podem sentir pressão ou recorrer a uma memória partilhada mais lenta
Compressão de prompt ✅ Disponível; permite janelas de contexto eficazes mais longas ❌ Não disponível na GPU
Decodificação Especulativa ✅ Disponível; Acelera a geração de texto usando um modelo de rascunho ❌ Não disponível na GPU
Opcionalidade de Modelo O modelo é gerido pelo sistema O modelo é transferido quando necessário e pode ser removido pelo utilizador através de Definições>Sistema>Componentes de IA

Limitações Técnicas Gerais

  • Precisão e alucinações: Phi Silica pode gerar respostas plausíveis, mas factualmente incorretas. A qualidade de saída do modelo não varia entre a execução da NPU e da GPU, mas a resposta reduzida em PCs que não são Copilot+ PCs pode levar os utilizadores a aceitar as saídas iniciais sem revisão crítica.
  • Suporte linguístico: As capacidades linguísticas da Phi Silica são determinadas pelos seus dados de treino. O desempenho pode variar entre línguas, e algumas podem não ser suportadas. As funcionalidades da Phi Silica não estão disponíveis na China.
  • Limitações da janela de contexto: O modelo tem uma janela de contexto fixa. Prompts longos ou conversas com múltiplas voltas podem exceder esta janela, levando à perda do contexto anterior.
  • Viés e justiça: O modelo pode refletir preconceitos presentes nos seus dados de treino, incluindo estereótipos relacionados com género, raça, etnia, religião ou outras características. Os programadores devem avaliar os resultados para garantir a justiça entre as populações que a sua aplicação serve.
  • Entradas adversariais: O modelo pode ser suscetível a tentativas de injeção rápida ou jailbreak. Os filtros de moderação de conteúdo mitigam, mas não eliminam, este risco.

Fatores Operacionais para PCs sem Copilot+

  • Diversidade de hardware: Os não-Copilot+ PCs abrangem uma vasta gama de configurações de GPU (GPUs integradas vs. discretas, capacidades variáveis de VRAM, diferentes arquiteturas de GPU). O desempenho varia significativamente ao longo deste espectro de dispositivos.
  • Requisitos mínimos de hardware: Os dispositivos devem cumprir os requisitos mínimos de GPU e memória para executar Phi Silica. Dispositivos com apenas gráficos integrados ou GPUs discretas mais antigas podem apresentar desempenho degradado ou não atingir os limiares mínimos.
  • Contenção de recursos de fundo: Ao contrário da execução baseada em NPU, a inferência da GPU é afetada por outras cargas de trabalho aceleradas pela GPU. Utilizadores que executam aplicações intensivas em gráficos (jogos, edição de vídeo, renderização 3D) simultaneamente podem experienciar um desempenho fraco dos modelos.
  • Dependências de software: A execução de PC que não seja Copilot+ PC requer o driver IHV mais recente instalado diretamente pelo fabricante da GPU (NVIDIA ou AMD). Os drivers predefinidos do Windows Update ou das instalações OEM podem não ser suficientes e podem causar falhas ou desempenho degradado.

Desempenho do sistema

Compreender o desempenho em PCs sem Copilot+

A qualidade dos resultados da Phi Silica (precisão, coerência, relevância) é consistente entre PCs Copilot+ e PCs não Copilot+, porque são usados os mesmos pesos e a mesma arquitetura do modelo. As principais diferenças estão na velocidade de inferência, no consumo de recursos e na capacidade de resposta da experiência do utilizador.

Os desenvolvedores devem:

  • Avalie o desempenho em hardware representativo: Teste numa variedade de dispositivos sem Copilot+ que reflitam a sua base de utilizadores, incluindo configurações mais modestas.
  • Defina as expectativas do utilizador: Comunique claramente que os tempos de resposta podem variar consoante o hardware do dispositivo. Considere mostrar indicadores de progresso ou transmitir resultados parciais.
  • Implemente tempos limite e alternativas: Para cenários em que o tempo de resposta é crítico, implemente tempos limite adequados e considere disponibilizar opções alternativas na cloud (com o consentimento do utilizador).
  • Monitorizar o uso de recursos: Monitorizar a utilização da GPU, o consumo de VRAM e o uso de memória do sistema durante a inferência para identificar e corrigir gargalos de desempenho.

Moderação de conteúdo

A moderação de conteúdo está disponível e é fortemente recomendada tanto em PCs Copilot+ como em PCs sem Copilot+. A ContentFilterOptions API permite aos programadores configurar limiares de gravidade para categorias de violência, ódio, conteúdo sexual e autoagressão. O comportamento de moderação de conteúdo é idêntico independentemente do hardware de inferência.

Melhores práticas:

  • Ative sempre a moderação de conteúdos para aplicações orientadas ao utilizador.
  • Configure níveis de gravidade adequados à sua população de utilizadores (por exemplo, configurações mais rigorosas para aplicações usadas por menores).
  • Não confie apenas na moderação automática de conteúdos; incluir mecanismos para reporte de utilizadores e revisão humana de conteúdos sinalizados.

Orientação de Avaliação e Integração

Antes do destacamento

  1. Realize testes de ponta a ponta em hardware não-Copilot+ representativo dos seus utilizadores-alvo, incluindo:

    • Teste funcional dos resultados do modelo em todos os casos de uso da sua aplicação.
    • Testes de desempenho em cenários realistas de contenção de recursos.
    • Red teaming para identificar potenciais padrões de uso indevido, especialmente aqueles que podem explorar inferências mais lentas (por exemplo, riscos de canal lateral baseados no tempo).
  2. Avalie a justiça e o viés entre as populações de utilizadores que a sua aplicação serve. Teste com pedidos em todas as línguas suportadas e que representem diferentes grupos demográficos.

  3. Avalie a experiência do utilizador em dispositivos de gama mais baixa. Garantir que o desempenho degradado não conduza à frustração do utilizador, abandono ou dependência excessiva de saídas incompletas.

Após o destacamento

  1. Monitorizar a telemetria (em conformidade com as leis e políticas de privacidade aplicáveis) para:

    • Distribuições de latência de inferência entre tipos de dispositivos.
    • Taxas de acionamento da moderação de conteúdos.
    • Sinais de feedback do utilizador indicam problemas de qualidade ou desempenho.
  2. Mantenha um plano de resposta a incidentes que inclua a possibilidade de desativar ou atualizar o modelo caso seja detetado um problema de segurança.

  3. Ajuste as definições de moderação de conteúdos com base em padrões de utilização reais, comentários dos utilizadores e ameaças emergentes à segurança dos conteúdos.

  4. Fornecer mecanismos de feedback dos utilizadores diretamente na experiência da aplicação, permitindo que os utilizadores reportem resultados imprecisos, prejudiciais ou inesperados.


Considerações de IA Responsável para a Expansão Não-Copilot+

Alcance mais amplo, responsabilidade mais ampla

Expandir a Phi Silica para PCs que não sejam Copilot+ PCs torna as capacidades locais de IA acessíveis a uma população de utilizadores muito maior e diversificada. Este aumento do alcance amplifica tanto os benefícios como os riscos:

  • Acesso democratizado: Mais utilizadores podem beneficiar da IA no dispositivo sem necessidade de adquirir hardware especializado. Isto apoia a inclusão e a equidade.
  • Aumento da superfície de uso indevido: Uma base de utilizadores maior aumenta a probabilidade estatística de uso adversarial ou prejudicial. Uma moderação robusta de conteúdos e monitorização de abusos são essenciais.
  • Contextos diversos de dispositivos: Utilizadores em não-Copilot+ PCs podem estar em ambientes com conectividade limitada, hardware mais antigo ou dispositivos partilhados — tudo isto influencia a forma como a IA é experienciada e potencialmente mal utilizada.

Privacidade

A Phi Silica processa todos os prompts e gera todas as respostas localmente no dispositivo do utilizador. Nenhum pedido do utilizador nem quaisquer saídas do modelo são transmitidos à Microsoft ou a qualquer terceiro durante a inferência. Esta arquitetura de privacidade mantém-se em PCs sem Copilot+.

Os desenvolvedores que integram a Phi Silica devem:

  • Revele claramente aos utilizadores que o processamento da IA ocorre no dispositivo.
  • Evite recolher ou registar perguntas e respostas, a menos que o utilizador tenha dado consentimento informado.
  • Siga as leis de privacidade aplicáveis, regulamentos e políticas de privacidade da Microsoft relativamente a quaisquer dados de telemetria ou diagnóstico recolhidos.

Transparência

  • Informar aos utilizadores quando o conteúdo for gerado por IA. Não apresente texto gerado por IA como escrito por humanos.
  • Comunique que a IA pode produzir erros e incentive os utilizadores a verificar informações importantes.
  • Em PCs sem Copilot+, informe os utilizadores de que o desempenho pode ser diferente do desempenho em hardware Copilot+.

Justiça

  • Avaliar os resultados do modelo para potenciais preconceitos entre línguas, culturas e grupos demográficos.
  • Monitorizar desempenhos ou qualidades dispares entre diferentes configurações de hardware para garantir experiências de utilizador equitativas.

Fiabilidade e Segurança

  • Implemente moderação de conteúdos com níveis de gravidade adequados à sua população de utilizadores.
  • Projete a sua aplicação para lidar com falhas de modelos de forma elegante (por exemplo, indisponibilidade do modelo, condições de falta de memória em dispositivos restritos).
  • Forneça um interruptor de desligamento ou um flag de funcionalidade para desativar rapidamente a funcionalidade da Phi Silica caso seja identificado um problema de segurança.

Responsabilidade

  • Mantenha documentação das suas decisões de integração com IA, configurações de moderação de conteúdos e resultados de avaliação.
  • Designe um indivíduo ou equipa responsável responsável por monitorizar e responder a incidentes relacionados com IA.

Ferramentas e Recursos


Esta nota de transparência complementa a documentação existente da Phi Silica e as orientações Responsible Generative AI Development on Windows. Será atualizado à medida que a tecnologia, os padrões de utilização e as medidas de mitigação evoluem.