Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
O que é uma Nota de Transparência?
Um sistema de IA inclui não apenas a tecnologia, mas também as pessoas que a usarão, as pessoas que serão afetadas por ela e o ambiente no qual ela é implantada. Criar um sistema adequado para sua finalidade pretendida requer uma compreensão de como a tecnologia funciona, suas funcionalidades e limitações e como obter o melhor desempenho.
A Microsoft fornece notas de transparência para ajudá-lo a entender como nossa tecnologia de IA funciona. Isso inclui as opções que os proprietários do sistema podem fazer que influenciam o desempenho e o comportamento do sistema e a importância de pensar em todo o sistema, incluindo a tecnologia, as pessoas e o meio ambiente. Você pode usar notas de transparência ao desenvolver ou implantar seu próprio sistema ou compartilhá-las com as pessoas que usarão ou serão afetadas pelo seu sistema.
As notas de transparência fazem parte de um esforço mais amplo em Microsoft para colocar nossos princípios AI em prática.
Introdução ao Phi Silica
O Phi Silica é um modelo pequeno de linguagem (SLM) otimizado para inferência no próprio dispositivo no Windows. Ele habilita os recursos de IA de geração local , incluindo geração de texto, resumo, reescrita e transformação texto a tabela, sem a necessidade de uma conexão de nuvem. Ao executar totalmente no dispositivo, o Phi Silica dá suporte à privacidade do usuário mantendo prompts e respostas locais.
O Phi Silica foi originalmente projetado e otimizado exclusivamente para Windows Copilot+ PCs, que incluem uma NPU (Unidade de Processamento Neural) fornecendo mais de 40 TOPS de computação de IA dedicada. Com essa expansão, o Phi Silica agora está disponível em non-Copilot+ PCs — dispositivos de Windows padrão que não têm uma NPU dedicada — em que a inferência é executada usando a GPU do dispositivo.
Termos-chave
| Term | Definition |
|---|---|
| Copilot+ PC | Um computador Windows equipado com uma NPU (Unidade de Processamento Neural) dedicada que atende ao patamar de 40+ TOPS, projetado para cargas de trabalho de IA aceleradas executadas no dispositivo. |
| PC sem Copilot+ | Um computador Windows padrão sem uma NPU dedicada (ou com uma NPU abaixo do limite Copilot+). A inferência Phi Silica nesses dispositivos é executada por meio da GPU. |
| NPU (Unidade de Processamento Neural) | Hardware especializado projetado para acelerar cargas de trabalho de machine learning com alta eficiência e baixo consumo de energia. |
| SLM (modelo de linguagem pequena) | Um modelo de linguagem otimizado para execução local no dispositivo com uma contagem de parâmetros menor do que os LLMs (modelos de linguagem grande) em escala de nuvem. |
| Decodificação especulativa | Uma técnica que usa um modelo de rascunho menor para propor várias sequências de token, que são validadas em paralelo pelo modelo principal para acelerar a geração de texto. |
| Moderação de conteúdo | Mecanismos de filtragem que detectam e bloqueiam conteúdo prejudicial, ofensivo ou não seguro em entradas e saídas de modelo. |
Capabilities
Comportamento do Sistema
O Phi Silica processa prompts de linguagem natural no dispositivo e gera respostas de texto. O modelo dá suporte a:
- Geração de texto de forma livre: respondendo perguntas, fornecendo explicações e gerando conteúdo criativo a partir de prompts do usuário.
- Habilidades de Inteligência de Texto: funcionalidades de transformação internas, incluindo resumo, reescrita (com ajuste de tom) e formatação de texto para tabela.
- Respostas de streaming: resultados parciais retornados progressivamente para experiências responsivas do usuário.
- Integração de moderação de conteúdo: filtragem de conteúdo configurável em quatro categorias (violência, ódio, conteúdo sexual, automutilação) em vários níveis de gravidade.
Em Copilot+ PCs, o Phi Silica aproveita o hardware da NPU para inferência otimizada com menor latência e consumo de energia reduzido. Em PCs sem Copilot+, a inferência é executada na GPU. O modelo subjacente e suas funcionalidades permanecem os mesmos; no entanto, as características operacionais diferem (consulte Limitações).
Casos de uso
Usos pretendidos
- Assistência de escrita no aplicativo: resumir documentos, reescrever texto para maior clareza ou para ajustar o tom e gerar rascunhos em aplicativos de produtividade.
- Q&A local e recuperação de informações: respondendo perguntas factuais usando os dados de treinamento do modelo, sem transmitir consultas de usuário para um serviço de nuvem.
- Recursos de acessibilidade: simplificar texto complexo, gerar descrições e dar suporte a usuários que se beneficiam da leitura e gravação assistidas por IA.
- Criação de protótipos para desenvolvedores: habilitando os desenvolvedores de aplicativos a integrar a geração de texto de IA local para cenários de teste e prova de conceito.
- Fluxos de trabalho sensíveis à privacidade: cenários em que a soberania de dados, a operação offline ou os requisitos de privacidade do usuário impedem o uso de serviços de IA baseados em nuvem.
Considerações ao escolher casos de uso
- Não use para tomada de decisões de alto risco sem supervisão humana. Phi Silica, como todos os modelos de linguagem, pode produzir informações imprecisas, incompletas ou fabricadas (alucinações). Os aplicativos que informam decisões médicas, legais, financeiras ou críticas à segurança devem incluir uma revisão humana significativa.
- Não use como única fonte confiável de fatos. Os dados de treinamento do modelo têm uma data limite de conhecimento e podem conter vieses ou imprecisões. Incentive os usuários a verificar informações importantes de fontes autoritativas.
- Tenha cuidado com dados pessoais confidenciais. Embora o processamento no dispositivo aprimore a privacidade, os desenvolvedores devem evitar a criação de fluxos de trabalho que solicitam o modelo com informações pessoais confidenciais (por exemplo, registros de integridade, detalhes financeiros), a menos que as proteções apropriadas estejam em vigor.
- Considere a base de usuários expandida. A expansão para não Copilot+ PCs amplia significativamente a população de usuários, incluindo dispositivos com diferentes funcionalidades de hardware e usuários com alfabetização técnica diversificada. Crie seu aplicativo para lidar normalmente com a variação de desempenho e fornecer expectativas claras aos usuários.
Limitações
Limitações técnicas específicas para PCs sem Copilot+
| Fator | Copilot+ PCs (NPU) | PCs sem Copilot+ (GPU) |
|---|---|---|
| Latência de Inferência | Otimizado; baixa latência com aceleração de NPU e decodificação especulativa | Latência mais alta; A velocidade de inferência depende da geração de GPU, da VRAM disponível e da carga de GPU atual |
| Consumo de energia | A NPU é eficiente em termos de energia, adequada para uso alimentado por bateria | A inferência de GPU consome mais energia; pode afetar significativamente a vida útil da bateria em laptops |
| Cargas de trabalho simultâneas | A NPU opera de forma independente, minimizando o impacto em outras tarefas | A inferência de GPU compete com outros aplicativos acelerados por GPU (renderização, reprodução de vídeo, jogos) para recursos de computação; pode causar lentidão no sistema |
| Impacto térmico | NPU projetada para cargas de trabalho de IA contínuas com controle térmico | A inferência prolongada por GPU pode causar redução de desempenho por aquecimento em dispositivos não projetados para cargas sustentadas de processamento na GPU |
| Pressão de memória | Carregamento e inferência de modelo gerenciados em conjunto com a memória da NPU | O modelo deve ser carregado em VRAM de GPU (ou memória de GPU compartilhada); dispositivos com VRAM limitada podem sofrer pressão ou recuar para memória compartilhada mais lenta |
| Compressão de prompt | ✅ Disponível; permite janelas de contexto mais eficazes | ❌ Não disponível na GPU |
| Decodificação especulativa | ✅ Disponível; acelera a geração de texto usando um modelo de rascunho | ❌ Não disponível na GPU |
| Opcionalidade do modelo | O modelo é gerenciado pelo sistema | O modelo é baixado sob demanda e pode ser removido pelo usuário em Configurações>Sistema>Componentes de IA |
Limitações técnicas gerais
- Precisão e alucinações: Phi Silica pode gerar respostas plausíveis, mas factualmente incorretas. A qualidade de saída do modelo não muda entre a execução de NPU e GPU, mas a capacidade de resposta reduzida em não Copilot+ PCs pode levar os usuários a aceitar saídas iniciais sem revisão crítica.
- Suporte à linguagem: os recursos de linguagem do Phi Silica são determinados por seus dados de treinamento. O desempenho pode variar entre idiomas e alguns idiomas podem não ter suporte. Os recursos do Phi Silica não estão disponíveis na China.
- Limitações da janela de contexto: o modelo tem uma janela de contexto fixa. Prompts longos ou conversas de vários turnos podem exceder essa janela, levando à perda de contexto anterior.
- Preconceito e imparcialidade: o modelo pode refletir preconceitos presentes em seus dados de treinamento, incluindo estereótipos relacionados a gênero, raça, etnia, religião ou outras características. Os desenvolvedores devem avaliar as saídas para fins de imparcialidade entre as populações que seus aplicativos servem.
- Entradas adversariais: O modelo pode ser suscetível a tentativas de injeção de prompts ou de contornar restrições. Os filtros de moderação de conteúdo reduzem, mas não eliminam esse risco.
Fatores operacionais para PCs sem Copilot+
- Diversidade de hardware: PCs sem Copilot+ abrangem uma ampla variedade de configurações de GPU (GPUs integradas ou dedicadas, diferentes capacidades de VRAM, diferentes arquiteturas de GPU). O desempenho variará significativamente em todo esse espectro de dispositivos.
- Requisitos mínimos de hardware: os dispositivos devem atender aos requisitos mínimos de GPU e memória para executar o Phi Silica. Dispositivos com apenas elementos gráficos integrados ou GPUs discretas mais antigas podem ter um desempenho degradado ou podem não atender aos limites mínimos.
- Contenção de recursos em segundo plano: ao contrário da execução baseada em NPU, a inferência de GPU é afetada por outras cargas de trabalho aceleradas por GPU. Os usuários que executam aplicativos com uso intensivo de gráficos (jogos, edição de vídeo, renderização 3D) simultaneamente podem experimentar um desempenho de modelo ruim.
- Dependências de software: a execução não Copilot+ PC requer o driver de GPU IHV mais recente instalado diretamente do fabricante de GPU (NVIDIA ou AMD). Os drivers padrão de instalações de Windows Update ou OEM podem não ser suficientes e podem causar falhas ou desempenho degradado.
Desempenho do sistema
Entendendo o desempenho em PCs que não são Copilot+
A qualidade da saída do Phi Silica (precisão, coerência e relevância) é consistente em PCs Copilot+ e não Copilot+, pois usam os mesmos pesos e a mesma arquitetura de modelo. As principais diferenças são a velocidade de inferência, o consumo de recursos e a capacidade de resposta da experiência do usuário.
Os desenvolvedores devem:
- Avaliação de desempenho em hardware representativo: teste em uma variedade de dispositivos sem Copilot+ que reflitam sua base de usuários-alvo, incluindo configurações mais básicas.
- Definir expectativas do usuário: comunique claramente que os tempos de resposta podem variar com base no hardware do dispositivo. Considere mostrar indicadores de progresso ou transmitir resultados parciais.
- Implementar tempos limite e fallbacks: para cenários em que o tempo de resposta é crítico, implemente tempos limite apropriados e considere oferecer opções de fallback baseadas em nuvem (com consentimento do usuário).
- Monitorar o uso de recursos: acompanhe a utilização de GPU, o consumo de VRAM e o uso de memória do sistema durante a inferência para identificar e solucionar gargalos de desempenho.
Moderação de conteúdo
A moderação de conteúdo está disponível e é altamente recomendada tanto em PCs Copilot+ quanto em PCs sem Copilot+. A ContentFilterOptions API permite que os desenvolvedores configurem limites de gravidade para categorias de violência, ódio, conteúdo sexual e automutilação. O comportamento de moderação de conteúdo é idêntico, independentemente do hardware de inferência.
Práticas recomendadas:
- Sempre habilite a moderação de conteúdo para aplicativos voltados para o usuário.
- Configure os níveis de severidade apropriados à sua população de usuários (por exemplo, configurações mais rigorosas para aplicativos usados por menores).
- Não dependa apenas da moderação automatizada de conteúdo; inclua mecanismos para relatórios de usuários e revisão humana de conteúdo sinalizado.
Diretrizes de avaliação e integração
Antes da implantação
Realize testes de ponta a ponta em hardware sem Copilot+ representativo dos seus usuários-alvo, incluindo:
- Teste funcional das saídas do modelo em todos os casos de uso do seu aplicativo.
- Teste de desempenho em cenários de contenção de recursos realistas.
- Agrupamento vermelho para identificar possíveis padrões de uso indevido, especialmente aqueles que podem explorar inferências mais lentas (por exemplo, riscos de canal lateral baseados em tempo).
Avalie a imparcialidade e o viés entre as populações de usuários que seu aplicativo atende. Teste com prompts em todos os idiomas suportados e que representem diversos perfis demográficos.
Avaliar a experiência do usuário em dispositivos de extremidade inferior. Verifique se o desempenho degradado não leva à frustração, ao abandono ou à dependência excessiva de saídas incompletas.
Após a implantação
Monitore a telemetria (em conformidade com as leis e políticas de privacidade aplicáveis) para:
- Distribuições de latência de inferência entre tipos de dispositivo.
- Taxas de acionamento da moderação de conteúdo.
- Sinais de comentários do usuário que indicam problemas de qualidade ou desempenho.
Mantenha um plano de resposta a incidentes que inclua a capacidade de desabilitar ou atualizar o modelo se um problema de segurança for descoberto.
Ajuste as configurações de moderação de conteúdo com base em padrões reais de uso, no feedback dos usuários e em novas ameaças à segurança de conteúdo.
Forneça mecanismos de comentários do usuário diretamente na experiência do aplicativo, permitindo que os usuários relatem saídas imprecisas, prejudiciais ou inesperadas.
Considerações sobre IA responsável para a expansão para dispositivos sem Copilot+
Alcance mais amplo, responsabilidade mais ampla
Expandir o Phi Silica para não Copilot+ PCs torna as funcionalidades locais de IA acessíveis a uma população de usuários muito maior e mais diversificada. Esse aumento de alcance amplifica os benefícios e os riscos:
- Acesso democratizado: mais usuários podem se beneficiar da IA no dispositivo sem comprar hardware especializado. Isso dá suporte à inclusão e à equidade.
- Aumento da superfície de uso indevido: uma base de usuário maior aumenta a probabilidade estatística de uso contraditório ou prejudicial. Moderação robusta de conteúdo e monitoramento de abuso são essenciais.
- Diversos contextos de dispositivos: usuários de PCs sem Copilot+ podem estar em ambientes com conectividade limitada, hardware mais antigo ou dispositivos compartilhados — o que afeta como a IA é vivenciada e potencialmente mal utilizada.
Privacidade
O Phi Silica processa todos os prompts e gera todas as respostas localmente no dispositivo do usuário. Nenhuma solicitação de usuário ou saídas de modelo são transmitidas para Microsoft ou terceiros durante a inferência. Essa arquitetura de privacidade é mantida em PCs sem Copilot+.
Os desenvolvedores que integram o Phi Silica devem:
- Divulgue claramente aos usuários que o processamento de IA ocorre no dispositivo.
- Evite coletar ou registrar prompts e respostas, a menos que o usuário tenha fornecido consentimento informado.
- Siga as leis de privacidade, os regulamentos e as políticas de privacidade Microsoft aplicáveis em relação a qualquer telemetria ou dados de diagnóstico coletados.
Transparência
- Divulgue aos usuários quando o conteúdo é gerado pela IA. Não apresente o texto gerado por IA como de autoria humana.
- Comunique que a IA pode produzir erros e incentivar os usuários a verificar informações importantes.
- Em PCs sem Copilot+, informe os usuários de que o desempenho pode diferir do desempenho em hardware Copilot+.
Imparcialidade
- Avalie as saídas de modelo para possíveis preconceitos entre linguagens, culturas e grupos demográficos.
- Monitore o desempenho ou a qualidade diferentes em diferentes configurações de hardware para garantir experiências de usuário equitativas.
Confiabilidade e segurança
- Implemente a moderação de conteúdo com níveis de severidade apropriados para sua população de usuários.
- Projete seu aplicativo para lidar de forma adequada com falhas do modelo (por exemplo, indisponibilidade do modelo e condições de falta de memória em dispositivos com recursos limitados).
- Forneça um mecanismo de desligamento ou uma flag de recurso para desativar rapidamente a funcionalidade do Phi Silica caso seja identificado um problema de segurança.
Responsabilidade
- Mantenha a documentação de suas decisões de integração de IA, configurações de moderação de conteúdo e resultados de avaliação.
- Designe um indivíduo responsável ou uma equipe responsável por monitorar e responder a incidentes relacionados à IA.
Ferramentas e Recursos
- Visão geral do Phi Silica – Documentação principal para APIs Phi Silica.
- Desenvolvimento Responsável de IA Generativa no Windows — Diretrizes para práticas de governar, mapear, medir e gerenciar.
- Microsoft AI Standard Responsável — Princípios e abordagem fundamentais.
- Moderação de conteúdo com Windows AI APIs — Configurando filtros de conteúdo para Phi Silica.
- Galeria de Desenvolvimento de IA – Exemplos e demonstrações.
Esta nota de transparência complementa a documentação existente do Phi Silica e a orientação Responsible Generative AI Development on Windows. Ela será atualizada à medida que a tecnologia, os padrões de uso e as mitigações evoluirem.