Nota de transparencia: Phi Silica en equipos sin Copilot+

¿Qué es una nota de transparencia?

Un sistema de inteligencia artificial incluye no solo la tecnología, sino también las personas que lo usarán, las personas que se verán afectadas por ella y el entorno en el que se implementa. La creación de un sistema adecuado a su finalidad requiere comprender cómo funciona la tecnología, sus capacidades y limitaciones, y cómo conseguir el mejor rendimiento.

Microsoft proporciona notas de transparencia que le ayudarán a comprender cómo funciona nuestra tecnología de inteligencia artificial. Esto incluye las elecciones que los propietarios del sistema pueden hacer que influyan en el rendimiento y el comportamiento del sistema y la importancia de pensar en todo el sistema, incluida la tecnología, las personas y el entorno. Puede usar notas de transparencia al desarrollar o implementar su propio sistema, o compartirlas con las personas que usarán o se verán afectadas por el sistema.

Las notas de transparencia forman parte de un esfuerzo más amplio en Microsoft poner en práctica nuestros principios de AI.


Introducción a PhiLice

PhiLice es un modelo de lenguaje pequeño (SLM) optimizado para la inferencia en el dispositivo en Windows. Permite funcionalidades locales de inteligencia artificial generativa (incluida la generación de texto, el resumen, la reescritura y la transformación de texto a tabla) sin necesidad de una conexión en la nube. Al ejecutarse por completo en el dispositivo, Phi Silica protege la privacidad del usuario al mantener las solicitudes y las respuestas en el dispositivo.

Phi Silica fue diseñado originalmente y optimizado exclusivamente para Windows Copilot+ PCs, que incluyen una unidad de procesamiento neuronal (NPU) que ofrece más de 40 TOPS de capacidad de cálculo de IA dedicada. Con esta expansión, PhiLice ya está disponible en non-Copilot+ PCs ( dispositivos Windows estándar que carecen de una NPU dedicada, donde la inferencia se realiza mediante la GPU del dispositivo.

Términos clave

Término Definición
Copilot+ PC Un equipo Windows con una unidad de procesamiento neuronal (NPU) dedicada que cumple el umbral de 40 TOPS o superior, diseñado específicamente para cargas de trabajo de inteligencia artificial aceleradas en el propio dispositivo.
PC sin Copilot+ Un equipo estándar Windows sin una NPU dedicada (o con una NPU por debajo del umbral de Copilot+). La inferencia de PhiLice en estos dispositivos se realiza a través de la GPU.
NPU (unidad de procesamiento neuronal) Hardware especializado diseñado para acelerar las cargas de trabajo de aprendizaje automático con alta eficiencia y bajo consumo de energía.
SLM (modelo de lenguaje pequeño) Un modelo de lenguaje optimizado para la ejecución local en el dispositivo con un recuento de parámetros más pequeño que los modelos de lenguaje grande (LLM) a escala en la nube.
Descodificación especulativa Técnica que usa un modelo de borrador más pequeño para proponer varias secuencias de tokens, que luego se validan en paralelo por el modelo principal para acelerar la generación de texto.
Moderación de contenido Mecanismos de filtrado que detectan y bloquean contenido dañino, ofensivo o no seguro en las entradas y salidas del modelo.

Capabilities

Comportamiento del sistema

PhiLice procesa mensajes de lenguaje natural en el dispositivo y genera respuestas de texto. El modelo admite:

  • Generación de texto de forma libre: responder a preguntas, proporcionar explicaciones y generar contenido creativo a partir de mensajes de usuario.
  • Aptitudes de inteligencia de texto: funcionalidades de transformación integradas, como resumen, reescritura (con ajuste de tono) y formato de texto a tabla.
  • Respuestas en flujo: Resultados parciales que se devuelven progresivamente para ofrecer experiencias de usuario más ágiles.
  • Integración de moderación de contenido: filtrado de contenido configurable entre cuatro categorías (violencia, odio, contenido sexual, autolesión) en varios niveles de gravedad.

En Copilot+ PCs, PhiLice aprovecha el hardware NPU para la inferencia optimizada con menor latencia y menor consumo de energía. En los PC sin Copilot+, la inferencia se ejecuta en la GPU. El modelo subyacente y sus capacidades siguen siendo los mismos; sin embargo, las características operativas difieren (consulte Limitaciones).

Casos de uso

Usos previstos

  • Asistencia para la escritura en la aplicación: resumen de documentos, reescritura de texto para mayor claridad o tono y generación de borradores dentro de las aplicaciones de productividad.
  • Preguntas y respuestas locales y recuperación de información: Respuesta a preguntas fácticas utilizando los datos de entrenamiento del modelo, sin transmitir las consultas de los usuarios a un servicio en la nube.
  • Características de accesibilidad: simplificación del texto complejo, generación de descripciones y apoyo a los usuarios que se benefician de la lectura y escritura asistidas por IA.
  • Prototipado para desarrolladores: Permite a los desarrolladores de aplicaciones integrar la generación local de texto con IA para escenarios de pruebas y de prueba de concepto.
  • Flujos de trabajo sensibles a la privacidad: escenarios en los que los requisitos de soberanía de los datos, funcionamiento sin conexión o privacidad del usuario impiden el uso de servicios de inteligencia artificial basados en la nube.

Consideraciones al elegir casos de uso

  • No use para la toma de decisiones de alto riesgo sin supervisión humana. PhiLice, como todos los modelos de lenguaje, puede producir información inexacta, incompleta o fabricada (alucinaciones). Las aplicaciones que informan a las decisiones médicas, legales, financieras o críticas para la seguridad deben incluir una revisión humana significativa.
  • No use como única fuente de verdad fáctica. Los datos de entrenamiento del modelo tienen un límite de conocimiento y pueden contener sesgos o inexactitudes. Anime a los usuarios a comprobar información importante de orígenes autoritativos.
  • Tenga cuidado con los datos personales confidenciales. Aunque el procesamiento en el dispositivo mejora la privacidad, los desarrolladores deben evitar diseñar flujos de trabajo que pidan al modelo información personal confidencial (por ejemplo, registros de salud, detalles financieros), a menos que se establezcan medidas de seguridad adecuadas.
  • Considere la base de usuarios expandida. La expansión a equipos que no son Copilot+ amplía significativamente la base de usuarios, incluyendo dispositivos con distintas capacidades de hardware y usuarios con distintos niveles de conocimientos técnicos. Diseñe la aplicación para controlar correctamente la varianza de rendimiento y proporcionar expectativas claras a los usuarios.

Limitaciones

Limitaciones técnicas específicas para PC sin Copilot+

Factor Pc de Copilot+ (NPU) PCs sin Copilot+ (GPU)
Latencia de inferencia Optimizado; baja latencia mediante aceleración por NPU y decodificación especulativa Mayor latencia; la velocidad de inferencia depende de la generación de GPU, la VRAM disponible y la carga de GPU actual.
Consumo de energía NPU es eficiente para energía, adecuada para el uso con batería La inferencia de GPU consume más energía; puede afectar significativamente a la duración de la batería en portátiles
Cargas de trabajo simultáneas La NPU funciona de forma independiente, lo que minimiza el impacto en otras tareas La inferencia de GPU compite con otras aplicaciones aceleradas por GPU (representación, reproducción de vídeo, juegos) para los recursos de proceso; puede provocar ralentizaciones del sistema
Impacto térmico NPU diseñada para cargas de trabajo de IA continuas con gestión térmica controlada La inferencia prolongada en la GPU puede provocar estrangulamiento térmico en dispositivos que no están diseñados para soportar cargas sostenidas de cálculo en la GPU.
Presión de memoria Carga de modelos e inferencia gestionadas de forma conjunta con la memoria de la NPU El modelo debe cargarse en VRAM de GPU (o memoria de GPU compartida); Los dispositivos con VRAM limitado pueden experimentar presión o revertir a memoria compartida más lenta
Compresión de instrucciones ✅ Disponible; habilita ventanas de contexto más largas efectivas ❌ No disponible en GPU
Descodificación especulativa ✅ Disponible; acelera la generación de texto mediante un modelo de borrador ❌ No disponible en GPU
Opcionalidad del modelo El sistema administra el modelo. El modelo se descarga bajo demanda y el usuario puede eliminarlo desde Ajustes>Sistema>Componentes de IA

Limitaciones técnicas generales

  • Precisión y alucinaciones: PhiLice puede generar respuestas creíbles pero objetivamente incorrectas. La calidad del resultado del modelo no cambia entre la ejecución en la NPU y en la GPU, pero la menor capacidad de respuesta en los PC sin Copilot+ puede llevar a los usuarios a aceptar los resultados iniciales sin someterlos a una revisión crítica.
  • Compatibilidad con idiomas: las funcionalidades de idioma de PhiLice están determinadas por sus datos de entrenamiento. El rendimiento puede variar entre idiomas y es posible que algunos idiomas no se admita. Las características de PhiLice no están disponibles en China.
  • Limitaciones de la ventana de contexto: el modelo tiene una ventana de contexto fija. Las indicaciones largas o las conversaciones de varios turnos pueden superar esta ventana, lo que puede provocar la pérdida del contexto previo.
  • Sesgo y equidad: el modelo puede reflejar los sesgos presentes en sus datos de entrenamiento, incluidos los estereotipos relacionados con el género, la raza, la raza, la raza, la religión u otras características. Los desarrolladores deben evaluar los resultados para garantizar la equidad entre las poblaciones a las que va dirigida su aplicación.
  • Entradas adversarias: El modelo puede ser vulnerable a intentos de inyección de instrucciones o de evasión de restricciones. Los filtros de moderación de contenido mitigan pero no eliminan este riesgo.

Factores operativos para PCs sin Copilot+

  • Diversidad de hardware: Los PC sin Copilot+ abarcan una amplia gama de configuraciones de GPU (GPU integradas frente a discretas, distintas capacidades de VRAM y diferentes arquitecturas de GPU). El rendimiento variará significativamente en este espectro de dispositivos.
  • Requisitos mínimos de hardware: los dispositivos deben cumplir los requisitos mínimos de GPU y memoria para ejecutar PhiLice. Los dispositivos con solo gráficos integrados o GPU discretas anteriores pueden experimentar un rendimiento degradado o no cumplir los umbrales mínimos.
  • Contención de recursos en segundo plano: a diferencia de la ejecución basada en NPU, la inferencia de GPU se ve afectada por otras cargas de trabajo aceleradas por GPU. Los usuarios que ejecutan aplicaciones de uso intensivo de gráficos (juegos, edición de vídeo, representación 3D) simultáneamente pueden experimentar un rendimiento deficiente del modelo.
  • Dependencias de software: la ejecución no Copilot+ PC requiere el controlador de GPU de IHV más reciente instalado directamente desde el fabricante de GPU (NVIDIA o AMD). Los controladores predeterminados de las instalaciones de Windows Update o OEM pueden no ser suficientes y pueden provocar errores o un rendimiento degradado.

Rendimiento del sistema

Comprender el rendimiento en PC sin Copilot+

La calidad de los resultados de Phi Silica (precisión, coherencia y relevancia) se mantiene constante tanto en los PC Copilot+ como en los que no lo son, porque se utilizan los mismos pesos y la misma arquitectura del modelo. Las principales diferencias son la velocidad de inferencia, el consumo de recursos y la capacidad de respuesta de la experiencia del usuario.

Los desarrolladores deben:

  • Evalúe el rendimiento en hardware representativo: pruebe en una gama de dispositivos sin Copilot+ que reflejen su base de usuarios objetivo, incluidas las configuraciones más básicas.
  • Establecer expectativas de usuario: comunique claramente que los tiempos de respuesta pueden variar en función del hardware del dispositivo. Considere la posibilidad de mostrar indicadores de progreso o transmitir resultados parciales.
  • Implementar tiempos de espera y reserva: en escenarios en los que el tiempo de respuesta es crítico, implemente los tiempos de espera adecuados y considere la posibilidad de ofrecer opciones de reserva basadas en la nube (con consentimiento del usuario).
  • Supervisar el uso de recursos: realice un seguimiento del uso de GPU, el consumo de VRAM y el uso de memoria del sistema durante la inferencia para identificar y abordar los cuellos de botella de rendimiento.

Moderación de contenido

La moderación de contenido está disponible y se recomienda encarecidamente tanto en los PC Copilot+ como en los PC que no son Copilot+. La ContentFilterOptions API permite a los desarrolladores configurar umbrales de gravedad para las categorías de violencia, odio, contenido sexual y autolesión. El comportamiento de moderación de contenido es idéntico independientemente del hardware de inferencia.

Procedimiento recomendado:

  • Habilite siempre la moderación de contenido para las aplicaciones orientadas al usuario.
  • Configure los niveles de gravedad adecuados para su base de usuarios (por ejemplo, una configuración más estricta para las aplicaciones utilizadas por menores).
  • No confíe únicamente en la moderación de contenido automatizada; incluyen mecanismos para los informes de usuarios y la revisión humana del contenido marcado.

Guía de evaluación e integración

Antes de la implementación

  1. Realice pruebas integrales en hardware sin Copilot+ que sea representativo de sus usuarios objetivo, incluido lo siguiente:

    • Pruebas funcionales de los resultados del modelo en los casos de uso de tu aplicación.
    • Pruebas de rendimiento en escenarios de contención de recursos realistas.
    • Formación de equipos rojos para identificar posibles patrones de uso incorrecto, especialmente aquellos que pueden aprovechar la inferencia más lenta (por ejemplo, riesgos de canal lateral basados en tiempo).
  2. Evalúe la imparcialidad y el sesgo entre las poblaciones de usuarios a las que sirve la aplicación. Pruebe con avisos en todos los idiomas admitidos y represente diversos datos demográficos.

  3. Evaluar la experiencia del usuario en dispositivos de gama inferior. Asegúrese de que el rendimiento degradado no conduce a la frustración del usuario, el abandono o la dependencia excesiva de las salidas incompletas.

Después de la implementación

  1. Supervise la telemetría (en cumplimiento de las leyes y directivas de privacidad aplicables) para:

    • Distribuciones de latencia de inferencia según el tipo de dispositivo.
    • Tasas de activación de la moderación de contenido.
    • Señales de comentarios del usuario que indican problemas de calidad o rendimiento.
  2. Mantenga un plan de respuesta a incidentes que incluya la capacidad de deshabilitar o actualizar el modelo si se detecta un problema de seguridad.

  3. Iteración de la configuración de moderación de contenido basada en patrones de uso reales, comentarios de usuario y amenazas emergentes de seguridad de contenido.

  4. Proporcione mecanismos de comentarios de usuario directamente en la experiencia de la aplicación, lo que permite a los usuarios notificar salidas inexactas, dañinas o inesperadas.


Consideraciones sobre IA responsable para la expansión sin Copilot+

Alcance más amplio, responsabilidad más amplia

La expansión de PhiLice a no Copilot+ PCs hace que las funcionalidades de inteligencia artificial locales sean accesibles para una población de usuarios mucho más grande y diversa. Este aumento del alcance amplía tanto las ventajas como los riesgos:

  • Acceso democratizado: más usuarios pueden beneficiarse de la inteligencia artificial en el dispositivo sin adquirir hardware especializado. Esto fomenta la inclusión y la equidad.
  • Mayor superficie de uso incorrecto: una base de usuarios más grande aumenta la probabilidad estadística de uso adversario o perjudicial. La moderación de contenido y la supervisión de abusos sólidas son esenciales.
  • Diversos contextos de dispositivos: Los usuarios de PC que no son Copilot+ pueden encontrarse en entornos con conectividad limitada, hardware antiguo o dispositivos compartidos, lo que afecta a cómo se percibe y utiliza la IA y a cómo podría hacerse un uso indebido de ella.

Privacidad

PhiLice procesa todas las solicitudes y genera todas las respuestas localmente en el dispositivo del usuario. No se transmiten solicitudes de usuario ni salidas del modelo a Microsoft ni a ningún tercero durante la inferencia. Esta arquitectura de privacidad se mantiene en equipos sin Copilot+.

Los desarrolladores que integran PhiLice deben:

  • Informe claramente a los usuarios de que el procesamiento de IA se realiza en el dispositivo.
  • Evite recopilar o registrar solicitudes y respuestas a menos que el usuario haya proporcionado consentimiento informado.
  • Siga las leyes de privacidad, las regulaciones y las directivas de privacidad aplicables Microsoft con respecto a los datos de telemetría o diagnóstico recopilados.

Transparencia

  • Informe a los usuarios cuando el contenido haya sido generado por IA. No presente texto generado por ia como autoría humana.
  • Comunique que la inteligencia artificial puede producir errores y animar a los usuarios a comprobar información importante.
  • En los equipos sin Copilot+, informe a los usuarios de que el rendimiento puede diferir del de los equipos Copilot+.

Imparcialidad

  • Evalúe los resultados del modelo en busca de posibles sesgos entre idiomas, culturas y grupos demográficos.
  • Supervise el rendimiento o la calidad dispares en diferentes configuraciones de hardware para garantizar experiencias de usuario equitativas.

Confiabilidad y seguridad

  • Implemente la moderación de contenido con niveles de gravedad adecuados para su base de usuarios.
  • Diseñe la aplicación para gestionar correctamente los fallos del modelo (por ejemplo, la indisponibilidad del modelo o las situaciones de falta de memoria en dispositivos con recursos limitados).
  • Proporcione un interruptor de eliminación o una marca de características para deshabilitar rápidamente la funcionalidad de PhiLice si se identifica un problema de seguridad.

Responsabilidad

  • Mantenga la documentación de las decisiones de integración de IA, las configuraciones de moderación de contenido y los resultados de evaluación.
  • Designe a un individuo responsable o equipo responsable de la supervisión y respuesta a incidentes relacionados con la inteligencia artificial.

Herramientas y recursos


Esta nota de transparencia complementa la documentación existente de PhiLice y la guía Responsible Generative AI Development en Windows. Se actualizará a medida que evoluciona la tecnología, los patrones de uso y las mitigaciones.