Guía de decisión sobre el uso compartido de plataformas de INTELIGENCIA ARTIFICIAL

Una plataforma de inteligencia artificial es donde su organización ejecuta y opera modelos de INTELIGENCIA ARTIFICIAL. Proporciona el perímetro de red, el modelo de identidad, el plano de datos y la asignación de cuotas que rodean los modelos, las implementaciones, los índices, las evaluaciones y los recursos relacionados. Microsoft Foundry y Azure Machine Learning son dos plataformas de inteligencia artificial Azure. Cada implementación de cualquiera de los servicios crea una nueva instancia.

Su organización debe decidir cómo colocar entornos de carga de trabajo de IA en instancias de la plataforma de IA. Puede aislar cada entorno, como dev, test o prod, en su propia instancia de plataforma. También puede permitir que varias cargas de trabajo o entornos compartan la misma instancia. Esta decisión, a menudo llamada colocación conjunta, determina el alcance de las incidencias operativas o de seguridad. También afecta a los límites de cumplimiento y al costo de la plataforma.

Recomendación: Establezca una directiva de toda la organización que defina los requisitos de aislamiento predeterminados, los límites de uso compartido aprobados, los criterios de excepción y las expectativas independientes para entornos de plataformas de ia de producción y preproducción.

Guía de decisión:

1. Definir límites de uso compartido de plataformas de IA

Cada organización necesita límites en los que las cargas de trabajo nunca deben compartir una instancia de la plataforma de IA. Este límite se aplica en todos los entornos, incluidos los entornos de producción y preproducción. Las cargas de trabajo dentro del mismo límite pueden compartir una instancia de plataforma. Las cargas de trabajo en distintos límites no pueden.

  • ¿Por qué dibujar límites de uso compartido? Sin compartir límites, los equipos de carga de trabajo tienen como valor predeterminado cualquier patrón que sea conveniente en este momento y la plataforma de inteligencia artificial acumula requisitos en conflicto a lo largo del tiempo. Con el tiempo, crea modelos de propiedad incoherentes, requisitos de cumplimiento en conflicto, asignación de costos poco clara y riesgo operativo compartido en cargas de trabajo no relacionadas. Por ejemplo, las áreas empresariales no relacionadas pueden compartir la cuota en la misma instancia de plataforma para reducir el costo. El resultado es una plataforma de inteligencia artificial con límites de gobernanza incoherentes que resultan difíciles de comprender y auditar.

  • Límites comunes. Elija un modelo de límites que se alinee con la forma en que su organización ya asigna la responsabilidad y rige las decisiones tecnológicas. Entre los modelos comunes se incluyen:

    • Un límite de unidad de negocio optimiza la propiedad operativa común y la financiación

    • Un límite de dominio de datos optimiza los requisitos comunes de cumplimiento y control de datos

    • El ámbito de un propietario de producto está pensado para optimizar un ciclo de vida de ingeniería común y las operaciones de la plataforma.

    Dentro del límite, los equipos todavía pueden elegir instancias de plataforma dedicadas cuando el aislamiento tenga sentido. Fuera del límite, no se permite el uso compartido.

  • Encuentre lo que mejor funciona. Ningún modelo único es universalmente correcto. La coherencia importa más que el modelo que seleccione, ya que un modelo de límites claramente aplicado mantiene la gobernanza comprensible a medida que crece la plataforma de inteligencia artificial.

2. Definición de una directiva de uso compartido de plataformas de IA de producción

El uso compartido de plataformas de IA en producción consiste en ejecutar más de un entorno de carga de trabajo de IA en producción en el mismo recurso de Microsoft Foundry o área de trabajo de Azure Machine Learning. En Azure, la instancia de la plataforma de IA define el límite de red, el límite de identidad y el límite de cuota para los entornos de carga de trabajo que lo usan. Por ese motivo, las organizaciones deben definir una directiva específica para el uso compartido de plataformas de inteligencia artificial de producción.

2.1 Usar por defecto una única instancia de la plataforma de IA por carga de trabajo de producción

Los entornos de ia de producción deben tener como valor predeterminado el aislamiento del entorno de producción. No coloque varias cargas de trabajo de producción en el mismo recurso de Microsoft Foundry o Azure Machine Learning área de trabajo a menos que exista una excepción documentada. Una instancia de plataforma de IA dedicada para cada entorno de carga de trabajo de producción debe ser el enfoque estándar. Trate el uso compartido de plataformas de IA como una excepción, no como práctica predeterminada.

  • ¿Por qué optar por el aislamiento por defecto? Las plataformas de IA compartidas también crean riesgos operativos compartidos. Un problema de seguridad, una configuración incorrecta, una interrupción del servicio o un evento de agotamiento de cuotas puede afectar a cada entorno de carga de trabajo colocado. El aislamiento también reduce el riesgo de exposición accidental del acceso entre cargas de trabajo y evita que una carga de trabajo consuma capacidad o cuota de GPU necesaria para otra carga de trabajo. Los entornos de producción suelen tener el mayor impacto empresarial y la exposición normativa. La mayoría de las organizaciones requieren límites de propiedad claros y aislamiento operativo sólido para estos entornos.

  • Contrapartida: El aislamiento aumenta el coste y la sobrecarga de gestión. Cada instancia de plataforma conlleva su propia sobrecarga operativa para las redes, la identidad, la supervisión y las operaciones. Las organizaciones deben equilibrar estos costos con respecto a las ventajas operativas y de seguridad de una contención más sólida.

2.2 Permitir la colocación de producción a través de una excepción documentada

La co-ubicación reduce la sobrecarga y consolida las operaciones de la plataforma. Por ejemplo, si los casos de uso comparten los mismos orígenes de datos como entrada, la colocación evita tener que configurar la conectividad y la autenticación entre la plataforma de IA y esos recursos para cada caso de uso. Contrapartida: compartir instancias de la plataforma de IA en producción también fusiona el radio de impacto, el perímetro de identidad y la reserva de cuotas de todas las cargas de trabajo que comparten la instancia.

  • Características de la coubicación: Permita solo que las cargas de trabajo de producción compartan instancias de Microsoft Foundry o Azure Machine Learning cuando se cumpla cada una de las siguientes condiciones:

    • Todas las cargas de trabajo coubicadas comparten el mismo ámbito normativo, clasificación de datos, requisitos de residencia y estándares de control de datos.

    • Todas las cargas de trabajo funcionan dentro del mismo límite de red, el mismo espacio de nombres DNS y el mismo límite de identidad.

    • La organización acepta el riesgo de interrupción compartida y el riesgo de agotamiento de cuotas compartidas que introduce la colocación.

    • El costo o la sobrecarga operativa de instancias independientes supera materialmente la ventaja de aislamiento. La presión de costos por sí sola no es suficiente justificación.

    • El equipo acepta que dividir las cargas de trabajo más adelante es costosa. El estado de la plataforma de IA no se transfiere de forma limpia entre instancias y, a menudo, requiere recreación o reconfiguración.

  • Contrapartida: Cada instancia compartida de la plataforma de IA requiere un responsable de la plataforma claramente identificado que se encargue de la gestión de cuotas, la configuración de la red, las revisiones de acceso, las operaciones del ciclo de vida y la coordinación de incidentes.

2.3 Segmenta los casos de uso en producción dentro de la instancia de la plataforma de IA

Tanto si una instancia de la plataforma está aislada como si está en un entorno compartido, utilice las funciones de segmentación integradas en el producto para aislar los casos de uso. Trate cada caso de uso distinto, como experiencias de usuario totalmente distintas dentro de una sola carga de trabajo, como su propia implementación lógica dentro de la instancia de la plataforma. Por ejemplo:

  • En Microsoft Foundry, aprovisione un project por caso de uso dentro del recurso Foundry.

  • En Azure Machine Learning, use un área de trabajo de hub con áreas de trabajo del proyecto para segmentar casos de uso.

Estas construcciones proporcionan a cada caso de uso sus propios recursos y asignaciones de roles. Comparten un conjunto común de componentes de infraestructura para la seguridad y la conectividad. No tiene que aprovisionar una nueva instancia para cada escenario.

  • Cuando se permite la colocación en el proceso de excepción, eleva esta separación en el producto de una recomendación a un requisito de directiva aplicada.

  • Si una carga de trabajo requiere una segmentación compleja en varios proyectos de Foundry o espacios de trabajo de Azure Machine Learning, reconsidere si el modelo actual de uso compartido sigue proporcionando una simplicidad operativa y un aislamiento aceptables.

Para más información sobre los conceptos que sustentan estas decisiones, consulte recursos de Microsoft Foundry y áreas de trabajo de Azure Machine Learning.

3. Definición de una directiva de uso compartido de plataformas de inteligencia artificial de preproducción

Los entornos de preproducción invierten el valor predeterminado de producción. Los entornos de preproducción incluyen desarrollo, prueba y fase. Estos entornos admiten la experimentación y la validación preliminar. Las instancias dedicadas de los recursos de la plataforma de inteligencia artificial rara vez justifican su costo en esos niveles. Usar por defecto una instancia compartida por nivel de entorno.

  • ¿Por qué colocar en entornos de preproducción? Una instancia compartida de plataforma de IA de preproducción permite a los equipos reutilizar la infraestructura de IA de Azure en lugar de aprovisionar instancias independientes para cada nuevo caso de uso. Los equipos de cargas de trabajo pueden reutilizar los modelos implementados, la conectividad de red aprobada, las integraciones de datos existentes y las configuraciones de seguridad establecidas. Este enfoque acelera la experimentación y reduce el trabajo repetido de configuración. Es más valioso cuando los equipos empresariales evalúan la viabilidad de nuevos escenarios de inteligencia artificial o validan las soluciones en fase temprana.

  • Cuando no se va a colocar en preproducción. Use una instancia de preproducción dedicada por carga de trabajo cuando una carga de trabajo procesa datos regulados en pruebas o debe reflejar su topología de producción para la validación del rendimiento. Trate ese requisito como una excepción y requiera aprobación explícita antes del aprovisionamiento.

  • Contrapartida: La co-ubicación en preproducción reduce el coste de la capacidad ociosa y mantiene más reducido el inventario de la plataforma. Sin embargo, expone cada carga de trabajo a interferencias causadas por los experimentos de otro equipo. Un trabajo de ajuste fino mal configurado o un proceso de evaluación desbocado puede consumir la cuota compartida y ralentizar el trabajo de otros equipos. Los resultados de las pruebas capturados en una instancia compartida tampoco siempre predicen el comportamiento de producción. Las cargas de trabajo con un rendimiento estricto o las necesidades de validación de cumplimiento requieren un entorno dedicado a pesar del mayor costo.

References