Orientações sobre decisões de compartilhamento da plataforma de IA

Uma plataforma de IA é onde sua organização executa e opera modelos de IA. Ele fornece o perímetro de rede, o modelo de identidade, o plano de dados e a alocação de cotas que envolvem seus modelos, implantações, índices, avaliações e ativos relacionados. Microsoft Foundry e Azure Machine Learning são duas plataformas de IA Azure. Cada implantação de qualquer serviço cria uma nova instância.

Sua organização deve decidir como colocar ambientes de carga de trabalho de IA em instâncias da plataforma de IA. Você pode isolar cada ambiente, como desenvolvimento, teste ou produção, em sua própria instância da plataforma. Você também pode permitir que várias cargas de trabalho ou ambientes compartilhem a mesma instância. Essa decisão, geralmente chamada de colocação, afeta o raio de explosão de problemas operacionais ou de segurança. Também afeta os limites de conformidade e o custo da plataforma.

Recomendação: Estabeleça uma política de toda a organização que define requisitos de isolamento padrão, limites de compartilhamento aprovados, critérios de exceção e expectativas separadas para ambientes de plataforma de IA de produção e pré-produção.

Diretrizes de decisão:

1. Definir limites de compartilhamento da plataforma de IA

Cada organização precisa de limites nos quais as cargas de trabalho nunca devem compartilhar uma instância da plataforma de IA. Esse limite se aplica em todos os ambientes, incluindo ambientes de produção e pré-produção. Cargas de trabalho dentro do mesmo limite podem potencialmente compartilhar uma instância de plataforma. Cargas de trabalho em limites diferentes não podem.

  • Por que desenhar limites de compartilhamento? Sem compartilhar limites, as equipes de carga de trabalho usam como padrão qualquer padrão conveniente no momento e a plataforma de IA acumula requisitos conflitantes ao longo do tempo. Ao longo do tempo, ele cria modelos de propriedade inconsistentes, requisitos de conformidade conflitantes, alocação de custos pouco claras e risco operacional compartilhado entre cargas de trabalho não relacionadas. Por exemplo, áreas de negócios não relacionadas podem compartilhar cota na mesma instância de plataforma para reduzir o custo. O resultado é uma plataforma de IA com limites de governança inconsistentes que se tornam difíceis de entender e auditar.

  • Limites comuns. Escolha um modelo de limite que se alinhe à forma como sua organização já atribui responsabilidade e rege as decisões de tecnologia. Os modelos comuns incluem:

    • A delimitação da unidade de negócios otimiza a responsabilidade operacional e o financiamento comuns

    • A fronteira de domínio de dados é otimizada para atender a requisitos comuns de conformidade e tratamento de dados

    • Um limite do proprietário do produto otimiza para um ciclo de vida de engenharia comum e operações de plataforma

    Dentro desse limite, as equipes ainda podem escolher instâncias de plataforma dedicadas quando o isolamento se justifica. Fora do limite, o compartilhamento não é permitido.

  • Encontre o que funciona melhor. Nenhum modelo único está universalmente correto. A consistência importa mais do que o modelo selecionado, pois um modelo de limite claramente imposto mantém a governança compreensível à medida que a plataforma de IA cresce.

2. Definir uma política de compartilhamento de plataforma de IA de produção

O compartilhamento de plataforma de IA em produção é a prática de executar mais de um ambiente de produção para cargas de trabalho de IA no mesmo recurso do Microsoft Foundry ou espaço de trabalho do Azure Machine Learning. Em Azure, a instância da plataforma de IA define o limite de rede, o limite de identidade e o limite de cota para os ambientes de carga de trabalho que a usam. Por esse motivo, as organizações devem definir uma política específica para o compartilhamento da plataforma de IA de produção.

2.1 Adote por padrão uma única instância da plataforma de IA por carga de trabalho de produção

Os ambientes de IA de produção devem usar como padrão o isolamento do ambiente de produção. Não coloque várias cargas de trabalho de produção no mesmo recurso do Microsoft Foundry nem no mesmo espaço de trabalho do Azure Machine Learning, a menos que exista uma exceção documentada. Uma instância de plataforma de IA dedicada para cada ambiente de carga de trabalho de produção deve ser a abordagem padrão. Trate o compartilhamento de plataforma de IA como uma exceção, não uma prática padrão.

  • Por que optar pelo isolamento por padrão? As plataformas de IA compartilhadas também criam riscos operacionais compartilhados. Um problema de segurança, configuração incorreta, interrupção de serviço ou evento de esgotamento de cota pode afetar todos os ambientes de carga de trabalho colocados. O isolamento também reduz o risco de exposição acidental de acesso entre cargas de trabalho e impede que uma carga de trabalho consuma a capacidade ou a cota de GPU necessária para outra carga de trabalho. Os ambientes de produção geralmente têm o maior impacto nos negócios e exposição regulatória. A maioria das organizações exige limites claros de propriedade e forte isolamento operacional para esses ambientes.

  • Trade-off: O isolamento aumenta o custo e a sobrecarga de gerenciamento. Cada instância de plataforma carrega sua própria sobrecarga operacional para rede, identidade, monitoramento e operações. As organizações devem equilibrar esses custos em relação aos benefícios operacionais e de segurança da contenção mais forte.

2.2 Permitir colocação de produção por meio de uma exceção documentada

O colocation reduz a sobrecarga e consolida as operações da plataforma. Por exemplo, se os casos de uso compartilharem as mesmas fontes de dados como entrada, a colocalização evita a necessidade de configurar conectividade e autenticação entre a plataforma de IA e esses recursos para cada caso de uso. Compromisso: compartilhar instâncias da plataforma de IA em produção também combina o raio de impacto, a fronteira de identidade e o conjunto de cotas de todas as cargas de trabalho que compartilham a instância.

  • Características para colocalização: Permita que cargas de trabalho de produção compartilhem instâncias do Microsoft Foundry ou do Azure Machine Learning somente quando cada uma das seguintes condições for atendida:

    • Todas as cargas de trabalho colocadas compartilham o mesmo escopo regulatório, classificação de dados, requisitos de residência e padrões de manipulação de dados.

    • Todas as cargas de trabalho operam dentro do mesmo limite de rede, mesmo namespace DNS e o mesmo limite de identidade.

    • A organização aceita o risco compartilhado de interrupção e o risco compartilhado de esgotamento de cota que a colocation introduz.

    • O custo ou a sobrecarga operacional de instâncias separadas supera materialmente o benefício de isolamento. A pressão de custo por si só não é justificativa suficiente.

    • A equipe aceita que dividir cargas de trabalho separadas mais tarde é caro. O estado da plataforma de IA não é transferido de forma limpa entre instâncias e geralmente requer recriação ou reconfiguração.

  • Troca: Cada instância de plataforma de IA compartilhada requer um proprietário de plataforma claramente identificado responsável pelo gerenciamento de cotas, configuração de rede, revisões de acesso, operações de ciclo de vida e coordenação de incidentes.

2.3 Casos de uso de produção de segmento na instância da plataforma de IA

Se uma instância de plataforma é isolada ou colocada, use recursos de segmentação no produto para isolar casos de uso. Trate cada caso de uso distinto, como experiências de usuário totalmente distintas em uma única carga de trabalho, como sua própria implantação lógica dentro da instância da plataforma. Por exemplo:

  • No Microsoft Foundry, provisione um project por caso de uso dentro do recurso Foundry.

  • No Azure Machine Learning, use um workspace de hub junto com workspaces de projeto para segmentar casos de uso.

Esses constructos dão a cada caso de uso seus próprios ativos e atribuições de função. Eles compartilham um conjunto comum de componentes de infraestrutura para segurança e conectividade. Você não precisa provisionar uma nova instância para cada cenário.

  • Quando a colocação for permitida pelo processo de exceção, transforme essa separação no produto de uma recomendação em um requisito obrigatório de política.

  • Se uma carga de trabalho exigir uma segmentação complexa em vários projetos do Foundry ou Azure Machine Learning workspaces, reavalie se o modelo de compartilhamento atual ainda fornece simplicidade e isolamento operacionais aceitáveis.

Para obter informações sobre os conceitos que fundamentam essas decisões, consulte recursos do Microsoft Foundry e espaços de trabalho do Azure Machine Learning.

3. Definir uma política de compartilhamento de plataforma de IA de pré-produção

Os ambientes de pré-produção invertem o padrão da produção. Os ambientes de pré-produção incluem desenvolvimento, teste e estágio. Esses ambientes dão suporte à experimentação e à validação de pré-lançamento. Instâncias dedicadas de recursos da plataforma de IA raramente justificam seu custo nesses níveis. Usar por padrão uma instância compartilhada por nível de ambiente.

  • Por que colocar em ambientes de pré-produção? Uma instância de plataforma de IA de pré-produção compartilhada permite que as equipes reutilizem Azure infraestrutura de IA em vez de provisionar instâncias separadas para cada novo caso de uso. As equipes de carga de trabalho podem reutilizar modelos implantados, conectividade de rede aprovada, integrações de dados existentes e configurações de segurança estabelecidas. Essa abordagem acelera a experimentação e reduz o trabalho de instalação repetido. É mais valioso quando as equipes de negócios estão avaliando a viabilidade de novos cenários de IA ou validando soluções em estágio inicial.

  • Quando não colocar na pré-produção. Use uma instância de pré-produção dedicada por carga de trabalho quando uma carga de trabalho processa dados regulamentados no teste ou deve espelhar sua topologia de produção para validação de desempenho. Trate esse requisito como uma exceção e exija aprovação explícita antes do provisionamento.

  • Trade-off: A colocation de pré-produção reduz o custo da capacidade ociosa e mantém menor o inventário da plataforma. No entanto, ele expõe todas as cargas de trabalho à interferência causada pelos experimentos de outra equipe. Uma tarefa de ajuste fino mal configurada ou uma execução de avaliação fora de controle pode consumir a cota compartilhada e atrasar outras equipes. Os resultados do teste capturados em uma instância compartilhada também nem sempre preveem o comportamento de produção. Cargas de trabalho com estrito desempenho ou necessidades de validação de conformidade exigem um ambiente dedicado, apesar do custo mais alto.

References