Use essa arquitetura como referência para criar e implantar soluções de IA de conversa seguras e escalonáveis em Azure usando o Foundry, Azure OpenAI e outros serviços relacionados. Ele enfatiza a rede privada, a redundância de zona e os controles de segurança estritos para garantir a conformidade e a preparação da empresa.
Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Este artigo fornece padrões de arquitetura e arquiteturas de referência de linha de base para ajudá-lo a projetar, implantar e controlar cargas de trabalho de IA em Azure. Ele abrange os principais componentes, interações e práticas recomendadas para criar sistemas de IA seguros, escalonáveis e bem controlados.
Use esse padrão de arquitetura como uma linha de base ao projetar cargas de trabalho de IA. Comece com os principais componentes e interações mostrados no padrão e adapte-os para corresponder às suas metas de negócios, restrições técnicas e postura de risco.
Por exemplo, uma organização deseja criar um aplicativo assistente de IA empresarial que permita que os funcionários façam perguntas sobre documentos internos e dados operacionais. Quando um usuário faz uma pergunta, o aplicativo descobre quais dados são necessários, recupera o contexto relevante e chama o modelo certo para gerar uma resposta aterrada. Para isso, é necessário um pipeline de dados para limpar, enriquecer e indexar documentos internos para que o assistente possa recuperar um contexto confiável e atualizado. Assim como em qualquer aplicativo, use as práticas de Well-Architected para manter o aplicativo confiável, seguro e otimizado em termos de custos.
Embora esse assistente de IA represente um cenário de negócios específico, o padrão de arquitetura a seguir é genérico o suficiente para se adaptar a muitos casos de uso de IA com características semelhantes.
Este artigo orienta você por esse padrão genérico que estabelece um conhecimento de linha de base dos componentes principais, suas funções e interações em uma carga de trabalho de IA. Com essa base, você pode tomar decisões de design informadas para criar soluções de IA robustas à medida que personaliza a arquitetura para se ajustar ao seu caso de uso específico.
Arquitetura de carga de trabalho de IA de alto nível
Este diagrama mostra os principais componentes que você pode ter no design da carga de trabalho de IA.
| Componente | Description |
|---|---|
| Processamento e análise de dados | Colete dados brutos de diferentes fontes, limpe-os, transforme-os e organize-os em conjuntos de dados prontos para treinamento de modelo, ajuste fino e aterramento. Essa camada não interage diretamente com os usuários, mas permite interações de IA precisas e eficientes downstream. |
| Treinamento e ajuste fino do modelo | Treine modelos em seus dados, acompanhe versões e monitore o desempenho por meio de um processo repetível. Use as práticas de MLOps para continuar melhorando à medida que novos dados entram e manter o alinhamento com as necessidades do negócio. |
| Aplicativos de IA inteligentes | É aí que os usuários interagem com a IA. Ele combina modelos pré-treinados com a lógica do aplicativo para encontrar as informações certas, criar prompts, criar interfaces e aprender com os comentários. |
| Práticas e processo de IA | Mantenha sua solução de IA confiável incorporando princípios do DevOps, controle de versão e pipelines automatizados em fluxos de trabalho do MLOps. Implante iterativamente com proteções e verifique continuamente a precisão, o desempenho e o viés. |
| Ferramentas e serviços de plataforma | Os principais serviços de nuvem que protegem seus recursos, controlam os custos e monitoram a integridade do sistema do desenvolvimento à implantação. Use pipelines de CI/CD para uma automação confiável e ferramentas especializadas para examinar saídas de IA em busca de conformidade. |
Composição da carga de trabalho
Esta seção descreve duas cargas de trabalho principais: a carga de trabalho de aplicativo inteligente e a carga de trabalho de treinamento e ajuste fino. Cada carga de trabalho tem suas próprias considerações de design para tempo de vida e estado, alcance e dependências, escalabilidade e disponibilidade, além de segurança e IA responsável.
Nem todas as cargas de trabalho de IA exigem componentes de treinamento e ajuste fino. Se você usar apenas modelos pré-treinados sem nenhum treinamento personalizado, concentre-se na carga de trabalho de aplicativo inteligente. No entanto, se o caso de uso envolver a criação de modelos personalizados ou aprimorá-los continuamente com novos dados, a carga de trabalho de treinamento e ajuste fino se tornará essencial. Ambas as cargas de trabalho são modulares, portanto, você pode implementar os componentes relevantes para seu caso de uso específico, seguindo as práticas recomendadas descritas nas considerações de design.
| Característica de projeto | Description |
|---|---|
| Tempo de vida e estado |
O tempo de vida refere-se à duração esperada da existência e da atividade de um recurso dentro da carga de trabalho. O estado refere-se aos dados ou informações que um recurso mantém ao longo do tempo. |
| Alcance e dependências |
O alcance refere-se à extensão em que um recurso precisa ser acessível ou distribuído. As dependências referem-se às relações e à dependência de outros recursos. |
| Escalabilidade e disponibilidade |
A escalabilidade é a capacidade de um recurso lidar com o aumento da carga ou da demanda. A disponibilidade é a capacidade de um recurso permanecer operacional e acessível. |
| Segurança e IA responsável |
A segurança refere-se às medidas que protegem os dados e garantem a conformidade com as regulamentações. A IA responsável refere-se às práticas que garantem a IA ética, incluindo imparcialidade, transparência e responsabilidade. |
Este diagrama mostra os principais componentes da carga de trabalho de aplicativo inteligente a ser incluída em seu design.
| Componente | Description |
|---|---|
| Camada do cliente | A camada de cliente permite que usuários e sistemas externos se conectem à IA. Essa camada usa suas solicitações e retorna respostas geradas por IA, certificando-se de que a experiência seja simples e fácil de usar. |
| Camada de inteligência – API | A API de camada de Inteligência conecta clientes e os recursos de inteligência do sistema por meio de APIs bem definidas. Ele é responsável por direcionar solicitações para o processo de orquestração ou agente correto, certificando-se de que as interações entre usuários e serviços sejam suaves e consistentes. Essa camada também manipula como os dados são acessados, coloca medidas de segurança em vigor e define limites para impedir que o sistema seja sobrecarregado. Se um aplicativo precisar apenas de uma previsão simples, essa camada poderá ignorar as etapas de orquestração complexas e enviar a solicitação diretamente ao mecanismo de inferência para obter uma resposta rápida. |
| Camada de inteligência – orquestração e computação de agente | A camada de computação de orquestração e agente é responsável por coordenar como diferentes componentes de IA funcionam juntos para realizar cada tarefa. Dependendo do necessário, ele pode executar tarefas um após o outro ou permitir que vários agentes trabalhem ao mesmo tempo e mesclar seus resultados. Ele descobre a intenção do usuário, verifica as respostas para garantir que ele esteja seguro, integra-se à camada de conhecimento para obter informações e usa ferramentas para combinar tudo e dar a melhor resposta. |
| Camada de inteligência – gerenciamento de conversa | A camada de gerenciamento de conversas é o gerenciador de memória e conversa do sistema. Ele permite que o chat de IA naturalmente lembre-se de mensagens anteriores, acompanhando tópicos em andamento e armazenando partes importantes da discussão, para que as conversas possam fluir suavemente mesmo durante sessões longas. Ele também cuida de como os dados de conversa são mantidos ou excluídos, garantindo que suas informações sejam tratadas com responsabilidade. |
| Camada de inferência – modelos básicos ou preditivos | A camada de inferência é onde um modelo treinado faz previsões, gera conteúdo ou fornece decisões com base nas informações recebidas. O processo começa carregando seu modelo de IA, preparando os dados, executando as previsões e formatando os resultados para que eles estejam disponíveis imediatamente (em tempo real) ou posterior (processamento em lote). |
| Camada de conhecimento | A camada de conhecimento é onde o sistema obtém as informações e o contexto necessários para responder às perguntas com precisão. Ele garante que os dados sejam acessados com segurança, usando permissões e autorização. A camada de conhecimento ajuda a IA a seguir a abordagem RAG pesquisando por meio de índices ou bancos de dados de vetor para encontrar exatamente o conteúdo certo. Ele permite que a IA acesse várias fontes de dados internas e externas de forma consistente, seja por meio de protocolos MCP ou REST. |
| Camada de ferramentas | A camada de ferramentas é onde as ações comerciais e os recursos externos são disponibilizados. A camada de inteligência pode disparar essas ações ou se conectar a outros sistemas chamando ferramentas ou agentes de maneira padronizada, seja por meio de MCP, A2A ou OpenAPI/REST. Esses recursos são apresentados como opções acionáveis, prontos para uso da camada de inteligência e podem ser tratados diretamente pela carga de trabalho ou por serviços externos. |
Considerações sobre o design
Ao projetar sua arquitetura de carga de trabalho de aplicativo inteligente, considere as seguintes características de design para tomar decisões informadas sobre design e interações de componentes.
Tempo de vida e estado
A API de Inteligência, a orquestração, a inferência e as camadas de conhecimento são todos serviços de longa duração executados durante o tempo de vida da carga de trabalho. Invista em disponibilidade, monitoramento e excelência operacional para cada serviço.
Cada camada evolui em um ritmo diferente, portanto, você precisa de coordenação de implantação deliberada. A API de Inteligência evolui lentamente para se manter estável e manter a compatibilidade com versões anteriores. As camadas de orquestração e agente evoluem mais rapidamente à medida que você adiciona novos recursos. A camada de inferência é atualizada quando você implanta novos modelos. A camada de conhecimento evolui continuamente conforme os dados são alterados.
Componentes sem estado podem ser alocados ou desalocados sob demanda, enquanto componentes com estado gerenciam dados que persistem entre interações.
A API de Inteligência, as camadas de orquestração e inferência são sem estado (stateless), o que facilita sua escalabilidade por meio da adição de mais instâncias. A camada de orquestração pode conter o estado efêmero durante a execução, mas não o mantém após o tratamento da solicitação. O estado efêmero reduz a complexidade operacional, mas limita as opções de recuperação de falhas; portanto, é importante projetar cuidadosamente para repetições e idempotência.
Os dados da sessão de gerenciamento de conversa podem durar de minutos a dias. Sessões mais longas permitem conversas mais avançadas, mas custam mais e aumentam o risco de privacidade. A camada de conhecimento armazena dados em índices e bancos de dados que evoluem conforme você adiciona, atualiza ou remove informações.
Compensação. As decisões de gerenciamento de tempo de vida e de estado afetam diretamente o custo, a confiabilidade e o desempenho. Componentes com estado de longo prazo exigem maior investimento em dimensionamento e resiliência, enquanto componentes efêmeros sem estado são mais econômicos, mas podem introduzir latência de inicializações a frio ou recuperação do estado externo.
Alcance e dependências
A API de Inteligência é o único ponto de extremidade exposto publicamente na arquitetura, todo o resto permanece interno. Você pode implantá-lo em várias regiões para manter os usuários próximos a um ponto de extremidade e melhorar a resiliência.
A camada de orquestração fica no centro, opera dentro de sua rede e coordena tudo, como estado da conversa, chamadas de modelo, recuperação de conhecimento e invocação de ferramentas. As falhas aqui bloqueiam todo o sistema, portanto, tornam-no altamente disponível.
A camada de inferência é executada internamente sem dependências externas. Implante-o perto do orquestrador para manter a latência baixa.
As camadas de conhecimento e ferramentas são internas, mas podem depender de sistemas externos. Essas dependências externas podem introduzir atrasos ou problemas de disponibilidade que afetam a qualidade da resposta.
Compensação. A implantação de várias regiões melhora o desempenho e a resiliência, mas aumenta o custo. A implantação de região única é mais econômica, mas pode resultar em maior latência para usuários distantes da região.
Escalabilidade e disponibilidade
Seu aplicativo inteligente tem dois padrões de dimensionamento. Camadas sem estado, como a API, a orquestração e a inferência, escalam ao adicionar mais instâncias. Camadas de dados, como gerenciamento de conversas e escalabilidade do conhecimento, são escaladas distribuindo os dados em vários repositórios por meio de mecanismos como réplicas de leitura, particionamento e fragmentação.
A API de Inteligência é expandida para lidar com mais solicitações. Implante-o em várias zonas ou regiões para melhor disponibilidade e para manter os usuários próximos a um ponto de extremidade.
A computação de orquestração e dos agentes situa-se no centro do seu sistema, portanto, falhas nesse ponto podem bloquear todo o funcionamento. Adicione mais instâncias, use o balanceamento de carga e tenha o failover pronto para que o sistema continue em execução quando as instâncias individuais falharem.
A camada de inferência é dimensionada com base no que seus modelos precisam. Adicione mais instâncias com GPUs à medida que a demanda aumenta. Use IaC (infraestrutura como código) para recriar rapidamente ambientes durante a recuperação.
O gerenciamento de conversas é dimensionado com o número de usuários simultâneos. Use cópias e backups para manter os dados de sessão disponíveis.
A camada de conhecimento é dimensionada com base na quantidade de dados que você tem e com que frequência ela é consultada. Use a indexação eficiente e o ajuste de banco de dados para manter as respostas rápidas. Configure cópias em vários locais para disponibilidade.
Compensação. Componentes sem estado podem ser dimensionados rapidamente, mas podem apresentar latência de inicialização a frio. Os componentes de dados fornecem durabilidade, mas exigem mais planejamento para dimensionamento. Balancee esses fatores com base nos requisitos de carga e negócios esperados.
Segurança e IA responsável
Cada camada em seu aplicativo inteligente traz riscos diferentes e precisa de seus próprios controles. Ferramentas podem desencadear ações no mundo real, o conhecimento molda o que sua IA sabe, e a inferência produz resultados que os usuários veem. Restrinja o acesso em cada camada, monitore o que está acontecendo e explique como as decisões são tomadas.
A camada de ferramentas traz o maior risco porque as ações podem ter consequências do mundo real que são potencialmente irreversíveis. Para operações de alto risco, adicione etapas de aprovação humana. Use autenticação estrita, acesso com menos privilégios e a imposição de privacidade de dados para evitar ações não autorizadas e exposição de PII. Avalie cada ferramenta antes de integrá-la para que a governança se estenda além do limite de carga de trabalho.
A camada de conhecimento precisa de dados imparciales e de alta qualidade para produzir saídas confiáveis. Mantenha o acesso a dados seguro com autenticação, autorização e conformidade adequadas com os requisitos de residência de dados. O acesso somente leitura e o isolamento de rede impedem a corrupção. Registre quais fontes foram recuperadas para cada resposta por meio de trilhas de auditoria, esse processo permite que você explique as decisões e investigue os problemas posteriormente.
A camada de inferência só deve ser acessível às funções de operações e à identidade da camada de orquestração. Monitore as saídas por meio de um serviço de validação que verifica se há toxicidade e outros problemas de segurança. Valide os modelos antes da implantação para capturar o viés e mantenha os mecanismos de reversão prontos se os problemas aparecerem na produção.
Arquiteturas de linha de base para cargas de trabalho de IA
Esses exemplos de linha de base servem como a arquitetura recomendada para cargas de trabalho de IA.
-
Arquitetura de referência de chat Baseline do Microsoft Foundry
-
Arquitetura de referência de chat do Microsoft Foundry em uma zona de destino do Azure
Essa arquitetura se baseia no design do Microsoft Foundry Chat e a coloca em uma zona de destino Azure segura. Ele reúne os principais componentes — Serviço do Agente do Foundry, Azure OpenAI e Serviço de Aplicativo — dentro de um ambiente privado isolado por rede. Todos os serviços se conectam por meio de pontos de extremidade privados e são protegidos por Firewall do Azure, com redundância de zona para alta disponibilidade.
-
Análise de ponta a ponta com Microsoft Fabric
Use essa arquitetura como referência ao criar uma plataforma de dados unificada que simplifica o ciclo de vida de análise completa.
Próxima etapa
Examine as práticas recomendadas para criar cenários de aplicativos inteligentes.