Visão geral da implantação para modelos do Microsoft Foundry

O Microsoft Foundry Models é o hub para descobrir e implantar uma ampla gama de modelos de IA para aplicativos de IA generativos. Para disponibilizar um modelo para solicitações de inferência, implante-o. A Foundry oferece duas opções de implantação, dependendo do tipo de modelo e de suas necessidades de infraestrutura.

Gorjeta

Nem sempre é necessário criar uma implantação. Com o acesso instantâneo (versão prévia), você chama os modelos compatíveis pelo nome e começa a executar a inferência imediatamente — nenhuma implantação é necessária.

Opções de implantação

A Foundry fornece duas opções de implantação:

  • API sem servidor – Para Modelos de Fundação, incluindo Modelos de Fundação vendidos por Azure e selecionar Modelos de parceiros e comunidade. Essa opção é o caminho de implantação preferencial e mais capaz. Ele inclui os tipos de implantação padrão, de taxa de transferência provisionada, em lote e de desenvolvedor.
  • Computação gerenciada (versão prévia) – para modelos de software livre, parceiro e personalizados que são executados na capacidade de GPU dedicada que o Foundry gerencia para você.

A Foundry seleciona a opção de implantação apropriada com base no modelo escolhido.

Se você precisar experimentar apenas um modelo com suporte, ignore totalmente a implantação e use o acesso instantâneo (versão prévia), que chama modelos por nome sem criar uma API sem servidor ou implantação de computação gerenciada.

Diagrama que mostra a escolha entre acesso instantâneo, tipos de implantação de API sem servidor por ordem de inicialização e computação gerenciada.

Para obter uma comparação completa de funcionalidades, consulte a comparação de opções de implantação.

API sem servidor

A API sem servidor é a opção de implantação preferencial no Foundry. Ele dá suporte à maior variedade de recursos e tipos de implantação.

Quais modelos usam implantações de API sem servidor?

Todos os Modelos do Foundry, incluindo Modelos do Foundry vendidos pelo Azure e modelos selecionados de parceiros e da comunidade, usam implantações de API sem servidor. Os Foundry Models oferecidos pelo Azure incluem todos os modelos do Azure OpenAI e modelos selecionados dos principais provedores, que são faturados por meio da sua assinatura do Azure, cobertos pelos contratos de nível de serviço do Azure e contam com suporte da Microsoft. Modelos de parceiros e comunidade que usam implantações de API sem servidor incluem modelos Anthropic e modelos específicos de parceiros como Mistral, Cohere e Meta.

Recursos de API sem servidor

Suporte a implantações de API sem servidor:

  • Vários tipos de implantação (ou SKUs de implantação) — Global Standard, Data Zone Standard, Standard (região única), provisionada, em lote e muito mais. Cada tipo controla onde os dados são processados e como você paga. Para obter detalhes, consulte Os tipos de implantação para modelos do Microsoft Foundry.
  • Flexibilidade de processamento de dados – escolha regional, zona de dados (EUA, UE ou APAC) ou processamento global com base em seus requisitos de conformidade.
  • Filtragem de conteúdo – Filtros internos de Segurança de Conteúdo de IA do Azure com configurações personalizáveis.
  • Autenticação sem chave — ID do Microsoft Entra (recomendada) e autenticação baseada em chave.
  • Rede privada – Integração de rede virtual para acesso seguro.
  • Taxa de transferência provisionada – Reserve capacidade com PTUs (unidades de taxa de transferência) provisionadas para desempenho previsível e de baixa latência. Para obter detalhes, consulte Taxa de transferência provisionada.

Requisitos de recursos

As implantações de API sem servidor estão disponíveis em:

  • Foundry resources – o tipo de recurso primário para novos projetos de Foundry. Nenhum Hub de IA necessário.
  • Recursos do Azure OpenAI — se você usar recursos do Azure OpenAI, o catálogo de modelos mostrará apenas modelos do Azure OpenAI para implantação. Atualize para um recurso do Foundry para acesso ao conjunto completo de Modelos do Foundry.

Para começar a usar a implantação de API sem servidor, consulte Implantar modelos de Microsoft foundry no portal da Foundry ou implantar modelos usando CLI do Azure e Bicep.

Implantação de computação gerenciada (versão prévia)

Note

A computação gerenciada na Foundry está atualmente em versão prévia pública. Essa versão prévia é fornecida sem um contrato de nível de serviço e não recomendamos isso para cargas de trabalho de produção. Alguns recursos podem não ter suporte ou podem ter restrição de recursos. Para obter mais informações, consulte Termos de Uso Complementares para Versões Prévias do Microsoft Azure.

A computação gerenciada no Foundry (versão prévia) é uma PaaS (plataforma como serviço) de GPU gerenciada que hospeda modelos de software livre e de peso personalizado na capacidade de GPU dedicada. Você acessa implantações de computação gerenciada por meio do mesmo ponto de extremidade do projeto Foundry usado por outros tipos de implantação, sem precisar gerenciar máquinas virtuais, clusters ou ambientes de execução de serviço. Foundry dimensiona a implantação, provisiona os aceleradores e mantém o ambiente de execução atualizado com patches.

Importante

A computação gerenciada dá suporte a modelos de software livre, parceiro, setor e personalizados. As implantações de computação gerenciada são disponibilizadas no endpoint unificado de projeto do Foundry, usando a mesma autenticação, rede e interface do SDK.

Quais modelos usam computação gerenciada?

Você pode implantar modelos da coleção Hugging Face usando recursos computacionais gerenciados. Os exemplos incluem:

  • Modelos Qwen
  • Modelos NVIDIA Nemotron
  • Modelos meta selecionados
  • Modelos mistral selecionados

O catálogo do Microsoft Foundry inclui uma ampla e crescente seleção de modelos de código aberto e de parceiros. Para o catálogo atual, consulte o catálogo de modelos.

Recursos de computação gerenciada

A computação gerenciada (versão prévia) dá suporte a:

  • Ponto de extremidade e autenticação do Foundry unificado — use o mesmo ponto de extremidade do projeto, chaves de API, Microsoft Entra ID e rede privada que as implantações de pagamento por token e de taxa de transferência provisionada. As rotas de inferência usam <endpoint>/managed-deployments/<deployment-name>/. Runtimes compatíveis com conclusões de chat também funcionam com a rota padrão /openai/v1/ usando o SDK da OpenAI.
  • Dimensionamento por instância de modelo — As implantações são dimensionadas com base no modelo. Você não precisa escolher SKUs de máquina virtual, pois o Foundry escolhe GPUs por instância com base no tamanho do modelo, arquitetura, comprimento do contexto e se a carga de trabalho é otimizada para latência ou taxa de transferência.
  • Runtimes de inferência otimizados — contêineres vLLM, SGLang e NVIDIA NIM selecionados pela Microsoft, com lote contínuo e paralelismo de tensores.
  • Famílias de aceleradores — A100 (80 GB), H100 (80 GB) e MI300X (192 GB).
  • Escalonamento automático e redução para zero — Escale automaticamente com base no tráfego em tempo real ou escale manualmente. Configure um tempo limite de inatividade para que a implantação seja reduzida a zero quando não houver tráfego, fazendo a cobrança parar imediatamente.
  • Runtimes gerenciados pela Microsoft — A Microsoft é responsável pelos runtimes de execução, pelas imagens base de contêiner e pelos patches de segurança. As atualizações são aplicadas automaticamente às implantações ativas.
  • Métricas de observabilidade — cada implantação emite a contagem de chamadas à API por código de status e percentis de tempo de resposta. Os modelos de conclusão de chat também emitem a contagem de tokens de entrada e de saída, percentis de TTFT (tempo até o primeiro token) e percentis do tempo total de resposta, agrupados por tempo.

Cobrança e cota

O faturamento de computação gerenciada é feito por hora, por SKU de acelerador, tendo a capacidade de processamento por GPU como unidade base de faturamento. O dimensionamento automático e a redução para zero alinham os custos ao tráfego real, de modo que a cobrança cesse imediatamente quando as instâncias são reduzidas.

A cota é concedida por SKU de acelerador, por região, por meio do processo de cota do Foundry e é separada da cota de VM do Azure. As máquinas virtuais do Azure são uma oferta de IaaS (infraestrutura como serviço) com SKUs regionais; a computação gerenciada é uma oferta de PaaS que leva ao processamento global e de zona de dados. A cota de VM Azure existente não pode ser aplicada a uma implantação de computação gerenciada.

Atualmente, a computação gerenciada está disponível para implantação global. Para obter estimativas de taxa, consulte a calculadora de preços Azure.

Introdução

Para começar a usar a implantação de computação gerenciada, consulte Implantar modelos de software livre com computação gerenciada.

Comparação de opção de implantação

Use a API sem servidor sempre que possível. A tabela a seguir compara os recursos entre as duas opções de implantação:

Note

O acesso instantâneo (versão prévia) não é uma opção de implantação nesta comparação. Ele chama modelos com suporte por nome sem criar uma API sem servidor ou implantação de computação gerenciada.

Capacidade API sem servidor Computação gerenciada
Quais modelos podem ser implantados? Todos os Modelos do Foundry, incluindo Modelos do Foundry vendidos pelo Azure e modelos selecionados de parceiros e da comunidade Modelos de código aberto e de parceiros do catálogo de modelos, NVIDIA NIM e modelos do setor
Recurso de implantação Recurso do Foundry Projeto de fundição
Requer o Hub de IA No No
Opções de processamento de dados Regional, zona de dados, global Global
Rede privada Sim Sim
Filtragem de conteúdo Integrado e personalizável Não disponível em versão prévia pública
Autenticação sem chave Sim (Microsoft Entra ID e baseado em chave) Sim (Microsoft Entra ID e baseado em chave)
Billing Uso de tokens ou unidades de taxa de transferência provisionadas Por hora por SKU de acelerador

Gorjeta

Para obter informações detalhadas sobre preços, consulte Plane e gerencie os custos para Microsoft Foundry.