Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
O Microsoft Foundry Models é o centro para descobrir e implementar uma vasta gama de modelos de IA para aplicações de IA generativa. Para disponibilizar um modelo para pedidos de inferência, implementa-o. A Foundry oferece duas opções de implementação, dependendo do tipo de modelo e das suas necessidades de infraestrutura.
Dica
Nem sempre é preciso criar uma implantação. Com acesso instantâneo (pré-visualização), chama os modelos suportados pelo respetivo nome e começa imediatamente a executar inferências — sem necessidade de implantação.
Opções de implantação
A Foundry oferece duas opções de implementação:
- API serverless — Para Modelos Foundry, incluindo modelos Foundry vendidos pelo Azure e modelos selecionados de parceiros e comunidade. Esta opção é o caminho de implementação preferido e mais capaz. Inclui os tipos de implementação standard, de débito aprovisionado, em lote e para programadores.
- Computação gerida (pré-visualização) — Para modelos open-source, parceiros e personalizados que correm com capacidade dedicada de GPU que a Foundry gere por si.
O Foundry seleciona a opção de implementação apropriada com base no modelo que escolher.
Se só precisares de experimentar um modelo suportado, podes saltar completamente a implementação e usar acesso instantâneo (pré-visualização), que chama os modelos pelo nome sem criar uma API serverless ou uma implementação de computação gerida.
Para uma comparação completa de capacidades, veja Comparação de opções de implantação.
Serverless API
A API serverless é a opção de implementação preferida no Foundry. Suporta a mais ampla gama de capacidades e tipos de implementação.
Que modelos utilizam implementações de APIs serverless?
Todos os Modelos Foundry, incluindo os Modelos Foundry vendidos pela Azure e modelos selecionados de parceiros e comunidade, utilizam implementações de APIs serverless. Os Modelos Foundry vendidos pela Azure incluem todos os modelos OpenAI da Azure e modelos selecionados dos principais fornecedores que são faturados através da sua subscrição Azure, cobertos por acordos de nível de serviço Azure e suportados pela Microsoft. Modelos de parceiros e da comunidade que utilizam implementações de APIs serverless incluem modelos Anthropic e modelos específicos de parceiros como Mistral, Cohere e Meta.
Capacidades de API sem servidor
Suporte para implementações de APIs serverless:
- Múltiplos tipos de implementação (ou SKUs de implantação) — Global Standard, Data Zone Standard, Standard (região única), provisionado, lote e mais. Cada tipo controla onde os dados são processados e como você paga. Para mais detalhes, consulte Tipos de implantação para Modelos de Fundição da Microsoft.
- Flexibilidade no processamento de dados — Escolha processamento regional, zona de dados (EUA, UE ou APAC) ou global com base nos seus requisitos de conformidade.
- Filtragem de conteúdo — Filtros de Segurança de conteúdo de IA do Azure incorporados com configurações personalizáveis.
- Autenticação sem chave — autenticação Microsoft Entra ID (recomendada) e baseada em chaves.
- Rede privada — Integração de rede virtual para acesso seguro.
- Capacidade de processamento aprovisionada — Reserve capacidade com unidades de capacidade aprovisionada (PTUs) para um desempenho previsível e de baixa latência. Para mais detalhes, consulte Débito provisionado.
Requisitos de recursos
Implementações de APIs serverless estão disponíveis em:
- Recursos de fundição — O tipo principal de recurso para novos projetos de fundição. Não é necessário AI Hub.
- Azure recursos OpenAI — Se usar Azure recursos OpenAI, o catálogo de modelos mostra apenas Azure modelos OpenAI para implementação. Atualize para um recurso da Foundry para aceder ao conjunto completo de Modelos da Foundry.
Para começar com a implementação de APIs serverless, consulte Deploy Microsoft Foundry Models no portal Foundry ou Deploy models usando CLI do Azure e Bicep.
Implementação de computação gerida (pré-visualização)
Note
A computação gerida no Foundry está atualmente em pré-visualização pública. Esta pré-visualização é fornecida sem um acordo de nível de serviço, e não a recomendamos para trabalhos em produção. Certas funcionalidades podem não ser suportadas ou podem ter capacidades limitadas. Para mais informações, consulte Termos Suplementares de Utilização para Microsoft Azure Previews.
A computação gerida no Foundry (pré-visualização) é uma plataforma gerida de GPU como serviço (PaaS) que aloja modelos de código aberto e modelos com ponderações personalizadas em capacidade de GPU dedicada. Pode aceder a implementações de computação geridas através do mesmo ponto final do projeto Foundry utilizado para outros tipos de implementação, sem máquinas virtuais, clusters ou ambientes de execução de serviço para gerir. Foundry dimensiona a implantação, aprovisiona os aceleradores e mantém o ambiente de execução com os patches aplicados.
Importante
A computação gerida suporta modelos open-source, parceiros, industriais e personalizados. As implementações de computação gerida são servidas no endpoint unificado do projeto Foundry, usando a mesma autenticação, rede e superfície SDK.
Que modelos utilizam computação gerida?
Pode implementar modelos da Hugging Face Collection usando computação gerida. Os exemplos incluem:
- Modelos Qwen
- Modelos NVIDIA Nemotron
- Modelos Meta selecionados
- Modelos Mistral selecionados
O catálogo da Microsoft Foundry inclui uma seleção grande e crescente de modelos open-source e de parceiros. Para o catálogo atual, consulte o catálogo de modelos.
Capacidades de computação gerida
Computação gerida (Preview) suporta:
-
Ponto final e autenticação do Unified Foundry — Utilize o mesmo ponto final do projeto, as mesmas chaves de API, o Microsoft Entra ID e a mesma rede privada que nas implementações pay-per-token e de débito aprovisionado. As rotas de inferência utilizam
<endpoint>/managed-deployments/<deployment-name>/. Runtimes compatíveis com completações de chat também funcionam na rota padrão/openai/v1/com o SDK OpenAI. - Dimensionamento modelo-instância — As implementações são dimensionadas em termos centrados no modelo. Não precisas de escolher SKUs de máquinas virtuais, porque o Foundry escolhe as GPUs por instância com base no tamanho do modelo, arquitetura, comprimento do contexto e se a carga de trabalho está otimizada para latência ou rendimento.
- Ambientes de execução de inferência otimizados — contentores vLLM, SGLang e NVIDIA NIM selecionados pela Microsoft, com processamento contínuo em lotes e paralelismo tensorial.
- Famílias de aceleradores — A100 (80 GB), H100 (80 GB) e MI300X (192 GB).
- Escalabilidade automática e escala até zero — Escalar automaticamente a partir do tráfego em tempo real ou escalar manualmente. Configure um limite de inatividade para que a implantação escale para zero quando não houver tráfego, fazendo com que a faturação cesse imediatamente.
- Ambientes de execução geridos pela Microsoft — a Microsoft é responsável pelos ambientes de execução de disponibilização, pelas imagens de contentor de base e pelas correções de segurança. As atualizações são aplicadas automaticamente às implementações em direto.
- Métricas de observabilidade — Cada implementação emite a contagem de chamadas da API por código de estado e percentis de tempo de resposta. Os modelos de conclusão de chat também emitem contagens de tokens de entrada e de saída, percentis do tempo até ao primeiro token (TTFT) e percentis do tempo total de resposta, agrupados temporalmente.
Faturação e quota
A faturação da computação gerida é feita à hora, por SKU de acelerador, sendo a capacidade de processamento por GPU a unidade de faturação subjacente. O escalonamento automático e o escalonamento até zero alinham os custos com o tráfego real, fazendo com que a faturação cesse imediatamente quando o número de instâncias é reduzido.
A atribuição de quota é concedida por SKU de acelerador, por região, através do processo de quota do Foundry e é separada da quota de VM do Azure. As máquinas virtuais do Azure são uma oferta de infraestrutura como um serviço (IaaS) com SKUs regionais; a computação gerida é uma oferta de plataforma como um serviço (PaaS) que privilegia o processamento Global e de Zona de Dados. A quota existente de VM do Azure não pode ser aplicada a uma implementação de computação gerida.
A computação gerida está atualmente disponível para implementação global. Para estimativas de taxas, consulte a calculadora de preços Azure.
Introdução
Para começar com a implementação de computação gerida, veja Implementar modelos open-source com computação gerida.
Comparação de opções de implantação
Use a API Serverless sempre que possível. A tabela seguinte compara capacidades entre as duas opções de implementação:
Note
O acesso instantâneo (pré-visualização) não é uma opção de implementação nesta comparação. Permite chamar modelos suportados pelo respetivo nome sem criar uma API Serverless nem uma implementação de computação gerida.
| Capacidade | Serverless API | Computação gerida |
|---|---|---|
| Que modelos podem ser implementados? | Todos os modelos do Foundry, incluindo modelos do Foundry vendidos pelo Azure e determinados modelos de parceiros e da comunidade | Modelos de código aberto e modelos de parceiros do catálogo de modelos, NVIDIA NIM e modelos da indústria |
| Recursos de implantação | Recurso da fundição | Projeto de fundição |
| Requer um Hub de IA | Não | Não |
| Opções de processamento de dados | Regional, zona de dados, global | Global |
| Redes privadas | Sim | Sim |
| Filtragem de conteúdos | Incorporado e personalizável | Não disponível em pré-visualização pública |
| Autenticação sem chave | Sim (Microsoft Entra ID e baseado em teclas) | Sim (Microsoft Entra ID e baseado em teclas) |
| Faturamento | Utilização de tokens ou unidades de rendimento provisionadas | Por hora, por SKU do acelerador |
Dica
Para informações detalhadas sobre preços, consulte Planear e gerir custos para Microsoft Foundry.
Conteúdo relacionado
- Tipos de implantação para modelos Microsoft Foundry
- Implementar os Modelos Foundry da Microsoft no portal Foundry
- Implantar modelos usando CLI do Azure e Bicep
- Foundry Models comercializados pela Azure
- Modelos de Fundição de parceiros e comunidade
- Microsoft Visão geral dos Modelos de Foundry
- Computação gerida na Microsoft Foundry