Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Exibição no momento:Nova versão - Alternar para a versão do portal clássico do Foundry
A capacidade de processamento provisionada é um tipo de implantação no Microsoft Foundry que fornece capacidade dedicada de processamento do modelo para a sua implantação. Ao contrário das implantações padrão, em que a capacidade de inferência é compartilhada entre os clientes e a taxa de transferência pode variar com a demanda, uma implantação provisionada contém uma quantidade fixa de capacidade de processamento exclusivamente para uso da implantação, independentemente de as solicitações estarem sendo feitas ou não.
Este artigo apresenta os conceitos fundamentais sobre a taxa de transferência provisionada: o que ela é, quando usá-la, como a capacidade é medida e cobrada e o que você precisa saber sobre cotas e capacidade antes de implantar.
Categorias de implantação comparadas
Implantações padrão, implantações em lote, processamento de prioridade e taxa de transferência provisionada são maneiras de implantar modelos no Microsoft Foundry. A escolha certa depende de seus requisitos de latência, padrões de tráfego e tolerância a custos.
| Tipo de implantação | Faturamento | SLA (Contrato de Nível de Serviço de Latência) | Tipo e necessidades de carga de trabalho |
|---|---|---|---|
| Standard | Pagamento por token | Nenhum | Cargas de trabalho equilibradas: desenvolvimento, teste e produção com tráfego variável ou imprevisível |
| Processamento prioritário | Pagamento por token (tarifa do nível de prioridade) | Destino de latência definido por modelo | Cargas de trabalho de produção sensíveis à latência que precisam de baixa latência consistente sem um compromisso de longo prazo |
| Provisionado | Por PTU por hora (ou usando as reservas do Azure) | Destino de latência definido por modelo | Cargas de trabalho de produção críticas e de alta escala que exigem taxa de transferência garantida e latência consistente |
| Batch | Pagamento por token (tarifa de lote com desconto) | Nenhum | Cargas de trabalho de processamento em massa sem requisitos de latência. Os resultados são retornados de forma assíncrona. |
Quando usar a taxa de transferência provisionada
A capacidade de processamento provisionada é a escolha certa quando sua aplicação tem:
- Padrões de tráfego previsíveis: você tem uma estimativa razoável de solicitações por minuto e volumes de token.
- Requisitos sensíveis à latência: seus usuários ou sistemas downstream precisam de respostas consistentes e de baixa latência.
- Volume em escala de produção: casos de uso de alta taxa de transferência em que a cobrança por token se torna dispendiosa.
- Cenários interativos ou em tempo real: aplicativos de chat, copilots ou agentes em que os tempos de resposta variáveis degradam a experiência do usuário.
As implantações padrão continuam sendo as mais adequadas para desenvolvimento, teste, uso de baixo volume ou tráfego altamente variável, o que dificulta o dimensionamento de uma implantação com antecedência.
Unidades de taxa de transferência provisionadas
AS PTUs (unidades de taxa de transferência) provisionadas são a unidade de medida para a taxa de transferência provisionada. Um PTU representa uma quantidade fixa de capacidade de processamento de modelo. Ao criar uma implantação provisionada, especifique quantas PTUs alocar. Foundry reserva essa quantidade de capacidade computacional e a mantém reservada para sua implantação.
Principais características de PTUs:
- Independente de modelo: a mesma cota de PTU pode ser usada para implantar qualquer modelo com suporte. Você não compra PTUs para um modelo específico.
- Específico da região: a cota de PTU é concedida por assinatura, por região e por tipo de implantação. A cota no Leste dos EUA não vai para a Europa Ocidental.
- A taxa de transferência varia de acordo com o modelo: os tokens por minuto (TPM) fornecidos por determinado número de PTUs dependem do modelo. Um modelo mais pesado requer mais PTUs para atender ao mesmo TPM que um mais leve. Para as proporções de PTU para TPM por modelo, consulte Parâmetros de taxa de transferência por modelo.
- Tamanhos mínimos de implantação se aplicam: cada modelo tem uma contagem mínima de PTU necessária para criar uma implantação. Os mínimos variam de acordo com o modelo e são listados em parâmetros de implantação e valores de taxa de transferência por modelo.
Cota e capacidade
A cota e a capacidade de PTU são conceitos relacionados, mas distintos, e ambos afetam a possibilidade de você criar uma implantação. Esta seção explica o que cada um é, como solicitar cota adicional e como verificar se a capacidade está disponível em sua região.
O que é a cota de PTU?
A cota de PTU é o número máximo de PTUs que você pode implantar por assinatura, por região e por tipo de implantação. A cota é um limite de política imposto por Azure e não tem nenhum custo associado. A cota é definida no nível da oferta (Global Provisioned, Data Zone Provisioned e Regional Provisioned são grupos de cotas separados) e no nível da região (por exemplo, a cota em East US não se aplica a West Europe).
Uma quantidade padrão de quota é atribuída às assinaturas elegíveis em várias regiões.
O que é capacidade?
A capacidade é a quantidade real de PTUs por versão de modelo que está disponível para ser implantada. A capacidade é alocada no momento da implantação e mantida para o tempo de vida da implantação.
Importante
Ter cota de PTU não garante que a capacidade esteja disponível. Se a capacidade na região for insuficiente para a contagem de PTU solicitada, a implantação falhará. Sempre verifique a disponibilidade da capacidade antes de planejar uma implantação ou comprar uma reserva.
Como a capacidade é um recurso finito e dinâmico:
- A disponibilidade da capacidade muda ao longo do dia com base na demanda do cliente em todas as regiões e modelos.
- Excluir ou reduzir a escala de uma implantação libera sua capacidade de volta para o pool regional. Não há garantia de que a mesma capacidade esteja disponível se você recriar ou ampliar a implantação mais tarde.
Como obter cota
Uma quantidade padrão de cota provisionada global, de zona de dados e regional é atribuída a assinaturas qualificadas em várias regiões. Você pode solicitar mais cota ou capacidade enviando o formulário de solicitação de cota. O formulário também está disponível no portal Foundry na página Quota.
A aprovação pode levar vários dias com base na disponibilidade da cota e você recebe uma notificação por email quando a solicitação é aprovada.
Como verificar a capacidade disponível
Para verificar a disponibilidade da capacidade em tempo real:
- Use a experiência de implantação do portal do Foundry, que informa se a capacidade está disponível quando você tenta criar uma implantação e lista regiões alternativas com capacidade disponível se sua região de destino não tiver o suficiente.
- Use a API de capacidades do modelo para consultar programaticamente a contagem máxima de PTU implantável para um determinado modelo e região.
Se sua região de destino não tiver capacidade disponível:
- Envie o formulário de solicitação de cota para solicitar mais cota ou capacidade.
- Tente implantar com menos PTUs.
- Tente novamente mais tarde, pois a disponibilidade da capacidade muda dinamicamente ao longo do dia.
Para obter orientações passo a passo sobre como criar implantações provisionadas e lidar com restrições de capacidade, consulte Introdução às implantações provisionadas.
Dimensionamento de PTU
Antes de criar uma implantação provisionada, estime quantas PTUs sua carga de trabalho exige. Três fatores impulsionam o cálculo:
- Forma da solicitação: suas solicitações esperadas por minuto (RPM), tamanho médio do prompt (tokens de entrada) e tamanho médio da resposta (tokens de saída).
- Taxa de saída para entrada: os tokens de saída exigem mais capacidade de processamento do que tokens de entrada. Cada modelo tem uma proporção que expressa a quantos tokens de entrada um token de saída equivale em termos de capacidade. Para o GPT-4.1 e os modelos posteriores do Azure OpenAI, essa proporção corresponde à proporção de preços padrão global do modelo entre tokens de saída e tokens de entrada. Para obter mais informações sobre essa taxa, consulte parâmetros de implantação e valores de taxa de transferência por modelo.
- Taxa de cache: a fração dos tokens de entrada servidos do cache de prompt. Os tokens armazenados em cache não consomem capacidade de PTU, portanto, uma taxa de cache mais alta reduz as PTUs necessárias.
O cálculo de dimensionamento usa esses fatores para converter os volumes de token esperados em uma única figura de TPM normalizada e, em seguida, divide pelo valor de TPM de Entrada por PTU do modelo para chegar à contagem de PTU necessária.
Você pode dimensionar manualmente, usando as fórmulas e valores por modelo ou usar a calculadora de capacidade no portal do Foundry para uma estimativa guiada.
Para obter a metodologia completa de dimensionamento, incluindo fórmulas, exemplos práticos e a referência para a calculadora de capacidade, consulte Determinar o dimensionamento de PTU para uma carga de trabalho.
Tipos de implantação de taxa de transferência provisionada
A taxa de transferência provisionada está disponível em três tipos de implantação. Todos eles fornecem capacidade dedicada e latência previsível uma vez implantadas. A diferença é onde o tráfego de inferência é processado:
| Tipo de implantação |
sku-name na CLI |
Roteamento de dados | Melhor para |
|---|---|---|---|
| Provisionamento Global | GlobalProvisionedManaged |
Encaminhado entre regiões do Azure em todo o mundo | Maior disponibilidade; quando a região de roteamento não é restrita |
| Zona de dados provisionada | DataZoneProvisionedManaged |
Permanece dentro de uma zona geográfica (EUA ou UE) | Residência de dados no nível de zona com disponibilidade superior à regional |
| Provisionamento Regional | ProvisionedManaged |
Permanece na região de Azure específica da implantação | Requisitos estritos de residência de dados em uma única região |
Para obter uma comparação completa de todos os tipos de implantação do Foundry, incluindo padrão, lote e provisionado, consulte Deployment types for Microsoft Foundry Models.
Modelos com suporte
Para obter uma lista completa dos Foundry Models que oferecem suporte à taxa de transferência provisionada, incluindo os tipos de implantação compatíveis com cada modelo e a disponibilidade regional, consulte Disponibilidade regional dos Foundry Models vendidos diretamente pela Azure.
Transbordamento
O transbordamento é uma configuração opcional para gerenciar flutuações de tráfego em implantações provisionadas, ao rotear automaticamente solicitações excedentes para uma implantação padrão correspondente no mesmo recurso Foundry. Quando uma implantação com capacidade provisionada é totalmente utilizada e retorna respostas diferentes de 200 (como um 429 quando as PTUs se esgotam), o transbordo redireciona essas solicitações para a implantação padrão, ajudando a reduzir interrupções durante picos de tráfego.
Todos os modelos do OpenAI do Azure em Modelos do Foundry que dão suporte à taxa de transferência provisionada também dão suporte à capacidade de excedente. Modelos do Foundry de outros provedores (Azure DeepSeek, Meta Llama) no momento não oferecem suporte a spillover.
A capacidade excedente pode ser configurada para todas as solicitações de uma implantação ou controlada individualmente por solicitação usando o cabeçalho de solicitação x-ms-spillover-deployment. Para ver as etapas de configuração, consulte Gerenciar o tráfego com transbordamento para implantações provisionadas.
Cobrança por hora e reservas de Azure
As implantações provisionadas oferecem suporte a dois modos de cobrança: cobrança por hora para uso flexível e de curto prazo, e Reservas do Azure para cargas de trabalho de produção contínuas a uma tarifa com desconto.
Cobrança por hora
Todos os tipos de implantação provisionados são cobrados a uma taxa por hora (US$/PTU/hr) com base no número de PTUs implantados, independentemente do número de tokens consumidos. O medidor começa quando a implantação é criada e é interrompida quando é excluída.
A cobrança por hora é prática para cenários de curto prazo, como fazer benchmark de um novo modelo ou escalar temporariamente para um evento como um hackathon. No entanto, não planeje aumentar e reduzir as implantações provisionadas de acordo com o tráfego para continuar na cobrança por hora pelos seguintes motivos:
A capacidade pode não estar disponível quando você precisar escalar verticalmente novamente.
Normalmente, a cobrança contínua por hora com alta utilização excede os preços de reserva.
Para obter diretrizes completas sobre cobrança por hora e dimensionamento de implantações provisionadas, consulte a cobrança por hora.
Reservas do Azure
As Reservas do Azure são um desconto financeiro aplicado ao medidor de faturamento de PTU (o contador de uso por hora que o Azure usa para cobrar), e não a implantações individuais. Em troca de um compromisso de 1 mês ou 1 ano, você recebe uma taxa efetiva de $/PTU/hr com desconto. Alguns itens importantes a serem observados sobre reservas incluem:
As reservas são adquiridas por tipo de implantação (Global, Zona de Dados ou Regional) e podem ser definidas para abranger uma ou mais assinaturas ou grupos de recursos.
As reservas e as implantações são fracamente acopladas, o que significa que você cria implantações e reservas de maneira independente.
As reservas não garantem a capacidade. Primeiro, crie implantações para confirmar que há capacidade disponível e, em seguida, compre a reserva para garantir a taxa com desconto.
Para obter orientações completas sobre dimensionamento, compra e gerenciamento de reservas, consulte Reservas do Azure para throughput provisionado.
Como controlar os custos e a cobrança de PTU
Use o Gerenciamento de Custos da Microsoft para acompanhar e analisar o uso de PTU e os custos de reserva:
| O que você quer fazer | Artigo |
|---|---|
| Veja qual porcentagem de suas PTUs reservadas estão ativamente em uso em suas implantações | Visualizar a utilização de reservas do Azure |
| Examinar o histórico de compras e qualquer atividade de reembolso | Visualizar transações de compra e reembolso de reservas do Azure |
| Entenda o impacto do custo amortizado das suas reservas para ter maior clareza na cobrança por implantação | Exibir custos de benefício amortizados |
| Distribuir custos de reserva entre equipes ou projetos para atribuição de custo interno | Cobrar de volta os custos de Reservas do Azure |
| Configurar a renovação automática para impedir a expiração da reserva e manter a taxa com desconto | Automaticamente renovar reservas Azure |
Conteúdo relacionado
- Introdução às implantações provisionadas
- Custos de PTU e cobrança
- Gerenciar tráfego com excedente para implantações provisionadas
- Habilitar processamento prioritário para modelos do Microsoft Foundry
- Economizar custos com reservas de taxa de transferência provisionadas do Microsoft Foundry
- Cotas e limites dos modelos do Foundry