Acesso instantâneo a modelos no Microsoft Foundry (versão prévia)

O acesso instantâneo aos modelos permite que você chame qualquer modelo com suporte por nome , sem necessidade de implantação. Crie um projeto do Foundry, inicie a codificação e use qualquer modelo disponível imediatamente.

Pré-requisitos

  • Uma assinatura do Azure. Criar um gratuitamente.
  • Entre no Microsoft Foundry. Verifique se o botão New Foundry está ativado. Estas etapas se referem ao Foundry (novo).
  • Um projeto do Foundry em West US 3 (a única região com suporte para acesso instantâneo durante a versão prévia). Se você precisar criar um projeto, consulte Criar um projeto.
  • A função de usuário do Foundry no projeto ou na conta.

Importante

As funções RBAC do Foundry foram renomeadas recentemente. Foundry User, Foundry Owner, Foundry Account Owner e Foundry Project Manager eram anteriormente chamados de Usuário do Azure AI, Proprietário do Azure AI, Proprietário da conta do Azure AI e Gerente de Projeto do Azure AI. Você ainda pode ver os nomes anteriores em alguns lugares enquanto essa mudança de nome está sendo implementada. Os IDs das funções e as permissões principais não são alterados com a mudança de nome.

Comece a usar modelos instantaneamente

Com o acesso instantâneo, o fluxo de trabalho é simples: use um nome de modelo instantâneo com suporte em seu código. Nenhuma implantação é necessária. A mesma API, SDK e cliente que você já usa para implantações funciona com modelos de acesso instantâneo. Nenhum segundo SDK, nenhum cliente separado, nenhuma alteração de configuração.

O suporte para acesso instantâneo continua a se expandir ao longo do tempo. O conjunto exato muda com frequência. Consulte os modelos com suporte para obter maneiras de ver a lista completa.

Para o model parâmetro, use o nome do modelo de acesso instantâneo, como "gpt-5-mini", em vez de um nome de modelo implantado.

import os

from azure.identity import DefaultAzureCredential
from azure.ai.projects import AIProjectClient

# Format: "https://resource_name.ai.azure.com/api/projects/project_name"
PROJECT_ENDPOINT = os.getenv("AZURE_AI_PROJECT_ENDPOINT", "your_project_endpoint")
MODEL_DEPLOYMENT = os.getenv("MODEL_DEPLOYMENT", "gpt-5-mini")

# Create project and openai clients to call Foundry API
project = AIProjectClient(
    endpoint=PROJECT_ENDPOINT,
    credential=DefaultAzureCredential(),
)
openai = project.get_openai_client()

# Run a responses API call
response = openai.responses.create(
    model=MODEL_DEPLOYMENT,
    input="What is the size of France in square miles?",
)
if not response.output_text or not response.output_text.strip():
    raise RuntimeError("Response output text was empty.")

print(f"Response output: {response.output_text}")

Playground para acessar modelos instantaneamente

Para acessar o playground a fim de obter modelos de acesso instantâneo, use um destes caminhos:

  1. Na página Home, selecione Test in playground.
  2. Em Página Inicial, selecione Explorar modelos para ir para o catálogo de modelos. Ou selecione Descobrir>Modelos. Qualquer um dos caminhos abre o catálogo.
  3. No catálogo de modelos, selecione um modelo de acesso instantâneo para exibir seus detalhes.
  4. Na página de detalhes de um modelo de acesso instantâneo, selecione Abrir playground.
  5. Em um playground, use a lista suspensa Modelo para alternar para outros modelos de acesso instantâneo ou implantados.

Diagrama de caminhos de navegação de Página Inicial para Playground, incluindo rotas de Catálogo e Modelo.

Por que o acesso instantâneo importa

  • Alterne modelos alterando uma cadeia de caracteres – use qualquer nome de modelo instantâneo na model= linha, sem criar ou excluir implantações.
  • A mesma API e SDK – as mesmas chamadas funcionam para acesso instantâneo e implantações.
  • Funciona com suas ferramentas de desenvolvimento – o acesso instantâneo se integra a CLI do Foundry, VS Code e pipelines de CI/CD da mesma maneira que as implantações.

As implantações não vão desaparecer. Eles permanecem a escolha certa quando você precisa de taxa de transferência reservada, filtros de conteúdo personalizado, residência de dados ou configurações corporativas avançadas. O acesso instantâneo simplifica a experiência inicial, para que as implantações se tornem algo para o qual você evolui, e não uma barreira que precisa superar antes de poder usar um modelo.

Modelos com suporte

Os novos modelos dão suporte ao acesso instantâneo por padrão quando são lançados. A equipe de produtos considera o suporte para modelos adicionais com base na demanda do cliente. A lista cresce ao longo do tempo e exemplos de modelos que você pode ver incluem:

  • chat-gpt-latest
  • gpt-5.6-sol
  • gpt-5.5
  • gpt-5-mini
  • gpt-5.3-codex

Para ver todos os modelos que dão suporte ao acesso instantâneo:

  1. Abra um projeto no Oeste dos EUA 3 na nova experiência do Foundry,
  2. Selecione Descobrir na navegação superior direita e, em seguida, Modelos no painel esquerdo.
  3. No catálogo de modelos, selecione Instant em Opções de desenvolvimento para ver os modelos de acesso instantâneo disponíveis.

Você também pode listar modelos de acesso instantâneo programaticamente:

SUBSCRIPTION_ID="<your-subscription-id>"
LOCATION="westus3"

az rest --method get \
  --url "https://management.azure.com/subscriptions/$SUBSCRIPTION_ID/providers/Microsoft.CognitiveServices/locations/$LOCATION/models?api-version=2025-06-01" \
  --output json \
| jq -r '(.value // .models // .)[]
  | select((.model.capabilities.instant // "false" | tostring | ascii_downcase) == "true")
  | .model.name' \
| sort -u

Note

Durante a versão prévia, os modelos de acesso instantâneo estão disponíveis apenas em projetos no Oeste dos EUA 3 .

Alguns modelos de acesso instantâneo podem aparecer na lista mesmo que sua assinatura não tenha cota para eles. Para obter mais informações, consulte Cotas e limites para modelos do Foundry.

Quando usar o acesso instantâneo versus implantações

Scenario Abordagem recomendada
Introdução, protótipo ou experimentação Acesso instantâneo
Usar o modelo mais recente imediatamente após o lançamento Acesso instantâneo
Precisa de capacidade reservada ou taxa de transferência previsível Implantação
Exigir PTU (taxa de transferência provisionada) Implantação
Precisa de residência de dados em uma região específica Implantação
Políticas de filtragem de conteúdo personalizado por modelo Implantação
Proteções personalizadas por modelo Implantação
Configuração específica do ponto de extremidade (por exemplo, bloqueios de versão por ponto de extremidade) Implantação
Particionamento granular de cota entre equipes Implantação
Modelos ajustados Implantação

O acesso instantâneo e as implantações podem coexistir no mesmo projeto. Você pode começar com o modelo de acesso instantâneo e criar uma implantação mais tarde à medida que seus requisitos evoluem.

Versões de modelo

Por padrão, o acesso instantâneo usa a versão mais recente de um modelo. Para fixar em uma versão específica, acrescente a data de versão ao nome do modelo como um sufixo hifenizado:

O que você passa como model Behavior
model-name Rotas para a versão mais recente
model-name-2025-04-01 Rotas para aquela versão específica

A fixação de versão é opcional. Se o aplicativo exigir estabilidade, inclua o sufixo de versão. Caso contrário, você sempre obterá a versão mais recente automaticamente.

Como a cota é consumida

O acesso instantâneo usa um pool de cota global por modelo atribuído à sua assinatura. Essa cota é separada da cota regional usada pelas implantações padrão.

  • Você não aloca nem particiona a cota global — ela é compartilhada automaticamente entre todos os usos de modelos instantâneos na sua assinatura.
  • As implantações do Padrão Global reservam uma parcela da sua cota global. Os modelos de acesso instantâneo usam qualquer capacidade restante.
  • Outros tipos de implantação (Padrão Regional, Provisionado) usam cota regional separada e não afetam a capacidade do modelo instantâneo.
  • Se as solicitações de modelo instantâneo forem limitadas, você poderá solicitar um aumento de cota ou criar uma implantação com capacidade reservada.

Para obter mais detalhes sobre como as cotas globais e regionais interagem, consulte Gerenciar e aumentar as cotas.

Controles corporativos

Capacidade Como funciona
Bloquear modelos ou provedores específicos As definições do Azure Policy se aplicam ao acesso instantâneo da mesma forma que se aplicam às implantações
Fixar em uma versão de modelo Acrescente o sufixo de versão ao nome do modelo (consulte versões do modelo)
Desabilitar totalmente o acesso instantâneo Os administradores podem desativar o acesso instantâneo no nível da assinatura por meio de Azure Policy

Para remover o acesso instantâneo de uma conta, configure as definições por meio do Bicep ou da API REST do ARM.

Atualize sua conta com:

PATCH https://management.azure.com/subscriptions/{sub}/resourceGroups/{rg}/providers/Microsoft.CognitiveServices/accounts/{account}?api-version=2026-01-15-preview
Authorization: Bearer {arm_token}
Content-Type: application/json

Use este corpo da requisição para desativar efetivamente o acesso instantâneo ao modelo:

{
  "properties": {
    "instant": {
      "raiPolicyName": "Microsoft.DefaultV2",
      "modelAllowList": []
    }
  }
}

Importante

Todos os modelos de acesso instantâneo usam guardrails e filtros de conteúdo padrão. No entanto, você não pode configurar os guardrails personalizados ou as políticas de IA Responsável (RAI) por modelo para acesso instantâneo. Você pode definir uma política RAI padrão no nível da conta por meio da API, mas essa política se aplica uniformemente a todos os modelos de acesso instantâneo. Se você precisar de políticas de filtragem de conteúdo diferentes para cada modelo, use uma implantação.

Colisões de nomes de implantação

Novas implantações não podem usar um nome que corresponda a um nome de modelo existente. Se você tiver uma implantação existente cujo nome colide com um nome de modelo, a implantação terá precedência e o acesso de modelo instantâneo para esse nome de modelo não estará disponível nesse projeto.

Limitações durante a visualização

  • Disponível somente no Oeste dos EUA 3 .
  • Não há suporte para modelos ajustados. Para usar um modelo refinado, crie uma implantação.
  • Guardrails, políticas RAI personalizadas e filtros de conteúdo não são configuráveis para acesso instantâneo.
  • Somente os modelos listados em modelos com suporte são qualificados.