Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
O acesso instantâneo aos modelos permite que você chame qualquer modelo com suporte por nome , sem necessidade de implantação. Crie um projeto do Foundry, inicie a codificação e use qualquer modelo disponível imediatamente.
Pré-requisitos
- Uma assinatura do Azure. Criar um gratuitamente.
- Entre no Microsoft Foundry. Verifique se o botão New Foundry está ativado. Estas etapas se referem ao Foundry (novo).
- Um projeto do Foundry em West US 3 (a única região com suporte para acesso instantâneo durante a versão prévia). Se você precisar criar um projeto, consulte Criar um projeto.
- A função de usuário do Foundry no projeto ou na conta.
Importante
As funções RBAC do Foundry foram renomeadas recentemente. Foundry User, Foundry Owner, Foundry Account Owner e Foundry Project Manager eram anteriormente chamados de Usuário do Azure AI, Proprietário do Azure AI, Proprietário da conta do Azure AI e Gerente de Projeto do Azure AI. Você ainda pode ver os nomes anteriores em alguns lugares enquanto essa mudança de nome está sendo implementada. Os IDs das funções e as permissões principais não são alterados com a mudança de nome.
Comece a usar modelos instantaneamente
Com o acesso instantâneo, o fluxo de trabalho é simples: use um nome de modelo instantâneo com suporte em seu código. Nenhuma implantação é necessária. A mesma API, SDK e cliente que você já usa para implantações funciona com modelos de acesso instantâneo. Nenhum segundo SDK, nenhum cliente separado, nenhuma alteração de configuração.
O suporte para acesso instantâneo continua a se expandir ao longo do tempo. O conjunto exato muda com frequência. Consulte os modelos com suporte para obter maneiras de ver a lista completa.
Para o model parâmetro, use o nome do modelo de acesso instantâneo, como "gpt-5-mini", em vez de um nome de modelo implantado.
import os
from azure.identity import DefaultAzureCredential
from azure.ai.projects import AIProjectClient
# Format: "https://resource_name.ai.azure.com/api/projects/project_name"
PROJECT_ENDPOINT = os.getenv("AZURE_AI_PROJECT_ENDPOINT", "your_project_endpoint")
MODEL_DEPLOYMENT = os.getenv("MODEL_DEPLOYMENT", "gpt-5-mini")
# Create project and openai clients to call Foundry API
project = AIProjectClient(
endpoint=PROJECT_ENDPOINT,
credential=DefaultAzureCredential(),
)
openai = project.get_openai_client()
# Run a responses API call
response = openai.responses.create(
model=MODEL_DEPLOYMENT,
input="What is the size of France in square miles?",
)
if not response.output_text or not response.output_text.strip():
raise RuntimeError("Response output text was empty.")
print(f"Response output: {response.output_text}")
Playground para acessar modelos instantaneamente
Para acessar o playground a fim de obter modelos de acesso instantâneo, use um destes caminhos:
- Na página Home, selecione Test in playground.
- Em Página Inicial, selecione Explorar modelos para ir para o catálogo de modelos. Ou selecione Descobrir>Modelos. Qualquer um dos caminhos abre o catálogo.
- No catálogo de modelos, selecione um modelo de acesso instantâneo para exibir seus detalhes.
- Na página de detalhes de um modelo de acesso instantâneo, selecione Abrir playground.
- Em um playground, use a lista suspensa Modelo para alternar para outros modelos de acesso instantâneo ou implantados.
Por que o acesso instantâneo importa
-
Alterne modelos alterando uma cadeia de caracteres – use qualquer nome de modelo instantâneo na
model=linha, sem criar ou excluir implantações. - A mesma API e SDK – as mesmas chamadas funcionam para acesso instantâneo e implantações.
- Funciona com suas ferramentas de desenvolvimento – o acesso instantâneo se integra a CLI do Foundry, VS Code e pipelines de CI/CD da mesma maneira que as implantações.
As implantações não vão desaparecer. Eles permanecem a escolha certa quando você precisa de taxa de transferência reservada, filtros de conteúdo personalizado, residência de dados ou configurações corporativas avançadas. O acesso instantâneo simplifica a experiência inicial, para que as implantações se tornem algo para o qual você evolui, e não uma barreira que precisa superar antes de poder usar um modelo.
Modelos com suporte
Os novos modelos dão suporte ao acesso instantâneo por padrão quando são lançados. A equipe de produtos considera o suporte para modelos adicionais com base na demanda do cliente. A lista cresce ao longo do tempo e exemplos de modelos que você pode ver incluem:
chat-gpt-latestgpt-5.6-solgpt-5.5gpt-5-minigpt-5.3-codex
Para ver todos os modelos que dão suporte ao acesso instantâneo:
- Abra um projeto no Oeste dos EUA 3 na nova experiência do Foundry,
- Selecione Descobrir na navegação superior direita e, em seguida, Modelos no painel esquerdo.
- No catálogo de modelos, selecione Instant em Opções de desenvolvimento para ver os modelos de acesso instantâneo disponíveis.
Você também pode listar modelos de acesso instantâneo programaticamente:
SUBSCRIPTION_ID="<your-subscription-id>"
LOCATION="westus3"
az rest --method get \
--url "https://management.azure.com/subscriptions/$SUBSCRIPTION_ID/providers/Microsoft.CognitiveServices/locations/$LOCATION/models?api-version=2025-06-01" \
--output json \
| jq -r '(.value // .models // .)[]
| select((.model.capabilities.instant // "false" | tostring | ascii_downcase) == "true")
| .model.name' \
| sort -u
Note
Durante a versão prévia, os modelos de acesso instantâneo estão disponíveis apenas em projetos no Oeste dos EUA 3 .
Alguns modelos de acesso instantâneo podem aparecer na lista mesmo que sua assinatura não tenha cota para eles. Para obter mais informações, consulte Cotas e limites para modelos do Foundry.
Quando usar o acesso instantâneo versus implantações
| Scenario | Abordagem recomendada |
|---|---|
| Introdução, protótipo ou experimentação | Acesso instantâneo |
| Usar o modelo mais recente imediatamente após o lançamento | Acesso instantâneo |
| Precisa de capacidade reservada ou taxa de transferência previsível | Implantação |
| Exigir PTU (taxa de transferência provisionada) | Implantação |
| Precisa de residência de dados em uma região específica | Implantação |
| Políticas de filtragem de conteúdo personalizado por modelo | Implantação |
| Proteções personalizadas por modelo | Implantação |
| Configuração específica do ponto de extremidade (por exemplo, bloqueios de versão por ponto de extremidade) | Implantação |
| Particionamento granular de cota entre equipes | Implantação |
| Modelos ajustados | Implantação |
O acesso instantâneo e as implantações podem coexistir no mesmo projeto. Você pode começar com o modelo de acesso instantâneo e criar uma implantação mais tarde à medida que seus requisitos evoluem.
Versões de modelo
Por padrão, o acesso instantâneo usa a versão mais recente de um modelo. Para fixar em uma versão específica, acrescente a data de versão ao nome do modelo como um sufixo hifenizado:
O que você passa como model |
Behavior |
|---|---|
model-name |
Rotas para a versão mais recente |
model-name-2025-04-01 |
Rotas para aquela versão específica |
A fixação de versão é opcional. Se o aplicativo exigir estabilidade, inclua o sufixo de versão. Caso contrário, você sempre obterá a versão mais recente automaticamente.
Como a cota é consumida
O acesso instantâneo usa um pool de cota global por modelo atribuído à sua assinatura. Essa cota é separada da cota regional usada pelas implantações padrão.
- Você não aloca nem particiona a cota global — ela é compartilhada automaticamente entre todos os usos de modelos instantâneos na sua assinatura.
- As implantações do Padrão Global reservam uma parcela da sua cota global. Os modelos de acesso instantâneo usam qualquer capacidade restante.
- Outros tipos de implantação (Padrão Regional, Provisionado) usam cota regional separada e não afetam a capacidade do modelo instantâneo.
- Se as solicitações de modelo instantâneo forem limitadas, você poderá solicitar um aumento de cota ou criar uma implantação com capacidade reservada.
Para obter mais detalhes sobre como as cotas globais e regionais interagem, consulte Gerenciar e aumentar as cotas.
Controles corporativos
| Capacidade | Como funciona |
|---|---|
| Bloquear modelos ou provedores específicos | As definições do Azure Policy se aplicam ao acesso instantâneo da mesma forma que se aplicam às implantações |
| Fixar em uma versão de modelo | Acrescente o sufixo de versão ao nome do modelo (consulte versões do modelo) |
| Desabilitar totalmente o acesso instantâneo | Os administradores podem desativar o acesso instantâneo no nível da assinatura por meio de Azure Policy |
Para remover o acesso instantâneo de uma conta, configure as definições por meio do Bicep ou da API REST do ARM.
Atualize sua conta com:
PATCH https://management.azure.com/subscriptions/{sub}/resourceGroups/{rg}/providers/Microsoft.CognitiveServices/accounts/{account}?api-version=2026-01-15-preview
Authorization: Bearer {arm_token}
Content-Type: application/json
Use este corpo da requisição para desativar efetivamente o acesso instantâneo ao modelo:
{
"properties": {
"instant": {
"raiPolicyName": "Microsoft.DefaultV2",
"modelAllowList": []
}
}
}
Importante
Todos os modelos de acesso instantâneo usam guardrails e filtros de conteúdo padrão. No entanto, você não pode configurar os guardrails personalizados ou as políticas de IA Responsável (RAI) por modelo para acesso instantâneo. Você pode definir uma política RAI padrão no nível da conta por meio da API, mas essa política se aplica uniformemente a todos os modelos de acesso instantâneo. Se você precisar de políticas de filtragem de conteúdo diferentes para cada modelo, use uma implantação.
Colisões de nomes de implantação
Novas implantações não podem usar um nome que corresponda a um nome de modelo existente. Se você tiver uma implantação existente cujo nome colide com um nome de modelo, a implantação terá precedência e o acesso de modelo instantâneo para esse nome de modelo não estará disponível nesse projeto.
Limitações durante a visualização
- Disponível somente no Oeste dos EUA 3 .
- Não há suporte para modelos ajustados. Para usar um modelo refinado, crie uma implantação.
- Guardrails, políticas RAI personalizadas e filtros de conteúdo não são configuráveis para acesso instantâneo.
- Somente os modelos listados em modelos com suporte são qualificados.