Acesso instantâneo a modelos no Microsoft Foundry (pré-visualização)

O acesso instantâneo aos modelos permite-lhe chamar qualquer modelo suportado pelo nome — sem necessidade de implementação. Cria um projeto Foundry, começa a programar e usa qualquer modelo disponível imediatamente.

Pré-requisitos

  • Uma assinatura do Azure. Crie um gratuitamente.
  • Inicie sessão no Microsoft Foundry. Certifica-te de que a opção New Foundry está ativada. Estes passos referem-se à Foundry (new).
  • Um projeto Foundry na West US 3 (a única região suportada para acesso instantâneo durante a pré-visualização). Se precisar de criar um projeto, veja Criar um projeto.
  • O papel de Utilizador Foundry no projeto ou conta.

Importante

As funções RBAC do Foundry foram recentemente renomeadas. Foundry User, Foundry Owner, Foundry Account Owner e Foundry Project Manager foram anteriormente nomeados Azure AI User, Azure AI Owner, Azure AI Account Owner e Azure AI Project Manager. Poderá ainda ver os nomes anteriores em alguns locais enquanto esta alteração de nome está a ser implementada. Os IDs das funções e as permissões principais não são alterados por esta mudança de nome.

Comece a usar modelos imediatamente

Com acesso instantâneo, o fluxo de trabalho é simples — use um nome de modelo instantâneo suportado no seu código. Não é necessário deslocamento. A mesma API, SDK e cliente que já usas para implementações funciona com modelos de acesso instantâneo. Sem segundo SDK, sem cliente separado, sem alterações de configuração.

O suporte ao acesso instantâneo continua a expandir-se ao longo do tempo. O conjunto exato muda frequentemente. Consulte Modelos suportados para formas de consultar a lista completa.

Para o model parâmetro, use o nome do modelo de acesso instantâneo, como "gpt-5-mini", em vez do nome do modelo implementado.

import os

from azure.identity import DefaultAzureCredential
from azure.ai.projects import AIProjectClient

# Format: "https://resource_name.ai.azure.com/api/projects/project_name"
PROJECT_ENDPOINT = os.getenv("AZURE_AI_PROJECT_ENDPOINT", "your_project_endpoint")
MODEL_DEPLOYMENT = os.getenv("MODEL_DEPLOYMENT", "gpt-5-mini")

# Create project and openai clients to call Foundry API
project = AIProjectClient(
    endpoint=PROJECT_ENDPOINT,
    credential=DefaultAzureCredential(),
)
openai = project.get_openai_client()

# Run a responses API call
response = openai.responses.create(
    model=MODEL_DEPLOYMENT,
    input="What is the size of France in square miles?",
)
if not response.output_text or not response.output_text.strip():
    raise RuntimeError("Response output text was empty.")

print(f"Response output: {response.output_text}")

Ambiente de teste para modelos de acesso imediato

Para chegar ao parque infantil para modelos de acesso instantâneo, utilize um destes caminhos:

  1. A partir de casa, selecione Testar no parque infantil.
  2. Em Home, selecione Explorar modelos para aceder ao catálogo de modelos. Ou, selecione Descobrir>Modelos. Qualquer um dos caminhos abre o catálogo.
  3. Do catálogo de modelos, selecione um modelo de acesso instantâneo para ver os seus detalhes.
  4. Na página de detalhes de um modelo com acesso instantâneo, selecione Abrir área de teste.
  5. Num playground, use a lista pendente Model para alternar para outros modelos de acesso imediato ou implementados.

Diagrama dos percursos de navegação da Página inicial ao Playground, incluindo as rotas Catálogo e Modelo.

Por que o acesso instantâneo é importante

  • Mude de modelo mudando uma string — use qualquer nome instantâneo de modelo na model= linha, sem criar ou eliminar deployments.
  • Mesma API e SDK — as mesmas chamadas funcionam tanto para acesso instantâneo como para implementações.
  • Funciona com as suas ferramentas de desenvolvimento — o acesso instantâneo integra-se com o Foundry CLI, o VS Code e os pipelines de CI/CD, tal como as implementações.

As missões não vão desaparecer. Eles continuam a ser a escolha certa quando precisa de capacidade de processamento reservada, filtros de conteúdo personalizados, residência dos dados ou configurações empresariais avançadas. O acesso instantâneo simplifica a experiência inicial para que as implementações se tornem algo a que se sube de nível, e não um portal que tens de ultrapassar antes de poderes usar um modelo.

Modelos suportados

Os modelos novos suportam acesso instantâneo por defeito quando são lançados. A equipa de produto considera o suporte para modelos adicionais com base na procura do cliente. A lista cresce ao longo do tempo, e exemplos de modelos que pode ver incluem:

  • chat-gpt-latest
  • gpt-5.6-sol
  • gpt-5.5
  • gpt-5-mini
  • gpt-5.3-codex

Para ver todos os modelos que suportam acesso instantâneo:

  1. Abra um projeto em West US 3 na nova experiência do Foundry,
  2. Selecione Descobrir no canto superior direito da navegação, depois Modelos no painel esquerdo.
  3. No catálogo de modelos, selecione Instantâneo nas opções de Desenvolvimento para visualizar os modelos de acesso instantâneo disponíveis.

Também pode listar modelos de acesso instantâneo programáticamente:

SUBSCRIPTION_ID="<your-subscription-id>"
LOCATION="westus3"

az rest --method get \
  --url "https://management.azure.com/subscriptions/$SUBSCRIPTION_ID/providers/Microsoft.CognitiveServices/locations/$LOCATION/models?api-version=2025-06-01" \
  --output json \
| jq -r '(.value // .models // .)[]
  | select((.model.capabilities.instant // "false" | tostring | ascii_downcase) == "true")
  | .model.name' \
| sort -u

Note

Durante a pré-visualização, os modelos de acesso instantâneo estão disponíveis apenas em projetos na região West US 3.

Alguns modelos de acesso instantâneo podem aparecer na lista mesmo que a sua subscrição não tenha quota para eles. Para mais informações, consulte Quotas e limites para Foundry Models.

Quando usar acesso instantâneo vs. implementações

Scenario Abordagem recomendada
Iniciação, prototipagem ou experimentação Acesso instantâneo
Usando o modelo mais recente imediatamente após o lançamento Acesso instantâneo
Necessidade de capacidade reservada ou débito previsível Deployment
Requer capacidade de processamento aprovisionada (PTU) Deployment
Necessidade de residência de dados numa região específica Deployment
Políticas personalizadas de filtragem de conteúdos por modelo Deployment
Guarda-raias personalizadas por modelo Deployment
Configuração específica do endpoint (por exemplo, bloqueios de versão por endpoint) Deployment
Partição de quotas detalhada entre equipas Deployment
Modelos afinados Deployment

O acesso instantâneo e as implementações podem coexistir no mesmo projeto. Pode começar com o modelo de acesso instantâneo e criar uma implementação mais tarde, à medida que os seus requisitos evoluem.

Versões dos modelos

Por defeito, o acesso instantâneo utiliza a versão mais recente e sempre atualizada de um modelo. Para fixar uma versão específica, adicione a data da versão ao nome do modelo como um sufixo hifenizado:

O que fazes passar por model Comportamento
model-name Rotas para a versão mais recente
model-name-2025-04-01 Caminhos para essa versão específica

A fixação de versão é opcional. Se a sua aplicação requer estabilidade, inclua o sufixo da versão. Caso contrário, recebes sempre a versão mais recente automaticamente.

Como a quota é consumida

O acesso instantâneo recorre a um conjunto de quotas globais por modelo atribuído à sua subscrição. Esta quota é separada da quota regional utilizada nas implantações padrão.

  • Não precisa de alocar nem particionar a quota global — esta é partilhada automaticamente por toda a utilização de modelos instantâneos na sua subscrição.
  • As implementações do Global Standard reservam parte da sua quota global. Os modelos de acesso instantâneo utilizam a capacidade que resta.
  • Outros tipos de implementação (Regional Standard, Provisioned) usam quotas regionais separadas e não afetam a capacidade do teu modelo instantâneo.
  • Se os pedidos de modelos instantâneos forem limitados, pode pedir um aumento de quota ou criar uma implementação com capacidade reservada.

Para mais detalhes sobre como as quotas globais e regionais interagem, consulte Gerir e aumentar quotas.

Controlos empresariais

Capacidade Como funciona
Bloquear modelos ou fornecedores específicos As definições do Azure Policy aplicam-se ao acesso instantâneo da mesma forma que se aplicam às implementações
Afixar uma versão do modelo Adicionar o sufixo da versão ao nome do modelo (ver Versões do modelo)
Desativar completamente o acesso instantâneo Os administradores podem desligar o acesso instantâneo ao nível da subscrição através do Azure Policy

Para remover o acesso imediato de uma conta, configure as definições através de Bicep ou ARM REST.

Atualize a sua conta com:

PATCH https://management.azure.com/subscriptions/{sub}/resourceGroups/{rg}/providers/Microsoft.CognitiveServices/accounts/{account}?api-version=2026-01-15-preview
Authorization: Bearer {arm_token}
Content-Type: application/json

Use este corpo do pedido para desativar de forma eficaz o acesso imediato ao modelo:

{
  "properties": {
    "instant": {
      "raiPolicyName": "Microsoft.DefaultV2",
      "modelAllowList": []
    }
  }
}

Importante

Todos os modelos de acesso instantâneo usam salvaguardas e filtros de conteúdo predefinidos. No entanto, não pode configurar guardas personalizados ou políticas de IA Responsável (RAI) por modelo para acesso instantâneo. Pode definir uma política RAI por defeito ao nível da conta através da API, mas essa política aplica-se uniformemente a todos os modelos de acesso instantâneo. Se precisar de políticas de filtragem de conteúdo diferentes para cada modelo, use uma implementação.

Colisões de nomes de implementações

Novas implementações não podem usar um nome que corresponda a um nome de modelo existente. Se tiver uma implementação existente cujo nome colide com um nome de modelo, a implementação tem precedência e o acesso instantâneo ao modelo para esse nome de modelo não está disponível nesse projeto.

Limitações durante a pré-visualização

  • Disponível apenas na West US 3 .
  • Modelos finamente ajustados não são suportados. Para utilizar um modelo ajustado, crie uma implementação.
  • Guardrails, políticas RAI personalizadas e filtros de conteúdo não são configuráveis para acesso instantâneo.
  • Apenas os modelos listados em Modelos Suportados são elegíveis.