Pontos de extremidade para modelos Microsoft Foundry (clássico)

Exibição no momento:Versão do portal Foundry (clássico) - Alternar para a versão do novo portal Foundry

O Microsoft Foundry Models fornece acesso a uma ampla variedade de modelos de vários provedores por meio de um único endpoint e um único conjunto de credenciais. Essa funcionalidade permite alternar entre modelos e usá-los em seu aplicativo sem fazer alterações de código.

Este artigo explica como os serviços Foundry organizam modelos e como usar o endpoint de inferência para acessá-los.

Pré-requisitos

Implantações

O Foundry usa implantações como aliases para acessar modelos. Uma implantação fornece a um modelo um nome e um conjunto de configurações. Você acessa um modelo usando seu nome de implantação em suas solicitações.

Uma implantação define:

  • Um nome do modelo
  • Uma versão do modelo
  • Um tipo de provisionamento ou capacidade1
  • Uma configuração de filtragem de conteúdo1
  • Uma configuração de limitação de taxa1

1 Essas configurações podem ser alteradas dependendo do modelo selecionado.

Um recurso Foundry pode ter muitas implantações de modelo. Você paga apenas pela inferência executada em implantações de modelo. As implantações são recursos do Azure, portanto, estão sujeitas às políticas do Azure.

Para obter mais informações sobre como criar implantações, consulte Adicionar e configurar implantações de modelo.

Ponto de extremidade de inferência do OpenAI do Azure

A API Azure OpenAI expõe todos os recursos de modelos OpenAI e dá suporte a mais recursos como assistentes, threads, arquivos e inferência em lote. Você também pode usá-lo para acessar modelos não OpenAI.

Os endpoints do Azure OpenAI são formatados como https://<resource-name>.openai.azure.com. Pontos de extremidade correspondem a implantações, e cada implantação tem sua própria URL associada. No entanto, você pode usar o mesmo mecanismo de autenticação para consumir mais de uma implantação. Para obter mais informações, consulte a página de referência para Azure API OpenAI.

Uma ilustração que mostra como as implantações do Azure OpenAI contêm uma única URL para cada implantação.

As URLs de implantação são formadas concatenando a URL base do Azure OpenAI e a rota/deployments/<model-deployment-name>. Ao usar a API OpenAI v1, chame a rota /openai/v1/ na URL base, https://<resource-name>.openai.azure.com/openai/v1/, e passe o nome da implantação no campo model da solicitação. A rota /openai/v1/ usa versionamento implícito, portanto, você não precisa passar um api-version.

Os exemplos a seguir usam a API de Respostas, que dá suporte aos recursos de inferência mais recentes.

Nota

A API Responses funciona com modelos do Azure OpenAI e com Foundry Models comercializados pela Azure que oferecem suporte a ela, como os modelos DeepSeek, Llama e Grok. Se uma implantação não der suporte à API de Respostas, a solicitação retornará 400 Model not supported. Nesse caso, use a API de Conclusões de Chat chamando client.chat.completions.create em vez disso.

Usar autenticação de chave de API

Você pode autenticar solicitações de inferência com uma chave de API do recurso Foundry. As chaves de API são rápidas de configurar, mas concedem acesso total ao recurso, são difíceis de definir o escopo para usuários ou ações específicos e exigem rotação manual para se manterem seguras. Para cargas de trabalho de produção, use a autenticação sem chave com Microsoft Entra ID em vez disso.

No exemplo a seguir, deepseek-v3-0324 é o nome de uma implantação de modelo no recurso Microsoft Foundry. Substitua-o pelo seu próprio nome de implantação e armazene sua chave de API na variável de AZURE_INFERENCE_CREDENTIAL ambiente.

Instale o openai pacote usando pip:

pip install openai --upgrade

Crie um cliente que aponte para o endpoint do Azure OpenAI v1 e, em seguida, gere uma resposta. A rota /openai/v1/ usa versionamento implícito, portanto, você não passa um api-version. Insira o nome da implantação no campo model:

import os
from openai import OpenAI

client = OpenAI(
    base_url="https://<resource>.openai.azure.com/openai/v1/",
    api_key=os.environ["AZURE_INFERENCE_CREDENTIAL"],
)

response = client.responses.create(
    model="deepseek-v3-0324",  # Replace with your model deployment name.
    input="Explain the Riemann hypothesis in one paragraph.",
)

print(response.output_text)

Para obter mais informações sobre como usar o ponto de extremidade do OpenAI do Azure, consulte suporte a linguagens do SDK do OpenAI do Azure.

Usar autenticação sem chave

Os Modelos do Foundry implantados oferecem suporte à autorização sem chave com o Microsoft Entra ID. A autorização sem chave aprimora a segurança, simplifica a experiência do usuário, reduz a complexidade operacional e fornece suporte robusto à conformidade. Use a autorização sem chave se sua organização usar soluções de gerenciamento de identidade seguras e escalonáveis.

Para usar a autenticação sem chave, configure seu recurso e conceda acesso aos usuários para executar a inferência. Depois de configurar o recurso e conceder acesso, autentique da seguinte maneira:

Instale o SDK do OpenAI usando um gerenciador de pacotes como pip:

pip install openai

Para Microsoft Entra ID autenticação, instale também:

pip install azure-identity

Use o pacote para consumir o modelo. O exemplo a seguir mostra como criar um cliente e fazer uma chamada de teste para a API de Respostas usando Microsoft Entra ID e sua implantação de modelo.

Substitua <resource> pelo nome do recurso Foundry. Localize-o no portal do Azure ou executando az cognitiveservices account list. Substitua deepseek-v3-0324 pelo nome da implantação real.

from openai import OpenAI
from azure.identity import DefaultAzureCredential, get_bearer_token_provider

token_provider = get_bearer_token_provider(
    DefaultAzureCredential(), 
    "https://ai.azure.com/.default"
)

client = OpenAI(
    base_url="https://<resource>.openai.azure.com/openai/v1/",
    api_key=token_provider,
)

response = client.responses.create(
    model="deepseek-v3-0324",  # Replace with your model deployment name.
    input="What is Azure AI?",
)

print(response.output_text)

Saída esperada

Azure AI is a comprehensive suite of artificial intelligence services and tools from Microsoft that enables developers to build intelligent applications. It includes services for natural language processing, computer vision, speech recognition, and machine learning capabilities.

Referência: OpenAI Python SDK e classeDefaultAzureCredential.