Pontos de extremidade para Modelos do Microsoft Foundry

O Microsoft Foundry Models fornece acesso a uma ampla variedade de modelos de vários provedores por meio de um único endpoint e conjunto de credenciais. Essa funcionalidade permite alternar entre modelos e usá-los em seu aplicativo sem fazer alterações de código.

Este artigo explica como os serviços Foundry organizam modelos e como usar o endpoint de inferência para acessá-los.

Pré-requisitos

Implantações

O Foundry usa implantações como aliases para acessar modelos. Uma implantação fornece a um modelo um nome e um conjunto de configurações. Você acessa um modelo usando seu nome de implantação em suas solicitações.

Uma implantação define:

  • Um nome do modelo
  • Uma versão do modelo
  • Um tipo de provisionamento ou capacidade1
  • Uma configuração de filtragem de conteúdo1
  • Uma configuração de limitação de taxa1

1 Essas configurações podem ser alteradas dependendo do modelo selecionado.

Um recurso Foundry pode ter muitas implantações de modelo. Você paga apenas pela inferência executada em implantações de modelo. As implantações são recursos do Azure, portanto, estão sujeitas às políticas do Azure.

Para obter mais informações sobre como criar implantações, consulte Adicionar e configurar implantações de modelo.

Ponto de extremidade de inferência do OpenAI do Azure

A API Azure OpenAI expõe todos os recursos de modelos OpenAI e dá suporte a mais recursos como assistentes, threads, arquivos e inferência em lote. Você também pode usá-lo para acessar modelos não OpenAI.

Os endpoints do Azure OpenAI são formatados como https://<resource-name>.openai.azure.com. Pontos de extremidade correspondem a implantações, e cada implantação tem sua própria URL associada. No entanto, você pode usar o mesmo mecanismo de autenticação para acessar mais de uma implantação. Para obter mais informações, consulte a página de referência para Azure API OpenAI.

Uma ilustração que mostra como as implantações do Azure OpenAI contêm uma única URL para cada implantação.

As URLs de implantação são formadas concatenando a URL base do Azure OpenAI e a rota/deployments/<model-deployment-name>. Ao usar a API OpenAI v1, chame a rota /openai/v1/ na URL base https://<resource-name>.openai.azure.com/openai/v1/ e passe o nome da implantação no campo model da solicitação. A rota /openai/v1/ usa controle de versão implícito, portanto, você não fornece um api-version.

Os exemplos a seguir usam a API de Respostas, que dá suporte aos recursos de inferência mais recentes.

Note

A API de Respostas funciona com modelos do Azure OpenAI e com Modelos do Foundry vendidos pelo Azure que oferecem suporte à API, como os modelos DeepSeek, Llama e Grok. Se uma implantação não der suporte à API de Respostas, a solicitação retornará 400 Model not supported. Nesse caso, use a API de Conclusões de Chat chamando client.chat.completions.create em vez disso.

Usar autenticação de chave de API

Você pode autenticar solicitações de inferência com uma chave de API do recurso foundry. As chaves de API são rápidas de configurar, mas concedem acesso total ao recurso, são difíceis de definir o escopo para usuários ou ações específicos e exigem rotação manual para se manterem seguras. Para cargas de trabalho de produção, use a autenticação sem chave com Microsoft Entra ID em vez disso.

No exemplo a seguir, deepseek-v3-0324 é o nome de uma implantação de modelo no recurso Microsoft Foundry. Substitua-o pelo seu próprio nome de implantação e armazene sua chave de API na variável de AZURE_INFERENCE_CREDENTIAL ambiente.

Instale o openai pacote usando pip:

pip install openai --upgrade

Crie um cliente que aponte para o endpoint do Azure OpenAI v1 e gere uma resposta. A rota /openai/v1/ usa controle de versão implícito, portanto, você não fornece um api-version. Insira o nome da implantação no campo model:

import os
from openai import OpenAI

client = OpenAI(
    base_url="https://<resource>.openai.azure.com/openai/v1/",
    api_key=os.environ["AZURE_INFERENCE_CREDENTIAL"],
)

response = client.responses.create(
    model="deepseek-v3-0324",  # Replace with your model deployment name.
    input="Explain the Riemann hypothesis in one paragraph.",
)

print(response.output_text)

Para obter mais informações sobre como usar o endpoint do Azure OpenAI, consulte suporte a idiomas do SDK do Azure OpenAI.

Usar autenticação sem chave

Os modelos do Foundry implantados dão suporte à autorização sem uso de chave com o Microsoft Entra ID. A autorização sem chave aprimora a segurança, simplifica a experiência do usuário, reduz a complexidade operacional e fornece suporte robusto à conformidade. Use a autorização sem chave se sua organização usar soluções de gerenciamento de identidade seguras e escalonáveis.

Para usar a autenticação sem chave, configure seu recurso e conceda acesso aos usuários para executar a inferência. Depois de configurar o recurso e conceder acesso, autentique da seguinte maneira:

Instale o SDK do OpenAI usando um gerenciador de pacotes como pip:

pip install openai

Para Microsoft Entra ID autenticação, instale também:

pip install azure-identity

Use o pacote para consumir o modelo. O exemplo a seguir mostra como criar um cliente e fazer uma chamada de teste para a API de Respostas usando Microsoft Entra ID e sua implantação de modelo.

Substitua <resource> pelo nome do recurso Foundry. Localize-o no portal do Azure ou executando az cognitiveservices account list. Substitua deepseek-v3-0324 pelo nome da implantação real.

from openai import OpenAI
from azure.identity import DefaultAzureCredential, get_bearer_token_provider

token_provider = get_bearer_token_provider(
    DefaultAzureCredential(), 
    "https://ai.azure.com/.default"
)

client = OpenAI(
    base_url="https://<resource>.openai.azure.com/openai/v1/",
    api_key=token_provider,
)

response = client.responses.create(
    model="deepseek-v3-0324",  # Replace with your model deployment name.
    input="What is Azure AI?",
)

print(response.output_text)

Saída esperada

Azure AI is a comprehensive suite of artificial intelligence services and tools from Microsoft that enables developers to build intelligent applications. It includes services for natural language processing, computer vision, speech recognition, and machine learning capabilities.

Referência: OpenAI Python SDK e classeDefaultAzureCredential.