Azure AI Model Inference REST API reference

A inferência de modelos de IA do Azure é uma API que expõe um conjunto comum de capacidades para modelos fundamentais e que pode ser usada por desenvolvedores para consumir previsões de um conjunto diversificado de modelos de forma uniforme e consistente. Os desenvolvedores podem se comunicar com diferentes modelos implantados no portal Fábrica de IA do Azure sem alterar o código subjacente que estão usando.

Benefícios

Modelos fundamentais, como os modelos de linguagem, realmente fizeram avanços notáveis nos últimos anos. Esses avanços revolucionaram diversos campos, incluindo processamento de linguagem natural e visão computacional, além de possibilitarem aplicações como chatbots, assistentes virtuais e serviços de tradução de idiomas.

Embora os modelos fundamentais se destaquem em domínios específicos, eles carecem de um conjunto uniforme de capacidades. Alguns modelos são melhores em tarefas específicas e, mesmo em uma tarefa semelhante, alguns modelos podem abordar o problema de uma forma enquanto outros de outra. Os desenvolvedores podem se beneficiar dessa diversidade usando o modelo certo para o trabalho certo , permitindo que:

  • Melhore o desempenho em uma tarefa específica a jusante.
  • Use modelos mais eficientes para tarefas mais simples.
  • Use modelos menores que possam rodar mais rápido em tarefas específicas.
  • Componha múltiplos modelos para desenvolver experiências inteligentes.

Ter uma forma uniforme de consumir modelos fundamentais permite que os desenvolvedores realizem todos esses benefícios sem sacrificar portabilidade ou alterar o código subjacente.

Suporte a SDK de inferência

O pacote Azure AI Inference permite que você consuma todos os modelos que suportam a API de inferência de modelos de IA do Azure e mude facilmente entre eles. O pacote Azure AI Inference faz parte do SDK da Fábrica de IA do Azure.

Linguagem Documentation Package Exemplos
C# Referência azure-ai-inferência (NuGet) Exemplos de C#
Java Referência Azure-AI-inferência (Maven) Exemplos de Java
JavaScript Referência @azure/IA-inferência (npm) Exemplos de JavaScript
Python Referência azure-ai-inferência (PyPi) Exemplos de Python

Capabilities

A seção a seguir descreve algumas das capacidades que a API expõe:

Modalidades

A API indica como os desenvolvedores podem consumir previsões para as seguintes modalidades:

Extensibility

A API de Inferência de Modelos de IA do Azure especifica um conjunto de modalidades e parâmetros aos quais os modelos podem se subscriver. No entanto, alguns modelos podem ter capacidades adicionais às indicadas pela API. Nesses casos, a API permite que o desenvolvedor os passe como parâmetros extras na carga útil.

Ao definir um cabeçalho extra-parameters: pass-through, a API tentará passar qualquer parâmetro desconhecido diretamente para o modelo subjacente. Se o modelo conseguir lidar com esse parâmetro, a solicitação é concluída.

O exemplo a seguir mostra uma requisição passando o parâmetro safe_prompt suportado pelo Mistral-Large, que não é especificado na API de Inferência de Modelos de IA do Azure.

Solicitação

POST /chat/completions?api-version=2025-04-01
Authorization: Bearer <bearer-token>
Content-Type: application/json
extra-parameters: pass-through
{
    "messages": [
    {
        "role": "system",
        "content": "You are a helpful assistant"
    },
    {
        "role": "user",
        "content": "Explain Riemann's conjecture in 1 paragraph"
    }
    ],
    "temperature": 0,
    "top_p": 1,
    "response_format": { "type": "text" },
    "safe_prompt": true
}

Note

O valor padrão para extra-parameters é error que retorna um erro se um parâmetro extra for indicado na carga útil. Alternativamente, você pode configurar extra-parameters: drop para eliminar qualquer parâmetro desconhecido na solicitação. Use essa funcionalidade caso você esteja enviando requisições com parâmetros extras que você sabe que o modelo não suporta, mas que você queira que a requisição seja concluída mesmo assim. Um exemplo típico disso é o parâmetro indicador seed .

Modelos com conjuntos de capacidades distintas

A API de Inferência de Modelos de IA do Azure indica um conjunto geral de capacidades, mas cada um dos modelos pode decidir implementá-las ou não. Um erro específico é retornado nos casos em que o modelo não suporta um parâmetro específico.

O exemplo a seguir mostra a resposta para um pedido de conclusão de chat indicando o parâmetro reponse_format e pedindo uma resposta no JSON formato. No exemplo, como o modelo não suporta essa capacidade, um erro 422 é devolvido ao usuário.

Solicitação

POST /chat/completions?api-version=2025-04-01
Authorization: Bearer <bearer-token>
Content-Type: application/json
{
    "messages": [
    {
        "role": "system",
        "content": "You are a helpful assistant"
    },
    {
        "role": "user",
        "content": "Explain Riemann's conjecture in 1 paragraph"
    }
    ],
    "temperature": 0,
    "top_p": 1,
    "response_format": { "type": "json_object" },
}

Resposta

{
    "status": 422,
    "code": "parameter_not_supported",
    "detail": {
        "loc": [ "body", "response_format" ],
        "input": "json_object"
    },
    "message": "One of the parameters contain invalid values."
}

Dica

Você pode inspecionar a propriedade details.loc para entender a localização do parâmetro infrator e details.input ver o valor que foi passado na solicitação.

Segurança de conteúdo

A API de inferência de modelos de IA Azure suporta Segurança de Conteúdo de IA do Azure. Ao usar implantações com o Segurança de Conteúdo de IA do Azure ativado, entradas e saídas passam por um conjunto de modelos de classificação voltados para detectar e prevenir a saída de conteúdo nocivo. O sistema de filtragem de conteúdo (prévia) detecta e age em categorias específicas de conteúdo potencialmente prejudicial tanto em prompts de entrada quanto em conclusãos de saída.

O exemplo a seguir mostra a resposta para uma solicitação de conclusão de chat que acionou a segurança de conteúdo.

Solicitação

POST /chat/completions?api-version=2025-04-01
Authorization: Bearer <bearer-token>
Content-Type: application/json
{
    "messages": [
    {
        "role": "system",
        "content": "You are a helpful assistant"
    },
    {
        "role": "user",
        "content": "Chopping tomatoes and cutting them into cubes or wedges are great ways to practice your knife skills."
    }
    ],
    "temperature": 0,
    "top_p": 1,
}

Resposta

{
    "status": 400,
    "code": "content_filter",
    "message": "The response was filtered",
    "param": "messages",
    "type": null
}

Como começar

A API de inferência de modelos de IA do Azure está disponível nos recursos do Azure AI Services. Você pode começar com ele da mesma forma que qualquer outro produto Azure, onde você criar e configurar seu recurso para Azure inferência de modelo de IA, ou instância do serviço, na sua Assinatura de Azure. Você pode criar quantos recursos precisarem e configurá-los de forma independente, caso tenha várias equipes com requisitos diferentes.

Depois de criar um recurso de Serviços de IA do Azure, você deve implantar um modelo antes de começar a fazer chamadas de API. Por padrão, não há modelos disponíveis, então você pode controlar por quais começar. Veja o tutorial Crie sua primeira implantação de modelo em Azure inferência de modelo de IA.