Executar avaliações a partir do portal Microsoft Foundry

Importante

Os itens marcados (pré-visualização) neste artigo encontram-se atualmente em pré-visualização pública. Esta pré-visualização é fornecida sem um acordo de nível de serviço, e não a recomendamos para cargas de trabalho em produção. Certas funcionalidades podem não ser suportadas ou podem ter capacidades limitadas. Para mais informações, consulte Termos de Utilização Suplementares para Microsoft Azure Pré-visualizações.

Teste os seus modelos e agentes de IA generativa realizando avaliações que medem desempenho, qualidade e segurança. Use avaliações antes da implementação para validar o comportamento, ou após a implementação para monitorizar a qualidade da produção. As avaliações executam o seu modelo ou agente com dados de teste e pontuam os resultados usando avaliadores incorporados ou personalizados.

Este artigo mostra-lhe como criar e executar avaliações no portal Foundry.

Pré-requisitos

  • Uma assinatura do Azure. Crie um gratuitamente.

  • Um projeto da Microsoft Foundry. Crie um projeto se não tiver um.

  • Um dos seguintes, dependendo do seu objetivo de avaliação:

    • Avaliação de agentes: Um agente no seu projeto.
    • Avaliação do modelo: Um modelo implementado ou um modelo disponível com acesso instantâneo.
    • Avaliação de conjuntos de dados: Um conjunto de dados de teste em formato CSV ou JSONL contendo resultados pré-existentes de modelos ou agentes.
  • Uma ligação Azure OpenAI com um modelo GPT implementado (por exemplo, gpt-4.1-mini). Obrigatório para avaliações de qualidade assistidas por IA.

  • Papel de utilizador da Foundry no projeto Foundry. Para mais informações, consulte Controlo de acesso baseado em funções para Microsoft Foundry.

    Importante

    As funções RBAC do Foundry foram recentemente renomeadas. Foundry User, Foundry Owner, Foundry Account Owner e Foundry Project Manager foram anteriormente nomeados Azure AI User, Azure AI Owner, Azure AI Account Owner e Azure AI Project Manager. Poderá ainda ver os nomes anteriores em alguns locais enquanto esta alteração de nome está a ser implementada. Os IDs das funções e as permissões principais não são alterados por esta mudança de nome.

Escolha uma abordagem de avaliação

Escolha uma abordagem de avaliação baseada no que pretende testar:

Target Scope Fonte de dados Melhor para
Agent Conversas completas Dados simulados Testar o comportamento do agente de ponta a ponta com cenários sintéticos antes da implementação.
Agent Conversas completas Conversas existentes Avaliar interações reais com os utilizadores para monitorizar a qualidade da produção.
Agent Turnos individuais Conjunto de dados existente Depuração de respostas específicas de agentes, uso de ferramentas de teste, análise detalhada.
Agent Turnos individuais Dados sintéticos Teste de cenários de pergunta-resposta ou de RAG de um único turno com consultas geradas.
Agent Turnos individuais Vestígios existentes Avaliar vestígios históricos de agentes do seu projeto.
Modelo Turnos individuais Dados sintéticos Testar a conclusão do modelo com prompts gerados.
Modelo Turnos individuais Conjunto de dados existente Avaliação comparativa do desempenho do modelo face a um conjunto de testes criteriosamente selecionado.
Conjunto de dados Turnos individuais (Conjunto de dados é o alvo) Avaliar resultados pré-existentes sem repetir o modelo ou agente.

Dica

Comece com Agente > Conversas completas > Dados simulados para testar o comportamento do seu agente em cenários controlados. Use as conversas existentes quando o seu agente estiver em produção para monitorizar o desempenho no mundo real.

Crie uma avaliação

Pode iniciar uma avaliação a partir de vários locais no portal Foundry:

  • Página de avaliação: No painel esquerdo, selecione Criar Avaliação>.
  • Página de Modelos: Vai ao teu modelo, seleciona o separador Avaliação e depois seleciona Criar.
  • Página de agentes: Vá ao seu agente, selecione o separador Avaliação e depois selecione Criar.
  • Agent Playground: Vá ao seu agente, selecione o separador Playground e depois selecione Métricas>Executar avaliação completa.

Passo 1: Selecionar o objetivo de avaliação

Ao criar uma avaliação, escolha primeiro o objetivo da avaliação. O alvo determina contra o que a avaliação se aplica:

Target Description
Agent Avalia a saída gerada pelo agente selecionado e pela entrada definida pelo utilizador. Funciona tanto para agentes de resposta como agentes hospedados.
Modelo Avalia a saída gerada pelo modelo selecionado e pelo prompt definido pelo utilizador.
Conjunto de dados Avalia os resultados preexistentes de um modelo ou agente a partir de um conjunto de dados de teste.
Traces Avalia as interações com agentes já captadas em Application Insights. Selecione o agente e o intervalo temporal, e o portal recupera as pistas correspondentes para avaliação. Para o equivalente ao SDK, veja Trace de avaliação.

Dica

Acesso instantâneo: O acesso instantâneo são modelos sem implementação que pode usar imediatamente sem necessidade de criar uma implementação. Ao criar uma avaliação, pode selecionar um modelo instantâneo como alvo de avaliação ou como modelo de julgamento diretamente do selecionador do modelo.

Passo 2: Selecionar o âmbito da avaliação

Nota

Este passo aparece apenas para alvos de Agente e Conjunto de Dados . As avaliações dos modelos usam sempre turnos individuais.

Escolha como pretende avaliar o desempenho do seu agente:

Scope Description Melhor para
Conversas completas (pré-visualização) Avalia conversas completas com vários turnos do início ao fim. Mede a qualidade global da conversa, a conclusão das tarefas e a satisfação do utilizador. Testar experiências de agentes de ponta a ponta, satisfação do cliente e fluxo de conversa.
Turnos individuais Avalia as respostas individuais dos agentes durante as conversas. Mede métricas por turno, como a precisão da seleção da ferramenta e a qualidade da resposta. Depuração de comportamentos específicos de agentes, utilização de ferramentas de teste e análise detalhada.

Passo 3: Selecionar a fonte dos dados

As opções de fontes de dados dependem do seu objetivo e âmbito de avaliação.

Para avaliações de conversas (conversas completas do agente >) (pré-visualização)

Escolha de onde vêm os dados das suas conversas:

Dados simulados

Gera conversas sintéticas ao comparar o seu agente com descrições de cenários de um conjunto de dados. Use esta opção para testar o comportamento do seu agente em cenários controlados antes da implementação.

  1. Selecione dados simulados.

  2. Selecione Gerar para abrir o diálogo de configuração da simulação.

  3. Selecione o seu ficheiro: Escolha um conjunto de dados que contenha descrições de cenários. Cada linha do seu conjunto de dados descreve um cenário que usa para gerar uma conversa simulada.

    Captura de ecrã que mostra a pré-visualização do conjunto de dados no diálogo de simulação.

  4. Selecionar modelo: Escolha o modelo que simule o utilizador na conversa:

    • gpt-4.1 (recomendado para cenários complexos)
    • gpt-4o
    • gpt-4o-mini
    • gpt-4.1-mini
  5. Configurar as definições da simulação:

    • Número de conversas simuladas por cenário: Quantas conversas gerar para cada linha do seu conjunto de dados (1-5). Múltiplas conversas por cenário ajudam a identificar variações no comportamento do agente.
    • Número de turnos por conversa: Turnos máximos permitidos por conversa (1-50). A conversa termina quando a tarefa está concluída ou quando esse limite é atingido.
  6. Selecione Confirmar para guardar a sua configuração de simulação.

Conversas existentes

Avalie conversas reais que o seu agente já teve com os utilizadores.

  1. Selecione Conversas Existentes.
  2. Configurar opções de filtragem:
    • Número de conversas: Número máximo de conversas a amostrar do intervalo de datas (1-100).
    • Intervalo temporal: Filtre as conversas por período. Use filtros rápidos (Last Day, 7D, 1M, 3M) ou selecione um intervalo de datas personalizado.
  3. Navegue e selecione conversas específicas para incluir na avaliação.

Para avaliações individuais de turnos

Escolha de onde provêm os seus dados de avaliação:

Dados sintéticos

Gera consultas de teste usando IA. Selecione Sintético e configure o número de linhas e um prompt que descreva os dados a gerar. Também pode carregar ficheiros para aumentar a relevância.

Nota

A geração de dados sintéticos requer um modelo com capacidade de API de Respostas. Para disponibilidade, consulte Disponibilidade de regiões da API de Respostas.

Conjunto de dados existente

Use um conjunto de dados preparado em formato CSV ou JSONL. Selecione Conjunto de dados existente e escolha um ficheiro dos ativos de dados do seu projeto. Apenas são suportados formatos de ficheiro CSV e JSONL.

Traços existentes (apenas agente)

Avalie os vestígios históricos do seu projeto. Selecione Traços existentes e filtre por intervalo de datas para selecionar traços.

Conteúdo multimodal (pré-visualização)

Todos os objetivos de avaliação suportam conteúdos de imagem e áudio. Cada tipo de conteúdo utiliza um esquema JSONL específico:

Conteúdo da imagem:

  • image_url: A imagem como um URI de dados (por exemplo, data:image/png;base64,...) ou uma URL acessível publicamente.
  • caption: Uma descrição em texto do conteúdo da imagem.
{"image_url": "data:image/png;base64,iVBOR...", "caption": "A red to blue color gradient"}

Conteúdo áudio:

  • audio_data: O áudio como um URI de dados com dados WAV codificados em base64 (por exemplo, data:audio/wav;base64,...).
  • expected: Uma descrição em texto do conteúdo áudio esperado.

Nota

Atualmente, apenas o formato de áudio WAV é suportado.

{"audio_data": "data:audio/wav;base64,UklGR...", "expected": "A short beep tone at 440 Hz"}

Os conjuntos de dados também podem usar o formato de conversa de mensagens de chat, onde dados de áudio e imagem estão incorporados numa única coluna de mensagens de chat como URIs de dados ou URLs acessíveis publicamente.

O exemplo seguinte mostra uma coluna de conjunto de dados de conversas com conteúdo de imagem e áudio incorporado:

[
  {
    "role": "system",
    "content": "..."
  },
  {
    "role": "user",
    "content": [
      {
        "type": "text",
        "text": "What are in these images?"
      },
      {
        "type": "image_url",
        "image_url": {
          "url": "https://example.com/path/image.png"
        }
      },
      {
        "type": "image_url",
        "image_url": {
          "url": "data:image/png;base64,iVBORw0KGgo..."
        }
      }
    ]
  },
  {
    "role": "assistant",
    "content": "..."
  },
  {
    "role": "user",
    "content": [
      {
        "type": "text",
        "text": "Tell me the tones for the voices?"
      },
      {
        "type": "input_audio",
        "input_audio": {
          "data": "https://example.com/path/voice.wav",
          "format": "wav"
        }
      },
      {
        "type": "input_audio",
        "input_audio": {
          "data": "data:audio/wav;base64,UklGRigAAA...",
          "format": "wav"
        }
      }
    ]
  }
]

Pode pré-visualizar imagens e reproduzir excertos áudio diretamente no fluxo de criação da avaliação e na vista de resultados da avaliação.

Passo 4: Configurar agentes

Nota

Este passo aparece apenas para avaliações de agentes .

Personalize o comportamento do seu agente durante a avaliação:

  1. Revise a lista de agentes envolvidos na sua avaliação.
  2. Para cada agente, selecione Configurar para personalizar o seu comportamento:
    • Instrução do sistema: Modifique as instruções do agente para a avaliação.
    • Prompt do utilizador: Especifique como cada item do conjunto de dados é enviado ao seu agente durante a avaliação.
  3. A execução de avaliação preserva as configurações do agente.

Configuração do prompt do utilizador

O prompt do utilizador define como as entradas de teste são passadas ao seu agente. Por defeito, o portal usa {{item.query}} para passar a consulta do conjunto de dados diretamente ao seu agente.

Na maioria dos casos, podes usar o padrão. Só altere este valor se o seu agente esperar um formato de entrada diferente. Por exemplo, se o seu agente usar um protocolo de agente hospedado ou exigir entrada estruturada com campos adicionais.

Padrões comuns:

Format Quando utilizar
{{item.query}} Predefinido. Passa diretamente o campo de consulta do seu conjunto de dados.
{{item.messages}} Para agentes que esperam o histórico de conversas como entrada.
JSON personalizado Para agentes alojados ou APIs que requerem corpos de pedido estruturados.

Dica

Utilize prompts personalizados para testar casos-limite ou cenários específicos que possam não ocorrer naturalmente no seu conjunto de dados.

Passo 5: Configurar o mapeamento de campos

Nota

Este passo surge quando utilizas dados existentes (conversas existentes, conjunto de dados existentes ou vestígios existentes).

Mapeie os seus campos de dados para os campos que cada avaliador espera. Os campos exigidos dependem do âmbito da tua avaliação.

Para avaliações de conversação (múltiplos turnos)

Campo Description Obrigatório
mensagens As mensagens de conversa em formato de chat. Sim
tool_definitions Definições de ferramentas ou funções disponíveis para o agente. Sim

Para avaliações individuais de turno (turno único)

Campo Description Obrigatório
query A consulta ou o pedido do utilizador. Sim
response A resposta do modelo ou agente. Sim
contexto Contexto recuperado para cenários RAG. No
ground_truth Resposta correta esperada para comparação. No
tool_calls Chamadas a ferramentas feitas pelo agente. No
tool_definitions Definições de ferramentas disponíveis. No

O portal tenta automaticamente mapear os campos do seu conjunto de dados. Se um campo aparecer como Não Atribuído, selecione o menu suspenso para atribuir manualmente uma coluna do seu conjunto de dados.

Nota

Os campos obrigatórios estão marcados com um asterisco (*). Os avaliadores falham se os campos obrigatórios não forem atribuídos.

Passo 6: Selecionar os critérios de teste

Selecione os avaliadores a utilizar para a sua avaliação. A Microsoft Foundry disponibiliza três categorias de avaliadores integrados. Os avaliadores disponíveis dependem do âmbito da sua avaliação.

Avaliadores de agentes

Avalie a eficácia com que os agentes lidam com tarefas, ferramentas e a intenção do utilizador. Disponível apenas para o âmbito de turnos individuais.

Avaliador Description
Resolução de Intenções Mede se o agente identificou e abordou corretamente a intenção do utilizador.
Aderência à Tarefa Mede quão bem o agente seguiu instruções e restrições.
Sucesso na Chamada de Ferramenta Avalia se as chamadas de ferramenta foram executadas com sucesso.
Seleção de Ferramentas Mede se o agente selecionou as ferramentas adequadas para a tarefa.
Utilização dos Resultados da Ferramenta Avalia quão eficazmente o agente utilizou os resultados da ferramenta nas respostas.
Precisão da Entrada da Ferramenta Mede se o agente forneceu entradas corretas às ferramentas.
Precisão da chamada de ferramenta Precisão geral no uso da ferramenta.

Avaliadores de qualidade

Mede a qualidade global das respostas geradas. A maioria dos avaliadores de qualidade está disponível em todos os âmbitos de avaliação. Os avaliadores assinalados com ★ suportam tanto a análise ao nível da conversa como a análise ao nível do turno.

Avaliador Description Suporte a conversas
Satisfação do Cliente Prevê a satisfação do utilizador com a interação com o agente.
Conclusão da Tarefa Avalia se o agente completou com sucesso a tarefa solicitada.
Coherence Mede o fluxo lógico e a consistência das respostas.
Groundedness Mede se as respostas estão fundamentadas no contexto fornecido.
Completude da resposta Avalia se as respostas respondem totalmente às questões dos utilizadores.
Fluency Avalia a qualidade da linguagem natural.
Relevance Avalia a relevância das respostas para a questão.

Avaliadores de segurança

Identifique potenciais riscos de conteúdo e segurança. Disponível apenas para o âmbito de turnos individuais.

Avaliador Description
Violência Deteta conteúdo violento nas respostas.
Sexual Deteta conteúdo sexual.
Automutilação Deteta conteúdo relacionado com automutilação.
Ódio/Injustiça Deteta conteúdo odioso ou tendencioso.

O portal pré-seleciona avaliadores recomendados com base no seu objetivo e âmbito de avaliação:

  • Conversas completas: Satisfação do Cliente, Conclusão de Tarefas, Coerência, Fundamento
  • Turnos individuais (dados existentes): Todos os avaliadores de agentes mais avaliadores de Qualidade e Segurança
  • Turnos individuais (sintéticos/traços): Relevância, Fundamento, Fluência, Coerência

Dica

Pode adicionar ou remover avaliadores conforme necessário. Selecione avaliadores personalizados para usar os avaliadores que definiu no seu projeto.

Passo 7: Rever e enviar

  1. Insera um nome para a sua avaliação.
  2. Reveja a sua configuração:
    • Objetivo e âmbito da avaliação
    • Fonte de dados e conjunto de dados
    • Avaliadores selecionados
    • Mapeamentos de campo (se aplicável)
  3. Selecione Enviar para iniciar a avaliação.

Depois de submeter, a execução da avaliação começa. As avaliações normalmente são concluídas em poucos minutos, dependendo do tamanho do conjunto de dados e do número de conversas simuladas.

Para garantir que a sua avaliação foi bem-sucedida:

  1. No painel esquerdo, selecione Avaliação.
  2. Encontre a sua avaliação na lista. A coluna Estado mostra o estado atual:
    • Em Progresso: A avaliação está a decorrer.
    • Concluído: A avaliação foi concluída com sucesso.
    • Parcial: Alguns avaliadores completaram, mas outros falharam.
    • Falhou: A avaliação encontrou um erro.

Para ver resultados detalhados, selecione o nome da avaliação ou consulte Ver os resultados da avaliação.

Dica

Para fluxos de trabalho de avaliação programática, use o Azure AI Evaluation SDK. Veja Como executar a avaliação em lote com o SDK.

Troubleshooting

A avaliação expira ou é executada lentamente

  • Reduza o número de conversas ou de linhas do conjunto de dados.
  • Para simulações, reduza o número máximo de turnos por conversa.
  • Verifique se o seu modelo de juiz tem quotas suficientes.

Erros de mapeamento de campos

  • Verifique se o seu conjunto de dados contém as colunas necessárias para o âmbito da sua avaliação.
  • Para avaliações de conversas, certifique-se de que a coluna de mensagens contém mensagens de chat devidamente formatadas.
  • Verifica se os nomes das colunas no teu conjunto de dados correspondem aos nomes dos campos esperados.

Quota do modelo excedida

  • O modelo de juiz utilizado para avaliações assistidas por IA conta para a sua quota do Azure OpenAI.
  • Use um conjunto de dados mais pequeno ou espere que a quota seja atualizada.
  • Considere usar gpt-4.1-mini em vez de gpt-4.1 para avaliações económicas.

Melhores práticas

Para avaliações baseadas em simulação

  • Começa pequeno: Começa com 1 conversa por cenário e 5-10 turnos para validar a tua configuração antes de aumentares.
  • Cenários diversos: Inclua uma variedade de descrições de cenários para testar as capacidades de diferentes agentes.
  • Iterar nos prompts: Se os agentes se comportarem de forma inesperada, use o passo Configurar agentes para ajustar os prompts.

Para avaliações de conversações existentes

  • Exemplo representativo: Selecione conversas que representem interações típicas dos utilizadores.
  • Inclua casos extremos: Não avalie apenas conversas bem-sucedidas — inclua cenários desafiantes.
  • Avaliação regular: Agende avaliações recorrentes para acompanhar o desempenho dos agentes ao longo do tempo.

Para avaliações de modelos

  • Conjuntos de dados de referência: Utilize conjuntos de dados padronizados para comparar o desempenho dos modelos entre versões.
  • Teste tanto as implementações como o acesso imediato: Compare as suas implementações ajustadas com os modelos de base.

Para avaliações de conjuntos de dados

  • Pré-computação de resultados: Gere resultados offline e avalie-os em lote para maior eficiência de custos.
  • Versão dos seus conjuntos de dados: Acompanhe qual versão do conjunto de dados produziu que resultados de avaliação.

Sugestões gerais

  • Compare os avaliadores: Submeta os mesmos dados a vários avaliadores para obter uma visão mais abrangente.
  • Acompanhe tendências: Use o histórico de avaliações para identificar melhorias ou regressões de desempenho.
  • Atue com base nos resultados: Utilize as informações da avaliação para refinar as instruções dos agentes, as definições das ferramentas e as configurações.

Saiba mais sobre como avaliar os seus modelos e agentes de IA generativa: