Conjuntos de dados de avaliação no Microsoft Foundry

Um conjunto de dados de avaliação é uma coleção reutilizável de casos de teste para medir a qualidade do modelo ou do agente. Os conjuntos de dados de avaliação normalmente usam JSONL, com um objeto JSON por linha. Este artigo explica quando usar um conjunto de dados reutilizável, como os dados de avaliação são organizados e as maneiras disponíveis de prepará-los.

Você precisa de um conjunto de dados de avaliação?

Crie um conjunto de dados quando quiser um conjunto de testes estável que possa ser executado novamente em diferentes versões de modelo, prompt ou agente. Conjuntos de dados reutilizáveis funcionam bem para testes de regressão, critérios de qualidade de CI/CD e comparações entre diferentes execuções de avaliação.

Nem sempre você precisa de um conjunto de dados. Se o seu agente do Foundry já tiver respostas ou se o seu aplicativo emitir rastreamentos para o Application Insights, você poderá avaliar esses dados onde eles existirem. Consulte Avaliar interações por ID de resposta e Avaliar rastreamentos.

Como o Foundry usa dados de avaliação

Em um conjunto de dados JSONL, o messages campo representa interações de modelo ou agente. Cada mensagem identifica uma função e seu conteúdo.

Se o conjunto de dados contiver respostas concluídas, o Foundry avaliará essas respostas diretamente. Se você executar a avaliação em um modelo ou agente, o Foundry gerará uma nova resposta para cada entrada e avaliará essa resposta. Qualquer resposta já armazenada no conjunto de dados é ignorada.

Por exemplo, considere um usuário que não pode entrar. O agente pergunta qual erro aparece, o usuário diz que sua senha foi rejeitada e o agente recomenda uma redefinição de senha. A avaliação em nível de turno avalia uma resposta individual de um agente, como as orientações para redefinição de senha, usando as mensagens anteriores como contexto. A avaliação em nível de conversa pontua a interação completa.

A configuração evaluation_level na execução controla a granularidade da pontuação. O conjunto de dados e os avaliadores selecionados devem dar suporte a esse nível. Para obter detalhes, consulte Escolher um nível de avaliação. Para obter colunas e exemplos padrão, consulte Esquema de conjunto de dados de avaliação.

Escolher como preparar dados de avaliação

Situação Abordagem recomendada
Você tem dados de avaliação selecionados Carregue isso como um conjunto de dados versionado do Foundry ou forneça um pequeno conjunto de dados diretamente na mensagem. Consulte Preparar dados de entrada.
Você deseja examinar e reutilizar casos de teste gerados antes de executar uma avaliação Gere um conjunto de dados de avaliação sintética de uma definição de agente, prompt embutido ou arquivo de referência.
Você deseja um conjunto de dados reutilizável com base no tráfego de produção Converter rastreamentos em um conjunto de dados.
Você deseja testar cenários simulados de várias voltas Gere um conjunto de dados de simulação ou crie cenários de caso de teste como JSONL e simule conversas.
Você tem IDs de resposta do Foundry Avalie as interações por ID de resposta sem criar um conjunto de dados.
Você deseja avaliar os rastreamentos existentes do Application Insights Avalie rastreamentos sem criar um conjunto de dados.
Você deseja gerar consultas, invocar um destino e avaliar suas respostas em um fluxo de trabalho Gere consultas sintéticas durante a execução da avaliação. Foundry salva as consultas geradas como um conjunto de dados para reutilização.

Próximas etapas