Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
[Este artigo é uma documentação de pré-lançamento e está sujeito a alterações.]
Depois de criar um conjunto de testes com conversas, faça uma avaliação para medir o desempenho do seu agente. A avaliação processa cada conversa e produz resultados pontuados com base no método de teste selecionado.
Importante
- Esta é uma versão prévia do recurso pronta para produção.
- As versões preliminares prontas para produção estão sujeitas a termos de uso complementares.
Pré-requisitos
- Um agente criado e salvo com a estrutura do GitHub Copilot. Veja Criar um agente (versão preliminar).
- Pelo menos uma avaliação com conversas. Consulte Criar um conjunto de testes para um agente (versão preliminar).
Para realizar uma avaliação para um agente:
- Abra seu agente no Copilot Studio.
- Selecione a guia Avaliar.
- No menu suspenso Avaliação, selecione a avaliação que deseja executar.
- Adicione pelo menos uma conversa ao conjunto de testes, caso ainda não tenha feito isso.
- No painel Configurar conjunto de testes, verifique:
- O Nome da avaliação está definido.
- O método de teste está configurado (por exemplo, Qualidade geral).
- Selecione Avaliar para iniciar a avaliação. A avaliação processa cada conversa no conjunto de testes. Dependendo do número de conversas, esse processo pode levar vários minutos.
Dica
Faça a mesma avaliação várias vezes. Cada execução é salva separadamente, para que você possa comparar os resultados entre execuções e ver como as alterações no seu agente afetam a qualidade.
Executar novamente uma avaliação
Depois de alterar as instruções, conhecimentos ou ferramentas do seu agente, refaça a avaliação para medir o impacto:
- Na guia Avaliar, selecione a avaliação que deseja reexecutar no menu suspenso Avaliação.
- Em Resultados recentes, selecione Avaliar conjunto de teste novamente ou selecione o ícone Avaliar conjunto de teste dentro
do conjunto de teste para iniciar uma nova execução. - Compare os resultados da nova corrida com as anteriores para ver se as mudanças melhoraram ou degradaram o desempenho.