Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Neste artigo, aprende como:
- Localiza e abre as corridas de avaliação.
- Consulte métricas agregadas e ao nível da amostra.
- Compare os resultados entre as corridas.
- Interpretar categorias métricas e cálculos.
- Resolver problemas de métricas em falta ou parciais.
Pré-requisitos
Papel de utilizador da Foundry no projeto Foundry. Para mais informações, consulte Controlo de acesso baseado em funções para Microsoft Foundry.
Importante
As funções RBAC do Foundry foram recentemente renomeadas. Foundry User, Foundry Owner, Foundry Account Owner e Foundry Project Manager foram anteriormente nomeados Azure AI User, Azure AI Owner, Azure AI Account Owner e Azure AI Project Manager. Poderá ainda ver os nomes anteriores em alguns locais enquanto esta alteração de nome está a ser implementada. Os IDs das funções e as permissões principais não são alterados por esta mudança de nome.
Uma avaliação concluída.
- Para realizar avaliações no portal, consulte Avaliar modelos e aplicações de IA generativa.
- Para executar avaliações a partir do SDK, veja Executar avaliações a partir do SDK ou Avaliar os seus agentes de IA.
Veja os resultados da sua avaliação
No portal Foundry, vá ao seu projeto e selecione Avaliação no painel esquerdo.
Selecione uma avaliação executada na lista para abrir a sua página de detalhes. Se a execução ainda estiver em curso, o estado mostra Em Execução e atualiza-se automaticamente quando concluída.
A página de detalhes mostra:
Campo Descrição Nome O nome da execução de avaliação. Alvo O modelo ou agente que foi avaliado. Conjunto de dados O conjunto de dados de teste utilizado. Selecione o ícone de download para exportar como ficheiro CSV. Estado Estado atual da corrida (Em Curso, Concluída ou Falhada). Tokens de avaliação Tokens consumidos pelos avaliadores durante a execução. Tokens-alvo Tokens consumidos pelo modelo ou agente avaliado. Pontuações Pontuação agregada para cada avaliador utilizado. Passe o rato sobre uma célula de pontuação para ver detalhes de utilização do token e contexto adicional.
Selecione Saiba mais sobre métricas para ver definições de métricas e fórmulas de pontuação.
Detalhes da execução de avaliação
Selecione o nome da execução para visualizar os resultados a nível de linha para cada uma das consultas. Para cada linha, pode ver a consulta, a resposta, a verdade de base, a pontuação do avaliador e a explicação da pontuação.
Compare os resultados da avaliação
Para comparar duas ou mais corridas, selecione as que quer comparar e inicie o processo.
- Selecione duas ou mais corridas na página de detalhe da avaliação.
- Selecionar Comparar.
Vês uma vista de comparação lado a lado para todas as corridas selecionadas.
A comparação utiliza testes estatísticos t, que lhe dão resultados mais sensíveis e fiáveis para o ajudar a tomar decisões. Pode usar diferentes funcionalidades desta funcionalidade:
- Comparação da linha de base: Ao definir uma linha de base, pode identificar um ponto de referência para comparar as outras execuções. Podes ver como cada corrida se desvia do padrão escolhido.
- Avaliação estatística do teste t: Cada célula fornece os resultados do stat-signature com diferentes códigos de cor. Também podes passar o rato na célula para obter o tamanho da amostra e o valor p.
| Legenda | Definição |
|---|---|
| MelhoredStrong | Altamente estatisticamente significativo (p<=0,001) e moveu-se na direção desejada |
| Fraco Melhorado | Stat-sig (0,001<p<=0,05) e moveu-se na direção desejada |
| DegradadoForte | Altamente estatisticamente significativo (p<=0,001) e direcionou-se na direção errada |
| DegradadoFraco | Stat-sig (0,001<p<=0,05) e moveu-se na direção errada |
| ChangedStrong | Significância estatística alta (p<=0,001) e a direção desejada é neutra |
| Alterado para Fraco | Stat-sig (0,001<p<=0,05) e a direção desejada é neutra |
| Inconclusivo | Poucos exemplos, ou p>=0,05 |
Nota
A vista de comparação não é guardada. Se saíres da página, podes voltar a selecionar as execuções e selecionar Comparar para regenerar a visualização.
Compreenda as métricas de avaliação incorporadas
Compreender as métricas incorporadas é essencial para avaliar o desempenho e a eficácia da sua aplicação de IA. Ao aprender sobre estas ferramentas chave de medição, pode interpretar os resultados, tomar decisões informadas e afinar a sua aplicação para alcançar resultados ótimos.
Para saber mais, consulte Avaliadores integrados.
Resolução de problemas
| Sintoma | Causa possível | Ação |
|---|---|---|
| A execução mantém-se pendente | Carga de serviço elevada ou tarefas em fila | Atualize, verifique a quota e submeta novamente se for prolongado |
| Métricas em falta | Não selecionado na criação | Executar novamente e selecionar métricas necessárias |
| Todas as métricas de segurança estão a zero | Categoria modelo desativado ou não suportado | Confirmar o suporte dos modelos e avaliadores em avaliadores de risco e segurança |
| Aterramento inesperadamente reduzido | Recuperação/contexto incompleto | Verificar a construção do contexto / latência de recuperação |