Referência de avaliadores internos

Importante

Itens marcados (versão prévia) neste artigo estão atualmente em versão prévia pública. Essa versão prévia é fornecida sem um contrato de nível de serviço e não recomendamos isso para cargas de trabalho de produção. Alguns recursos podem não ter suporte ou ter recursos restritos. Para obter mais informações, consulte Supplemental Terms of Use for Microsoft Azure Previews.

Microsoft Foundry inclui avaliadores internos para avaliar a qualidade, a segurança e a confiabilidade das respostas de IA em todo o ciclo de vida de desenvolvimento. Essa referência lista todos os avaliadores disponíveis, suas finalidades e diretrizes sobre como selecionar o correto para seu caso de uso. Você também pode criar avaliadores personalizados adaptados aos critérios de avaliação específicos.

Conforme você escolhe os avaliadores, o Microsoft Habilidade de Pesquisa pode ajudar a conectar essa referência à configuração de avaliação, otimização de prompt e solução de problemas de fluxos de trabalho.

Avaliadores de finalidade geral

Avaliador Purpose
Coerência Mede a consistência lógica e o fluxo de respostas.
Fluência Mede a qualidade e a legibilidade da linguagem natural.

Para saber mais, confira os avaliadores de uso geral.

Avaliadores de similaridade textual

Avaliador Purpose
Semelhança Medida de similaridade textual assistida por IA.
Pontuação F1 A média harmônica de precisão e recall no token se sobrepõe entre a resposta e a verdade básica.
BLEU A pontuação de Subestudo de Avaliação Bilíngue para medidas de qualidade de tradução se sobrepõe em n-gramas entre a resposta e a verdade básica.
GLEU Google-BLEU variante para medidas de avaliação em nível de frase se sobrepõe em n-gramas entre resposta e verdade fundamentada.
ROUGE Recall-Oriented Understudy for Gisting Avaliação mede sobreposições em n-gramas entre resposta e verdade de base.
METEORO A métrica para avaliação de tradução com medidas de ordenação explícita se sobrepõe em n-gramas entre a resposta e a verdade do solo.

Para saber mais, confira os avaliadores de similaridade textual.

Avaliadores de RAG

Avaliador Purpose
Recuperação Mede a eficiência com que o sistema recupera informações relevantes.
Recuperação de documento Mede a precisão nos resultados de recuperação dada a verdade básica.
Groundedness Mede o quão fundamentada a resposta está no contexto recuperado. Retorna uma pontuação de 1 a 5 usando um julgamento baseado em modelo.
Aterramento Pro (versão prévia) Mede se a resposta está fundamentada no contexto recuperado usando o serviço Segurança de Conteúdo de IA do Azure. Retorna uma passagem/falha binária sem a necessidade de uma implantação de modelo.
Relevância Mede o quão relevante é a resposta em relação à consulta.
Integridade da resposta (versão prévia) Medidas até que ponto a resposta é completa (não faltando informações críticas) em relação à verdade básica.

Para saber mais, confira os avaliadores de RAG (Geração Aumentada de Recuperação).

Avaliadores de risco e segurança

Avaliador Purpose
Ódio e injustiça Identifica conteúdo tendencioso, discriminatório ou odioso.
Sexual Identifica conteúdo sexual inadequado.
Violência Detecta conteúdo violento ou incitação.
Automutilação Detecta conteúdo que promove ou descreve a automutilação.
Materiais protegidos Detecta o uso não autorizado de conteúdo protegido ou protegido por direitos autorais.
Ataque indireto (XPIA) Mede se a resposta caiu para uma tentativa indireta de jailbreak injetada por meio do contexto recuperado.
Vulnerabilidade de código Identifica problemas de segurança no código gerado.
Atributos sem base Detecta informações fabricadas ou errôneas inferidas das interações do usuário.
Ações proibidas Mede a capacidade de um agente de IA de se envolver em comportamentos que violam ações explicitamente não permitidas.
Vazamento de dados confidenciais Mede a vulnerabilidade de um agente de IA para expor informações confidenciais.

Para saber mais, consulte avaliadores de risco e segurança.

Avaliadores de Agentes

Avaliador Purpose
Adesão à tarefa (versão prévia) Mede se o agente segue em tarefas identificadas de acordo com as instruções do sistema.
Conclusão da tarefa (versão prévia) Mede se o agente concluiu com êxito a tarefa solicitada de ponta a ponta.
Satisfação do cliente (versão prévia) Mede a satisfação holística do usuário em uma conversa usando seis dimensões: utilidade, integridade, clareza, tom, resolução e adaptabilidade.
Resolução de intenção (versão prévia) Mede a precisão com que o agente identifica e aborda as intenções do usuário.
Eficiência de navegação da tarefa Determina se a sequência de etapas do agente corresponde a um caminho ideal ou esperado para medir a eficiência.
Precisão de chamada de ferramenta Mede a qualidade geral das chamadas de ferramenta, incluindo seleção, correção de parâmetro e eficiência.
Seleção de ferramenta Mede se o agente selecionou as ferramentas mais apropriadas e eficientes para uma tarefa.
Precisão da entrada da ferramenta Valida que todos os parâmetros de chamada de ferramenta estão corretos com critérios estritos, incluindo aterramento, tipo, formato, integridade e adequação.
Utilização da saída da ferramenta Mede se o agente interpreta e usa corretamente as saídas da ferramenta contextualmente em respostas e chamadas subsequentes.
Êxito na chamada de ferramenta Avalia se todas as chamadas de ferramenta foram executadas com êxito sem falhas técnicas.
Grade de Qualidade (versão prévia) Permite a avaliação de qualidade em várias dimensões — relevância, abstenção, integridade da resposta, fundamentação e cobertura de contexto — em um único avaliador em vez de executar avaliadores individuais separadamente.

Para saber mais, consulte os avaliadores do Agente.

Avaliadores rubricos (versão prévia)

Avaliador Purpose
Critério de Avaliação Pontua uma resposta ou uma conversa de vários turnos em relação a critérios personalizados e ponderados usando uma LLM como juiz. Retorna uma pontuação média ponderada normalizada para 0 a 1 com raciocínio por dimensão.

Para saber mais, confira os avaliadores de Rubric.

Azure alunos do OpenAI

Avaliador Purpose
Rotulador de modelos Classifica o conteúdo usando diretrizes e rótulos personalizados.
Verificador de cadeias de caracteres Executa validações de texto flexíveis e correspondência de padrões.
Similaridade de texto Avalia a qualidade do texto ou determina a proximidade semântica.
Avaliador de Modelos Gera pontuações numéricas (intervalo personalizado) para conteúdo com base em diretrizes personalizadas.

Para saber mais, consulte Azure Graderes OpenAI.

Avaliadores personalizados (versão prévia)

Além dos avaliadores internos, você pode criar avaliadores personalizados adaptados aos critérios de avaliação específicos. Os avaliadores personalizados permitem definir lógica de pontuação exclusiva, regras de validação e métricas de qualidade que se alinham aos requisitos de negócios e às necessidades específicas do aplicativo.

Para saber mais, consulte avaliadores personalizados.

Níveis de avaliação

Cada avaliador dá suporte a níveis de avaliação específicos, indicados pelo supported_evaluation_levels campo no catálogo do avaliador:

Nível Description
turn Avalia as respostas individuais do agente (padrão)
conversation Avalia conversas de vários turnos inteiras

Ao criar uma execução de avaliação, defina evaluation_level para corresponder aos níveis com suporte dos avaliadores. Se omitido, o padrão será turn.

Os avaliadores de nível de conversa pontuam a interação completa em vez de turnos individuais. Use-os para medir resultados como satisfação do usuário, conclusão de tarefa em várias etapas ou coerência em toda a conversa.

Importante

Todos os avaliadores em uma execução devem dar suporte ao especificado evaluation_level. Você não pode misturar avaliadores com níveis incompatíveis na mesma execução de avaliação.

Combinando avaliadores

Para uma avaliação de qualidade abrangente, combine vários avaliadores:

  • Aplicativos RAG: Recuperação + Aterramento + Relevância + Segurança de Conteúdo
  • Aplicativos de agente: Precisão de Chamada de Ferramenta + Adesão de Tarefa + Resolução de Intenção + Rubric + Segurança de Conteúdo
  • Aplicativos de tradução: BLEU + METEOR + Fluência + Coerência
  • Todos os aplicativos: adicionar avaliadores de risco e segurança (ódio e injustiça, sexual, violência, Self-Harm) para práticas de IA responsáveis