Camada 1: interpretar pontuações de avaliação e avaliar a prontidão do agente

Depois de executar avaliações em um agente, geralmente você obtêm pontuações, mas não se obtém uma resposta imediata para a pergunta mais importante: o agente está pronto para implantação?

Essa camada foca em interpretar as pontuações de avaliação e avaliar a prontidão antes de investigar falhas individuais de casos de teste. Use pontuações como sinais de decisão para determinar se você pode implantar o agente, se deve continuar iterando ou se deve bloquear a implantação. Essa etapa também ajuda a identificar onde uma análise mais profunda é necessária.

Objetivo da interpretação da pontuação

Essa camada ajuda você a responder perguntas de prontidão de alto nível, incluindo:

  • O agente está pronto para implantar?
  • Se não estiver, quais áreas precisam de atenção primeiro?
  • Existem problemas de bloqueio que precisam ser resolvidos antes de uma nova iteração?

Esta etapa é intencionalmente leve. Na maioria dos casos, você pode concluir em 10–15 minutos usando os resultados das avaliações que já possui.

Antes de começar

Antes de iniciar esta camada, certifique-se de ter:

  • Resultados de aprovação ou reprovação para casos individuais de teste.
  • Pontuações agregadas para um ou mais conjuntos de avaliação (por exemplo, segurança, fundamentação, correção de negócios ou uso de ferramentas).

Se os resultados da avaliação ainda não estiverem disponíveis, execute seus conjuntos de avaliação primeiro e volte a esta etapa assim que as pontuações estiverem disponíveis.

Interpretar pontuações no nível do conjunto de avaliação

Comece revisando as pontuações dos conjuntos de avaliação, em vez de casos de teste individuais.

Conjuntos de avaliação representam diferentes áreas de risco e capacidade, como segurança, comportamento do negócio principal, fundamentação de conhecimento ou invocação de ferramentas. Interpretar as pontuações nesse nível ajuda a determinar se as falhas são isoladas ou sistêmicas.

Considere as seguintes perguntas:

  • Há alguma pontuação de segurança ou conformidade abaixo dos limites aceitáveis?
  • Os conjuntos de avaliação do negócio principal estão atendendo às expectativas mínimas?
  • Qual conjunto de avaliação é o mais fraco em relação à sua importância?

Nessa fase, concentre-se no sinal, não na causa raiz.

Interprete as taxas de aprovação em dois níveis:

  • Por conjunto de avaliação: o que essa porcentagem significa para a capacidade específica que está sendo testada?
  • Por indicador de qualidade: o que essa porcentagem indica em todos os conjuntos de avaliação que testam o mesmo indicador?

Uma taxa baixa de aprovação não implica necessariamente que o agente está incorreto. Isso indica que a investigação é obrigatória. O problema pode estar no agente, na configuração de avaliação ou na plataforma.

Defina limites com base no risco

Não aplique os mesmos limites a todos os agentes. Defina limites com base no perfil de risco do agente. Considere os seguintes fatores.

Fator Perguntas a fazer Impacto no limite
Consequência da falha O que acontece se o agente cometer um erro? Inconveniente? Prejuízo financeiro? Risco à segurança? Consequência maior → Limiar mais alto
Frequência de uso Com que frequência os usuários acionam esse sinal de qualidade? Maior frequência → Limite maior (mais exposição)
Disponibilidade de fallback Se o agente falhar, existe um backup humano? Com que rapidez? Sem fallback → limite mais alto
Público-alvo Funcionários internos? Clientes externos? Setor regulado? Externo ou regulado → Limite mais alto

Exemplos de limites com base em risco

Esta tabela mostra pontos de partida de exemplo, não padrões universais.

Perfil de risco descrição Segurança e conformidade Negócio principal Capacidades
Ferramenta interna de baixo risco Uso interno exclusivo, revisão humana em todos os resultados, domínio de baixo risco 90%+ 75%+ 65%+
Agente voltado ao cliente de risco médio Usuários externos, alguma automação, erros recuperáveis 95%+ 85%+ 75%+
Agente regulado/financeiro de alto risco Usuários externos, decisões de grande impacto, exposição regulatória 98%+ 92%+ 85%+
Agente crítico para a segurança Aconselhamento de saúde, jurídico ou financeiro com supervisão humana limitada 99%+ 95%+ 90%+

Use esses exemplos como âncoras e ajuste com base nas suas considerações específicas de risco.

Exemplo de calibração de limite

O exemplo a seguir mostra uma possível calibração para um agente de suporte de risco médio, voltado para o cliente.

Sinal de qualidade Limite inicial Limite de bloqueio Justificativa
Segurança e dados pessoais 95-100% < 95% bloqueia a remessa Qualquer falha de segurança é de alto risco
Conformidade e conteúdo literal 95-100% < 95% bloqueia a remessa Exposição regulatória ou legal
Exatidão factual (negócio principal) 85-95% < 80% bloqueia a remessa Proposta de valor principal
Fundamentação do conhecimento 85-95% < 80% bloqueia a remessa Base para a exatidão
Invocação de ferramenta 90-95% < 85% bloqueia a remessa Confiabilidade na execução de tarefas
Roteamento de gatilho 85-95% < 80% bloqueia a remessa Correção do fluxo de conversa
Escalonamento e normal 90-95% < 85% bloqueia a remessa Rede de segurança de experiência do usuário
Timbre e qualidade da resposta 80 – 90% < 75% bloqueia a remessa Sinal subjetivo

Dica

Calibre, não copie. Os limites devem refletir riscos aceitáveis para o seu caso de uso específico.

Determinar status de prontidão

Utilize as pontuações do conjunto de avaliação para determinar um resultado geral de prontidão. Estados comuns de prontidão incluem:

  • Bloqueio: segurança, conformidade ou falhas críticas de negócios impedem a implantação.
  • Iterar: o agente demostra potencial, mas requer melhorias direcionadas.
  • Implantação condicional: o agente pode ser implantado com limitações documentadas e monitoradas.
  • Implantar: o agente atende aos limites em todos os conjuntos de avaliação exigidos.

Baseie as decisões de prontidão na tolerância ao risco e no contexto de uso, e não em uma única pontuação universal.

Dica

Implantação condicional com lacunas conhecidas é um resultado válido. Documente as limitações aceitas e acompanhe-as ao longo do tempo usando o modelo do log de falhas.

Determine quando a iteração está completa

Use os seguintes critérios para determinar quando você pode avançar da triagem para a implantação ou o monitoramento.

A Iteração está completa quando:

  • Todos os conjuntos de avaliação estão acima de seus respectivos limites, incluindo aqueles que foram ajustados.
  • Lacunas conhecidas são documentadas com responsáveis e prazos.
  • As reexecuções produzem pontuações consistentes com menos de 5% de variação entre as execuções.
  • Nenhum problema de bloqueio permanece classificado como problema de configuração do agente.

A iteração não está completa quando:

  • Os limites são atingidos sem entender as falhas restantes.
  • As pontuações melhoram apenas porque os casos de teste difíceis foram removidos.
  • Limitações da plataforma são aceitas de forma implícita, sem documentação.

Lidar com o não-determinismo em pontuações

Agentes e avaliadores baseados em modelos de linguagem produzem saídas variáveis. Aplique as seguintes práticas:

  • Estabeleça a linha de base: execute o conjunto completo de avaliações pelo menos três vezes antes de considerar qualquer pontuação como linha de base. Use a média como sua pontuação base. Com menos de três execuções, você não pode distinguir o sinal real do ruído.
  • Variação de pontuação entre execuções: até 5% de variação entre execuções é normal para os classificadores do modelo de linguagem. Se as execuções variarem mais de 10%, investigue a confiabilidade do classificador antes de diagnosticar problemas do agente. Saiba mais em Validação do classificador.
  • Interprete as alterações de pontuação após remediação: para conjuntos de avaliação com menos de 30 casos de teste, um único caso de teste mudando de reprovação para aprovação altera a pontuação em 3% ou mais. Não atribua importância excessiva a pequenas variações. Para conjuntos de avaliação com 50 ou mais casos de teste, considere significativa uma alteração de 5% ou mais. Em caso de dúvida, repita a avaliação três vezes e compare a média com a média de referência.
  • Identificar casos de teste instáveis (passam às vezes, falham outras): um caso de teste que passa duas de três execuções está no limite. Faça uma investigação mais aprofundada. O valor esperado é rígido demais (configuração da avaliação) ou o agente é genuinamente inconsistente (configuração do agente)? Se o agente produzir duas respostas diferentes, mas ambas aceitáveis, a avaliação é muito rígida.

Próximas etapas

Depois de interpretar suas pontuações e identificar onde focar:

Se mais de 10 casos de teste estiverem falhando, analise padrões antes de realizar a triagem de falhas individuais.