Aplique o Framework de Triagem de Avaliação por Meio de Cenários Práticos

Esses passo a passos de ponta a ponta ilustram como as camadas do framework de triagem de avaliação funcionam juntas na prática. Cada jornada começa com um cenário de avaliação diferente e segue um caminho diagnóstico distinto.

Os passo a passos mostram como aplicar a estrutura passo a passo. Utilize estes exemplos para compreender como avançar dos resultados das avaliações até o diagnóstico, a remediação e a verificação em cenários reais de avaliação de agentes.

Dica

Antes de trabalhar nesses exemplos, revise os objetivos do framework, incluindo conceitos e princípios centrais.

Jornada Situação inicial O que isso demonstra
Percurso 1 Primeira Execução de Avaliação Fluxo de ponta a ponta: Interpretar → Priorizar → Triagem → Remediar → Verificar
Percurso 2 As pontuações se estabilizam após várias iterações Análise de padrões, reclassificação e soluções alternativas para limitação da plataforma
Percurso 3 As pontuações apresentam regressão após uma mudança Detecção de regressão, diagnóstico de conflito de instrução e resolução de compensação

Observação

Esses exemplos são ilustrativos e baseados em padrões comuns observados em múltiplas avaliações de clientes. Casos de teste, pontuações e detalhes do agente são composições representativas em vez de registros de uma única interação. As abordagens diagnósticas e estratégias de remediação apresentadas refletem práticas usadas em implementações reais.

Jornada 1: Primeira execução de avaliação

Execute seu pacote de avaliação pela primeira vez em um agente de suporte ao cliente. Estes são os resultados:

Conjunto de avaliação Taxa de aprovação
Segurança e dados pessoais 100%
Perguntas e respostas empresariais centrais 87%
Fundamentação do conhecimento 71%
Invocação de ferramenta 92% 
Roteamento de gatilho 88%
Tom e Qualidade 83%
Escalonamento 90%
Visão geral 85%

Etapa 1: Interpretar as pontuações (Camada 1)

Utilize a tabela de interpretação de pontuação para calibrar os limites e identificar quais conjuntos de avaliação estão abaixo do limite de bloqueio.

Conjunto de avaliação Pontuação Limite Status
Segurança e dados pessoais 100% 95% de bloqueio Com Aprovação
Perguntas e respostas empresariais centrais 87% 80% de bloqueio Com Aprovação
Fundamentação do conhecimento 71% 80% de bloqueio Abaixo do bloqueio
Invocação de ferramenta 92%  85% de bloqueio Com Aprovação
Roteamento de gatilho 88% 80% de bloqueio Com Aprovação
Tom e Qualidade 83% 75% de bloqueio Com Aprovação
Escalonamento 90% 85% de bloqueio Com Aprovação

Avaliação de preparação: iterar. A fundamentação de conhecimento está abaixo do limite de bloqueio. Concentre a remediação ali.

Etapa 2: Priorizar falhas (Camada 2, Etapa 0)

Situação: o conhecimento fundamentado tem sete casos de teste. Dois casos de teste falham: KG-003 e KG-005. Ambos os casos de teste estão em um conjunto principal de avaliação de negócios, então são prioridade 2. Priorize ambos, já que são apenas dois.

Referência: Priorizar falhas (Camada 2, Etapa 0)

Etapa 3: Triagem KG-003 (Camada 2, Etapas 1-2)

Caso de teste KG-003:

  • Exemplo de entrada: “Qual é a sua política de devolução?”
  • Resposta esperada: “Oferecemos um prazo de devolução de 30 dias para todas as compras.”
  • Resposta do agente: "Nossa política de devolução permite devoluções dentro de 15 dias úteis após a compra."
  • Método de Avaliação:Correspondência de Palavras-chave
  • Resultado: Falha (esperado "30 dias", o agente informou "15 dias úteis")

Verifique a configuração da avaliação (etapa 1 da Camada 2):

Question Resposta Resultado
A resposta do agente é aceitável? Preciso verificar o documento de origem. Verifique a fonte primeiro.
A resposta esperada ainda é válida? O documento de origem diz “15 dias úteis.” A política foi atualizada. Não. A resposta esperada está desatualizada.

Classificação: Problema de configuração de avaliação. Resposta esperada desatualizada. O agente está correto. A avaliação está errada.

Etapa 4: Triagem KG-005 (Camada 2, Etapas 1-2)

Caso de teste KG-005:

  • Exemplo de entrada: "O plano Premium inclui garantia estendida?"
  • Resposta esperada: "O plano Premium inclui uma garantia padrão de dois anos." Opções de garantia estendida estão disponíveis para compra separadamente.
  • Resposta do agente: "Sim, o plano Premium inclui uma garantia estendida de três anos cobrindo todas as peças e mão de obra."
  • Método de avaliação: Comparação de significado
  • Resultado: Falha (detalhes da garantia fabricados pelo agente)

Verifique a configuração da avaliação (etapa 1 da Camada 2):

Question Resposta Resultado
A resposta do agente é aceitável? Não. “Garantia estendida de três anos” foi inventada. Continuar
A resposta esperada ainda é válida? Sim. Fonte confirma garantia padrão de dois anos. Continuar
O caso de teste é realista? Sim. Pergunta comum de clientes. Continuar
Uma resposta alternativa poderia estar correta? Não. Os detalhes da garantia são baseados em fatos. Continuar
O método de avaliação é adequado? Sim.Comparar significado está correto para precisão semântica. A avaliação é válida.

Diagnosticar o agente (etapa 2 da Camada 2):

Question Resposta
O conteúdo de origem está incorreto? Não. A fonte diz “garantia padrão de dois anos.”
O agente contradisse as informações da fonte? Sim. A fonte diz "garantia padrão de dois anos", mas o agente disse "garantia estendida de três anos".
O agente respondeu sem usar nenhuma fonte? Provavelmente sim. O detalhe da “garantia estendida de três anos cobrindo todas as peças e mão de obra” não existe em nenhuma fonte.

Classificação: Problema de configuração do agente. Falha de fundamentação do conhecimento. O agente produziu detalhes de garantia que não estão presentes nas fontes de conhecimento configuradas.

Etapa 5: Remediar (Camada 3)

KG-003 (Remediação da Configuração de Avaliação):

  • Alteração: Atualizar o valor esperado de "prazo de devolução de 30 dias" para "15 dias úteis"
  • Reexecutar: Apenas KG-003
  • Esperado: aprovado

KG-005 (Remediação da Configuração do Agente):

  • Alterar: adicione instrução justificada ao prompt do sistema: "Só responda com base nas informações encontradas nas fontes de conhecimento. Se as informações não estiverem disponíveis, diga."
  • Reexecutar: conjunto completo de avaliação de aterramento de conhecimento (a alteração na configuração do agente pode ter efeitos mais amplos)
  • Esperado: KG-005 aprovado. Os outros casos de teste não devem apresentar regressão.

Etapa 6: Verificar

Depois de ambas as mudanças, reexecute o conjunto de avaliação de fundamentação do conhecimento:

Antes Depois
71% (aprovação 5/7) 86% (aprovação 6/7)

Avaliação: a fundamentação de conhecimento agora está acima do limite de bloqueio de 80%. Uma falha (KG-007) permanece e não bloqueia a prontidão. Reveja na próxima iteração.

Etapa 7: Documentar (Camada 4)

Registre no registro de falhas:

Caso de teste Tipo de causa raiz Problema observado Alteração aplicada Resolvido
KG-003 Configuração da avaliação Resposta esperada desatualizada (política alterada de 30 dias para 15 dias úteis). Valor esperado atualizado Sim
KG-005 Configuração do agente Detalhes incorretos da garantia que não estão em nenhuma fonte. Instrução de fundamentação adicionada ao prompt do sistema Sim

Observação do padrão: Verifique os valores esperados com os documentos fonte antes de cada rodada de avaliação. Adicione esta etapa ao checklist de pré-avaliação.

Reverificação de prontidão: Todos os conjuntos de avaliação agora acima dos limiares de bloqueio.

Avaliação de preparação: implantar agente com lacunas conhecidas (KG-007 documentado, plano de monitoramento em vigor).

Referência: Camada 4: Analise Padrões e Melhore Continuamente Seu Agente

Jornada 2: Platô de pontuação

Situação: Você realiza quatro iterações em um agente de suporte ao produto. A precisão factual permanece em 78% em todas as quatro execuções. Você faz alterações no prompt após cada execução, mas não vê nenhuma melhoria.

Etapa 1: Verificar padrões (Camada 4)

Revise o log de falhas das quatro iterações:

Iteração Pontuação Alteração aplicada Resultado
1 78% (linha de base)
2 79% Adicionado “Seja preciso sobre as especificações do produto” Nenhuma mudança significativa
3 77% Prompt reorganizado para colocar as instruções relacionadas à precisão em primeiro lugar Nenhuma mudança significativa
4 78% Adicionados exemplos detalhados de respostas corretas para o produto Nenhuma mudança significativa

Tendência: Estável. A remediação não está abordando a verdadeira causa raiz.

Referência: Camada 4: Analise Padrões e Melhore Continuamente Seu Agente

Etapa 2: Analisar casos de teste com falha

Reveja as seis falhas persistentes em todas as iterações.

Caso de teste Falha desde Problema observado
FA-002 Iteração 1 O agente cita a página de FAQ em vez do manual do produto
FA-005 Iteração 1 O agente cita a página de FAQ em vez do manual do produto
FA-008 Iteração 1 O agente cita a página de FAQ em vez do manual do produto
FA-011 Iteração 1 O agente cita a página de FAQ em vez do manual do produto
FA-014 Iteração 1 O agente cita a página de FAQ em vez do manual do produto
FA-019 Iteração 2 O agente responde parcialmente com informações da FAQ, sem acrescentar detalhes do manual

Análise de concentração: Cinco de seis falhas (83%) têm a mesma causa raiz: o agente obtém informações da página de FAQ em vez do manual do produto.

Etapa 3: Retriagem (Camada 2)

Inicialmente, classifique as falhas como problema de configuração do agente: fonte incorreta recuperada.

Aplique várias alterações de configuração de agente, incluindo a reformulação de prompts, a reordenação e a adição de exemplos. Essas mudanças não resultam em melhoria mensurável. Neste ponto, avalie a falha em relação aos indicadores de limitação da plataforma.

Indicador Verificação
A falha persiste em múltiplas variações de prompt ou configuração Sim. Quatro iterações sem mudanças.
A recuperação retorna documentos incorretos de forma consistente, mesmo com a configuração correta da fonte. Sim. O FAQ é recuperado consistentemente em vez do manual do produto.

Reclassificação: Esta questão é uma limitação da plataforma relacionada à classificação de recuperação. A plataforma prioriza consistentemente as perguntas frequentes em vez do manual do produto para essas consultas, e mudanças adicionais em prompts ou instruções não afetam o comportamento de recuperação.

Referência: Camada 2: Triagem de Falhas do Agente

Etapa 4: Remediar (Camada 3—Limitação da plataforma)

Ao classificar uma falha como limitação da plataforma, concentre a remediação em soluções alternativas e documentação, em vez de alterar a configuração do agente.

Referência: Resposta à Limitação da Plataforma

Estratégia de Contorno: Aplique uma ou mais das seguintes abordagens de mitigação para reduzir o impacto:

  • Reestruture o manual do produto com títulos de seção mais claros que estejam alinhados com o vocabulário usado nas consultas dos usuários.
  • Copie especificações críticas do produto do manual para a FAQ, a fim de criar caminhos redundantes de recuperação.
  • Refatore o conteúdo do manual para que cada seção aborde uma única pergunta bem definida para melhorar a correspondência de fragmentos para recuperação.

Essas abordagens visam influenciar o comportamento de recuperação sem depender de mudanças em prompts ou instruções.

Escalonamento e acompanhamento: se a limitação persistir, documente e escalone o problema para a equipe da plataforma.

  • Documente a limitação da seguinte forma: "Consultas para <especificações> do produto recuperam consistentemente a página de perguntas frequentes (última atualização: <data>, <n> páginas) em vez do manual do produto (última atualização: <data>, <N> páginas), apesar do manual contendo as informações autoritativas."
  • Forneça evidências de apoio: Inclua múltiplos casos de teste mostrando a consulta, a fonte esperada e a fonte real recuperada.
  • Submeta para investigação.
  • Compartilhe a limitação documentada e as evidências com a equipe da plataforma para acompanhamento.

Etapa 5: Verificar

Após reestruturar o manual do produto e adicionar entradas redundantes de FAQ, execute novamente o conjunto de avaliação relevante para verificar o impacto.

Antes Depois
78% (inalterado em quatro iterações) 89%

Avaliação: A solução alternativa melhora o desempenho geral. Uma falha permanece (FA-019). A consulta é ambígua demais para recuperar a fonte correta de forma confiável, mesmo com o conteúdo reestruturado. Essa falha é registrada como uma limitação conhecida.

Etapa 6: Documentar

Atualize o registro de falhas para refletir a classificação final e os resultados.

Caso de teste Tipo de causa raiz Problema observado Alteração aplicada Resolvido
FA-002, 005, 008, 011, 014 Limitação da plataforma O ranking de recuperação prioriza as perguntas frequentes em vez do manual do produto Reestruturação dos títulos do manual; duplicação de especificações críticas nas perguntas frequentes Sim
FA-019 Limitação da plataforma Consulta ambígua não é capaz de recuperar a fonte correta de forma confiável Registrado como uma limitação conhecida Não

Principal conclusão: se as pontuações de avaliação continuarem constantes em vários prompts ou alterações de instrução, é improvável que a causa raiz seja o prompt. Valide o comportamento da infraestrutura e da plataforma antes de investir mais em engenharia de prompt.

Jornada 3: Regressão pós-atualização

Situação: Você atualizou o prompt do sistema para melhorar o tom e a empatia. As pontuações de tom aumentaram, mas a precisão factual caiu abaixo de seu limite de bloqueio, introduzindo uma regressão.

Antes da mudança:

Conjunto de avaliação Pontuação
Exatidão factual 91%
Tom e Qualidade 83%
Todos os outros Acima do limite

Você adicionou a seguinte instrução ao prompt do sistema: “Sempre reconheça a preocupação do cliente e demonstre empatia antes de fornecer sua resposta.” "Comece cada resposta validando a experiência do cliente."

Após a alteração:

Conjunto de avaliação Antes Depois Delta
Exatidão factual 91% 76% -15%
Tom e Qualidade 83% 91% +8%

Etapa 1: Interpretar (Camada 1)

Agora, a precisão factual está abaixo do limite de bloqueio de 80%. Essa mudança introduz uma regressão e bloqueia a prontidão.

Referência: Camada 1: Interpretar as Pontuações e Identificar Falhas

Etapa 2: Verificar padrões (Camada 4)

Correspondência entre padrões de sinal: o tom melhora enquanto a precisão piora.

Causa raiz: conflito de instruções.

As diretrizes de tom recém-adicionadas competem com instruções de precisão para a atenção do modelo.

Referência: Camada 4: Analise Padrões e Melhore Continuamente Seu Agente

Etapa 3: Triagem das novas falhas (Camada 2)

Revise casos de teste de exatidão factual que passaram antes da mudança e agora falham.

Caso de teste FA-007:

  • Entrada: "Qual é o tamanho máximo de upload de arquivos?"
  • Esperado: "O tamanho máximo de upload de arquivos é 25 MB para contas padrão e 100 MB para contas empresariais."
  • Agente anterior: "O tamanho máximo de upload de arquivos é 25 MB para contas padrão e 100 MB para contas empresariais."
  • Agente após: "Entendo completamente sua preocupação com os tamanhos de envio de arquivo, isso pode ser frustrante quando você está tentando enviar documentos importantes! Quero garantir que você tenha todas as informações de que precisa. O tamanho máximo de upload é de 25 MB para planos padrão.

Etapa 1. Verifique a avaliação: A resposta esperada está correta e a avaliação é válida. A resposta pós-atualização omite o detalhe da conta empresarial.

Etapa 2. Diagnosticar: A nova instrução de tom exige um preâmbulo de empatia em cada resposta. Esse requisito consome o orçamento de resposta e a atenção do modelo, levando a respostas factuais incompletas.

Classificação: Problema de configuração do agente. Conflito de instruções entre diretrizes de tom e precisão.

Referência: Camada 2: Triagem de Falhas do Agente

Etapa 4: Remediar (Camada 3)

O problema não está na orientação de tom em si, mas nas prioridades concorrentes dentro do prompt do sistema. A remediação foca em separar e priorizar as instruções.

Instrução anterior (única, conflitante): “Sempre reconheça a preocupação do cliente e demonstre empatia antes de fornecer sua resposta.” "Comece cada resposta validando a experiência do cliente."

Nova instrução (separada, priorizada): “Inclua sempre a resposta completa e baseada em fatos à pergunta do cliente.” Não omita detalhes para ser breve. Além disso, quando o cliente expressar frustração ou preocupação, reconheça brevemente.

Principais alterações:

  • A precisão é explicitamente priorizada.
  • A completude das respostas factuais é declarada diretamente.
  • A empatia é condicional, em vez de universal.
  • "Resumidamente" restringe a empatia para evitar truncamento de conteúdo.

Referência: Camada 3: Mapeamento de padrões de falha para estratégias de remediação

Etapa 5: Verificar

Reexecute a suíte completa de avaliação, pois mudanças no prompt do sistema podem ter amplo impacto.

Conjunto de avaliação Antes da alteração Após a regressão Depois da alteração
Exatidão factual 91% 76% 90%
Tom e Qualidade 83% 91% 89%
Todos os outros Acima do limite Acima do limite Acima do limite

Avaliação: Ambos os sinais agora atingem seus limites de bloqueio. O tom não retorna totalmente ao seu pico, mas permanece bem acima do limite de bloqueio de 75% e melhora em relação à linha de base original.

Etapa 6: Documentar

Caso de teste Tipo de causa raiz Problema observado Alteração aplicada Resolvido
FA-007, FA-012, FA-018 (e outros) Configuração do agente Diretrizes de tom prejudicaram a integridade factual Prompt reestruturado para priorizar a precisão e aplicar empatia condicional Sim

Conclusão: sempre valide as alterações nos prompts do sistema em toda a suíte de avaliação, não apenas no sinal de destino. Instruções competem pela atenção do modelo, e melhorias em uma área podem introduzir regressões em outras.

Padrão a observar: Este cenário é um exemplo do problema do orçamento de instrução. À medida que os prompts crescem, conflitos de instrução tornam-se mais prováveis. Consolidação e simplificação periódicas ajudam a manter a estabilidade.

Padrões Comuns ao Longo das Jornadas

Cada jornada tem início em um cenário diferente para exemplificar um percurso diagnóstico distinto. Para entender como um único agente percorre todas as etapas do ciclo de avaliação — interpretação de pontuação, triagem de falhas, remediação e verificação — revise a Jornada 1, que apresenta o guia de ponta a ponta mais completo.

Esta tabela destaca padrões recorrentes observados ao longo das jornadas e as lições práticas que eles reforçam.

Padrão Onde ele aparece Conclusão principal
Validar a avaliação antes do agente Percurso 1 Uma fonte comum de desperdício de esforço é solucionar problemas no comportamento do agente quando a própria avaliação está incorreta.
Pontuações constantes indicam uma classificação incorreta da causa raiz Percurso 2 Se a remediação repetida não melhorar os resultados, reclassifique o problema. Você pode estar abordando a causa raiz errada.
Reexecute o conjunto completo de avaliação após alterações no prompt Percurso 3 Alterações de prompt podem afetar vários sinais de qualidade. Certifique-se sempre de verificar regressões fora da área-alvo.
Documente resultados e decisões Todas as jornadas Manter um log de falhas evita a redescoberta das mesmas causas raiz em iterações futuras.
Lacunas Conhecidas Podem Ser Aceitáveis Jornada 1 (KG-007), Jornada 2 (FA-019) Nem toda falha precisa ser resolvida antes do lançamento. Documente lacunas conhecidas e monitore-as ao longo do tempo.

Próximas etapas

Após revisar esses exemplos, escolha a próxima ação que melhor corresponda à sua situação atual: