Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Esses passo a passos de ponta a ponta ilustram como as camadas do framework de triagem de avaliação funcionam juntas na prática. Cada jornada começa com um cenário de avaliação diferente e segue um caminho diagnóstico distinto.
Os passo a passos mostram como aplicar a estrutura passo a passo. Utilize estes exemplos para compreender como avançar dos resultados das avaliações até o diagnóstico, a remediação e a verificação em cenários reais de avaliação de agentes.
Dica
Antes de trabalhar nesses exemplos, revise os objetivos do framework, incluindo conceitos e princípios centrais.
| Jornada | Situação inicial | O que isso demonstra |
|---|---|---|
| Percurso 1 | Primeira Execução de Avaliação | Fluxo de ponta a ponta: Interpretar → Priorizar → Triagem → Remediar → Verificar |
| Percurso 2 | As pontuações se estabilizam após várias iterações | Análise de padrões, reclassificação e soluções alternativas para limitação da plataforma |
| Percurso 3 | As pontuações apresentam regressão após uma mudança | Detecção de regressão, diagnóstico de conflito de instrução e resolução de compensação |
Observação
Esses exemplos são ilustrativos e baseados em padrões comuns observados em múltiplas avaliações de clientes. Casos de teste, pontuações e detalhes do agente são composições representativas em vez de registros de uma única interação. As abordagens diagnósticas e estratégias de remediação apresentadas refletem práticas usadas em implementações reais.
Jornada 1: Primeira execução de avaliação
Execute seu pacote de avaliação pela primeira vez em um agente de suporte ao cliente. Estes são os resultados:
| Conjunto de avaliação | Taxa de aprovação |
|---|---|
| Segurança e dados pessoais | 100% |
| Perguntas e respostas empresariais centrais | 87% |
| Fundamentação do conhecimento | 71% |
| Invocação de ferramenta | 92% |
| Roteamento de gatilho | 88% |
| Tom e Qualidade | 83% |
| Escalonamento | 90% |
| Visão geral | 85% |
Etapa 1: Interpretar as pontuações (Camada 1)
Utilize a tabela de interpretação de pontuação para calibrar os limites e identificar quais conjuntos de avaliação estão abaixo do limite de bloqueio.
| Conjunto de avaliação | Pontuação | Limite | Status |
|---|---|---|---|
| Segurança e dados pessoais | 100% | 95% de bloqueio | Com Aprovação |
| Perguntas e respostas empresariais centrais | 87% | 80% de bloqueio | Com Aprovação |
| Fundamentação do conhecimento | 71% | 80% de bloqueio | Abaixo do bloqueio |
| Invocação de ferramenta | 92% | 85% de bloqueio | Com Aprovação |
| Roteamento de gatilho | 88% | 80% de bloqueio | Com Aprovação |
| Tom e Qualidade | 83% | 75% de bloqueio | Com Aprovação |
| Escalonamento | 90% | 85% de bloqueio | Com Aprovação |
Avaliação de preparação: iterar. A fundamentação de conhecimento está abaixo do limite de bloqueio. Concentre a remediação ali.
Etapa 2: Priorizar falhas (Camada 2, Etapa 0)
Situação: o conhecimento fundamentado tem sete casos de teste. Dois casos de teste falham: KG-003 e KG-005. Ambos os casos de teste estão em um conjunto principal de avaliação de negócios, então são prioridade 2. Priorize ambos, já que são apenas dois.
Referência: Priorizar falhas (Camada 2, Etapa 0)
Etapa 3: Triagem KG-003 (Camada 2, Etapas 1-2)
Caso de teste KG-003:
- Exemplo de entrada: “Qual é a sua política de devolução?”
- Resposta esperada: “Oferecemos um prazo de devolução de 30 dias para todas as compras.”
- Resposta do agente: "Nossa política de devolução permite devoluções dentro de 15 dias úteis após a compra."
- Método de Avaliação:Correspondência de Palavras-chave
- Resultado: Falha (esperado "30 dias", o agente informou "15 dias úteis")
Verifique a configuração da avaliação (etapa 1 da Camada 2):
| Question | Resposta | Resultado |
|---|---|---|
| A resposta do agente é aceitável? | Preciso verificar o documento de origem. | Verifique a fonte primeiro. |
| A resposta esperada ainda é válida? | O documento de origem diz “15 dias úteis.” A política foi atualizada. | Não. A resposta esperada está desatualizada. |
Classificação: Problema de configuração de avaliação. Resposta esperada desatualizada. O agente está correto. A avaliação está errada.
Etapa 4: Triagem KG-005 (Camada 2, Etapas 1-2)
Caso de teste KG-005:
- Exemplo de entrada: "O plano Premium inclui garantia estendida?"
- Resposta esperada: "O plano Premium inclui uma garantia padrão de dois anos." Opções de garantia estendida estão disponíveis para compra separadamente.
- Resposta do agente: "Sim, o plano Premium inclui uma garantia estendida de três anos cobrindo todas as peças e mão de obra."
- Método de avaliação: Comparação de significado
- Resultado: Falha (detalhes da garantia fabricados pelo agente)
Verifique a configuração da avaliação (etapa 1 da Camada 2):
| Question | Resposta | Resultado |
|---|---|---|
| A resposta do agente é aceitável? | Não. “Garantia estendida de três anos” foi inventada. | Continuar |
| A resposta esperada ainda é válida? | Sim. Fonte confirma garantia padrão de dois anos. | Continuar |
| O caso de teste é realista? | Sim. Pergunta comum de clientes. | Continuar |
| Uma resposta alternativa poderia estar correta? | Não. Os detalhes da garantia são baseados em fatos. | Continuar |
| O método de avaliação é adequado? | Sim.Comparar significado está correto para precisão semântica. | A avaliação é válida. |
Diagnosticar o agente (etapa 2 da Camada 2):
| Question | Resposta |
|---|---|
| O conteúdo de origem está incorreto? | Não. A fonte diz “garantia padrão de dois anos.” |
| O agente contradisse as informações da fonte? | Sim. A fonte diz "garantia padrão de dois anos", mas o agente disse "garantia estendida de três anos". |
| O agente respondeu sem usar nenhuma fonte? | Provavelmente sim. O detalhe da “garantia estendida de três anos cobrindo todas as peças e mão de obra” não existe em nenhuma fonte. |
Classificação: Problema de configuração do agente. Falha de fundamentação do conhecimento. O agente produziu detalhes de garantia que não estão presentes nas fontes de conhecimento configuradas.
Etapa 5: Remediar (Camada 3)
KG-003 (Remediação da Configuração de Avaliação):
- Alteração: Atualizar o valor esperado de "prazo de devolução de 30 dias" para "15 dias úteis"
- Reexecutar: Apenas KG-003
- Esperado: aprovado
KG-005 (Remediação da Configuração do Agente):
- Alterar: adicione instrução justificada ao prompt do sistema: "Só responda com base nas informações encontradas nas fontes de conhecimento. Se as informações não estiverem disponíveis, diga."
- Reexecutar: conjunto completo de avaliação de aterramento de conhecimento (a alteração na configuração do agente pode ter efeitos mais amplos)
- Esperado: KG-005 aprovado. Os outros casos de teste não devem apresentar regressão.
Etapa 6: Verificar
Depois de ambas as mudanças, reexecute o conjunto de avaliação de fundamentação do conhecimento:
| Antes | Depois |
|---|---|
| 71% (aprovação 5/7) | 86% (aprovação 6/7) |
Avaliação: a fundamentação de conhecimento agora está acima do limite de bloqueio de 80%. Uma falha (KG-007) permanece e não bloqueia a prontidão. Reveja na próxima iteração.
Etapa 7: Documentar (Camada 4)
Registre no registro de falhas:
| Caso de teste | Tipo de causa raiz | Problema observado | Alteração aplicada | Resolvido |
|---|---|---|---|---|
| KG-003 | Configuração da avaliação | Resposta esperada desatualizada (política alterada de 30 dias para 15 dias úteis). | Valor esperado atualizado | Sim |
| KG-005 | Configuração do agente | Detalhes incorretos da garantia que não estão em nenhuma fonte. | Instrução de fundamentação adicionada ao prompt do sistema | Sim |
Observação do padrão: Verifique os valores esperados com os documentos fonte antes de cada rodada de avaliação. Adicione esta etapa ao checklist de pré-avaliação.
Reverificação de prontidão: Todos os conjuntos de avaliação agora acima dos limiares de bloqueio.
Avaliação de preparação: implantar agente com lacunas conhecidas (KG-007 documentado, plano de monitoramento em vigor).
Referência: Camada 4: Analise Padrões e Melhore Continuamente Seu Agente
Jornada 2: Platô de pontuação
Situação: Você realiza quatro iterações em um agente de suporte ao produto. A precisão factual permanece em 78% em todas as quatro execuções. Você faz alterações no prompt após cada execução, mas não vê nenhuma melhoria.
Etapa 1: Verificar padrões (Camada 4)
Revise o log de falhas das quatro iterações:
| Iteração | Pontuação | Alteração aplicada | Resultado |
|---|---|---|---|
| 1 | 78% | (linha de base) | — |
| 2 | 79% | Adicionado “Seja preciso sobre as especificações do produto” | Nenhuma mudança significativa |
| 3 | 77% | Prompt reorganizado para colocar as instruções relacionadas à precisão em primeiro lugar | Nenhuma mudança significativa |
| 4 | 78% | Adicionados exemplos detalhados de respostas corretas para o produto | Nenhuma mudança significativa |
Tendência: Estável. A remediação não está abordando a verdadeira causa raiz.
Referência: Camada 4: Analise Padrões e Melhore Continuamente Seu Agente
Etapa 2: Analisar casos de teste com falha
Reveja as seis falhas persistentes em todas as iterações.
| Caso de teste | Falha desde | Problema observado |
|---|---|---|
| FA-002 | Iteração 1 | O agente cita a página de FAQ em vez do manual do produto |
| FA-005 | Iteração 1 | O agente cita a página de FAQ em vez do manual do produto |
| FA-008 | Iteração 1 | O agente cita a página de FAQ em vez do manual do produto |
| FA-011 | Iteração 1 | O agente cita a página de FAQ em vez do manual do produto |
| FA-014 | Iteração 1 | O agente cita a página de FAQ em vez do manual do produto |
| FA-019 | Iteração 2 | O agente responde parcialmente com informações da FAQ, sem acrescentar detalhes do manual |
Análise de concentração: Cinco de seis falhas (83%) têm a mesma causa raiz: o agente obtém informações da página de FAQ em vez do manual do produto.
Etapa 3: Retriagem (Camada 2)
Inicialmente, classifique as falhas como problema de configuração do agente: fonte incorreta recuperada.
Aplique várias alterações de configuração de agente, incluindo a reformulação de prompts, a reordenação e a adição de exemplos. Essas mudanças não resultam em melhoria mensurável. Neste ponto, avalie a falha em relação aos indicadores de limitação da plataforma.
| Indicador | Verificação |
|---|---|
| A falha persiste em múltiplas variações de prompt ou configuração | Sim. Quatro iterações sem mudanças. |
| A recuperação retorna documentos incorretos de forma consistente, mesmo com a configuração correta da fonte. | Sim. O FAQ é recuperado consistentemente em vez do manual do produto. |
Reclassificação: Esta questão é uma limitação da plataforma relacionada à classificação de recuperação. A plataforma prioriza consistentemente as perguntas frequentes em vez do manual do produto para essas consultas, e mudanças adicionais em prompts ou instruções não afetam o comportamento de recuperação.
Referência: Camada 2: Triagem de Falhas do Agente
Etapa 4: Remediar (Camada 3—Limitação da plataforma)
Ao classificar uma falha como limitação da plataforma, concentre a remediação em soluções alternativas e documentação, em vez de alterar a configuração do agente.
Referência: Resposta à Limitação da Plataforma
Estratégia de Contorno: Aplique uma ou mais das seguintes abordagens de mitigação para reduzir o impacto:
- Reestruture o manual do produto com títulos de seção mais claros que estejam alinhados com o vocabulário usado nas consultas dos usuários.
- Copie especificações críticas do produto do manual para a FAQ, a fim de criar caminhos redundantes de recuperação.
- Refatore o conteúdo do manual para que cada seção aborde uma única pergunta bem definida para melhorar a correspondência de fragmentos para recuperação.
Essas abordagens visam influenciar o comportamento de recuperação sem depender de mudanças em prompts ou instruções.
Escalonamento e acompanhamento: se a limitação persistir, documente e escalone o problema para a equipe da plataforma.
- Documente a limitação da seguinte forma: "Consultas para <especificações> do produto recuperam consistentemente a página de perguntas frequentes (última atualização: <data>, <n> páginas) em vez do manual do produto (última atualização: <data>, <N> páginas), apesar do manual contendo as informações autoritativas."
- Forneça evidências de apoio: Inclua múltiplos casos de teste mostrando a consulta, a fonte esperada e a fonte real recuperada.
- Submeta para investigação.
- Compartilhe a limitação documentada e as evidências com a equipe da plataforma para acompanhamento.
Etapa 5: Verificar
Após reestruturar o manual do produto e adicionar entradas redundantes de FAQ, execute novamente o conjunto de avaliação relevante para verificar o impacto.
| Antes | Depois |
|---|---|
| 78% (inalterado em quatro iterações) | 89% |
Avaliação: A solução alternativa melhora o desempenho geral. Uma falha permanece (FA-019). A consulta é ambígua demais para recuperar a fonte correta de forma confiável, mesmo com o conteúdo reestruturado. Essa falha é registrada como uma limitação conhecida.
Etapa 6: Documentar
Atualize o registro de falhas para refletir a classificação final e os resultados.
| Caso de teste | Tipo de causa raiz | Problema observado | Alteração aplicada | Resolvido |
|---|---|---|---|---|
| FA-002, 005, 008, 011, 014 | Limitação da plataforma | O ranking de recuperação prioriza as perguntas frequentes em vez do manual do produto | Reestruturação dos títulos do manual; duplicação de especificações críticas nas perguntas frequentes | Sim |
| FA-019 | Limitação da plataforma | Consulta ambígua não é capaz de recuperar a fonte correta de forma confiável | Registrado como uma limitação conhecida | Não |
Principal conclusão: se as pontuações de avaliação continuarem constantes em vários prompts ou alterações de instrução, é improvável que a causa raiz seja o prompt. Valide o comportamento da infraestrutura e da plataforma antes de investir mais em engenharia de prompt.
Jornada 3: Regressão pós-atualização
Situação: Você atualizou o prompt do sistema para melhorar o tom e a empatia. As pontuações de tom aumentaram, mas a precisão factual caiu abaixo de seu limite de bloqueio, introduzindo uma regressão.
Antes da mudança:
| Conjunto de avaliação | Pontuação |
|---|---|
| Exatidão factual | 91% |
| Tom e Qualidade | 83% |
| Todos os outros | Acima do limite |
Você adicionou a seguinte instrução ao prompt do sistema: “Sempre reconheça a preocupação do cliente e demonstre empatia antes de fornecer sua resposta.” "Comece cada resposta validando a experiência do cliente."
Após a alteração:
| Conjunto de avaliação | Antes | Depois | Delta |
|---|---|---|---|
| Exatidão factual | 91% | 76% | -15% |
| Tom e Qualidade | 83% | 91% | +8% |
Etapa 1: Interpretar (Camada 1)
Agora, a precisão factual está abaixo do limite de bloqueio de 80%. Essa mudança introduz uma regressão e bloqueia a prontidão.
Referência: Camada 1: Interpretar as Pontuações e Identificar Falhas
Etapa 2: Verificar padrões (Camada 4)
Correspondência entre padrões de sinal: o tom melhora enquanto a precisão piora.
Causa raiz: conflito de instruções.
As diretrizes de tom recém-adicionadas competem com instruções de precisão para a atenção do modelo.
Referência: Camada 4: Analise Padrões e Melhore Continuamente Seu Agente
Etapa 3: Triagem das novas falhas (Camada 2)
Revise casos de teste de exatidão factual que passaram antes da mudança e agora falham.
Caso de teste FA-007:
- Entrada: "Qual é o tamanho máximo de upload de arquivos?"
- Esperado: "O tamanho máximo de upload de arquivos é 25 MB para contas padrão e 100 MB para contas empresariais."
- Agente anterior: "O tamanho máximo de upload de arquivos é 25 MB para contas padrão e 100 MB para contas empresariais."
- Agente após: "Entendo completamente sua preocupação com os tamanhos de envio de arquivo, isso pode ser frustrante quando você está tentando enviar documentos importantes! Quero garantir que você tenha todas as informações de que precisa. O tamanho máximo de upload é de 25 MB para planos padrão.
Etapa 1. Verifique a avaliação: A resposta esperada está correta e a avaliação é válida. A resposta pós-atualização omite o detalhe da conta empresarial.
Etapa 2. Diagnosticar: A nova instrução de tom exige um preâmbulo de empatia em cada resposta. Esse requisito consome o orçamento de resposta e a atenção do modelo, levando a respostas factuais incompletas.
Classificação: Problema de configuração do agente. Conflito de instruções entre diretrizes de tom e precisão.
Referência: Camada 2: Triagem de Falhas do Agente
Etapa 4: Remediar (Camada 3)
O problema não está na orientação de tom em si, mas nas prioridades concorrentes dentro do prompt do sistema. A remediação foca em separar e priorizar as instruções.
Instrução anterior (única, conflitante): “Sempre reconheça a preocupação do cliente e demonstre empatia antes de fornecer sua resposta.” "Comece cada resposta validando a experiência do cliente."
Nova instrução (separada, priorizada): “Inclua sempre a resposta completa e baseada em fatos à pergunta do cliente.” Não omita detalhes para ser breve. Além disso, quando o cliente expressar frustração ou preocupação, reconheça brevemente.
Principais alterações:
- A precisão é explicitamente priorizada.
- A completude das respostas factuais é declarada diretamente.
- A empatia é condicional, em vez de universal.
- "Resumidamente" restringe a empatia para evitar truncamento de conteúdo.
Referência: Camada 3: Mapeamento de padrões de falha para estratégias de remediação
Etapa 5: Verificar
Reexecute a suíte completa de avaliação, pois mudanças no prompt do sistema podem ter amplo impacto.
| Conjunto de avaliação | Antes da alteração | Após a regressão | Depois da alteração |
|---|---|---|---|
| Exatidão factual | 91% | 76% | 90% |
| Tom e Qualidade | 83% | 91% | 89% |
| Todos os outros | Acima do limite | Acima do limite | Acima do limite |
Avaliação: Ambos os sinais agora atingem seus limites de bloqueio. O tom não retorna totalmente ao seu pico, mas permanece bem acima do limite de bloqueio de 75% e melhora em relação à linha de base original.
Etapa 6: Documentar
| Caso de teste | Tipo de causa raiz | Problema observado | Alteração aplicada | Resolvido |
|---|---|---|---|---|
| FA-007, FA-012, FA-018 (e outros) | Configuração do agente | Diretrizes de tom prejudicaram a integridade factual | Prompt reestruturado para priorizar a precisão e aplicar empatia condicional | Sim |
Conclusão: sempre valide as alterações nos prompts do sistema em toda a suíte de avaliação, não apenas no sinal de destino. Instruções competem pela atenção do modelo, e melhorias em uma área podem introduzir regressões em outras.
Padrão a observar: Este cenário é um exemplo do problema do orçamento de instrução. À medida que os prompts crescem, conflitos de instrução tornam-se mais prováveis. Consolidação e simplificação periódicas ajudam a manter a estabilidade.
Padrões Comuns ao Longo das Jornadas
Cada jornada tem início em um cenário diferente para exemplificar um percurso diagnóstico distinto. Para entender como um único agente percorre todas as etapas do ciclo de avaliação — interpretação de pontuação, triagem de falhas, remediação e verificação — revise a Jornada 1, que apresenta o guia de ponta a ponta mais completo.
Esta tabela destaca padrões recorrentes observados ao longo das jornadas e as lições práticas que eles reforçam.
| Padrão | Onde ele aparece | Conclusão principal |
|---|---|---|
| Validar a avaliação antes do agente | Percurso 1 | Uma fonte comum de desperdício de esforço é solucionar problemas no comportamento do agente quando a própria avaliação está incorreta. |
| Pontuações constantes indicam uma classificação incorreta da causa raiz | Percurso 2 | Se a remediação repetida não melhorar os resultados, reclassifique o problema. Você pode estar abordando a causa raiz errada. |
| Reexecute o conjunto completo de avaliação após alterações no prompt | Percurso 3 | Alterações de prompt podem afetar vários sinais de qualidade. Certifique-se sempre de verificar regressões fora da área-alvo. |
| Documente resultados e decisões | Todas as jornadas | Manter um log de falhas evita a redescoberta das mesmas causas raiz em iterações futuras. |
| Lacunas Conhecidas Podem Ser Aceitáveis | Jornada 1 (KG-007), Jornada 2 (FA-019) | Nem toda falha precisa ser resolvida antes do lançamento. Documente lacunas conhecidas e monitore-as ao longo do tempo. |
Próximas etapas
Após revisar esses exemplos, escolha a próxima ação que melhor corresponda à sua situação atual:
- Comece com a interpretação das pontuações se você tiver resultados de avaliação disponíveis para análise.
- Comece a triagem de falhas se precisar diagnosticar falhas específicas de casos de teste.
- Aplique a análise de padrões se estiver lidando com múltiplas falhas e quiser identificar problemas sistêmicos.
- Configure o registro de falhas para acompanhar decisões, resultados e problemas recorrentes.
- Retorne aos objetivos do framework para revisar a abordagem completa de triagem da avaliação.