Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Estas instruções detalhadas de ponta a ponta ilustram como as camadas da estrutura de triagem de avaliação funcionam em conjunto na prática. Cada percurso começa a partir de um cenário de avaliação diferente e segue um caminho de diagnóstico distinto.
As instruções detalhadas mostram como aplicar a estrutura passo a passo. Utilize estes exemplos para compreender como passar dos resultados da avaliação para o diagnóstico, a remediação e a verificação em cenários reais de avaliação de agentes.
Sugestão
Antes de começar a trabalhar nestes exemplos, reveja os objetivos da estrutura, incluindo os conceitos e princípios fundamentais.
| Percurso | Situação inicial | O que demonstra |
|---|---|---|
| Percurso 1 | Primeira execução de avaliação | Fluxo ponto a ponto: Interpretar → Priorizar → Triagem → Remediar → Verificar |
| Percurso 2 | As pontuações atingem um patamar após múltiplas iterações | Análise de padrões, reclassificação e estratégias para contornar limitações da plataforma |
| Percurso 3 | As pontuações regressam após uma alteração | Deteção de regressão, diagnóstico de conflitos de instruções e resolução de compromissos |
Nota
Estes exemplos são ilustrativos e baseiam-se em padrões comuns observados em múltiplas execuções de avaliações de clientes. Os casos de teste, as pontuações e os detalhes dos agentes são compostos representativos em vez de registos de uma única cativação. As abordagens de diagnóstico e estratégias de remediação apresentadas refletem práticas utilizadas em implementações reais.
Percurso 1: Primeira execução de avaliação
Executa a sua suíte de avaliação pela primeira vez num agente de suporte ao cliente. Eis os resultados:
| Conjunto de avaliação | Taxa de aprovação |
|---|---|
| Dados pessoais e segurança | 100% |
| Perguntas e respostas essenciais sobre negócios | 87% |
| Fundamentação do conhecimento | 71% |
| Invocação da ferramenta | 92% |
| Encaminhamento do acionador | 88% |
| Tom e qualidade | 83% |
| Escalamento | 90% |
| Global | 85% |
Passo 1: Interpretar as pontuações (Camada 1)
Utilize a tabela de interpretação de pontuação para calibrar os limiares e identificar quais conjuntos de avaliação estão abaixo dos limiares de bloqueio.
| Conjunto de avaliação | Classificação | Limiar | Estado |
|---|---|---|---|
| Dados pessoais e segurança | 100% | 95% de bloqueio | Êxito |
| Perguntas e respostas essenciais sobre negócios | 87% | 80% de bloqueio | Êxito |
| Fundamentação do conhecimento | 71% | 80% de bloqueio | Abaixo do bloqueio |
| Invocação da ferramenta | 92% | 85% de bloqueio | Êxito |
| Encaminhamento do acionador | 88% | 80% de bloqueio | Êxito |
| Tom e qualidade | 83% | 75% de bloqueio | Êxito |
| Escalamento | 90% | 85% de bloqueio | Êxito |
Avaliação de preparação: Iterar. O fundamento do conhecimento está abaixo do seu limiar de bloqueio. Concentre a remediação aí.
Passo 2: Priorizar falhas (Camada 2, Passo 0)
Situação: A base do conhecimento tem sete casos de teste. Dois casos de teste falham: KG-003 e KG-005. Ambos os casos de teste fazem parte de um conjunto principal de avaliação de negócio, pelo que têm prioridade 2. Como só há dois, faça a triagem de ambos.
Referência: Priorizar falhas (Camada 2, Passo 0)
Passo 3: Triagem KG-003 (Camada 2, Passos 1-2)
Caso de teste KG-003:
- Entrada de exemplo: "Qual é a vossa política de devoluções?"
- Resposta esperada: "Oferecemos um prazo de devolução de 30 dias para todas as compras."
- Resposta do agente: "A nossa política de devoluções permite devoluções dentro de 15 dias úteis após a compra."
- Método de avaliação: Correspondência de palavras-chave
- Resultado: Falha (esperado "30 dias", o agente disse "15 dias úteis")
Verificar a configuração da avaliação (passo 1 da Camada 2):
| Pergunta | Atender | Resultado |
|---|---|---|
| A resposta do agente é aceitável? | É necessário verificar o documento de origem. | Verifique a origem primeiro. |
| A resposta esperada ainda está atual? | O documento de origem diz "15 dias úteis". A política foi atualizada. | Não. A resposta esperada está desatualizada. |
Classificação: Problema de configuração da avaliação. A resposta esperada está desatualizada. O agente está correto. A avaliação está incorreta.
Passo 4: Triagem KG-005 (Camada 2, Passos 1-2)
Caso de teste KG-005:
- Exemplo de entrada: "O plano Premium inclui uma garantia alargada?"
- Resposta esperada: "O plano Premium inclui uma garantia padrão de dois anos. Estão disponíveis opções de garantia alargada para compra separadamente."
- Resposta do agente: "Sim, o plano Premium inclui uma garantia alargada de três anos que abrange todas as peças e mão de obra."
- Método de avaliação: Comparar significado
- Resultado: Falha (agente inventou detalhes da garantia)
Verificar a configuração da avaliação (passo 1 da Camada 2):
| Pergunta | Atender | Resultado |
|---|---|---|
| A resposta do agente é aceitável? | Não. A resposta "Garantia alargada de três anos" é inventada. | Continuar |
| A resposta esperada está atual? | Sim. A fonte confirma uma garantia padrão de dois anos. | Continuar |
| O caso de teste é realista? | Sim. Uma pergunta comum dos clientes. | Continuar |
| Uma resposta alternativa poderia estar correta? | Não. Os detalhes da garantia são factuais. | Continuar |
| O método de avaliação é adequado? | Sim.A comparação de significado é correta para garantir a precisão semântica. | A avaliação é válida. |
Diagnosticar o agente (passo 2 da Camada 2):
| Pergunta | Atender |
|---|---|
| O conteúdo de origem está incorreto? | Não. A fonte diz "garantia padrão de dois anos." |
| O agente contradisse a informação da fonte? | Sim. A fonte diz "garantia padrão de dois anos", mas o agente disse "garantia alargada de três anos". |
| O agente respondeu sem utilizar nenhuma fonte? | Provavelmente sim. O detalhe da "garantia alargada de três anos cobrindo todas as peças e mão de obra" não existe em nenhuma fonte. |
Classificação: Problema de configuração do agente. Lacuna na fundamentação do conhecimento. O agente forneceu detalhes de garantia que não estão presentes nas fontes de conhecimento configuradas.
Passo 5: Remediar (Camada 3)
KG-003 (Remediação da configuração de avaliação):
- Atualização: Atualizar valor esperado de "janela de devolução de 30 dias" para "15 dias úteis"
- Volte a executar: apenas o KG-003
- Expectativa: Passo
KG-005 (Remediação da configuração do agente):
- Alteração: Adicionar instrução de fundamentação ao pedido do sistema: "Responda apenas com base na informação encontrada nas suas fontes de conhecimento." Se a informação não estiver disponível, diga-o."
- Volte a executar: conjunto de avaliação completa do fundamento do conhecimento (a alteração da configuração do agente pode ter efeitos mais amplos)
- Expectativa: o KG-005 passa. Os restantes casos de teste não devem apresentar regressão.
Passo 6: Verificar
Após ambas as alterações, execute novamente o conjunto de avaliação de fundamentação do conhecimento:
| Antes | Depois de |
|---|---|
| 71% (5/7 com aprovação) | 86% (6/7 com aprovação) |
Avaliação: a fundamentação de conhecimento está agora acima do limiar de bloqueio de 80%. Uma falha (KG-007) permanece e não bloqueia a preparação. Reveja-o na próxima iteração.
Passo 7: Documentar (Camada 4)
Registe no registo de falhas:
| Caso de teste | Tipo de causa raiz | Problema observado | Alteração aplicada | Resolvido |
|---|---|---|---|---|
| KG-003 | Configuração da avaliação | Resposta esperada desatualizada (a política mudou de 30 para 15 dias úteis). | Valor esperado atualizado | Sim |
| KG-005 | Configuração de agente | Detalhes de garantia incorretos que não estão em nenhuma fonte. | Instrução de fundamentação adicionada ao pedido do sistema | Sim |
Nota sobre o padrão: verifique os valores esperados em relação aos documentos fonte antes de cada execução de avaliação. Adicione este passo na lista de verificação pré-avaliação.
Nova verificação da prontidão: todos os conjuntos de avaliação agora acima dos limiares de bloqueio.
Avaliação de prontidão: Implemente o agente com lacunas conhecidas (KG-007 documentado, plano de monitorização em vigor).
Referência: Camada 4: Analisar padrões e melhorar continuamente o seu agente
Percurso 2: Plateau de pontuação
Situação: executa quatro iterações num agente de suporte de produto. A precisão factual mantém-se nos 78% nas quatro execuções. Fazem-se alterações aos pedidos após cada iteração, mas não se verifica qualquer melhoria.
Passo 1: Analisar padrões (Camada 4)
Reveja o registo de falhas ao longo de todas as quatro iterações:
| Iteração | Classificação | Alteração aplicada | Result |
|---|---|---|---|
| 1 | 78% | (linha de base) | — |
| 2 | 79% | Adicionado "Seja preciso nas especificações do produto" | Nenhuma mudança significativa |
| 3 | 77% | O pedido foi reorganizado para dar prioridade às instruções de precisão | Nenhuma mudança significativa |
| 4 | 78% | Adicionei exemplos resolvidos de respostas corretas ao produto | Nenhuma mudança significativa |
Tendência: Estável. A remediação não está a abordar a causa raiz real.
Referência: Camada 4: Analisar padrões e melhorar continuamente o seu agente
Passo 2: Analisar casos de teste falhados
Reveja as seis falhas persistentes ao longo de todas as iterações.
| Caso de teste | Em falha desde | Problema observado |
|---|---|---|
| FA-002 | Iteração 1 | O agente cita a página de FAQ em vez do manual do produto |
| FA-005 | Iteração 1 | O agente cita a página de FAQ em vez do manual do produto |
| FA-008 | Iteração 1 | O agente cita a página de FAQ em vez do manual do produto |
| FA-011 | Iteração 1 | O agente cita a página de FAQ em vez do manual do produto |
| FA-014 | Iteração 1 | O agente cita a página de FAQ em vez do manual do produto |
| FA-019 | Iteração 2 | O agente fornece uma resposta parcial baseada no FAQ, sem incluir detalhes do manual |
Análise de concentração: cinco em cada seis falhas (83%) têm a mesma causa raiz: o agente obtém informações da página de FAQ em vez do manual do produto.
Passo 3: Efetuar nova triagem (Camada 2)
Inicialmente, classifique as falhas como Problema de configuração do agente: fonte incorreta obtida.
Aplique múltiplas alterações na configuração do agente, incluindo reformulação do pedido, reordenação e adição de exemplos. Estas mudanças não resultam numa melhoria mensurável. Neste ponto, valide a falha em relação a indicadores de limitação da plataforma.
| Indicador | Verificar |
|---|---|
| A falha persiste por múltiplas variações de pedido ou configuração | Sim. Quatro iterações sem alterações. |
| A recuperação devolve consistentemente documentos incorretos, apesar de a fonte estar configurada corretamente | Sim. A FAQ é consistentemente obtida em vez do manual do produto. |
Reclassificação: trata-se de uma limitação da plataforma relacionada com a priorização dos resultados de recuperação. A plataforma prioriza consistentemente o FAQ em detrimento do manual do produto para estas consultas e alterações adicionais a pedidos ou instruções não afetam o comportamento da recuperação.
Referência: Camada 2: Falhas de agentes de triagem
Passo 4: Remediar (Camada 3: Limitação da plataforma)
Quando classificar uma falha como limitação da plataforma, concentre-se na remediação em soluções alternativas e documentação em vez de fazer alterações na configuração do agente.
Referência: Resposta à limitação da plataforma
Estratégia de solução de contorno: aplique uma ou mais das seguintes estratégias para mitigar o impacto:
- Reestruture o manual do produto com títulos de secção mais claros que estejam alinhados com o vocabulário utilizado nas consultas dos utilizadores.
- Duplique especificações críticas do produto do manual para as FAQ para criar caminhos redundantes de recuperação.
- Refatorize o conteúdo do manual para que cada secção responda a uma única questão bem definida para melhorar a correspondência de segmentos de recuperação.
Estas abordagens visam influenciar o comportamento de recuperação sem depender de alterações de pedido ou instruções.
Escalamento e monitorização: se a limitação persistir, documente e escale o problema para a equipa da plataforma.
- Documente a limitação da seguinte forma: "Consultas sobre <especificações do produto> obtêm repetidamente a página de FAQ (última atualização: <data>, <n> páginas) em vez do manual do produto (última atualização: <data>, <N> páginas), apesar de o manual conter a informação oficial."
- Forneça evidências de apoio: Inclua vários casos de teste mostrando a consulta, a fonte esperada e a fonte realmente obtida.
- Submeta para investigação.
- Partilhe a limitação documentada e as evidências com a equipa da plataforma para seguimento.
Passo 5: Verificar
Após a reestruturação do manual do produto e a adição de entradas redundantes de FAQ, execute novamente o conjunto de avaliação relevante para verificar o impacto.
| Antes | Depois de |
|---|---|
| 78% (sem alteração ao longo de quatro iterações) | 89% |
Avaliação: a solução alternativa melhora o desempenho global. Permanece uma falha (FA-019). A consulta é demasiado ambígua para obter a fonte correta de forma fiável, mesmo com conteúdo reestruturado. Esta falha é registada como uma limitação conhecida.
Passo 6: Documentar
Atualize o registo de falhas para refletir a classificação final e os resultados.
| Caso de teste | Tipo de causa raiz | Problema observado | Alteração aplicada | Resolvido |
|---|---|---|---|---|
| FA-002, 005, 008, 011, 014 | Limitação da plataforma | A classificação de recuperação prioriza as FAQ em relação ao manual do produto | Reestruturámos os cabeçalhos do manual; duplicámos as especificações críticas nas FAQ | Sim |
| FA-019 | Limitação da plataforma | Uma consulta ambígua não consegue obter de forma fiável a fonte correta | Documentado como uma limitação conhecida | Não |
Mensagem principal: se as pontuações de avaliação se mantiverem constantes após várias alterações ao pedido ou às instruções, a causa principal provavelmente não está no pedido. Valide o comportamento da infraestrutura e da plataforma antes de investir mais em engenharia de pedidos.
Percurso 3: Regressão pós-atualização
Situação: atualizou-se o pedido do sistema para melhorar o tom e a empatia. As pontuações de tom aumentaram, mas a exatidão factual caiu abaixo do limiar de bloqueio, resultando numa regressão.
Antes da alteração:
| Conjunto de avaliação | Classificação |
|---|---|
| Precisão factual | 91% |
| Tom e qualidade | 83% |
| Todos os outros | Acima do limiar |
Adicionou a seguinte instrução ao pedido do sistema: "Reconheça sempre a preocupação do cliente e mostre empatia antes de fornecer a sua resposta." Comece cada resposta validando a experiência do cliente."
Após a alteração:
| Conjunto de avaliação | Antes | Depois de | Delta |
|---|---|---|---|
| Precisão factual | 91% | 76% | -15% |
| Tom e qualidade | 83% | 91% | +8% |
Passo 1: Interpretar (Camada 1)
A exatidão factual está agora abaixo do limiar de bloqueio de 80%. Esta mudança introduz uma regressão e bloqueia a preparação.
Referência: Camada 1: Interpretar as pontuações e identificar falhas
Passo 2: Analisar padrões (Camada 4)
Correspondência de padrões de sinais cruzados: o tom melhora enquanto a precisão se degrada.
Causa raiz identificada: conflito de instruções.
A nova orientação tonal adicionada compete com instruções de precisão pela atenção do modelo.
Referência: Camada 4: Analisar padrões e melhorar continuamente o seu agente
Passo 3: Triagem das novas falhas (Camada 2)
Reveja casos de teste de exatidão factual que passaram antes da mudança e agora falham.
Caso de teste FA-007:
- Entrada: "Qual é o tamanho máximo de upload de ficheiros?"
- Esperado: "O tamanho máximo de upload de ficheiros é de 25 MB para contas padrão e 100 MB para contas empresariais."
- Agente anterior: "O tamanho máximo de upload de ficheiros é de 25 MB para contas padrão e 100 MB para contas empresariais."
- Agente após: "Compreendo perfeitamente a sua preocupação com os tamanhos de upload dos ficheiros; pode ser frustrante quando está a tentar carregar documentos importantes! Quero garantir que dispõe de toda a informação necessária. O tamanho máximo de carregamento é de 25 MB para planos padrão."
Passo 1. Verifique a avaliação: A resposta esperada é correta e a avaliação é válida. A resposta pós-atualização omite o detalhe da conta empresarial.
Passo 2. Diagnosticar: A nova instrução de tom exige um preâmbulo de empatia em cada resposta. Este requisito consome o orçamento de resposta e a atenção do modelo, levando a respostas factuais incompletas.
Classificação: Problema de configuração do agente. Conflito de instruções entre o tom e as orientações de precisão.
Referência: Camada 2: Falhas de agentes de triagem
Passo 4: Remediar (Camada 3)
O problema não é a orientação de tom em si, mas sim prioridades concorrentes dentro do pedido do sistema. A remediação foca-se em separar e priorizar as instruções.
Instrução antiga (única, concorrente): "Reconheça sempre a preocupação do cliente e mostre empatia antes de fornecer a resposta. Comece cada resposta validando a experiência do cliente."
Nova instrução (separada, priorizada): "Inclua sempre a resposta completa e factual à pergunta do cliente. Não omita detalhes para ser breve. Além disso, quando o cliente expressar frustração ou preocupação, reconheça brevemente."
Principais alterações:
- A precisão é explicitamente priorizada.
- A integridade das respostas factuais é declarada diretamente.
- A empatia é condicional em vez de universal.
- "Brevemente" limita a empatia para evitar o truncamento do conteúdo.
Referência: Camada 3: Mapear padrões de falhas para estratégias de remediação
Passo 5: Verificar
Volte a executar toda a suíte de avaliação, pois as alterações ao pedido do sistema podem ter um impacto alargado.
| Conjunto de avaliação | Antes da alteração | Após a regressão | Após a alteração |
|---|---|---|---|
| Precisão factual | 91% | 76% | 90% |
| Tom e qualidade | 83% | 91% | 89% |
| Todos os outros | Acima do limiar | Acima do limiar | Acima do limiar |
Avaliação: ambos os sinais cumprem agora os seus limiares de bloqueio. O tom não regressa totalmente ao seu pico, mas mantém-se bem acima do limiar de bloqueio de 75% e melhora a linha de base original.
Passo 6: Documentar
| Caso de teste | Tipo de causa raiz | Problema observado | Alteração aplicada | Resolvido |
|---|---|---|---|---|
| FA-007, FA-012, FA-018 (e outros casos) | Configuração de agente | A orientação tonal comprometia a completude factual | Pedido reestruturado para priorizar a precisão e aplicar empatia condicional | Sim |
Conclusão principal: Valide sempre as alterações de pedidos do sistema em relação a toda a suíte de avaliação, não apenas em relação ao sinal de destino. As instruções competem pela atenção do modelo, e melhorias numa área podem introduzir regressões noutras.
Padrão a observar: este cenário é um exemplo do problema do orçamento de instruções. À medida que os pedidos crescem, os conflitos de instrução tornam-se mais prováveis. A consolidação e a simplificação periódicas ajudam a manter estabilidade.
Padrões comuns ao longo dos percursos
Cada percurso parte de um cenário diferente para ilustrar um caminho diagnóstico distinto. Para ver como um único agente progride ao longo de todo o ciclo de vida da avaliação — interpretação das pontuações, triagem de falhas, remediação e verificação — consulte a Percurso 1, que oferece o guia mais completo de ponta a ponta.
Esta tabela destaca padrões recorrentes observados ao longo dos percursos e as lições práticas que elas reforçam.
| Padrão | Onde aparece | Principais conclusões |
|---|---|---|
| Valide a avaliação antes do agente | Percurso 1 | Uma fonte comum de esforço desperdiçado é tentar resolver problemas no comportamento do agente de resolução de problemas quando a avaliação utilizada está incorreta. |
| Pontuações constantes indicam uma causa raiz mal classificada | Percurso 2 | Se a remediação repetida não melhorar os resultados, reclassifique o problema. Pode estar a abordar a causa raiz errada. |
| Execute novamente o conjunto completo de avaliação após alterações no pedido | Percurso 3 | Alterações ao pedido podem afetar múltiplos sinais de qualidade. Verifique sempre se há regressões fora da área-alvo. |
| Documente resultados e decisões | Todos os percursos | Manter um registo de falhas impede a redescoberta das mesmas causas-raiz em iterações posteriores. |
| Lacunas conhecidas podem ser aceitáveis | Percurso 1 (KG-007), Percurso 2 (FA-019) | Nem todas as falhas têm de ser resolvidas antes do lançamento. Documente as lacunas conhecidas e monitorize-as ao longo do tempo. |
Passos seguintes
Depois de ter revisto estes exemplos, escolha a próxima ação que melhor se adequa à sua situação atual:
- Comece com a interpretação das pontuações se tiver resultados de avaliação disponíveis para análise.
- Inicie a triagem de falhas se precisar de diagnosticar falhas específicas de casos de teste.
- Aplique a análise de padrões se estiver a lidar com múltiplas falhas e quiser identificar problemas sistémicos.
- Configure os registos de falhas para monitorizar decisões, resultados e problemas recorrentes.
- Volte aos objetivos da estrutura para rever a abordagem completa de triagem da avaliação.