Avaliar conversas em vários turnos

Usuários reais não interagem com os agentes por meio de trocas isoladas de perguntas únicas. Em vez disso, eles se envolvem em conversas que incluem perguntas de acompanhamento, compartilhamento incremental de informações e conclusão de tarefas em várias etapas.

A avaliação em várias etapas ajuda a garantir que seu agente possa manter o contexto, concluir tarefas em várias etapas e responder adequadamente ao longo de um fluxo de conversa realista.

Quando usar a avaliação de várias voltas

Use a avaliação de várias voltas ao testar cenários que exigem retenção de contexto ou várias etapas para concluir uma tarefa.

Cenário Por que várias voltas são necessárias
Preenchimento do slot O agente deve coletar várias informações.
Fluxos de esclarecimento O agente deve resolver entradas de usuário ambíguas.
Tarefas de várias etapas A tarefa requer várias trocas para ser concluída.
Acompanhamentos dependentes do contexto Perguntas posteriores dependem de respostas anteriores.
Divulgação progressiva As informações são fornecidas de forma incremental.

Avaliação de turno único vs. vários turnos

Comece com avaliações de turno único para cobertura e, em seguida, adicione avaliações de vários turnos para testar interações realistas.

Aspecto Volta única Várias voltas
Testes Pares individuais de pergunta e resposta Concluir conversas
Contexto Cada prompt é independente Vira construir um sobre o outro
Complexidade Mais fácil de projetar e avaliar Mais realista, mas complexo
Diagnóstico de falha Problemas mais fáceis de isolar Requer análise passo a passo
Caso de uso Testando respostas específicas Testando o fluxo de conversa

Métricas-chave para avaliação em vários turnos

A avaliação de várias voltas requer métricas extras além da precisão de uma volta. Essas métricas avaliam o desempenho do agente em toda a conversa.

Integridade da conversa

A conclusão da conversa mede se o agente atinge a meta do usuário até o final da interação.

Exemplo de sucesso

Turno 1

  • Usuário: "Preciso pedir um laptop"
  • Agente: "Eu posso ajudar com isso. Que tipo de laptop você precisa?"

Turno 2

  • Usuário: "MacBook Pro"
  • Agente: "Qual o tamanho da tela - 14 polegadas ou 16 polegadas?"

Turno 3

  • Usuário: "16 polegadas"
  • Agente: "Enviei seu pedido para um MacBook Pro de 16 polegadas. ID do pedido: ORD-456. Entrega prevista: 5 a 7 dias úteis."

✅ O objetivo do usuário (encomendar um laptop) é alcançado.

Exemplo de falha

Turno 1

  • Usuário: "Preciso pedir um laptop"
  • Agente: "Eu posso ajudar com isso. Que tipo de laptop você precisa?"

Turno 2

  • Usuário: "MacBook Pro"
  • Agente: "O MacBook Pro é uma ótima escolha! Há mais alguma coisa?"

❌ O pedido não foi enviado e a meta do usuário não foi atingida.

Retenção de conhecimento

A retenção de conhecimento mede se o agente se lembra e usa as informações fornecidas em turnos anteriores.

Exemplo de sucesso

Turno 1

  • Usuário: "Meu ID de funcionário é EMP-12345"
  • Agente: "Obrigado! Como posso ajudá-lo hoje?"

Turno 2

  • Usuário: "Quero marcar meu saldo de TDF"
  • Agente: "Seu saldo atual de PTO é de 12 dias restantes."

✅ O agente usou a ID do funcionário fornecida anteriormente sem perguntar novamente.

Exemplo de falha

Turno 1

  • Usuário: "Meu ID de funcionário é EMP-12345"
  • Agente: "Obrigado! Como posso ajudá-lo hoje?"

Turno 2

  • Usuário: "Quero marcar meu saldo de TDF"
  • Agente: "Eu ficaria feliz em ajudar. Qual é a sua ID de funcionário?"

❌ O agente esqueceu a ID do funcionário do turno anterior.

Adesão à função

A adesão à função mede se o agente mantém seu escopo e responsabilidades definidos ao longo da conversa.

Exemplo de sucesso

Turno 1

  • Usuário: "Qual é a política de PTO?"
  • Agente: fornece informações corretas sobre a política de PTO

Turno 2

  • Usuário: "Você pode escrever um poema sobre férias?"
  • Agente: "Estou aqui para ajudar com questões de RH e integração. Há mais alguma coisa sobre o PTO com a qual eu possa ajudar?"

✅ O agente permaneceu dentro de sua função e redirecionou adequadamente.

Exemplo de falha

Turno 1

  • Usuário: "Qual é a política de PTO?"
  • Agente: fornece informações corretas sobre a política de PTO

Turno 2

  • Usuário: "Você pode escrever um poema sobre férias?"
  • Agente: "Claro! Aqui está um poema sobre praias ensolaradas ...

❌O agente se afastou de seu papel de assistente de RH.

Relevância da conversa

A relevância da conversa mede se cada resposta é diretamente relevante para a solicitação do usuário dentro do contexto de conversa atual.

Exemplo de falha

Turno 1

  • Usuário: "Quais planos de saúde estão disponíveis?"
  • Agente: Lista as opções de HMO e PPO

Turno 2

  • Usuário: "Qual é a diferença de custo?"
  • Agente: "O PPO oferece mais flexibilidade na escolha de médicos."

❌ A resposta não responde à pergunta do usuário sobre o custo.

Consistência de contexto

A consistência de contexto mede se o agente mantém fatos e informações consistentes em todos os turnos da conversa.

Exemplo de falha

Turno 1

  • Usuário: "Quantos dias de férias eu tenho?"
  • Agente: "Como novo funcionário, você recebe 15 dias de PTO anualmente."

Turno 2

  • Usuário: "E quantos dias de doença?"
  • Agente: "Você tem 10 dias de licença médica, mais seus 10 dias de férias."

❌ O agente contradiz informações anteriores alterando o número de dias de férias.

Projetar casos de teste de várias voltas

Projetar avaliações eficazes de várias voltas requer a definição do fluxo de conversa e dos comportamentos esperados. Um caso de teste de várias voltas normalmente inclui:

  • ID e descrição do caso de teste
  • Dados de base
  • Sequência de conversa
  • Comportamentos esperados
  • Asserções

Exemplo: Ordem do equipamento

  • ID do caso de teste: CONV-001
  • Descrição: Fluxo de pedidos de equipamentos

Dados de base

  • Funcionário: Katrin Pold
  • ID do funcionário: EMP-54321
  • Departamento: Design de Produto
  • Orçamento: $3,500

Conversa

Turno 1

  • Usuário: "Preciso configurar meu laptop."
  • Comportamento esperado: pergunte sobre preferências.

Turno 2

  • Usuário: "MacBook Pro"
  • Comportamento esperado: solicite especificações.

Turno 3

  • Usuário: "16 polegadas com 32 GB de RAM"
  • Comportamento esperado: confirmar e enviar pedido.

Turno 4

  • Usuário: "Na verdade, mude para 64 GB."
  • Comportamento esperado: atualize o pedido.

Asserções no nível da conversa

  • A conversa é concluída com um pedido de equipamento confirmado.
  • O pedido final reflete a especificação corrigida (64 GB).
  • O agente nunca pede a ID do funcionário (deve inferir do contexto).
  • O total de voltas até a conclusão é de ≤6.

Asserções em nível de turno

  • Turno 3:
    • O agente invoca a ferramenta OrderEquipment.
    • A chamada de ferramenta inclui o modelo: "MacBook Pro 16 polegadas".
    • A chamada de ferramenta inclui especificações que contêm "32 GB".
  • Curva 4:
    • O agente invoca UpdateOrder ou modifica a ordem anterior.
    • A confirmação final mostra "64 GB".

Exemplo: conversa de preenchimento de slot

Cenário: Registro de benefícios (preenchimento de slot)
Meta: coletar todas as informações necessárias e concluir o registro

Entradas necessárias (slots):

  • Seleção de plano (HMO ou PPO)
  • Nível de cobertura (individual ou familiar)
  • Informações dependentes (se aplicável)
  • Data efetiva

Conversa

Turno 1
Usuário: "Quero me inscrever no seguro de saúde".
Agente:

  • Reconhece a solicitação
  • Pede preferência de plano (HMO vs. PPO)

Turno 2
Usuário: "Qual é a diferença?"
Agente:

  • Explica as principais diferenças entre HMO e PPO
  • Pede novamente a seleção de plano

Turno 3
Usuário: "Eu vou com o PPO."
Agente:

  • Confirma a seleção
  • Pede o nível de cobertura (individual ou familiar)

Turno 4
Usuário: "Cobertura familiar. Eu tenho um cônjuge e dois filhos."
Agente:

  • Confirma o cenário dependente
  • Solicita detalhes dependentes (nomes, idades etc.)

Turno 5
Usuário: [Fornece informações dependentes]
Agente:

  • Confirma todas as informações coletadas
  • Envia o registro
  • Fornece resumo de confirmação

Afirmações:

  • Todos os slots necessários são coletados antes do envio.
  • O agente não ignora as entradas necessárias.
  • O agente explica as opções quando solicitado.
  • A confirmação final inclui todos os detalhes capturados.
  • A tarefa é concluída com êxito sem turnos desnecessários.

Exemplo: conversa de esclarecimento

Cenário: solicitação ambígua (esclarecimento)
Objetivo: resolver a ambiguidade reunindo contexto suficiente antes de responder

Conversa

Turno 1
Usuário: "Preciso tirar uma folga."
Agente:

  • Reconhece a solicitação
  • Pergunta que tipo de folga (PTO, licença médica, licença pessoal)

Turno 2
Usuário: "É para um procedimento médico."
Agente:

  • Identifica a categoria provável
  • Pergunta se a solicitação é para o usuário ou um membro da família

Turno 3
Usuário: "É para mim. É uma pequena cirurgia."
Agente:

  • Determina que provavelmente é licença médica
  • Fornece informações relevantes sobre a política
  • Pergunta sobre a duração esperada

Turno 4
Usuário: "Cerca de uma semana."
Agente:

  • Confirma a qualificação e o processo
  • Fornece as próximas etapas (por exemplo, como solicitar licença)
  • Oferece-se para iniciar a solicitação, se aplicável

Afirmações:

  • O agente não assume a intenção da solicitação ambígua inicial.
  • Esclarecer questões são relevantes e estreitam progressivamente o escopo.
  • A resposta final reflete a situação real do usuário.
  • O agente faz a transição do esclarecimento para a resolução de forma eficaz.

Exemplo: conversa de recuperação de erro

Cenário: Falha e recuperação de pedido
Objetivo: lidar com falhas de forma transparente e orientar o usuário para um resultado bem-sucedido

Conversa:

Turno 1
Usuário: "Encomende um MacBook Pro de 16 polegadas."
Agente:

  • Tentativas de envio do pedido

Resposta do sistema/ferramenta:

  • Erro: Item esgotado

Agente:

  • comunica o problema claramente
  • Não obscurece nem ignora a falha
  • Sugere alternativas (por exemplo, modelo ou tamanho diferente)

Turno 2
Usuário: "Quando estará de volta em estoque?"
Agente:

  • Verifica a disponibilidade ou fornece uma estimativa de reabastecimento, se disponível
  • Se não estiver disponível, comunica isso claramente
  • Ofertas para notificar o usuário ou sugerir alternativas

Turno 3
Usuário: "Posso obter o de 14 polegadas em vez disso?"
Agente:

  • Confirma a disponibilidade da alternativa
  • Envia a nova encomenda
  • Fornece confirmação (detalhes do pedido, entrega prevista)

Afirmações:

  • O agente comunica claramente as falhas e suas causas.
  • O agente oferece alternativas acionáveis ou próximas etapas.
  • A conversa progride em direção à recuperação, não a becos sem saída.
  • O usuário conclui a tarefa com êxito após a falha.
  • O agente mantém o contexto entre as etapas de falha e recuperação.

Asserções de várias voltas

A avaliação em vários turnos requer validação no nível da conversa e no nível do turno.

Asserções no nível da conversa

  • A conversa atinge o objetivo do usuário.
  • O número de voltas está dentro de um intervalo esperado.
  • O agente mantém informações consistentes.
  • O agente mantém sua função.
  • O agente não solicita informações duplicadas.

Asserções em nível de turno

  • A resposta reconhece o contexto anterior.
  • A resposta faz perguntas de acompanhamento apropriadas.
  • O agente executa as ações esperadas.
  • A resposta confirma as ações tomadas.

Asserções condicionais

  • Quando o usuário corrige informações, o agente atualiza as respostas subsequentes.
  • Quando uma ação falha, o agente comunica o problema e fornece alternativas.
  • Quando um usuário faz uma pergunta fora do escopo, o agente redireciona adequadamente.

Exemplo: Avaliação completa de várias voltas

Caso de teste: Configuração de nova contratação

Descrição

Um novo funcionário solicita equipamentos e faz uma pergunta sobre benefícios durante a mesma conversa.

Dados de base

  • Funcionário: Marcus Johnson
  • ID do funcionário: EMP-99887
  • Departamento: Engenharia
  • Local: Seattle
  • Orçamento do equipamento: $ 4,000

Conversa

Turno 1

  • Usuário: "Vou começar na próxima semana e preciso configurar minha estação de trabalho."
  • Comportamento esperado: Bem-vindo e pergunte sobre as necessidades de equipamentos.

Turno 2

  • Usuário: "Preciso de um MacBook Pro de 16 polegadas com 64 GB de RAM e um monitor de 27 polegadas."
  • Comportamento esperado: Envie o pedido e confirme.

Turno 3

  • Usuário: "Quando é o prazo para se inscrever no seguro saúde?"
  • Comportamento esperado: forneça informações de benefícios sem perder o contexto.

Turno 4

  • Usuário: "Você pode confirmar o que eu pedi?"
  • Comportamento esperado: Recupere e resuma a ordem.

Resultados esperados

  • O pedido do equipamento foi concluído.
  • A pergunta sobre benefícios é respondida com precisão.
  • O contexto é mantido em todos os turnos.
  • As informações não são solicitadas novamente.

Armadilhas comuns

Esteja ciente desses problemas comuns ao projetar e avaliar conversas com vários turnos:

  • A avaliação se transforma isoladamente, em vez de dentro do contexto completo da conversa, o que pode ocultar falhas relacionadas à memória, continuidade e conclusão de tarefas.
  • Testar apenas cenários ideais (caminho feliz), que não refletem o comportamento real do usuário, como ambiguidade, correções e interrupções.
  • Ignorar as diferenças entre conversas curtas e longas, em que os fluxos curtos geralmente perdem a conclusão e os fluxos longos introduzem o desvio de contexto.
  • Não inclui comportamento adversário ou inesperado do usuário, como entradas conflitantes, alternância de tópico ou solicitações vagas.
  • Definir objetivos do usuário pouco claros ou implícitos, tornando difícil determinar se a conversa foi bem-sucedida.
  • Especificação excessiva de respostas esperadas, o que reduz a flexibilidade e penaliza incorretamente variações válidas.
  • Falha ao testar o tratamento de erros e os caminhos de recuperação, deixando lacunas em como o agente responde a falhas ou informações ausentes.

Práticas recomendadas

Use estas práticas para projetar avaliações eficazes e escaláveis em várias etapas:

  • Comece com um pequeno conjunto de cenários de alto valor que representam os fluxos de conversa mais comuns ou críticos.
  • Defina uma meta de usuário clara para cada caso de teste e use a conclusão da meta como a principal métrica de sucesso.
  • Teste os caminhos diretos (o usuário fornece todas as entradas antecipadamente) e guiados (o agente coleta entradas em vários turnos) até a conclusão.
  • Use declarações em nível de conversa primeiro e, em seguida, adicione declarações em nível de turno para uma validação mais profunda.
  • Crie cenários que reflitam o comportamento realista do usuário, incluindo esclarecimentos, correções e alternância de tópicos.
  • Valide a retenção de contexto explicitamente, garantindo que o agente use informações fornecidas anteriormente sem perguntar novamente.
  • Inclua cenários de tratamento e recuperação de erros, garantindo que o agente comunique falhas e forneça as próximas etapas.
  • Use afirmações flexíveis baseadas em comportamento em vez de correspondência de resposta exata.
  • Certifique-se de que os testes sejam reproduzíveis, preservando o realismo, definindo comportamentos esperados em vez de frases exatas.
  • Itere e refine continuamente os casos de teste com base nas falhas observadas e nos padrões de uso em evolução.

Próxima etapa