Testar e monitorizar um Agente Génio

Teste um Agente Genie com perguntas reais, analise o SQL gerado e as visualizações, edite as respostas quando o Genie se enganar e monitorize a utilização do agente e os comentários dos utilizadores para manter a precisão do agente à medida que os dados e as perguntas evoluem. Use benchmarks para avaliar a precisão da resposta em grande escala.

Note

Os Agentes Génio eram anteriormente conhecidos como Espaços Génio.

Testa o teu Agente Génio

A maioria das interações do usuário ocorre na janela de chat. A melhor forma de saber se o seu agente está a trabalhar como pretende é testá-lo com perguntas realistas que espera que os seus utilizadores de negócio façam.

A janela de chat do Genie mostra perguntas de exemplo e um campo de texto para introduzir a tua própria pergunta.

Perguntas de exemplo configuradas nas definições do agente aparecem na janela de chat. O Genie também pode gerar perguntas de exemplo com base no contexto do agente para ajudar os utilizadores a começar a explorar os dados. Os usuários podem clicar em uma pergunta de exemplo ou inserir suas próprias perguntas no campo de texto na parte inferior da tela.

As respostas aparecem acima do campo de texto. Depois que um usuário insere uma pergunta, ela é salva no histórico de bate-papo.

Para iniciar uma nova conversa:

  1. Clique em Nova conversa para iniciar uma nova conversa. Clique no ícone Histórico para abrir uma conversa anterior.
  2. Digite a sua pergunta no campo de texto Faça a sua pergunta....

Revisão de respostas

As respostas são normalmente fornecidas como respostas em linguagem natural às perguntas e uma tabela que mostra o conjunto de resultados relevante. Quando o Genie deteta que uma visualização pode melhorar a clareza da resposta, ele também retorna uma visualização. A estrutura precisa da resposta varia de acordo com a pergunta. Se uma consulta SQL foi gerada para responder à pergunta, ela é incluída na resposta.

Um exemplo de resposta com visualização, feedback e outras opções é mostrado.

Note

Como outros grandes modelos de linguagem (LLMs), Genie pode exibir comportamentos não determinísticos. Isso significa que você pode ocasionalmente receber saídas diferentes ao enviar o mesmo prompt várias vezes. Fornecer consultas SQL de exemplo com as quais o Genie pode aprender pode ajudar a tornar o Genie mais consistente. Consulte Adicionar exemplos de consultas e funções SQL.

Feedback sobre a resposta

Cada resposta solicita que o usuário responda Está correto?. Os usuários podem responder de uma das seguintes maneiras:

  • Sim: Confirma que a resposta parece correta.
  • Corrija-o: Sinaliza a resposta como incorreta. Os usuários podem selecionar entre problemas comuns ou inserir sua própria explicação. Podem, então:
    • Clique em Enviar e tente novamente gerar novamente a resposta usando os comentários fornecidos.
    • Clique em Enviar para enviar o feedback sem regenerar a resposta.
  • Solicitar revisão: Sinaliza a resposta para revisão manual. Os usuários podem adicionar um comentário opcional para fornecer contexto adicional.

Como editor, você pode visualizar comentários e respostas sinalizadas na interface do Genie. O comportamento do seu Agente Génio não muda apenas com base no feedback dos utilizadores. Você deve usar o feedback para identificar oportunidades de melhoria ou responder diretamente às perguntas dos usuários. O Databricks recomenda incentivar os utilizadores a fornecer feedback sobre o agente utilizando este mecanismo.

Os utilizadores empresariais podem ver atualizações das perguntas que marcaram para revisão na sua página Monitor. Os utilizadores com, pelo menos, a permissão «PODE GERIR» no Genie Agent podem rever a interação específica, comentar o pedido e confirmar ou corrigir a resposta. Eles podem acessar comentários e revisar solicitações na página de monitoramento. Em seguida, podes usar esse feedback para ajustar as respostas e fazer iterações no teu agente. Veja Monitorizar o agente.

Outras ações de resposta

Para respostas que incluem SQL gerado, opções adicionais permitem que você interaja com os dados retornados.

  • Copiar CSV: Os utilizadores do agente podem descarregar até aproximadamente 1GB de dados de resultados como CSV. O tamanho final do download do arquivo pode ser um pouco maior ou menor que 1GB, pois o limite de 1GB é aplicado a uma etapa anterior ao download do arquivo final. Para baixar resultados, clique no ícone de download na resposta.

  • Mostrar código: Clique em Mostrar código para visualizar a consulta gerada. Isso pode ser útil para solucionar problemas de respostas não confiáveis. Consulte Editar e salvar consultas.

  • O ícone do menu Kebab: Aceda às seguintes ações:

    • Copiar CSV: copie o CSV da resposta para a área de transferência.
    • Adicionar como instrução: Para interações que possam ser úteis para ensinar o Genie a responder a perguntas semelhantes, clique em Adicionar como instrução. Isso abre a interface do usuário para salvar consultas SQL de exemplo, preenchidas com a pergunta e SQL geradas. Você pode deixar o exemplo como escrito ou editar e salvar para fazer alterações. Consulte Adicionar exemplos de consultas e funções SQL.
    • Adicionar como referência: Adicione a pergunta como uma pergunta de referência. Consulte Benchmarks.
    • Atualizar dados: atualize os dados executando a consulta gerada anteriormente.
    • Regenere a resposta: envie a pergunta novamente e peça ao Genie que regenere a resposta.

Editar e salvar consultas

As consultas SQL do Genie podem ser revisadas quanto à precisão e editadas conforme necessário. Os autores do Genie Agent normalmente conhecem o domínio e os dados que lhes permitem reconhecer quando o Genie está a gerar uma resposta incorreta. Muitas vezes, os erros podem ser corrigidos com uma pequena quantidade de ajuste manual para a consulta SQL gerada. Clique em Mostrar código gerado para inspecionar a consulta e exibir o SQL gerado para qualquer resposta.

Podes editar a instrução SQL gerada para corrigir se tiveres privilégios CAN EDIT ou superiores no Agente Genie. Depois de fazer as correções, execute a consulta. Então, você pode salvá-lo como uma instrução para ensinar Genie como responder no futuro. Para salvar a consulta editada, clique em Adicionar como instrução.

Depure respostas com Genie Code

Quando o Genie der uma resposta incorreta, use o Código Genie para diagnosticar o problema e melhorar o contexto do agente:

  1. Abra o Genie Code a partir da resposta.
  2. Descreve o problema e o comportamento que queres.
  3. Revê as mudanças de contexto que o Código Genie propõe e aceita as que queres manter.

Sugestão

Diz ao Genie Code para fazer isto por ti:

The Genie Agent is using calendar quarters instead of our fiscal calendar. Update its context to use our fiscal quarters: Q1 is February through April, Q2 is May through July, Q3 is August through October, and Q4 is November through January.

Também podes usar o Código Genie para guardar contexto semântico de uma conversa. Depois de os utilizadores introduzirem novos termos ou corrigirem o comportamento do Génio, peça ao Código do Génio para captar o que aprendeu. Revê cada sugestão e aceita o contexto que queres acrescentar ao agente.

Monitorize o agente

Um Agente Genie pode ser visto como uma ferramenta de colaboração a longo prazo entre equipas de dados e utilizadores de negócio. Ele acumula conhecimento ao longo do tempo, em vez de servir como uma implantação única. À medida que os utilizadores fazem novas perguntas, pode refinar o agente para melhorar a cobertura e a precisão.

Utilize a aba Monitor para rever perguntas e respostas individuais, ver o feedback dos utilizadores e identificar respostas sinalizadas para revisão.

O separador Monitor mostra uma lista de perguntas e respostas com filtros de tempo, classificação, utilizador e estado.

O separador do monitor mostra todas as perguntas e respostas feitas no agente. Você pode filtrar perguntas por tempo, classificação, usuário ou status. Ao monitorizar o agente, os utilizadores com permissões CAN MANAGE podem compreender proativamente as questões levantadas pelos utilizadores empresariais e como o Agente Genie respondeu.

Identificar as perguntas com que o Génio tem dificuldades pode ajudá-lo a atualizar o Agente Génio com instruções específicas para melhorar as suas respostas. Clique em uma pergunta para abrir o texto da pergunta e da resposta e visualizar o tópico de bate-papo completo.

Use a secção de resumo semanal do separador Monitor para rever o volume semanal de mensagens, utilizadores ativos e feedback positivo/negativo. Para identificar as principais tendências de utilização e problemas comuns, clique em Analisar o Uso do Espaço. Isto inicia o Genie Code, que analisa as mensagens, o feedback e os problemas dos utilizadores dos últimos sete dias e apresenta um relatório sobre tópicos comuns, problemas recorrentes e sugestões para melhorar o contexto. As respostas incluem citações com hiperligações para as conversas relevantes do seu agente. Clique numa citação para abrir a conversa diretamente no tópico Código Genie.

A secção de resumo semanal do separador de Monitorização mostra mensagens semanais, utilizadores e feedback.

Revisão da qualidade das conversas

O Genie Chat Sharing permite aos gestores de agentes rever todas as conversas que os utilizadores empresariais têm com um Agente Genie. Quando uma conversa é definida como Revisável pelos gestores de agentes, os utilizadores com a permissão PODE GERENCIAR podem abrir a conversa a partir do separador de monitorização para rever toda a troca. Isto permite-lhe avaliar a qualidade da resposta do Genie, responder ao feedback dos utilizadores e identificar áreas onde instruções adicionais ou exemplos de consultas poderiam melhorar a precisão. Para conversas definidas como Privadas, os gestores de agentes podem ver os prompts dos utilizadores no separador de monitorização, mas não conseguem ver a conversa completa ou os resultados. Para mais informações, consulte Partilhar uma conversa.

Note

As conversas criadas antes da funcionalidade de partilha de conversas estar ativada mantêm-se Privadas. Conversas criadas depois de ter sido ativado passam por defeito a ser Revisável pelos gestores de agentes.

Apagar uma conversa

Os utilizadores com a permissão "pode gerir" num agente Genie podem eliminar permanentemente qualquer conversa do agente a partir da página de monitorização. Isto remove a conversa e as suas mensagens para todos os utilizadores.

  1. Abra o Genie Agent e clique no separador Monitor.
  2. Clica numa conversa para abrir a gaveta.
  3. Clica em Apagar conversa.
  4. No diálogo de confirmação, clique em Eliminar para eliminar permanentemente a conversa, ou Cancelar para fechar o diálogo sem apagar.

Benchmarks

Os benchmarks permitem que você crie um conjunto de perguntas de teste que você pode executar para avaliar a precisão geral da resposta do Genie. Um conjunto bem desenhado de benchmarks que cobrem as perguntas mais frequentes dos utilizadores ajuda a avaliar a precisão do seu Agente Genie à medida que o vai refinando. Cada Agente Génio pode conter até 500 perguntas de referência.

As perguntas de avaliação funcionam como novas conversas. Eles não transmitem o mesmo contexto que uma conversa organizada do Genie. Cada pergunta é processada como uma nova consulta, usando as instruções definidas no agente, incluindo quaisquer exemplos de SQL e funções SQL fornecidas.

As perguntas de benchmark suportam dois modos:

  • Modo chat: O modo padrão. O Genie avalia a precisão comparando os seus resultados gerados por SQL com uma resposta SQL fornecida.
  • Modo Agente: Executa perguntas de benchmark usando o mesmo raciocínio em vários passos do modo Agente do Genie. Um juiz de LLM avalia as respostas. Pode fornecer uma nota de avaliação opcional para orientar a avaliação.

Seleciona o modo quando executa benchmarks, não quando adiciona uma pergunta. Utilize o alternador de modo no canto superior direito do separador Benchmarks para escolher o modo Chat ou Agente para uma execução. O modo selecionado aplica-se a todas as perguntas dessa sequência.

Exemplos de benchmarks com precisão reportada em nove perguntas.

Adicionar perguntas de referência

As perguntas de referência devem refletir diferentes maneiras de formular as perguntas comuns que seus usuários fazem. Você pode usá-los para verificar a resposta do Genie a variações no fraseado das perguntas ou diferentes formatos de perguntas.

Ao criar uma pergunta de referência, você pode, opcionalmente, incluir uma consulta SQL cujo conjunto de resultados é a resposta correta. Durante as execuções de benchmark, a precisão é avaliada comparando o conjunto de resultados da sua consulta SQL com o gerado pelo Genie. Você também pode usar as funções SQL do Unity Catalog como respostas padrão de referência para benchmarks.

Para adicionar uma pergunta de referência:

  1. Na parte superior do Genie Agent, clique em Benchmarks.

  2. Clique em Adicionar benchmark.

  3. No campo Pergunta, insira uma pergunta de referência para testar.

  4. (Opcional) Forneça uma consulta SQL que responda à pergunta. Pode escrever a sua própria consulta escrevendo na caixa de respostas SQL , incluindo as funções SQL do Unity Catalog. Como alternativa, clique em Gerar SQL para que o Genie escreva a consulta SQL para você. Use uma instrução SQL que responda com precisão à pergunta inserida.

    Note

    Este passo é recomendado para execuções em modo Chat. Somente as perguntas que incluem este exemplo de instrução SQL podem ser avaliadas automaticamente quanto à precisão. Quaisquer perguntas que não incluam uma Resposta SQL requerem revisão manual para serem pontuadas. Se você usar o botão Gerar SQL , revise a instrução para ter certeza de que ela está respondendo com precisão à pergunta.

  5. (Opcional) No campo da nota de avaliação , introduza orientações sobre a resposta correta ou o conteúdo esperado. Durante as execuções do modo Agente, o Génio passa a nota de avaliação ao juiz do LLM. A nota pode referenciar o conteúdo esperado em relatórios de texto que o modo Agente gera.

  6. (Opcional) Clique Executar para executar a consulta e visualizar os resultados.

  7. Quando terminar de editar, clique em Adicionar benchmark.

  8. Para atualizar uma pergunta depois de salvar, clique no ícone Editar para abrir a caixa de diálogo Atualizar pergunta.

Use critérios de referência para testar perguntas alternativas

Ao avaliar a precisão do seu Agente Génio, é importante estruturar os testes para refletir cenários realistas. Os usuários podem fazer a mesma pergunta de maneiras diferentes. O Databricks recomenda adicionar vários sintagmas da mesma pergunta e usar o mesmo exemplo SQL em seus testes de benchmark para avaliar totalmente a precisão. A maioria dos Agentes Génio deve incluir entre duas a quatro formulações da mesma pergunta.

Realizar perguntas de benchmark

Utilizadores com pelo menos permissões PODEM EDITAR num Agente Genie podem executar uma avaliação de benchmark a qualquer momento. Você pode executar todas as perguntas de referência ou selecionar um subconjunto de perguntas para testar.

Para cada pergunta, o Genie interpreta a entrada, gera SQL e retorna resultados. O SQL gerado e os resultados são então comparados com a Resposta SQL definida na pergunta de benchmark.

Para executar todas as perguntas de referência:

  1. Na parte superior do Genie Agent, clique em Benchmarks.
  2. Clique em Executar benchmarks para iniciar a execução do teste.

Para executar um subconjunto de perguntas de referência:

  1. Na parte superior do Genie Agent, clique em Benchmarks.
  2. Marque as caixas de seleção ao lado das perguntas que deseja testar.
  3. Clique em Executar seleção para iniciar execução do teste nas perguntas selecionadas.

Você também pode selecionar um subconjunto de perguntas de um resultado de benchmark anterior e executar novamente essas perguntas específicas para testar melhorias.

Os benchmarks continuam a ser executados quando você navega para fora da página. Você pode verificar os resultados na guia Avaliação quando a execução estiver concluída.

Depois de uma execução terminar, pode usar o Genie Code para rever os resultados ao longo de toda a execução e sugerir melhorias de contexto. Consulte Analisar uma execução de benchmark com o Genie Code.

Classificações do modo chat

Os seguintes critérios determinam como o Genie avalia as respostas do modo Chat:

Condição Rating
O Genie gera SQL que corresponde exatamente à resposta SQL fornecida Boa
O Genie gera um conjunto de resultados que corresponde exatamente ao conjunto de resultados produzido pela Resposta SQL Boa
O Genie gera um conjunto de resultados com os mesmos dados da Resposta SQL , mas classificados de forma diferente Boa
O Genie gera um conjunto de resultados com valores numéricos que arredondam para os mesmos 4 dígitos significativos da Resposta SQL Boa
O Genie gera SQL que produz um conjunto de resultados vazio ou retorna um erro Ruim
O Genie gera um conjunto de resultados que inclui colunas extras em comparação com o conjunto de resultados produzido pela Resposta SQL Ruim
O Genie gera um resultado de célula única que é diferente do resultado de célula única produzido pela Resposta SQL Ruim

Note

O modo Chat compara até 5.000 linhas de cada conjunto de resultados. Quando um conjunto de resultados ultrapassa 5.000 linhas e a ordem das linhas difere entre os resultados gerados pelo Genie e a resposta SQL, esta truncamento pode fazer com que um conjunto de resultados correspondente seja classificado como Mau. Para evitar isto, escreva consultas SQL Answer que retornem menos de 5.000 linhas, ou adicione uma ORDER BY cláusula tanto à resposta SQL como à saída esperada do Genie para que a ordem das linhas se mantenha consistente.

Quando um resultado é classificado como Mau, a explicação identifica o tipo de desajuste.

Revisão manual necessária: as respostas são marcadas com esse rótulo quando o Genie não pode avaliar a correção ou quando os resultados da consulta gerados pelo Genie não contêm uma correspondência exata com os resultados da resposta SQL fornecida. Todas as perguntas de referência que não incluam uma Resposta SQL devem ser revisadas manualmente.

Classificações do modo agente

Um juiz de LLM avalia respostas em modo agente em vez de usar comparações SQL. Se forneceu uma nota de avaliação, o juiz do LLM usa-a como orientação ao avaliar a resposta, incluindo qualquer conteúdo esperado no relatório de texto que o modo Agente gere. O juiz classifica as respostas que satisfazem os critérios da nota de avaliação como Boas.

Aceda a avaliações de benchmark

Pode aceder a todas as suas avaliações de benchmark para acompanhar a precisão do seu Agente Genie ao longo do tempo. Quando abre a página Benchmarks de um agente, é apresentada no separador Avaliações uma lista cronológica das execuções de avaliação. Se não forem encontradas execuções de avaliação, consulte Adicionar perguntas de benchmark ou Executar perguntas de benchmark.

Tela de avaliações conforme descrito no texto a seguir.

A guia Avaliações mostra uma visão geral das avaliações e do seu desempenho, conforme reportado nas seguintes categorias:

Nome da avaliação: carimbo de data/hora que indica quando ocorreu uma sessão de avaliação. Clique no carimbo de data/hora para ver os detalhes dessa avaliação. Status de execução: Indica se a avaliação foi concluída, pausada ou malsucedida. Se uma execução de avaliação incluir perguntas de referência que não tenham respostas SQL predefinidas, ela será marcada para revisão nesta coluna. Precisão: Uma avaliação numérica da precisão em todas as perguntas de referência. Para processos de avaliação que exigem revisão manual, a medição da precisão aparece somente depois que as perguntas foram revisadas. Criado por: Indica o nome do usuário que executou a avaliação.

Rever avaliações individuais

Pode rever avaliações individuais para obter uma visão detalhada de cada resposta. Você pode editar a avaliação para qualquer pergunta e atualizar todos os itens que precisam de revisão manual.

Para rever avaliações individuais:

  1. Na parte superior do Genie Agent, clique em Benchmark.

  2. Clique na data/hora de qualquer avaliação na coluna Nome da avaliação para abrir uma exibição detalhada da execução do teste.

    Uma tela que mostra os resultados de uma única execução de avaliação. Todas as perguntas estão listadas à esquerda. Se aplicável, as perguntas individuais são mostradas à direita com a saída do modelo e a saída da verdade básica.

  3. Use a lista de perguntas no lado esquerdo da tela para ver uma visão detalhada de cada pergunta.

  4. Analise e compare a resposta de saída do Modelo com a resposta de verdade fundamental.

    Para resultados classificados como incorretos, aparece uma explicação descrevendo por que o resultado foi classificado como Ruim. Isso ajuda você a entender as diferenças específicas entre a saída gerada e a verdade de base esperada.

    Note

    Os resultados destas respostas aparecem nos detalhes da avaliação durante uma semana. Após uma semana, os resultados já não são visíveis. A instrução SQL gerada e a instrução SQL de exemplo permanecem.

  5. Clique em Atualizar verdade de base para salvar a resposta como o novo Ground truth para esta pergunta. Isso é útil se nenhuma verdade fundamentada existir, ou se a resposta for melhor ou mais precisa do que a declaração de verdade básica existente.

  6. Clique no Ícone Editar rótulo para editar a avaliação.

    Marque cada resultado como Bom ou Ruim para obter uma pontuação precisa para esta avaliação.

Analise um benchmark executado com o Genie Code

Após a conclusão de uma execução de benchmark, use o Código Genie para rever os resultados ao longo de toda a execução em vez de inspecionar cada pergunta isoladamente. Lança o Genie Code na avaliação e pede que analise a execução. O Código Genie revê os resultados esperados, o que o seu agente gerou e o contexto atual do agente para encontrar lacunas, depois sugere instruções e melhorias de contexto para rever e guardar.