Práticas recomendadas para otimizar o desempenho do agente de conversa

Evite problemas de desempenho em agentes de conversa compreendendo os pontos comuns de falha e seguindo as melhores práticas.

Cotas e limites

Entenda cotas e limites, como RPM (solicitações por minuto, onde uma solicitação é uma mensagem enviada a um agente) e o número de solicitações do Power Platform permitidas em um intervalo de 24 horas.

As cotas se aplicam aos seus agentes, junto com as limitações de capacidade que acompanham um plano do Microsoft Copilot Studio.

Otimize o desempenho do agente

Para otimizar o desempenho do seu agente, considere as seguintes melhores práticas:

  • Realize chamadas de API e invocações de conectores de forma estratégica nos fluxos de conversa para evitar que os usuários tenham que esperar por múltiplas conclusões.
  • Quando aplicável, armazene em cache as informações usando variáveis, em vez de fazer múltiplas chamadas de API ou invocações de fluxo.
  • Fluxos da nuvem acionados por agentes do Copilot Studio podem causar latência. Considere o uso de chamadas de conector diretas ou o nó Solicitar solicitação HTTP em vez disso.
  • Entenda a compensação entre desempenho e complexidade do NLU Clássico e orquestração generativa no Copilot Studio. Modelos de Reconhecimento de Linguagem Natural (NLU) funcionam bem para intenções específicas, mas têm dificuldade com consultas complexas. Modelos de IA generativa processam uma faixa maior de entradas, mas podem causar latência.
  • Ative o modo expresso.

Otimize seu fluxo da nuvem para desempenho

Se o agente chamar um fluxo do Power Automate, verifique se os fluxos da nuvem estão otimizados.

Observação

Os fluxos do Power Automate e os fluxos de agente dão suporte a integrações de IVR, mas não são recomendados como o mecanismo de integração principal para fluxos de chamadas sensíveis à latência e alta simultaneidade. O modelo de execução síncrona e os limites de limitação de serviço podem introduzir latência extra que fica mais evidenciada à medida que o volume de chamadas aumenta. Avalie padrões de integração alternativos quando o desempenho de baixa latência previsível é um requisito.