Bästa metoder för att förbättra prestandan för konversationsagenter

Undvik prestandaproblem hos konversationsagenter genom att förstå vanliga felkällor och följa bästa praxis.

Kvoter och begränsningar

Förstå kvoter och gränser, såsom RPM (förfrågningar per minut, där en förfrågan är ett meddelande skickat till en agent) och antalet Power Platform-förfrågningar som är tillåtna inom en 24-timmarsperiod.

Kvoter gäller för dina agenter tillsammans med de kapacitetsbegränsningar som följer med en Microsoft Copilot Studio-plan.

Optimera din agent för prestanda

För att optimera din agent för prestanda, överväg följande bästa praxis:

  • Placera API-anrop och anslutningsprogramanrop strategiskt i dina konversationsflöden för att undvika att användarna måste vänta på flera slutförande.
  • Där det är tillämpligt, lagra hämtad information i variabler istället för att göra flera API-anrop eller flödesanrop.
  • Molnflöden som anropas från Copilot Studio-agenter kan introducera latens. Överväg att använda direkta anslutningsprogramsanrop eller HTTP-förfrågan-noden istället.
  • Förstå prestanda- och komplexitetskompromissen mellan klassisk NLU och generativ orkestrering i Copilot Studio. Modeller för förståelse av naturligt språk fungerar bra för specifika avsikter men har svårt med komplexa frågor. Modeller för generativ AI hanterar ett bredare spektrum av indata men kan medföra latens.
  • Aktivera expressläge.

Optimera ditt molnflöde för prestanda

Om din agent anropar ett Power Automate-flöde, se till att molnflöden är optimerade.

Kommentar

Power Automate-flöden och agentflöden stödjer IVR-integrationer men rekommenderas inte som den primära integrationsmekanismen för latenskänsliga, högsamtidiga samtalsflöden. Deras synkrona exekveringsmodell och begränsningar för tjänstbegränsningar kan införa extra latens som blir mer uttalad ju mer samtalsvolymen ökar. Utvärdera alternativa integrationsmönster när förutsägbar prestanda med låg latens är ett krav.