Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Undvik prestandaproblem hos konversationsagenter genom att förstå vanliga felkällor och följa bästa praxis.
Kvoter och begränsningar
Förstå kvoter och gränser, såsom RPM (förfrågningar per minut, där en förfrågan är ett meddelande skickat till en agent) och antalet Power Platform-förfrågningar som är tillåtna inom en 24-timmarsperiod.
Kvoter gäller för dina agenter tillsammans med de kapacitetsbegränsningar som följer med en Microsoft Copilot Studio-plan.
Optimera din agent för prestanda
För att optimera din agent för prestanda, överväg följande bästa praxis:
- Placera API-anrop och anslutningsprogramanrop strategiskt i dina konversationsflöden för att undvika att användarna måste vänta på flera slutförande.
- Där det är tillämpligt, lagra hämtad information i variabler istället för att göra flera API-anrop eller flödesanrop.
- Molnflöden som anropas från Copilot Studio-agenter kan introducera latens. Överväg att använda direkta anslutningsprogramsanrop eller HTTP-förfrågan-noden istället.
- Förstå prestanda- och komplexitetskompromissen mellan klassisk NLU och generativ orkestrering i Copilot Studio. Modeller för förståelse av naturligt språk fungerar bra för specifika avsikter men har svårt med komplexa frågor. Modeller för generativ AI hanterar ett bredare spektrum av indata men kan medföra latens.
- Aktivera expressläge.
Optimera ditt molnflöde för prestanda
Om din agent anropar ett Power Automate-flöde, se till att molnflöden är optimerade.
Säkerställ att du förstår begränsning och kapacitetsbegränsningar inom Power Automate och Power Platform. Att följa dessa begränsningar förbättrar skalbarheten för flöden och prestandan.
Läs mer om felsökning av långsamma flöden.
Kommentar
Power Automate-flöden och agentflöden stödjer IVR-integrationer men rekommenderas inte som den primära integrationsmekanismen för latenskänsliga, högsamtidiga samtalsflöden. Deras synkrona exekveringsmodell och begränsningar för tjänstbegränsningar kan införa extra latens som blir mer uttalad ju mer samtalsvolymen ökar. Utvärdera alternativa integrationsmönster när förutsägbar prestanda med låg latens är ett krav.