Beste praktijken om de prestaties van gespreksagenten te verbeteren

Voorkom prestatieproblemen bij gespreksagenten door de probleemgebieden te begrijpen en best practices te volgen.

Targets en limieten

Begrijp quota en limieten, zoals RPM (requests per minute, waarbij een verzoek een bericht is dat aan een agent wordt gestuurd) en het aantal Power Platform-verzoeken dat binnen 24 uur is toegestaan.

Quota zijn van toepassing op uw agenten, samen met de capaciteitsbeperkingen die gepaard gaan met een Microsoft Copilot Studio-abonnement.

Optimaliseer uw agent voor prestaties

Om uw agent te optimaliseren voor prestaties, overweegt u de volgende best practices:

  • Plaats API-aanroepen en connector-aanroepen strategisch in uw gespreksstromen zodat gebruikers niet hoeven te wachten op meerdere afrondingen.
  • Cache waar van toepassing opgehaalde informatie op via variabelen, in plaats van meerdere API's of stromen aan te roepen.
  • Cloudstromen die worden aangeroepen door Copilot Studio-agenten kunnen latentie veroorzaken. Overweeg om directe connector-aanroepen of het knooppunt HTTP-aanvraag te gebruiken.
  • Begrijp de afweging van prestaties en complexiteit tussen Classic NLU en generatieve indeling in Copilot Studio. Modellen met begrip van natuurlijke taal (NLU) werken goed voor specifieke intenties, maar hebben moeite met complexe zoekopdrachten. Generatieve AI-modellen verwerken een breder scala aan invoer, maar kunnen latentie veroorzaken.
  • Zet de expressmodus aan.

Optimaliseer uw cloudstroom voor prestaties

Als uw agent een Power Automate-stroom oproept, zorg er dan voor dat cloudstromen geoptimaliseerd zijn.

Notitie

Power Automate-stromen en agentstromen ondersteunen IVR-integraties, maar worden niet aanbevolen als het primaire integratiemechanisme voor latentiegevoelige, hoog-gelijktijdige oproepstromen. Hun synchrone uitvoeringsmodel en servicebeperkingen kunnen extra latentie veroorzaken die sterker wordt naarmate het aantal oproepen toeneemt. Evalueer alternatieve integratiepatronen wanneer voorspelbare prestaties met lage latentie vereist zijn.