Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Testning är avgörande för att säkerställa att dina anpassade agenter i Copilot-agentpaket svarar och beter sig som förväntat. Den här artikeln förklarar hur man skapar, hanterar och validerar olika typer av tester, inklusive scenarier med flera omgångar. Du kan också utföra bulkoperationer med Excel och dubbletter av testuppsättningar.
Testtyper
Skapa flera typer av tester för att validera dina agenter.
| Testtyp | beskrivning |
|---|---|
| Svarsmatchning | Detta test är den enklaste testtypen. Den jämför agentens svar med det förväntade svaret med hjälp av den valda jämförelseoperatorn. Den exakta matchningen (lika med) används som standard. Andra tillgängliga jämförelseoperatorer är "Inte lika med", "Innehåller", "Innehåller inte", "Börjar med", "Börjar inte med", "Slutar med" och "Slutar inte med". |
| Bilagor (till exempel Adaptiva kort) | Jämför agentens JSON-svar för bilagor med det förväntade JSON-svaret för hela arrayen av bilagor. Exakt matchning (lika med) används som standard. Andra tillgängliga jämförelseoperatorer är ”Inte lika med”, ”Innehåller”, ”Innehåller inte”. En särskild jämförelseoperator, ”AI-validering”, använder språkmodeller för att validera bilagan utifrån valideringsinstruktioner från utvecklaren, liknande generativa svar. |
| Ämnesmatchning |
Endast tillgängligt när Dataverse-berikning (Enrich with Conversation Transcripts) är konfigurerad. När Dataverse-berikningssteget är klart jämför detta test det förväntade ämnesnamnet med det utlösta ämnesnamnet. Testning av Topic Match stöder även multi-ämnesmatchning med anpassade agenter som har generativ orkestrering aktiverad. Vid multi-topic-matchning är ämnena komma-separerade; till exempel: "Topic1,Topic2". |
| Generativa svar |
Endast tillgängligt om AI Builder-berikning (Analyze Generated Answers) är konfigurerat. Använder en stor språkmodell för att bedöma om det AI-genererade svaret överensstämmer med ett exempelsvar eller uppfyller valideringsinstruktionerna. När Berika med Azure Application Insights är konfigurerad, kan negativa tester, såsom moderering eller inga sökresultat, också testas. Läs mer i Använd bedömningsmatriser i tester. |
| Flera omgångar | Består av ett eller flera testfall av andra typer, såsom svarsmatchning, bilagor, ämnesmatchning och generativa svar. Alla underordnade tester i en testkörning i flera omgångar inom samma konversationskontext körs i den specificerade ordningen. Använd multi-turn-tester för att testa ett scenario från början till slut och för att testa egna agenter med generativ orkestrering. Läs mer i Multi-Turn testing. |
| Valideringsplan | Tillåter utvecklaren att validera att den dynamiska planen för den anpassade agenten inkluderar de förväntade verktygen. Denna testtyp är avsedd för anpassade agenter i Copilot Studio som har generativ orkestrering aktiverad. Läs mer i Planvalideringstestning. |
Skapa en ny testuppsättning
Använd testuppsättningar för att gruppera flera tester tillsammans. När du kör tester, välj en testuppsättning för att köra alla tester i den uppsättningen.
- Öppna Copilot-agentpaketprogrammet.
- Gå till Testuppsättningar.
- Skapa en ny post för testuppsättning för agent.
- Ange ett Namn.
- Välj Spara.
Skapa ett nytt test
När du har skapat en testuppsättning kan du lägga till test till den. Från test-rutnät, välj + Nytt Agenttest.
I följande tabell beskrivs fälten.
| Kolumnnamn | Obligatoriskt | beskrivning |
|---|---|---|
| Namn | Ja | Namnet på testet. Detta namn kan vara ett internt referens-ID, såsom TST-001. |
| Testuppsättning för agent | Ja | Överordnad testuppsättning för testet. |
| Testtyp | Ja | En av de tillgängliga testtyperna. |
| Skicka startConversation-händelse | Nej | Om den är aktiverad tar agenten emot startConversation-händelsen så den startar proaktivt konversationen, och testuttalet skickas efteråt. Denna inställning krävs vanligtvis när ämnet Samtalsstart innehåller logik som måste köras innan agenten svarar användaren eller testyttrandet. |
| Förväntad position för svarsmeddelandet | Nej | Sätt inget värde om du är osäker. Detta alternativ låter dig fånga ett specifikt agentsvar när den skickar flera meddelanden. Till exempel, om agenten först säger "Hej" och sedan "Hur kan jag hjälpa dig?", och du vill testa det andra svaret, ange värdet till 1. Ordningen är 0-baserad, så det första meddelandet indexeras som 0, det andra svaret som 1, och så vidare. |
| Provyttrande | Ja | Meddelandet som du vill skicka till agenten som en del av testet. |
| Förväntat svar | Beror på | Obligatoriskt för Svar Match-testtypen. Förväntat svar från agenten. För ett test av generativa svar, ange ett exempelsvar eller dina egna valideringsinstruktioner för stor språkmodell. |
| Externa variabler JSON | Nej | JSON-post för alla externa eller kontextuella värden som du vill skicka till agenten som en del av testet. Till exempel: { "Language": "fr" } |
| Sekunder innan svar erhålls | Nej | Antal sekunder att vänta innan svaret från roboten utvärderas. I de flesta fall kan du lämna detta värde tomt, men det är användbart i situationer där agenten anropar ett API och svaret kan ta längre tid än vanligt. |
| Förväntat resultat för Generativt svar | Beror på | Obligatoriskt för testtypen för generativa svar. Ska vara antingen Besvarad eller Ej besvarad. När Azure Application Insights-berikning är aktiverad kan du välja Modererad eller Inga sökresultat. |
| Förväntat ämnesnamn | Beror på | Obligatoriskt för testtypen ämnesmatchning. Namnet på ämnet som du förväntar dig ska triggas. Multi-topic match stöds för anpassade agenter som har generativ orkestrering aktiverad. För matchning med flera ämnen, använd en komma-separerad lista; till exempel: "Topic1,Topic2". Lägg inte till extra blanksteg. Matchning med flera ämnen säkerställer att de förväntade ämnena finns bland ämnena i planen. |
| Förväntad bilagor-JSON | Beror på | Obligatoriskt för testtypen Bifogade filer (Adaptiva kort osv.). Den kompletta JSON-arrayen för bilagor som du förväntar dig från agentens svar. |
| Förväntade verktyg | Beror på | Obligatoriskt för testtypen Planvalidering. Komma-separerad lista över förväntade verktyg (verktyg, åtgärder och anslutna agenter). Lägg inte till extra blanksteg. Ordningen är inte relevant. Exempel: "Väder, klimatförändringar" |
| Godkännande tröskel % | Beror på | Obligatoriskt för testtypen Planvalidering. Procentandelen av förväntade verktyg som måste finnas i den dynamiska planen för att testet ska godkännas. Om procentandelen är 100 måste alla förväntade verktyg finnas i den dynamiska planen för att testet ska godkännas. Extra verktyg i den dynamiska planen påverkar inte testresultatet. |
Flervarvstestning
För testtypen Flera omgångar kan du ange ett eller flera deltester av typen standard. Varje underordnat test har en ordning och allvarlighetsgrad. Ordern definierar körningsordningen i samma konversationskontext (i testkörning med flera omgångar). Allvarlighetsgraden definierar om den underordnade testkörningen måste godkännas för att testkörningen med flera omgångar ska fortsätta.
Om ett underordnat test kräver utvärdering efter testning, till exempel Ämnesmatchning eller Generativa svar, förblir testet i pågående tillstånd och testkörningen fortsätter utan hänsyn till allvarlighetsgraden. Om något av de kritiska testerna misslyckas avbryts körningen av testet med flera omgångar och resultatet markeras som misslyckat. Om alla viktiga underordnade testkörningar godkänns är resultatet av testet i flera omgångar också godkänt.
Använd icke-kritiska underordnade testkörningar för att ”mata” information till anpassade agenter med generativ orkestrering. Du kan också använda dessa testfall när svaret är oväsentligt och du vill förbereda för kritiska tester.
Planvalideringstestning
Planvalidering fokuserar på verktygets korrekthet. Istället för att utvärdera vad agenten säger, kontrollerar denna testtyp om de förväntade verktygen användes i planen.
När du definierar ett planvalideringstest anger du:
- Ett testuttryck
- En komma-separerad lista över förväntade verktyg att inkludera i den dynamiska planen
- En godkänd tröskel, som anger hur mycket avvikelse som ska tolereras från listan
Detta test använder konversationstranskriptioner och utvärderas efter själva testkörningen som en berikningsaktivitet.
Tänk på följande:
Förväntade verktyg: Inkludera verktyg, åtgärder och anslutna agenter i en kommaseparerad lista. Lägg inte till extra blanksteg. Ordning spelar ingen roll.
Tröskelvärde för godkännande %: Tröskelvärdet för godkännande specificerar den andel av förväntade verktyg som måste finnas i den dynamiska planen för att testet ska godkännas.
Planvalidering är ett deterministiskt test: det beräknar avvikelsen mellan de faktiska verktygen och de förväntade verktygen och jämför denna med tröskelvärdet. Om avvikelsen ligger inom tröskelvärdet godkänns testet; annars underkänns det.
Läs mer i Orkestrera agentbeteende med generativ AI.
Testagenter som kräver kopplingsauktorisation
När en agent använder en extern datakälla som SharePoint eller Dataverse visar den första konversationen vanligtvis ett ”Koppla till fortsättning”-auktoriseringskort. Användaren måste välja Tillåt innan agenten kan kalla på kontakten. För att öva detta flöde i ett automatiserat test, modellera prompten och användarens svar som två underordnade testet i ett test med flera omgångar.
Kommentar
Detta är en engångsuppställning per testuppsättning. Efter att anslutningen är auktoriserad för testanvändaren behöver du inte upprepa auktorisationsstegen i senare tester.
Flerturstestet innehåller två ordnade underordnade test:
| Order | Testtyp | Åtgärdstyp | Syfte |
|---|---|---|---|
| 1 | Bilagor (till exempel Adaptiva kort) | Jämförelseoperatorer | Skickar yttrandet som triggar kontakten och aktiverar på auktorisationskortets JSON. |
| 2 | Bilagor (till exempel Adaptiva kort) | Anropa åtgärder | Skickar Tillåt på auktorisationskortet så att agenten kan slutföra samtalet. |
För att skapa ett test:
I din testuppsättning, välj + Nytt agenttest, ange ett namn, ställ Testtyp till Flera omgångar och välj Spara.
I det underordnade rutnät för testet med flera omgångar, välj + Nytt agenttest och konfigurera det första underordnade testet:
Fält Värde Testtyp Bilagor (till exempel Adaptiva kort) Order 1 Provyttrande Yttrandet som utlöser kontakten, till exempel List Fourth Coffee Brands.Åtgärdstyp Jämförelseoperatorer Jämförelseoperatorer Lika med Förväntad bilagor-JSON [](platshållare — du byter ut detta efter första körningen)Välj Spara test.
Spara testuppsättningen och kör den. Det första underordnade testet misslyckas som förväntat, eftersom platshållar-JSON inte matchar auktorisationskortet.
Öppna testresultaten, välj det underordnade testet mer flera omgångar, hitta avsnittet Bilagor och kopiera Den faktiska JSON-bilagan till urklippet.
Redigera det första underordnade testet, klistra in den kopierade JSON:en i Förväntade JSON-bilagor och välj Spara test.
I det underordnade rutnätet för testet med flera omgångar, välj + Nytt agenttest en gång till och konfigurera det andra underordnade testet:
Fält Värde Testtyp Bilagor (till exempel Adaptiva kort) Order 2 Åtgärdstyp Anropa åtgärder Nyttolast för adaptivt kort {"action": "Allow", "id": "submit", "shouldAwaitUserInput": true}Jämförelseoperatorer Innehåller data (eller Lika med, beroende på vilket svar du vill kontrollera) Förväntat svar Lämna det tomt, eller ställ in baserat på de data du förväntar dig efter att anslutningen är tillåten. Nyttolastvärdena kommer från JSON för det adaptiva kortet som du samlade in i steg 4. Justera
action- ochid-fälten om ditt anslutningskort använder olika identifierare.Välj Spara test.
Spara testuppsättningen och kör den igen. Båda de underordnade testerna borde nu bli godkända.
Efter att detta test med flera omgångar körts framgångsrikt en gång, godkänns anslutningen för testanvändaren och efterföljande tester mot samma anslutningsprogram kan göras som vanliga tester med en omgång.
Använd Excel för att skapa eller uppdatera tester i bulk
Efter att ha skapat en testuppsättning kan du använda Excel för att skapa eller uppdatera tester i stor skala.
- Från testuppsättningsposten växlar du den underordnade vyn från Tester till Export-/importvyn.
- Välj Export Agent Tests i Excel Online.
- Lägg till och modifiera tester vid behov.
- Välj Spara.
Om du importerar deltester med flera omgångar måste du först skapa eller importera det faktiska överordnade testet med flera omgångar. Importera sedan underordnade testfallen.
Läs mer i Import och export med Excel i Power Apps modellbaserade appar.
Duplicera tester och testuppsättningar
Du kan duplicera både testuppsättningar och individuella tester.
För att duplicera ett enskilt testfall, öppna agentens testpost och välj Duplicera testfall. Denna åtgärd är användbar när du skapar varianter av ett testfall, till exempel genom att ändra plats, tid eller mängd.
För att duplicera en hel testuppsättning, öppna testuppsättningen och välj Duplicera testuppsättning från kommandofältet. Den här åtgärden skapar en kopia av testuppsättningen och alla dess underordnade tester.