Konfigurer test i Copilot Agent Kit

Test er afgørende for at sikre, at dine brugerdefinerede agenter i Copilot Agent Kit reagerer og opfører sig som forventet. Denne artikel viser, hvordan du opretter, administrerer og validerer forskellige typer test, herunder scenarier med flere ture. Du kan også udføre massehandlinger med Excel og duplikerede testsæt.

Testtyper

Opret flere forskellige testtyper for at validere dine agenter.

Testtype Beskrivelse
Svarmatch Denne test er den enkleste testtype. Den sammenligner agentens svar med det forventede svar ved hjælp af den valgte sammenligningsoperator.
Som standard bruges nøjagtigt match ("er lig med"). Andre tilgængelige sammenligningsoperatorer er "Er ikke lig med", "Indeholder", "Indeholder ikke", "Begynder med", "Begynder ikke med", "Slutter med" og "Slutter ikke med".
Vedhæftninger (såsom Adaptive kort) Sammenligner agentens vedhæftningers JSON-svar med de forventede vedhæftningers JSON (hele matrixen af vedhæftninger).
Som standard bruges eksakt match ("er lig med"). Andre tilgængelige sammenligningsoperatorer er "Er ikke lig med," "Indeholder" og "Indeholder ikke". En særlig sammenligningsoperator kaldet "AI-validering" bruger sprogmodeller til at validere vedhæftningen baseret på valideringsinstruktioner leveret af udvikleren, i stil med generative svar.
Match af emne Kun tilgængelig, når Dataverse-forbedring (forbedring med samtaletranskriptioner) er konfigureret.
Når Dataverse-forbedringstrinnet er færdigt, sammenligner denne test det forventede emnenavn med det udløste emnenavn. Emnematch-test understøtter også fleremnematch med brugerdefinerede agenter, der har generativ orkestrering aktiveret. Ved fleremnematch er emnerne komma-adskilte, for eksempel: "Emne1,Emne2".
Generative svar Kun tilgængelig, hvis AI Builder-forbedring (Analysér genererede svar) er konfigureret.
Anvender en stor sprogmodel til at vurdere, om det AI-genererede svar ligger tæt op ad et eksempelsvar eller overholder valideringsinstruktioner.
Når Forbedring med Azure Application Insights er konfigureret, kan negative tests, såsom moderation eller ingen søgeresultater, også testes. Lær mere i Brug rubrikker i tests.
Flere skift Består af et eller flere testtilfælde af andre typer, såsom svarmatch, vedhæftede filer, emnematch og generative svar. Alle underliggende test i en testkørsel med flere skift inden for samme samtalekontekst i den angivne rækkefølge. Brug test med flere runder til at teste et scenarie fra start til slut og til at teste brugerdefinerede agenter med generativ orkestrering. Lær mere i Test med flere runder.
Planvalidering Gør det muligt for udvikleren at validere, om den dynamiske plan for brugerdefineret agent inkluderer de forventede værktøjer. Denne testtype er designet til Copilot Studio brugerdefineret agent, der har generativ orkestrering aktiveret. Lær mere i Planvalideringstest.

Opret et nyt testsæt

Brug testsæt til at gruppere flere tests sammen. Når du udfører tests, skal du vælge et testsæt, så alle tests i dette sæt bliver kørt.

  1. Få adgang til Copilot Agent Kit-programmet.
  2. Gå til Testsæt.
  3. Opret en ny sætpost til agenttest.
  4. Angiv et Navn.
  5. Vælg Gem.

Opret en ny test

Når du har oprettet et testsæt, kan du tilføje test i det. Gå til undergitteret Test, og vælg + Ny agenttest.

Skærmbillede af Opret agenttest-grænsefladen i Copilot Agent Kit med knappen Ny agenttest markeret.

I følgende tabel beskrives felterne.

Kolonnenavn Obligatorisk Beskrivelse
Navn Ja Navn på testen. Dette navn kan være en intern reference-id, såsom TST-001.
Agenttestsæt Ja Overordnet testsæt for testen.
Testtype Ja En af de tilgængelige testtyper.
Send startConversation-hændelse Nej Hvis den er aktiveret, modtager agenten startConversation-hændelsen, så den starter samtalen proaktivt, og testudtalelsen sendes bagefter. Denne indstilling er typisk nødvendig, når Samtalestart-emnet indeholder logik, der skal køre, før agenten svarer brugeren eller testytringen.
Forventet position af svarmeddelelsen Nej Angiv ikke en værdi, hvis du er usikker. Denne mulighed gør det muligt at registrere et specifikt agentsvar, når agenten sender flere beskeder. For eksempel, hvis agenten først siger "Hej" og derefter "Hvordan kan jeg hjælpe dig?", og du ønsker at teste det andet svar, sæt værdien til 1. Rækkefølgen er 0-baseret, så den første besked er indekseret som 0, det andet svar som 1, og så videre.
Timeout for test Ja De ønskede meddelels, der skal sendes til agenten som en del af testen.
Forventet svar Afhænger af Obligatorisk for Svarmatch-testtypen. Forventet svar fra agenten. For en test af generativt svar skal du angive et eksempelsvar eller dine egne valideringsinstruktioner til den store sprogmodel.
Eksterne variablers JSON Nej JSON-post for enhver ekstern eller kontekstuel værdi, du ønsker at sende til agenten som en del af testen. Eksempel: { "Language": "fr" }
Sekunder før svar modtages Nej Antal sekunder før vurdering af svaret fra robotten. I de fleste tilfælde kan du lade denne værdi stå tom, men den er nyttig i situationer, hvor agenten kalder et API, og svaret kan tage længere tid end normalt.
Forventet resultat for generative svar Afhænger af Obligatorisk for generativt svar-testtypen. Skal være enten Besvaret eller Ikke besvaret. Når Azure Application Insights-forbedring er aktiveret, kan du vælge Ændret eller Ingen søgeresultater.
Forventet emnenavn Afhænger af Obligatorisk for Emnematch-testtype. Navnet på det emne, du forventer bliver udløst. Fleremnematch understøttes for brugerdefinerede agenter, der har generativ orkestrering aktiveret. For fleremnematch, brug en komma-separeret liste, for eksempel: "Emne1,Emne2". Tilføj ikke ekstra blanktegn. Fleremnematch sikrer, at de forventede emner er blandt emner i planen.
Forventet vedhæftnings-JSON Afhænger af Obligatorisk for testtypen Vedhæftninger (Adaptive kort osv.). Det fulde vedhæftnings-JSON-matrix, som du forventer fra agentens svar.
Forventede værktøjer Afhænger af Obligatorisk for testtypen Planvalidering. Kommasepareret liste over forventede værktøjer (værktøjer, handlinger og tilknyttede agenter). Tilføj ikke ekstra blanktegn. Rækkefølge er ikke relevant. Eksempel: "Vejr,Klimaforandringer"
Beståelsesgrænse i % Afhænger af Obligatorisk for testtypen Planvalidering. Procentdelen af forventede værktøjer, der skal være i den dynamiske plan, for at testen kan bestås. Hvis procenten er 100, skal alle forventede værktøjer være i den dynamiske plan, for at testen består. Ekstra værktøjer i den dynamiske plan påvirker ikke testresultatet.

Test med flere runder

For typen af test med flere skift kan du angive en eller flere underordnede test af regulære typer. Alle underordnede test har en rækkefølge og et kritisk niveau. Rækkefølgen definerer udførelsesrækkefølgen i den samme samtalekontekst (i testcasen med flere skift). Kritiskheden definerer, om den underordnede testcase skal overføres, for at udførelsen af testen med flere skift kan fortsætte.

Skærmbillede af testopsætningen med flere runder i Copilot Agent Kit.

Hvis en underordnet test kræver en evaluering efter testen, f.eks. Emnematch eller Generative Answers, forbliver testen i en status som afventende, og testudførelsen fortsætter, uanset hvad statussen er for kritisk niveau. Hvis en af de kritiske test mislykkes, stoppes udførelsen af testen med flere runder, og dens resultat markeres som fejl. Hvis alle vigtige underordnede testtilfælde lykkes, er resultatet af flere omgange også en succes.

Skærmbillede af resultatvisning af flere runder i Copilot Agent Kit.

Brug ikke-kritiske underordnede testcases til at "overføre" oplysninger til brugerdefinerede agenter med generativ orkestrering. Du kan også bruge disse testcases, når responsen ikke betyder noget, og du vil bygge op til kritiske tests.

Planvalideringstest

Planvalidering har fokus på værktøjernes korrekthed. I stedet for at vurdere, hvad agenten siger, kontrollerer denne testtype, om de forventede værktøjer blev anvendt i planen.

Når du definerer en planvalideringstest, angiver du:

  • En testytring
  • En kommasepareret liste over forventede værktøjer, der skal indgå i den dynamiske plan
  • En beståelsesgrænse, som definerer, hvor meget afvigelse fra listen der er tilladt

Denne test bruger samtaleafskrifter og evalueres efter selve testkørslen som en forbedringsaktivitet.

Vær opmærksom på følgende:

  • Forventede værktøjer: Inkluder værktøjer, handlinger og tilknyttede agenter i den kommaseparerede liste. Tilføj ikke ekstra blanktegn. Rækkefølgen betyder ikke noget.

  • Beståelsesgrænse i %: Definerer, hvor stor en del af de forventede værktøjer der skal være i den dynamiske plan, for at testen kan bestå.

Planvalidering er en deterministisk test: den beregner afvigelsen mellem de faktiske værktøjer og de forventede værktøjer og sammenligner den med beståelsesgrænsen. Hvis afvigelsen er inden for grænseværdien, består testen, og ellers fejler testen.

Skærmbillede af testtypen Planvalidering i Copilot Agent Kit.

Se mere i Orkestrere agentfunktionsmåde med generativ AI.

Testagenter, der kræver connector-godkendelse

Når en agent bruger en ekstern datakilde som SharePoint eller Dataverse, præsenterer den første samtale typisk et godkendelseskort af typen "Opret forbindelse for at fortsætte". Brugeren skal vælge Tillad, før agenten kan kalde connectoren. For at gennemføre dette flow i en automatiseret test skal du oprette prompten og brugerens svar som to underordnede test i en test med flere trin.

Bemærk!

Dette skal konfigureres én gang i hvert testsæt. Når forbindelsen er godkendt for testbrugeren, skal du ikke gentage godkendelsestrinene i senere test.

Testen med flere kørsler indeholder to underordnede test i bestemt rækkefølge:

Ordre Testtype Handlingstype Formål
1 Vedhæftninger (adaptive kort osv.) Sammenligningsoperator Sender den udtalelse, der udløser connectoren, og bekræfter oplysningerne i JSON-filen til godkendelseskortet.
2 Vedhæftninger (adaptive kort osv.) Aktivér handlinger Indsender Tillad på godkendelseskortet, så agenten kan fuldføre opkaldet.

Sådan opretter du en test:

  1. Vælg + Ny agenttest i dit testsæt, indtast et navn, angiv Testtype som Flere runder, og vælg Gem.

  2. Vælg + Ny agenttest i det underordnede gitter til testen med flere omgange, og konfigurer den første underordnede test:

    Felt Værdi
    Testtype Vedhæftninger (adaptive kort osv.)
    Organiser 0
    Timeout for test Udtalelsen, der aktiverer connectoren, for eksempel List Fourth Coffee Brands.
    Handlingstype Sammenligningsoperator
    Sammenligningsoperator Lig med
    Forventet vedhæftnings-JSON [] (pladsholder — du erstatter dette efter første runde)

    Vælg Gem test.

  3. Gem testsættet, og kør det. Den første underordnede test mislykkes som forventet, fordi JSON-pladsholderen ikke stemmer overens med godkendelseskortet.

  4. Åbn testkørselsresultaterne, vælg fler-omgangs børnetesten, find afsnittet Vedhæftede, og kopier Actual Attachment JSON til udklipsholderen.

  5. Rediger den første underordnede test, indsæt den kopierede JSON i Expected Attachments JSON,, og vælg Gem test.

  6. Vælg + Ny agenttest i det underordnede gitter til testen med flere omgange igen, og konfigurer den næste underordnede test:

    Felt Værdi
    Testtype Vedhæftninger (adaptive kort osv.)
    Ordre 2
    Handlingstype Aktivér handlinger
    Adaptiv kortnyttelast {"action": "Allow", "id": "submit", "shouldAwaitUserInput": true}
    Sammenligningsoperator Indeholder data (eller Lig med, alt efter hvilket svar du vil verificere)
    Forventet svar Lad feltet stå tomt, eller angiv en værdi ud fra de data, du forventer at modtage, når forbindelsen er godkendt.

    Nyttelastværdierne kommer fra det tilpassede JSON-kort, du registrerede i trin 4. Tilpas felterne action og id, hvis dit connector-kort bruger forskellige identifikatorer.

    Vælg Gem test.

  7. Gem testsættet, og kør det igen. Nu skulle begge underordnede test gerne give et positivt resultat.

Når denne test med flere omgange er gennemført én gang, godkendes forbindelsen for testbrugeren, og efterfølgende test i forhold til samme connector kan udføres som almindelige test med en enkelt omgang.

Brug Excel til at masseoprette eller -opdatere tests

Efter at have oprettet et testsæt, kan du bruge Excel til at masseoprette eller -opdatere tests.

  1. Fra din testsætpost skifter du undergittervisningen fra Tests til Eksport/Import-visning.
  2. Vælg Eksportér agenttests i Excel Online.
  3. Tilføj og ret tests efter behov.
  4. Vælg Gem.

Hvis du importerer underordnede tests med flere skift, skal du først oprette eller importere den faktiske overordnede test med flere skift. Importér derefter underordnede testcases.

Læs mere i Excel-import og -eksport i Power Apps-modelbaserede apps.

Duplikér tests og testsæt

Du kan duplikere både testsæt og individuelle tests.

  • For at duplikere et enkelt testtilfælde skal du åbne agenttestposten og vælge Dupliker testtilfælde. Denne handling er nyttig, når du skaber varianter af et testtilfælde, såsom at ændre placering, tid eller mængde.

  • For at duplikere et helt testsæt, åbn testsætposten og vælg Dupliker testsæt fra kommandolinjen. Denne handling opretter en kopi af testsættet og alle dets underordnede tests.

Næste trin