Konfigurer tester i Copilot-agentsettet

Testing er essensielt for å sikre at dine tilpassede agenter i Copilot-agentsettet svarer og reagerer som forventet. Denne artikkelen forklarer hvordan du oppretter, administrerer og validerer ulike typer tester, inkludert scenarioer med flere runder. Du kan også utføre masseoperasjoner med Excel og dupliserte testsett.

Testtyper

Opprett flere typer tester for å validere agentene dine.

Testtype Description
Svartreff Denne testen er den enkleste testtypen. Den sammenligner agentens svar med det forventede svaret ved hjelp av den valgte sammenligningsoperatoren.
Som standard brukes sammenligningsoperatoren 'eksakt samsvar' («er lik»). Andre tilgjengelige sammenligningsoperatorer er «Er ikke lik», «Inneholder», «Inneholder ikke», «Begynner med», «Begynner ikke med», «Slutter med» og «Slutter ikke med».
Vedlegg (som dynamiske kort) Sammenligner agentens vedleggs JSON-svar med forventet vedleggs-JSON (full matrise med vedlegg).
Som standard brukes nøyaktig samsvar («er lik»). Andre tilgjengelige sammenligningsoperatorer er «Ikke lik», «Inneholder» og «Inneholder ikke». En spesiell sammenligningsoperator kalt «KI-validering» bruker språkmodeller til å validere vedlegget basert på valideringsinstruksjoner fra utvikleren, på samme måte som generative svar.
Emnesamsvar Bare tilgjengelig når Dataverse-supplering (Suppler med samtaleutskrifter) er konfigurert.
Når Dataverse-suppleringstrinnet er fullført, sammenligner denne testen det forventede emnenavnet med det utløste emnenavnet. Emnesamsvartesting støtter også treff med flere emner med egendefinerte agenter som har generativ iverksetting aktivert. Ved avstemming med flere emner er emner skilt med komma; f.eks.: «Emne1,Emne2».
Generative svar Bare tilgjengelig hvis AI Builder-supplering (Analyse generative svar) er konfigurert.
Bruker en stor språkmodell til å vurdere om det KI-genererte svaret ligner et eksempelsvar eller følger valideringsinstruksjoner.
Når Suppler med Azure Application Insights er konfigurert, kan negative tester, som moderering eller ingen søkeresultater, også testes. Les mer i Bruk vurderingskriterier i tester.
Flere vendinger Består av en eller flere testsaker av andre typer, som svartreff, vedlegg, emnetreff og generative svar. Alle underordnede tester i en testkjøring med flere vendinger oppstår innenfor samme samtalekontekst i den angitte rekkefølgen. Bruk tester med flere runder til å teste et scenario fra ende til ende, og til å teste tilpassede agenter med generativ iverksetting. Les mer om Testing med flere runder.
Planvalidering Lar utvikleren validere at den dynamiske planen til den tilpassede agenten inkluderer de forventede verktøyene. Denne testtypen er ment for Copilot Studio tilpassede agenter som har generativ iverksetting aktivert. Mer informasjon i Planvalideringstesting.

Opprett et nytt testsett

Bruk testsett til å gruppere flere tester. Når du kjører tester, velger du et testsett for å kjøre alle testene i det settet.

  1. Få tilgang til Copilot-agentsettappen.
  2. Gå til Testsett.
  3. Opprett en ny agenttestsettoppføring.
  4. Angi et navn.
  5. Velg Lagre.

Opprett en ny test

Når du har opprettet et testsett, kan du legge til tester i det. Velg + Ny agenttest i Tester-delrutenettet.

Skjermbilde av grensesnittet for Opprett agenttest i Copilot-agentsettet, med knappen Ny agenttest markert.

Tabellen nedenfor beskriver feltene.

Kolonnenavn Kreves Description
Navn Ja Navnet på testen. Dette navnet kan være en intern referanse-ID, for eksempel TST-001.
Agenttestsett Ja Overordnet testsett for testen.
Testtype Ja En av de tilgjengelige testtypene.
Send startConversation-hendelse Nei Hvis aktivert mottar agenten startConversation-hendelsen, så den starter proaktivt samtalen, og testuttalelsen sendes etterpå. Denne innstillingen er vanligvis nødvendig når Samtalestart-emnet inkluderer logikk som må kjøres før det svares brukeren eller testuttalelsen.
Forventet posisjon for svarmeldingen Nei Ikke sett en verdi hvis du er usikker. Denne innstillingen lar deg fange opp et spesifikt agentsvar når agenten sender flere meldinger. Hvis agenten for eksempel først sier «Hei» og deretter «Hvordan kan jeg hjelpe deg?» og du ønsker å teste den andre meldingen, setter du verdien til 1. Rekkefølgen starter på 0, så første melding har indeks 0, andre svar har indeks 1 og så videre.
Testytring Ja Meldingen du vil sende til agenten som en del av testen.
Forventet svar Avhenger Obligatorisk for testtypen Svartreff. Forventet svar fra agenten. For en Generative svar-test oppgir du et eksempel på svar eller dine egne valideringsinstruksjoner for den store språkmodellen.
JSON for eksterne variabler Nei JSON-oppføring for enhver ekstern eller kontekstuell verdi du ønsker å gi til agenten som en del av testen. Eksempel: { "Language": "fr" }
Sekunder før du får svar Nei Antall sekunder å vente før du vurderer svaret fra roboten. I de fleste tilfeller kan du la denne verdien stå tom, men det er nyttig i situasjoner der agenten kaller et API og svaret kan ta lengre tid enn vanlig.
Forventet resultat for generative svar Avhenger Obligatorisk for testtypen Generative svar. Bør være enten Besvart eller Ikke besvart. Når Azure Application Insights-supplering er aktivert, kan du velge Moderert eller Ingen søkeresultater.
Forventet emnenavn Avhenger Obligatorisk for testtypen Emnetreff. Navnet på emnet du forventer at skal utløses. Treff med flere emner støttes for egendefinerte agenter som har generativ iverksetting aktivert. For treff med flere emner bruker du en kommadelt liste, for eksempel: «Emne1,Emne2». Ikke legg til ekstra mellomrom. Treff med flere emner sikrer at de forventede emnene er blant emnene i planen.
JSON for forventet vedlegg Avhenger Obligatorisk for testtypen Vedlegg (dynamiske kort osv.). Hele JSON-matrisen for vedlegg som du forventer fra agentens svar.
Forventede verktøy Avhenger Obligatorisk for planvalideringstesttype. Kommadelt liste over forventede verktøy (verktøy, handlinger og tilknyttede agenter). Ikke legg til ekstra mellomrom. Rekkefølge er ikke relevant. Eksempel: «Vær, klimaendringer»
Bestått terskelprosent Avhenger Obligatorisk for planvalideringstesttype. Prosentandelen forventede verktøy som må være i den dynamiske planen for at testen skal bestå. Hvis prosentandelen er 100, må alle forventede verktøy være i den dynamiske planen for at testen skal lykkes. Ekstra verktøy i den dynamiske planen påvirker ikke testresultatet.

Testing med flere runder

For testtypen med flere runder kan du spesifisere en eller flere underordnede tester av vanlige typer. Hver underordnet test har en rekkefølge og kritikalitet. Rekkefølgen definerer utførelsesrekkefølgen innenfor samme samtalekontekst (innenfor testsak med flere runder). Kritiskheten definerer om den underordnede testsaken må være bestått for at kjøringen av flervendingstesten skal fortsette.

Skjermbilde av testoppsettet for flere runder i Copilot-agentsettet.

Hvis en underordnet test krever evaluering etter testing, som Emnetreff eller Generative svar, blir testen værende i ventende tilstand, og testutførelsen fortsetter uavhengig av kritikalitetsstatus. Hvis noen av de kritiske testene feiler, stoppes utførelsen av testen med flere runder og resultatet anses som mislykket. Hvis alle kritiske underordnede testsaker er bestått, er resultatet av flervendingstesten også bestått.

Skjermbilde av resultatvisning med flere runder i Copilot-agentsettet.

Bruk ikke-kritiske underordnede testsaker til å «mate» informasjon til egendefinerte agenter med generativ iverksetting. Du kan også bruke disse testsakene når svaret ikke betyr noe og du vil bygge opp til kritiske tester.

Planvalideringstesting

Planvalidering fokuserer på verktøyets korrekthet. I stedet for å evaluere hva agenten sier, undersøker denne testtypen om de forventede verktøyene ble brukt i planen.

Når du definerer en planvalideringstest, spesifiser følgende:

  • En testytring
  • En kommadelt liste over forventede verktøy som skal inkluderes i den dynamiske planen
  • En bestått-terskel, som viser hvor mye avvik som skal tolereres fra listen

Denne testen bruker samtaleutskrifter og vurderes etter selve testkjøringen som en suppleringsaktivitet.

Husk følgende:

  • Forventede verktøy: Inkluder verktøy, handlinger og tilknyttede agenter i en kommadelt liste. Ikke legg til ekstra mellomrom. Rekkefølgen spiller ingen rolle.

  • Godkjenningsgrense %: Godkjenningsgrensen angir hvilken prosentandel av forventede verktøy som må være i den dynamiske planen for at testen skal bestå.

Planvalidering er en deterministisk test: den beregner avviket mellom de faktiske verktøyene og de forventede verktøyene, og sammenligner dette med terskelen for å bestå. Hvis avviket er innenfor terskelen, består testen ellers feiler den.

Skjermbilde av testtypen Planvalidering i Copilot-agentsettet.

Les mer i Iverksett agentfunksjonalitet med generativ kunstig intelligens.

Testagenter som krever sammenkoblingsautorisasjon

Når en agent bruker en ekstern datakilde som SharePoint eller Dataverse, presenterer den første samtalen vanligvis et «Koble til for å fortsette»-autorisasjonskort. Brukeren må velge Tillat før agenten kan kalle koblingen. For å lære opp denne flyten i en automatisert test, må du modellere instruksen og brukerens svar som to underordnede tester innenfor en test med flere runder.

Notat

Dette er et engangsoppsett per testsett. Etter at tilkoblingen er autorisert for testbrukeren, trenger du ikke å gjenta autorisasjonstrinnene i senere tester.

Testen med flere vendinger inneholder to bestilte underordnede tester:

Ordre Testtype Operasjonstype Formål
1 Vedlegg (dynamiske kort osv.) Sammenligningsoperator Sender ytringen som utløser koblingen og aktiverer på autorisasjonskortets JSON.
2 Vedlegg (dynamiske kort osv.) Påkall handlinger Sender inn Tillat på autorisasjonskortet, slik at agenten kan fullføre samtalen.

Slik oppretter du en test:

  1. I testsettet ditt, velg + Ny agenttest, skriv inn et navn, sett Testtype til Flere vendinger, og velg Lagre.

  2. I det underordnede rutenettet til testen med flere vendinger, velg + New agenttest, og konfigurer den første underordnede testen:

    Felt Verdi
    Testtype Vedlegg (dynamiske kort osv.)
    Ordre 1
    Testytring Ytringen som utløser koblingen, for eksempel List Fourth Coffee Brands.
    Operasjonstype Sammenligningsoperator
    Sammenligningsoperator Equals
    JSON for forventet vedlegg [] (plassholder – du erstatter denne etter første kjøring)

    Velg Lagre test.

  3. Lagre testsettet og kjør det. Den første underordnede testen feiler som forventet, fordi plassholder-JSON-en ikke matcher autorisasjonskortet.

  4. Åpne testresultatene, velg den underordede testen med flere vendinger, finn Vedlegg-delen, og kopier JSON for det faktiske vedlegget til utklippstavlen.

  5. Rediger den første underordnede testen, lim inn den kopierte JSON-en i JSON for forvedede vedlegg, og velg Lagre test.

  6. I det underordnede rutenettet til testen med flere vendinger, velg + New agenttest igjen, og konfigurer den andre underordnede testen:

    Felt Verdi
    Testtype Vedlegg (dynamiske kort osv.)
    Ordre 2
    Operasjonstype Påkall handlinger
    Nyttelast for dynamisk kort {"action": "Allow", "id": "submit", "shouldAwaitUserInput": true}
    Sammenligningsoperator Inneholder data (eller likeverdier, avhengig av hvilket svar du vil deklarere)
    Forventet svar La det stå tomt, eller angi det basert på dataene du forventer etter at tilkoblingen er tillatt.

    Nyttelastverdiene kommer fra JSON for det dynamiske kortet du registrerte i trinn 4. Juster feltene action og id hvis koblingskortet ditt bruker forskjellige identifikatorer.

    Velg Lagre test.

  7. Lagre testsettet og kjør det på nytt. Begge de underordnede testene skal nå bestå nå.

Etter at denne testen med flere vendinger har kjørt én gang med suksess, blir tilkoblingen godkjent for testbrukeren, og påfølgende tester mot samme kobling kan utarbeides som vanlige tester med én vending.

Bruk Excel til å masseopprette eller -oppdatere tester

Etter å ha opprettet et testsett, kan du bruke Excel til å masseopprette eller -oppdatere tester.

  1. Bytt delnettvisningen fra Tester til Eksport-/importvisning fra testsettoppføringen.
  2. Velg Eksport agenttester i Excel Online.
  3. Legg til og modifiser tester etter behov.
  4. Velg Lagre.

Hvis du importerer underordnede tester med flere vendinger, må du først opprette eller importere den overordnede testen med flere vendinger. Deretter importerer du underordnede testtilfeller.

Du finner mer informasjon i Excel-import og -eksport i modelldrevne Power Apps-apper.

Dupliser tester og testsett

Du kan duplisere både testsett og individuelle tester.

  • For å duplisere et enkelt testtilfelle åpner du agentens testpost og velger Duplisert testtilfelle. Denne handlingen er nyttig når du lager varianter av et testtilfelle, som å endre sted, tid eller mengde.

  • For å duplisere et helt testsett åpner du testsettposten og velger Dupliser testsett fra verktøylinjen. Denne handlingen lager en kopi av testsettet og alle dets underordnede tester.

Neste trinn