Analyser agenter ved hjelp av Verktøy for agentgjennomgang i Copilot-agentsettet

Verktøy for agentgjennomgang er et automatisert system for kvalitetsvurdering og samsvarsgjennomgang for Microsoft Copilot Studio-agenter og deklarative Microsoft 365-agenter. Det hjelper skapere, administratorer og styringsteam med å identifisere problemer, avviksmønstre og etterlevelseshull før de når sluttbrukerne.

Etter hvert som organisasjoner skalerer sine Copilot Studio-distribusjoner, blir det umulig å manuelt gjennomgå hver agents konfigurasjon, instruksjoner og emnestruktur. Verktøy for agentgjennomgang automatiserer denne gjennomgangen gjennom KI-drevet analyse og viser vanligvis konkrete funn på under 60 sekunder.

Det er for:

  • Skapere: Få praktisk tilbakemelding for å forbedre agentkvaliteten før distribusjon.
  • Administratorer og CoE-team: Håndhev styringsstandarder på tvers av alle agenter i et miljø.
  • Sikkerhets- og etterlevelsesansvarlige: Kontroller at agentene følger retningslinjer for personvern, sikkerhet og nøyaktighet.

Viktige funksjoner

Funksjonalitet Detaljer
Agentdekning Copilot Studio-agenter og deklarative Microsoft 365-agenter
Gjennomgangstid Vanligvis under 60 sekunder per agent
Mønstre sjekket 18 mønstre (10 deterministiske + 8 KI-drevne)
Etterlevelseskriterier 15 kriterier for instruksjonskvalitet
Poengsystem 0–100 poeng totalt (50 % mønstre, 50 % etterlevelse)
Eksportformater PDF, SARIF, Excel
Datalagring Microsoft Dataverse (brukeromfang, sikkerhet på radnivå håndhevet)
KI-motor Microsoft Copilot Studio KI-instruksjoner gjennom Dataverse PredictV2

Kom i gang: Instrumentbordet

Når du åpner Verktøy for agentgjennomgang, lander du på Instrumentbord, det sentrale knutepunktet som viser alle agenter i miljøet ditt og deres gjennomgangsstatus.

Instrumentbordoppsett

Skjermbilde av instrumentbordet i Verktøy for agentgjennomgang med statistikkort, agentrutenett og knappen Last opp ZIP.

Instrumentbordet viser alt på én gang: fanelinjen som veksler mellom Copilot Studio- og Microsoft 365-agenter, fire statistikkort som oppsummerer tilstanden i porteføljen, en søkeverktøylinje, det paginerte agentrutenettet og knappen Last opp ZIP for frakoblede gjennomganger.

Statistikkort

De fire statistikkortene gir deg et øyeblikksbilde av tilstanden til agentporteføljen din:

Kort Hva det viser Hvordan det beregnet
Totalt antall agenter Alle aktive roboter i miljøet. Spør bot-tabellen der statecode = 0
Gjennomgått Antall og prosentandel av agenter som er gjennomgått. Antall fullførte gjennomganger delt på totalt antall agenter
Gjennomsnittlig poengsum Gjennomsnittlig poengsum for alle fullførte gjennomganger. Summen av poeng delt på antall gjennomgått
Totalt antall problemer Kumulative problemer funnet for alle gjennomgåtte agenter. Summen av mønsterfeil pluss etterlevelsesfeil

Agentrutenett

Kolonne Innhold
Name Visningsnavn for agent med ikon.
Poengsum Samlet poengsum for gjennomgang (0–100), eller -- hvis det ennå ikke er gjennomgått. Fargekodet.
Problemer Oppsummering av funn ved høy, middels og lav alvorlighetsgrad. -- hvis ikke gjennomgått.
Sist gjennomgått Relativ tid (for eksempel «2 timer siden» eller «1 uke siden») eller «Ikke gjennomgått».
Handlinger Gå gjennom for agenter uten gjennomgang. Vis for agenter med eksisterende gjennomganger.

Velg et miljø

Som standard viser verktøyet agenter fra miljøet der du installerte det. Hvis du trenger å gjennomgå en agent fra et annet miljø, bruk miljøvelgeren på verktøylinjen i instrumentbordet. Rullegardinlisten viser alle Power Platform-miljøer du har tilgang til.

Etter at du har valgt et annet miljø, oppdateres agentrutenettet for å vise agenter fra det miljøet. Du kan deretter gjennomgå hvilken som helst av disse agentene. Gjennomgangsresultatet lagres i det nåværende (hjemme)miljøet, ikke i det du har valgt.

Skjermbilde av nedtrekksmenyen for miljøvelgeren som viser tilgjengelige Power Platform-miljøer.

Gjennomgangsmoduser

Verktøyet støtter to distinkte gjennomgangsmoduser, som er tilgjengelige fra fanelinjen øverst på instrumentbordet.

Gjennomgang av Copilot Studio-agent

Denne modusen gjennomgår agenter utviklet i Microsoft Copilot Studio. Den leses direkte fra Dataverse – ingen filopplasting kreves.

Hva den analyserer:

  • Emnekonfigurasjoner (navn, beskrivelser, variabler).
  • Verktøy- og handlingskonfigurasjoner (antall, beskrivelser, ruting).
  • Kunnskapskildetyper.
  • Dekning av testsak.
  • Agentinstruksjoner (generativ modus).
  • Agentmetadata (språk, godkjenning, KI-innstillinger).

Slik starter du en gjennomgang:

  1. Finn agenten din i rutenettet.
  2. Velg Gjennomgang. Analysen starter automatisk.
  3. Et fremdriftspanel viser hva som skjer i sanntid.
  4. Resultatene åpnes i gjennomgangspanelet når de er ferdige.

Du kan gå gjennom en hvilken som helst agent igjen når som helst. Hver gjennomgang oppretter en ny post i Dataverse. Rutenettet viser alltid det nyeste gjennomgangsresultatet.

Gjennomgang av deklarativ agent (Microsoft 365 Copilot)

Denne modusen gjennomgår deklarative Microsoft 365-agenter, som defineres av en JSON-manifestfil og distribueres til Microsoft 365 Copilot-økosystemet.

Du kan sende inn en deklarativ agent til gjennomgang på to måter:

Metode Hvordan Når skal brukes
Last opp ZIP Velg Last opp ZIP i sideoverskriften, og velg den eksporterte pakken. Agenten er fra en annen leier eller ikke i katalogen din.
Fra Microsoft 365-katalogen Koble til Microsoft 365 via Graph API-oppsettsveiviseren, og bla deretter gjennom agenter. Agenten er distribuert i Microsoft 365-leieren din.

Hva den analyserer (5 kriterier, ikke 15):

Kriterium Vekt Hva sjekkes
Instruksjoner 30 % Klarhet, fullstendighet og kvalitet på agentinstruksjonene
Kunnskap 20 % Forankring gjennom tilkoblede kunnskapskilder
Funksjoner 15 % Bruk av CodeInterpreter og OneDriveAndSharePoint
Handlinger 15 % Verktøyruting og handlingsbeskrivelser
Samtalestartere 10 % Minimum 3, anbefalt 6 (maksimum 12)
Smidig feilhåndtering 10 % Feilgjenoppretting og basisatferd

Notat

Etterlevelseskontrollen på 15 kriterier for instruksjoner er spesifikk for Copilot Studio-agenter og gjelder ikke for deklarative agenter.

Hva skjer under en gjennomgang

Når du velger Gjennomgang, kjører verktøyet en automatisert analyse som vanligvis fullføres på under 60 sekunder. Et fremdriftspanel holder deg informert mens den arbeider.

Skjermbilde av fremdriftspanelet for gjennomgang som viser trinnene som utføres under en agentgjennomgang.

Analysen dekker tre ting i rekkefølge:

  1. Konfigurasjonsanalyse: Verktøyet leser agentens komplette konfigurasjon fra Dataverse – alle temaer, verktøy, kunnskapskilder, testsaker og instruksjoner. Den sjekker for manglende felter på tvers av alle komponenter og måler ting som antall verktøy og testdekning opp mot Microsofts dokumenterte anbefalte fremgangsmåter.
  2. KI-drevet mønsterevaluering: En KI-modell gjennomgår samme konfigurasjon for å vurdere kvalitet, ikke bare fullstendighet. Den ser på om emnenavn og beskrivelser er tydelige nok til at den generative iverksetteren kan rute riktig, om flere emner overlapper på måter som fører til rutingsforvirring, og om verktøybeskrivelser gir KI-en nok veiledning til å aktivere riktig verktøy til rett tid.
  3. Etterlevelseskontroll for instruksjoner: En annen KI-modell leser agentens systeminstruksjoner og sjekker dem mot 15 kriterier for anbefalte fremgangsmåter fra Microsofts veiledning om generativ modus – som dekker omfang, sikkerhet, responskvalitet og brukeropplevelse. For hvert kriterium instruksjonene ikke tilfredsstiller, dukker det opp et spesifikt funn og en konkret anbefaling.

Etter at alle tre trinnene er fullført, genereres en PDF-rapport automatisk, og resultatene åpnes i gjennomgangspanelet.

Viktig!

Hver gjennomgang forbruker Copilot-kreditter. De KI-drevne trinnene (mønsterevaluering, etterlevelseskontroll for instruksjoner og PDF-generering) kaller opp hver sin KI-modell gjennom Dataverse. Planlegg i henhold til dette hvis du går gjennom et stort antall agenter.

Mønstre oppdaget

Mønstre identifiserer spesifikke avviksmønstre eller manglende anbefalte fremgangsmåter i en agents konfigurasjon. Verktøyet sjekker 18 mønstre fordelt på 7 kategorier.

Alle de 18 mønstrene

ID Mønsternavn Kategori Konsekvens
pat-001 Navn på manglende modell Modellnavngivning Generative iverksettere kan ikke pålitelig rute til dette emnet.
pat-002 Manglende modellbeskrivelse Modellbeskrivelse Emnet kan bli hoppet over eller feilaktig utløst under rutingen.
pat-003 Manglende navn på inndatavariabel Inndatavariabler Brukere ser navnløse variabler, noe som skaper forvirring i samtalen.
pat-004 Beskrivelse av manglende inndatavariabel Inndatavariabler KI klarer ikke å hente ut riktig verdi fra brukerinndata.
pat-005 Manglende navn på utdatavariabel Utdatavariabler Utdataverdiene er umerkede og vanskelige for brukere å tolke.
pat-006 Beskrivelse av manglende utdatavariabel Utdatavariabler KI mangler kontekst for å fylle ut variabelen korrekt.
pat-007 Overdreven bruk av verktøy Arkitektur For mange verktøy svekker rutingsnøyaktigheten og øker ventetiden.
pat-008 Utilstrekkelige testsaker Evaluering Regresjoner i emneatferd blir ikke oppdaget før utrulling.
pat-009 Beskrivelse av manglende underordnet agent Arkitektur Iverksetter klarer ikke å bestemme når det skal delegeres til underordnet agent.
pat-010 Spreding av arkitektur for underordnet agent Arkitektur Overdreven delegering skaper iverksettingskompleksitet og ventetid.
pat-011 Uklart modellnavn Modellnavngivning Vage navn får iverksetteren til å rute til feil emne.
pat-012 Uklar modellbeskrivelse Modellbeskrivelse Dårlige beskrivelser fører til manglende eller feilaktige emneutløsere.
pat-013 Uklart navn på inndatavariabel Inndatavariabler Tvetydige navn gjør det vanskeligere for KI-en å fylle ut variabelen riktig.
pat-014 Uklar beskrivelse av inndatavariabel Inndatavariabler KI trekker ut feil verdi eller stiller unødvendige oppklarende spørsmål.
pat-015 Uklart navn på utdatavariabel Utdatavariabler Emner eller flyter nedstrøms som forbruker denne variabelen, kan feiltolke den.
pat-016 Uklar beskrivelse av utdatavariabel Utdatavariabler KI kan ikke pålitelig produsere forventet utdataformat eller -verdi.
pat-017 Overlappende emnebeskrivelser Modellbeskrivelse Flere emner konkurrerer om de samme brukeruttalelsene, noe som fører til uforutsigbar ruting.
pat-018 Verktøyrutingsmangel Arkitektur KI-en klarer ikke å bestemme hvilket verktøy den skal kalle, noe som fører til feil verktøykall eller ingen handling.

For hvert feilmønster viser verktøyet hvilke emner som er påvirket, den nåværende verdien som utløste funnet, en foreslått forbedring, og en kobling til relevant Microsoft Learn-dokumentasjon.

Skjermbilde av fanen Mønstre som viser alle 18 mønstre med status, alvorlighetsgrad, kategori og antall berørte emner.

Mønsterkategorier

Resultatrutenettet grupperer mønstre i syv kategorier, sortert i følgende rekkefølge:

# Kategori Inkluderte mønstre
1 Modellnavngivning pat-001, pat-011
2 Modellbeskrivelse pat-002, pat-012, pat-017
3 Inndatavariabler pat-003, pat-004, pat-013, pat-014
4 Utdatavariabler pat-005, pat-006, pat-015, pat-016
5 Arkitektur pat-007, pat-009, pat-010, pat-018
6 Iverksetting Reservert for fremtidige mønstre oppdaget av KI
7 Evaluering pat-008

Logikk for alvorsgrad

Kombinasjonen av nøkkelordsamsvar og antall emner avgjør mønsterets alvorsgrad:

Betingelse Tildelt alvorsgrad
Mønsternavnet inneholder «modellnavn» eller «modellbeskrivelse» Høy
Mønsternavnet inneholder «variabel» Middels (med mindre antall emner er 5 eller mer)
Antall emner er 5 eller mer Høy
Antall emner er 2 eller mer Middels
Antall emner er 1 Lav

Alvorsgraden styrer både den visuelle indikatoren i resultatrutenettet og SARIF-feilnivået i den eksporterte rapporten.

Etterlevelseskriterier

Denne delen av gjennomgangen vurderer kvaliteten på agentens systeminstruksjoner – teksten på naturlig språk en skaper oppgir i de generative innstillingene i Copilot Studio. Disse instruksjonene definerer hvordan agenten oppfører seg i alle samtaler.

De 15 kriteriene er utledet fra Microsofts veiledning for generativ modus og representerer de mest virkningsfulle anbefalte fremgangsmåtene for instruksjonskvalitet.

Alle de 15 kriteriene

# ID Navn på vilkår Kategori Alvorsgrad Hva den kontrollerer
1 scope-definition Omfangsdefinisjon Område Høy Agentens instruksjoner definerer eksplisitt hvilke emner agenten skal og ikke skal svare på.
2 out-of-scope-handling Håndtering utenfor omfanget Område Middels Instruksjoner angir hva som skal bli sagt når en bruker spør om noe utenfor agentens omgang.
3 persona-and-tone Identitet og tone Brukeropplevelse Lav Instruksjoner definerer tone for scenarioer som ikke er standard. (Profesjonell/høflig er allerede standard – hopp over hvis det ikke trengs.)
4 privacy-and-sensitive-data Personvern og sensitive data Sikkerhet Høy Instruksjonene inneholder eksplisitt veiledning om å ikke lagre, vise eller gjenta personopplysninger.
5 fallback-when-uncertain Basis når det er usikkert Kvalitet Høy Instruksjonene angir hva som skal gjøres når agenten ikke har informasjonen som trengs for å svare.
6 citations-and-sources Henvisninger og kilder Kvalitet Middels Instruksjonene krever at agenten siterer dokumentnavn og avsnitt når den refererer til kunnskapskilder.
7 formatting-guidelines Retningslinjer for formatering Brukeropplevelse Lav Instruksjonene spesifiserer responsformat (punktlister, tabeller, nummererte steg) for strukturerte utdata.
8 clarifying-questions Oppklarende spørsmål Brukeropplevelse Middels Instruksjonene tar for seg håndtering av tvetydige spørsmål ved å stille oppklarende oppfølgingsspørsmål.
9 prompt-injection-resilience Beskyttelse mot spørringsinjeksjon Sikkerhet Høy Instruksjonene inkluderer eksplisitte tiltak mot forsøk på jailbreak-angrep eller spørringsinjeksjon.
10 link-safety Koblingssikkerhet Sikkerhet Middels Instruksjonene sikrer at kun verifiserte, sikre koblinger deles med brukerne.
11 advice-disclaimers Forbehold om rådgivning Sikkerhet Høy Instruksjonene inkluderer ansvarsfraskrivelser for sensitive rådgivningsområder (finans, helse, juridisk).
12 accuracy-quality Nøyaktighet og kvalitet Kvalitet Høy Instruksjonene forankrer eksplisitt agenten i dens kunnskapskilder og forbyr fabrikasjon eller gjetting.
13 tool-routing-hints Verktøyrutingstips Kvalitet Middels Instruksjonene gir veiledning om hvilke verktøy eller kunnskapskilder som skal brukes når rutingen er uklar.
14 escalation-guidance Veiledning for eskalering Brukeropplevelse Høy Instruksjonene definerer hva som skal gjøres når agenten ikke kan hjelpe: overlevere til et menneske, foreslå et alternativ eller avslutte på en smidig måte.
15 deterministic-language Deterministisk språk Kvalitet Middels Instruksjonene bruker absolutte direktiver (alltid, aldri, bare, må) i stedet for vage modifikatorer (kan, som regel prøv, av og til).

Skjermbilde av Etterlevelse-fanen som viser de 15 kvalitetskriteriene for instruksjoner med status og alvorsgrad.

Kategorifordeling

Kategori Antall kriterier Fokus
Område 2 Definerer hva agenten svarer og ikke svarer på
Sikkerhet 4 Beskytter brukere mot feilinformasjon, datalekkasje og manipulering
Kvalitet 5 Sikrer nøyaktige, forankrede og godt strukturerte svar
Brukeropplevelse 4 Former samtaleopplevelsen og eskaleringsveiene

Hvordan poeng beregnes

Alle poeng er på en skala fra 0–100 og er deterministiske. De samme inndataene gir alltid samme poengsum.

Mønsterpoeng

Pattern Score = (Passed Patterns / Total Patterns) × 100
  • Totalt antall mønstre = 10 deterministiske + hvor mange KI-detekterte mønstre som returneres (opptil 8).
  • Beståtte mønstre = antall der mønsterstatusen er pass.
  • Resultatet rundes av til nærmeste heltall.

Eksempel: 15 mønstre totalt, 12 bestått = Mønsterpoeng på 80.

Instruksjonspoeng

Instruksjonspoengsummen bruker et vektet poengsystem basert på hvor alvorlig hvert kriterium er:

Iboende alvorsgrad Poeng hvis bestått Antall kriterier Maks poeng
Høy 3 7 21
Middels 2 6 12
Lav 1 2 2
Totalt 15 35
Instruction Score = (Earned Points / 35) × 100
  • For hvert av de 15 kriteriene legges dets iboende alvorsgradspoeng til hvis det ikke finnes noe problem med det kriteriet.
  • Hvis «manglende instruksjoner» oppdages, stryker alle kriterier, og poengsummen er 0.
  • Resultatet låses på 100 og avrundes til nærmeste heltall.

Eksempel: 3 høye og 2 middels kriterier stryker:

  • Poeng oppnådd: (4 × 3) + (4 × 2) + (2 × 1) = 12 + 8 + 2 = 22 poeng.
  • Poengsum = (22/35) × 100 = 63.

Total poengsum

Overall Score = (Pattern Score × 0.5) + (Instruction Score × 0.5)

Begge dimensjonene vektlegges likt. Hvis bare én dimensjon er tilgjengelig (det finnes for eksempel ingen instruksjoner), brukes den dimensjonens poengsum direkte.

Poengveiledning for farge og etikett

Poengsumområde Etikett Farge
80 og høyere Utmerket Grønn
60 til 79 Bra Gul
40 til 59 Ganske bra Rød
Under 40 Trenger forbedring Rød

Gjennomgå resultater

Etter at gjennomgangen er ferdig, vises resultatene på gjennomgangspanelet. Panelet har tre faner.

Fanen Oversikt

Oversikt-fanen gir deg et overordnet sammendrag:

  • Total poengsum: En sirkelformet måler farget grønn, gul eller rød.
  • Mønsterpoeng og instruksjonspoeng side ved side.
  • Agentmetadata: Navn, miljø, språk, godkjenningsmodus, KI-innstillinger.
  • KI-generert oppsummering: En beskrivelse på naturlig språk av de mest betydningsfulle funnene.
  • Tidsstempel for gjennomgang og datakilde (live-miljø eller ZIP-opplasting).

Skjermbilde av Oversikt-fanen i Gjennomgang-panelet som viser måleren for total poengsum, mønster- og instruksjonspoeng samt KI-sammendrag.

Mønstre-fanen

Mønstre-fanen viser hele rutenettet over alle de 18 evaluerte mønstrene, med disse kolonnene:

Kolonne Description
Status Bestått eller ikke bestått
Alvorsgrad Indikator for høy, middels eller lav
Kategori Mønsterkategori (modellnavngivning, arkitektur og så videre)
Mønsternavn Fullt mønsternavn
Berørte emner Antall emner som er påvirket av dette mønsteret
Handlinger Detaljer-knappen for å åpne panelet Mønsterdetaljer

Du kan sortere rutenettet etter enhver kolonne. Som standard vises ikke-beståtte mønstre først, sortert etter alvorsgrad (høy, middels og til slutt lav).

Etterlevelse-fanen

Etterlevelse-fanen viser alle de 15 instruksjonskriteriene:

Kolonne Description
Status Bestått eller ikke bestått
Alvorsgrad Indikator for høy, middels eller lav
Kategori Omfang, sikkerhet, kvalitet eller brukeropplevelse
Navn på vilkår Fullt navn på vilkår
Problemer funnet Antall spesifikke problemer under dette vilkåret
Handlinger Detaljer-knappen for å åpne panelet Etterlevelsesdetaljer

Neddrilling i mønsterdetaljer

Når du velger Detaljer på et ikke-bestått mønster, åpnes panelet Mønsterdetaljer . Den viser:

  • Mønsternavn og beskrivelse: Hva dette mønsteret sjekker.
  • Hvorfor det er viktig: Effekten av dette avviksmønsteret på agentkvaliteten.
  • Tabell for berørte emner: Hvert emne med sin nåværende verdi og KI-ens foreslåtte erstatning.
  • Anbefaling: En konkret handling for å løse problemet.
  • Mer informasjon: En direkte kobling til relevant Microsoft Learn-dokumentasjon.

Skjermbilde av panelet Mønsterdetaljer som viser mønsterbeskrivelse, berørte emner, anbefalinger og en kobling til mer informasjon.

Neddrilling i etterlevelsesdetaljer

Når du velger Detaljer på et ikke-bestått etterlevelsesvilkår, åpnes panelet Etterlevelsesdetaljer . Den viser:

  • Navn på vilkår, kategori og alvorsgrad
  • Hva vilkåret sjekker: En forklaring på enkelt språk
  • Spesifikt problem funnet: KI-ens analyse av hva som mangler eller er galt
  • Anbefaling: Eksakt språk eller mønstre som skal legges til agentens instruksjoner
  • Eksempel: Der det er tilgjengelig, et eksempel på en kompatibel instruksjon
  • Mer informasjon: Kobling til relevant Microsoft Learn-veiledning

Eksporter resultater

Du kan eksportere resultater i tre formater fra overskriften i gjennomgangspanelet.

PDF-rapport

En polert, lesbar PDF-rapport som egner seg for deling med interessenter eller som vedlegg til en styringsrevisjon.

Innhold:

  • Kortfattet sammendrag med poengsummer og nøkkelmålinger
  • Resultater fra mønsterevaluering (status, alvorsgrad, berørte emner)
  • Etterlevelsesfunn (alle 15 kriterier)
  • Anbefalinger for hvert problem som ble funnet
  • Agentmetadata (navn, miljø, gjennomgangsdato)

Filnavnmønster: {AgentName}_review_{YYYY-MM-DD}.pdf

PDF-filen genereres automatisk ved slutten av hver gjennomgang og lagres i Dataverse sammen med gjennomgangsoppføringen. Påfølgende nedlastinger henter den lagrede filen uten å kjøre analysen på nytt.

SARIF-eksport

SARIF (Static Analysis Results Interchange Format v2.1.0) er et JSON-format designet for integrasjon med utviklerverktøy og CI/CD-rørledninger.

Brukstilfeller:

  • Last opp til GitHub Advanced Security for SARIF-baserte PR-merknader
  • Importer til kvalitetssikringskontroller i Azure DevOps
  • Behandle med tredjepartsverktøy som bruker SARIF (SonarQube, Visual Studio Code osv.)

Oversikt over struktur:

{
  "version": "2.1.0",
  "runs": [{
    "tool": {
      "driver": {
        "name": "Copilot Studio Agent Review Tool",
        "version": "1.0"
      }
    },
    "results": [
      {
        "ruleId": "pat-007",
        "level": "error",
        "message": { "text": "Excessive Tools Usage: 28 tools exceed the recommended limit of 25" },
        "properties": {
          "category": "Architecture",
          "recommendation": "Reduce tool count to 25 or fewer"
        }
      }
    ]
  }]
}

Tildeling av alvorsgrad til SARIF-nivå:

  • Høy = "error"
  • Middels = "warning"
  • Lav = "note"

Filnavnmønster: {AgentName}_review.sarif

Excel-eksport

En Excel-arbeidsbok med flere ark for dataanalyse, rapportering og arkivering.

Ark Innhold
Sammendrag Én rad per gjennomgåtte agent – navn, poeng, antall problemer, gjennomgangsdato
Mønstre Alle de 18 mønstrene – ID, navn, kategori, alvorsgrad, status, berørte emner, anbefaling
Etterlevelse Alle de 15 kriteriene – ID, navn, kategori, alvorsgrad, status, antall problemer, anbefaling

Overskriftene er fete med bakgrunner i merkevarefarger. Celler for poengsum og alvorsgrad er fargekodet grønn, gul eller rød. Kolonnebreddene justeres automatisk.

Filnavnmønster: {AgentName}_review_{YYYY-MM-DD}.xlsx

Gjennomgang av deklarativ agent, dypdykk

Deklarative Microsoft 365-agenter er en annen type agent enn Copilot Studio-agenter. De defineres fullstendig av en JSON-manifestfil og distribueres til Microsoft 365-økosystemet.

Hva gjennomgangen av deklarativ agent sjekker

Gjennomgangen validerer først manifeststrukturen og sjekker at alle nødvendige felter er til stede, og at skjemaet er godt utformet. Deretter kjører den en KI-evaluering mot fem kvalitetskriterier og genererer en PDF-rapport. Etterlevelseskontrollen av instruksjoner, med 15 kriterier (spesifikt for Copilot Studio-agenter), brukes ikke her.

De 5 kriteriene for evaluering av deklarative agenter

Kriterium Vekt Hva som evalueres
Instruksjoner 30 % Klarhet, spesifikkhet og fullstendighet i agentens systeminstruks
Kunnskap 20 % Bruk av tilkoblede kunnskapskilder for forankring
Funksjoner 15 % Bruk av CodeInterpreter- og OneDriveAndSharePoint-funksjoner
Handlinger 15 % Tilstedeværelse av og kvalitet på verktøyhandlingsbeskrivelser
Samtalestartere 10 % Antall og kvalitet (minimum 3, anbefalt 6)
Smidig feilhåndtering 10 % Håndtering av ukjente inndata og feiltilstander

Tilstandskontroll av manifest (lokal validering)

Før KI-en kjører, valideres manifeststrukturen av en deterministisk tilstandskontroll:

  • Påkrevde felter til stede (name, description, instructions)
  • Kompatibilitet for skjemaversjon
  • Gyldige referanser til programtillegg for handling
  • Telling av samtalestarter innenfor grensene (3–12)
  • Kapabilitetsdeklarasjoner korrekt utformet

Eventuelle feil i tilstandskontrollen vises som problemer i gjennomgangsresultatene for den deklarative agenten, uavhengig av KI-evalueringen.

Send inn en deklarativ agent for gjennomgang

Gjennom ZIP-opplasting (vanligst):

  1. Eksporter den deklarative agenten fra forfatterverktøyet ditt som en ZIP-pakke.
  2. Velg Last opp ZIP i sideoverskriften i Verktøy for agentgjennomgang.
  3. Hvis ZIP-en inneholder flere agenter, kan du velge hvilken som skal gjennomgås, på et velgerpanel.
  4. Gjennomgangen kjører automatisk.

Gjennom Microsoft 365-katalogen (krever oppsett av Graph API):

  1. Velg Koble til Microsoft 365 på fanen Microsoft 365-agenter.
  2. Fullfør Graph API-autorisasjonsveiviseren.
  3. Dine implementerte deklarative agenter vises i rutenettet over deklarative agenter.
  4. Velg Gå gjennom for en hvilken som helst deklarativ agent.

Skjermbilde av panelet for gjennomgang av deklarative agenter som viser resultater av tilstandskontrollen av manifestet og KI-evalueringen.

Sikkerhet og datatilgang

Denne delen beskriver hvordan verktøyet for agentgjennomgang håndterer sikkerhet og datatilgang.

Datalagring

Alle gjennomgangsresultater lagres i cat_agentreviews Dataverse-tabellen. Hver oppføring lagrer:

Felt Innhold
cat_agentreviewsid Unik ID for gjennomgangsoppføring
cat_botid Referanse til agenten som er gjennomgått
cat_overallscore 0–100 total poengsum
cat_patternscore Evalueringspoeng for mønster
cat_instructionscore Etterlevelsespoeng for instruksjon
cat_totalissues Totalt antall problemer
cat_reviewresultjson Fullstendig gjennomgangsresultat som JSON
cat_reviewpdfreport_name PDF-rapport (Dataverse-filkolonne)
cat_sourceenvironment Nettadresse for kildemiljø eller zip
cat_agenttype 1 = Copilot Studio, 2 = deklarativ agent

Sikkerhet på radnivå

Tabellen cat_agentreviews bruker leseomgang på brukernivå (Basic) i Dataverse. Brukere kan kun se gjennomganger de har opprettet. En annen brukers gjennomganger er aldri synlige, selv ikke i samme miljø. Dataverse håndhever denne sikkerheten innebygd, ikke programkoden.

Kildemiljøer

Brukere kan gjennomgå agenter fra miljøer de har tilgang til, ikke bare det nåværende miljøet. Instrumentbordet støtter gjennomganger på tvers av miljøer gjennom miljøvelgeren. Gjennomganger fra andre miljøer er merket med nettadressen til kildemiljøet, slik at de vises korrekt når verktøyet lastes.

Gjennomganger hentet fra en ZIP-opplasting vises alltid, uansett hvilket miljø verktøyet er koblet til.

Hvilke data forlater miljøet

  • Agentens konfigurasjon (emner, verktøy, instruksjoner) sendes til KI-modellene via Dataverse PredictV2. Dette går gjennom standard oppkallsbane for KI-modellen i Dataverse og er underlagt de samme retningslinjene for datalagring som enhver KI-operasjon i Dataverse.
  • Ingen data sendes til en tredjepartstjeneste eller et ekstern endepunkt.
  • Gjennomgangsresultater (inkludert PDF-filen) lagres utelukkende i Dataverse.

Førstegangsopplevelse og velkomsttur

Første gang en bruker åpner verktøyet for agentgjennomgang, får de velkomstomvisning som veileder dem gjennom de viktigste delene av grensesnittet:

  1. Statistikkortene på instrumentbordet og hva de representerer
  2. Slik leser du agentrutenettet
  3. Slik starter du en gjennomgang
  4. Slik tolker du resultatene
  5. Eksportalternativene

Omvisningen fortsetter i Dataverse, så den gjentas ikke etter fullføring. Brukere kan åpne omvisningen når som helst fra Hjelp / Hurtigkoblinger i sideoverskriften.

Vanlige spørsmål

Denne delen tar for seg vanlige spørsmål om verktøyet for agentgjennomgang.

Hvor lang tid tar en gjennomgang?

En typisk agent med færre enn 20 emner blir ferdig på under 60 sekunder. Verktøyet har en fast tidsgrense på 2 minutter. Svært store agenter (flere enn 50 emner, mange verktøy) kan nærme seg grensen.

Endrer verktøyet agenten min?

Antall Verktøyet er fullstendig skrivebeskyttet når det gjelder agentdata. Det leser kun agentkonfigurasjonen. Alle skrivinger går til cat_agentreviews-tabellen.

Kan jeg gjennomgå en agent på nytt etter å ha gjort endringer?

Ja. Hver gjennomgang oppretter en ny oppføring. Rutenettet viser alltid den nyeste gjennomgangen. Gamle gjennomganger forblir i Dataverse og kan åpnes programmatisk om nødvendig.

Hva om agenten min er i et annet miljø?

Bruk miljøvelgeren på instrumentbordet for å peke verktøyet mot et annet miljø du har tilgang til. Gjennomgangen kjører mot det miljøet, og resultatet lagres i det nåværende miljøet.

Kan jeg gå gjennom agenter jeg ikke har opprettet?

Ja. Du kan gå gjennom en hvilken som helst agent du har lesetilgang til i Dataverse. Du kan imidlertid bare se gjennomganger du har opprettet (sikkerhet på radnivå). Gjennomganger fra andre brukere er ikke synlige.

Hva er SARIF, og trenger jeg det?

SARIF er et standardformat for statiske analyseresultater. Du trenger det bare hvis du integrerer agentens kvalitetskontroller i en CI/CD-rørledning (GitHub-handlinger eller Azure DevOps). For de fleste brukere er PDF- og Excel-eksport tilstrekkelig.

Verktøyet sier at agenten min ikke har noen instruksjoner. Er det et problem?

Ja. Verktøyet viser kun agenter som har generativ KI aktivert, så alle agenter i rutenettet forventes å ha instruksjoner. Hvis etterlevelseskontrollen ikke rapporterer noen instruksjoner, er agentens generative iverksetting aktiv, men ingen systeminstruksjoner er skrevet ennå. Det anbefales sterkt å legge til instruksjoner.

Hvorfor har «Identitet og tone» lav alvorsgrad?

Microsofts veiledning påpeker at en profesjonell, høflig tone allerede er standard atferd for Copilot Studio-agenter. Instruksjoner for tone er bare nødvendige hvis du vil ha en ikke-standard tone. Dette kriteriet er lavt fordi det sjelden fører til problemer for brukeren hvis det ikke er bestått.

Vil kjøring av en gjennomgang bruke Copilot-kreditter?

Ja. Hver gjennomgang kaller opp KI-modeller tre ganger – for mønsterevaluering, etterlevelse av instruksjoner og PDF-generering. Hvert oppkall bruker Copilot-kreditter fra leieren din. Å gjennomgå samme agent på nytt bruker også kreditter, så gjør endringene først og kjør deretter gjennomgangen på nytt.

Kan jeg eksportere alle gjennomganger samtidig?

Ja. Bruk knappen Eksporter Alle på verktøylinjen i agentrutenettet for å generere en Excel-arbeidsbok som dekker alle gjennomgåtte agenter i den nåværende visningen.