Analyser dine agenter ved hjælp af Agent-vurderingsværktøj l i Copilot Agent Kit

Agent-vurderingsværktøj er et automatiseret system til kvalitetsvurderings- og vurdering af overholdelse til Microsoft Copilot Studio-agenter og beskrivende Microsoft 365-agenter. Det hjælper udviklere, administratorer og styringsteams med at identificere problemer, anti-mønstre og manglende overholdelse før de når ud til slutbrugerne.

Efterhånden som organisationer skalerer deres Copilot Studio-udrulninger, bliver det umuligt at gennemgå hver agents konfiguration, instruktioner og emnestruktur manuelt. Agent-vurderingsværktøj automatiserer denne vurdering via AI-drevet analyse, der typisk giver handlingsorienterede resultater på under 60 sekunder.

Det er til:

  • Udviklere: Få handlingsorienteret feedback, og forbedr agenten før implementeringen.
  • Administratorer og CoE-teams: Håndhæv styringsstandarder for alle agenter i et miljø.
  • Sikkerheds- og overholdelsesansvarlige: Bekræft, at agenter følger retningslinjer for beskyttelse af personlige oplysninger, sikkerhed og nøjagtighed.

Nøglefunktioner

Egenskab Oplysninger
Agentdækning Copilot Studio-agenter og deklarative Microsoft 365-agenter
Vurderingstid Typisk under 60 sekunder pr. agent
Tjekkede mønstre 18 mønstre (10 deterministiske + 8 AI-drevne)
Overholdelseskriterier 15 undervisningskvalitetskriterier
Pointsystem 0–100 samlet score (50 % mønstre, 50 % overholdelse)
Eksportér formater PDF, SARIF og Excel
Datalagring Microsoft Dataverse (med brugeromfang og håndhævelse af sikkerhed på rækkeniveau)
AI-motor AI-prompter til Microsoft Copilot Studio via Dataverse PredictV2

Kom i gang: dashboardet

Når du åbner Agent-vurderingsværktøj, lander du på dashboardet, som er det centrale sted, der viser alle agenter i dit miljø og deres vurderingsstatus.

Dashboardlayout

Skærmbillede af dashboardet til Agent-vurderingsværktøj med statistikkort, agentgitter og knappen Upload ZIP-fil.

Dashboardet viser alt med en oversigt: Fanelinjen, der skifter mellem Copilot Studio- og Microsoft 365-agenter, fire statistikkort der opsummerer porteføljens status, en søgeværktøjslinje, det sideinddelte agentgitter og knappen Upload ZIP-fil til offline-vurderinger.

Statistikkort

De fire statistikkort giver dig et hurtigt overblik over din agentporteføljes status:

Kort Hvad det viser Hvordan det beregnes
Samlet antal agenter Tæl alle aktive robotter i miljøet. Spørg bot tabellen, hvor statecode = 0
Gennemset Antal og procentdel af agenter, der bliver gennemgået. Antal færdige anmeldelser divideret med det samlede antal agenter
Gennemsnitlig score Gennemsnitlig samlet score for alle gennemførte anmeldelser. Summen af scorer divideret med gennemgået antal
Samlede problemer Samlede problemer fundet hos alle gennemgåede agenter. Summen af mønsterfejl plus overholdelsesfejl

Agentgitter

Column Indhold
Navn Agentens viste navn med ikon.
Score Samlet vurderingsscore (0–100), eller -- hvis det endnu ikke er gennemgået. Farvekodet.
Problemer Oversigt over fund ved høj, mellemhøj og lav alvorlighedsgrad. --, hvis det ikke er gennemgået.
Sidst gennemgået Relativ tid (for eksempel "for 2 timer siden" eller "for 1 uge siden") eller "Ikke gennemgået".
Handlinger Vurdering for agenter, der ikke er gennemgået. Vis for agenter med nuværende gennemgange.

Vælg et miljø

Som standard viser værktøjet agenter fra det miljø, hvor du installerede den. Hvis du skal gennemgå en agent fra et andet miljø, skal du bruge miljøvælgeren i dashboard-værktøjslinjen. Rullemenuen viser alle de Power Platform-miljøer, du har adgang til.

Når du har valgt et andet miljø, opdateres agentgitteret og viser agenter fra det pågældende miljø. Herefter kan du gennemgå en af disse agenter. Vurderingsresultatet gemmes i det nuværende miljø (start) – ikke i det, du har valgt.

Skærmbillede af rullemenuen til at vælge miljø, der viser tilgængelige Power Platform-miljøer.

Vurderingstilstande

Værktøjet understøtter to forskellige vurderingstilstande, som kan tilgås fra fanelinjen øverst på dashboardet.

Vurdering af Copilot Studio-agent

Denne tilstand gennemgår agenter, der er i Microsoft Copilot Studio. Den læses direkte fra Dataverse – ingen filupload er nødvendig.

Hvad den analyserer:

  • Emnekonfigurationer (navne, beskrivelser og variabler).
  • Værktøjs- og handlingskonfigurationer (antal, beskrivelser, routing).
  • Typer af videnkilder.
  • Testsagsdækning.
  • Agentinstruktioner (generativ tilstand).
  • Agentmetadata (sprog, godkendelse og AI-indstillinger).

Sådan startes en vurdering:

  1. Find din agent i gitteret.
  2. Vælg Gennemse. Analysen starter automatisk.
  3. Et statuspanel viser, hvad der sker i realtid.
  4. Resultaterne åbner i vurderingspanelet, når de er færdige.

Du kan altid gennemgå enhver agent igen. Hver vurdering opretter en ny post i Dataverse. Gitteret viser altid det seneste vurderingsresultat.

Vurdering af deklarativ Microsoft 365 Copilot-agent

Denne tilstand gennemgår deklarative Microsoft 365-agenter, som defineres af en JSON-manifestfil og implementeres i Microsoft 365 Copilot-økosystemet.

Du kan få en deklarativ agent vurderet på to måder:

Metode Hvordan Bruges hvornår
Upload ZIP-fil Vælg Upload ZIP-fil i sideoverskriften. Vælg den eksporterede pakke. Agenten er fra en anden lejer eller ikke i dit katalog.
Fra Microsoft 365-kataloget Opret forbindelse til Microsoft 365 via Graph API-opsætningsguiden, og gennemse agenter. Agenten er udrullet i din Microsoft 365-lejer.

Hvad den analyserer (5 kriterier – ikke 15):

Kriterium Vægt Dette er tjekket
Instruktioner 30 % Klarhed, fuldstændighed og kvalitet i instruktionerne til agenten
Viden 20 % Forankring gennem forbundne videnskilder
Funktioner 15 % Brug af CodeInterpreter og OneDriveAndSharePoint
Handlinger 15 % Værktøjsrouting og handlingsbeskrivelser
Samtalestartere 10 % Minimum 3, anbefalet 6 (maksimum 12)
Elegant fejlhåndtering 10 % Fejlgendannelse og fallback-adfærd

Bemærk!

Kontrollen af overholdelse af instruktionerne, der omfatter 15 kriterier, gælder udelukkende for Copilot Studio-agenter og gælder ikke for deklarative agenter.

Hvad der sker under en vurdering

Når du vælger Vurdering, kører værktøjet en automatiseret analyse, som typisk gennemføres på under 60 sekunder. Et statuspanel holder dig informeret, mens det arbejder.

Skærmbillede af panelet til vurderingsstatus med de trin, der udføres under en agentgennemgang.

Analysen dækker tre ting i rækkefølge:

  1. Konfigurationsanalyse: Værktøjet læser agentens komplette konfiguration fra Dataverse – hvert emne, værktøj, videnskilde, testsag og instruktion. Det søger efter manglende felter i alle komponenter og måler ting som værktøjsantal og testdækning i forhold til Microsofts dokumenterede bedste praksis.
  2. AI-drevet mønstervurdering: En AI-model vurdere den samme konfiguration for at evaluere kvalitet – ikke blot fuldstændighed. Den undersøger, om emnenavne og beskrivelser er klare nok til, at den generative organisator kan route korrekt, om flere emner overlapper på måder, der skaber routing-forvirring, og om værktøjsbeskrivelser giver den kunstige intelligens vejledning nok til at aktivere det rigtige værktøj på det rigtige tidspunkt.
  3. Kontrol af instruktionsoverholdelse: En anden AI-model læser agentens systeminstruktioner og kontrollerer dem i forhold til 15 kriterier for bedste praksis fra Microsofts generative tilstandsvejledning, der dækker omfang, sikkerhed, svarkvalitet og brugeroplevelse. Hvert kriterium, som instruktionerne ikke opfylder, resulterer i et specifikt fund og en konkret anbefaling.

Når alle tre trin er gennemført, genereres en PDF-rapport automatisk, og resultaterne åbnes i vurderingspanelet.

Vigtigt!

Hver vurdering bruger Copilot-credits. De AI-drevne trin (mønsterevaluering, instruktionsoverholdelseskontrol og PDF-generering) aktiverer hver især en AI-model via Dataverse. Planlæg derefter, hvis du gennemgår et stort antal agenter.

Registrerede mønstre

Mønstre identificerer specifikke anti-mønstre eller manglende bedste praksis i en agents konfiguration. Værktøjet tjekker 18 mønstre i syv kategorier.

Alle 18 mønstre

Id Mønsternavn Kategori Effekt
pat-001 Manglende modelnavn Modelnavngivning Den generative organisator kan ikke videresende pålideligt til dette emne.
pat-002 Manglende modelbeskrivelse Modelbeskrivelse Emnet kan blive sprunget over eller fejlagtigt udløst under routing.
pat-003 Manglende navn på inputvariabel Inputvariabler Brugere ser unavngivne variabler, hvilket skaber forvirring i samtalen.
pat-004 Beskrivelse af manglende inputvariabel Inputvariabler Den kunstige intelligens kan ikke udtrække den rigtige værdi korrekt fra brugerinput.
pat-005 Manglende navn på outputvariabel Outputvariabler Outputværdierne er umærkede og svære for brugerne at tolke.
pat-006 Beskrivelse af manglende outputvariabel Outputvariabler AI mangler kontekst til at udfylde variablen korrekt.
pat-007 Overdreven brug af værktøjer Arkitektur For mange værktøjer forringer routing-nøjagtigheden og øger ventetiden.
pat-008 Utilstrækkelige testtilfælde Evaluering Regressioner i emneadfærd opdages ikke før implementering.
pat-009 Beskrivelse af manglende underordnet agent Arkitektur Organisatoren kan ikke beslutte, hvornår han den underordnede agent skal delegeres.
pat-010 Udbredelse af underordnet agents arkitektur Arkitektur Overdreven delegering skaber orkestreringskompleksitet og ventetid.
pat-011 Uklart modelnavn Modelnavngivning Vage navne får organisatoren til at gå til det forkerte emne.
pat-012 Uklar modelbeskrivelse Modelbeskrivelse Dårlige beskrivelser fører til oversete eller forkerte emneudløsere.
pat-013 Uklart navn på inputvariabel Inputvariabler Tvetydige navne gør det sværere for den kunstige intelligens at udfylde variablen korrekt.
pat-014 Uklar beskrivelse af inputvariabelen Inputvariabler Den kunstige intelligens udtrækker den forkerte værdi eller stiller unødvendige opklarende spørgsmål.
pat-015 Uklart navn på outputvariabel Outputvariabler Downstream-emner eller -flow, der forbruger denne variabel, kan misforstå den.
pat-016 Uklar beskrivelse af outputvariabelen Outputvariabler Den kunstige intelligens kan ikke pålideligt producere forventet outputformat eller -værdi.
pat-017 Overlappende emnebeskrivelser Modelbeskrivelse Flere emner konkurrerer om de samme brugerudtalelser, hvilket forårsager uforudsigelig routing.
pat-018 Værktøjsrouting-mangel Arkitektur Den kunstige intelligens kan ikke beslutte, hvilket værktøj den skal kalde, hvilket fører til forkerte værktøjskald eller ingen handling.

For hvert fejlramt mønster viser værktøjet, hvilke emner der er påvirket, den aktuelle værdi, der udløste resultatet, en foreslået forbedring og et link til den relevante Microsoft Learn-dokumentation.

Skærmbillede af fanen Mønstre, der viser alle 18 mønstre med status, alvorlighedsgrad, kategori og antal berørte emner.

Mønsterkategorier

Resultatgitteret grupperer mønstre i syv kategorier i følgende rækkefølge:

# Kategori Inkluderede mønstre
1 Modelnavngivning pat-001, pat-011
2 Modelbeskrivelse pat-002, pat-012, pat-017
3 Inputvariabler pat-003, pat-004, pat-013, pat-014
4 Outputvariabler pat-005, pat-006, pat-015, pat-016
5 Arkitektur pat-007, pat-009, pat-010, pat-018
6 Orkestrering Reserveret til fremtidige mønstre, der registreres af den kunstige intelligens
7 Evaluering pat-008

Alvorlighedslogik

Kombinationen af nøgleord, der matcher, og emneantal bestemmer mønsterets alvorlighedsgrad:

Betingelse Tildelt alvorlighedsgrad
Mønsternavnet indeholder "modelnavn" eller "modelbeskrivelse" High
Mønsternavnet indeholder "variabel" Medium (medmindre emnetællingen er 5 eller flere)
Antallet af emner er 5 eller flere High
Antallet af emner er 2 eller flere Medium
Antal emner: 1 Lav

Alvorligheden styrer både det visuelle mærke i resultatgitteret og SARIF-fejlniveauet i den eksporterede rapport.

Overholdelseskriterier

Denne del af vurderingen evaluerer kvaliteten af en agents systeminstruktioner – den naturlige tekst, som en udvikler leverer i Copilot Studios Generative indstillinger. Disse instruktioner definerer, hvordan agenten opfører sig i alle samtaler.

De 15 kriterier stammer fra Microsofts vejledning om generativ tilstand og repræsenterer de mest effektive bedste praksisser for undervisningskvalitet.

Alle 15 kriterier

# Id Kriterienavn Kategori Alvorlighedsgrad Hvad der kontrolleres
1 scope-definition Definition af omfang Område Høj Agentinstruktioner definerer eksplicit, hvilke emner agenten bør og ikke bør svare på.
2 out-of-scope-handling Håndtering uden for område Område Mellem Instruktioner angiver, hvad der skal siges, når en bruger spørger om noget uden for agentens område.
3 persona-and-tone Karakter og tone UX Lav Instruktioner definerer tone for scenarier, der ikke er standard. (Professionelt/høfligt er allerede standard – spring dette over, hvis det ikke er nødvendigt.)
4 privacy-and-sensitive-data Beskyttelse af personlige oplysninger og følsomme data Sikkerhed Høj Instruktionerne indeholder eksplicit vejledning om ikke at gemme, vise eller gentage personlige data.
5 fallback-when-uncertain Tilbagefald når det er usikkert Kvalitet Høj Instruktionerne angiver, hvad der skal gøres, når agenten ikke har de nødvendige oplysninger til at svare.
6 citations-and-sources Citater og kilder Kvalitet Mellem Instruktioner kræver, at agenten citerer dokumentnavne og sektioner, når der henvises til videnskilder.
7 formatting-guidelines Retningslinjer til formatering UX Lav Instruktioner specificerer svarformat (punktlister, tabeller og nummererede trin) for struktureret output.
8 clarifying-questions Præciserende spørgsmål UX Mellem Vejledningen beskriver, hvordan man tvetydige forespørgsler håndteres ved hjælp af afklarende opfølgningsspørgsmål.
9 prompt-injection-resilience Beskyttelse mod hurtig injektion Sikkerhed Høj Instruktionerne indeholder eksplicitte sikkerhedsforanstaltninger mod jailbreak-forsøg eller hurtig injektion.
10 link-safety Linksikkerhed Sikkerhed Mellem Instruktioner sørger for, at kun verificerede, sikre links deles med brugerne.
11 advice-disclaimers Rådgivningsansvarsfraskrivelser Sikkerhed Høj Instruktionerne indeholder ansvarsfraskrivelser for følsomme rådgivningsområder (finans, sundhed eller jura).
12 accuracy-quality Nøjagtighed og kvalitet Kvalitet Høj Instruktionerne forankrer eksplicit agenten i dens videnskilder og forbyder fabrikation eller gætteri.
13 tool-routing-hints Tip til routing af værktøj Kvalitet Mellem Instruktionerne giver vejledning om, hvilke værktøjer eller videnskilder der skal bruges, når routing er tvetydig.
14 escalation-guidance Vejledning om eskalering UX Høj Instruktioner definerer, hvad der skal gøres, når agenten ikke kan hjælpe: aflevere til et menneske, foreslå et alternativ eller afslutte på høflig vis.
15 deterministic-language Deterministisk sprog Kvalitet Mellem I instruktionerne anvendes absolutte udtryk (altid, aldrig, kun og skal) frem for vage formuleringer (måske, normalt, prøv og nogle gange).

Skærmbillede af fanen Overholdelse, der viser de 15 instruktionskvalitetskriterier med status og alvorlighed.

Kategoriopdeling

Kategori Antal kriterier Fokus
Område 2 Definerer, hvad agenten svarer på og ikke svarer på
Sikkerhed 4 Beskytter brugere mod misinformation, datalækager og manipulation
Kvalitet 5 Sikrer præcise, jordnære og velstrukturerede svar
UX 4 Former samtaleoplevelsen og eskaleringsvejene

Hvordan scores beregnes

Alle scores er på en skala fra 0-100 og er deterministiske. De samme input giver altid samme score.

Mønsterscore

Pattern Score = (Passed Patterns / Total Patterns) × 100
  • Samlede mønstre = 10 deterministiske + hvor mange AI-registrerede mønstre der returneres (op til 8).
  • Godkendte mønstre = optælling, hvor mønsterstatussen er pass.
  • Resultatet afrundes til nærmeste heltal.

Eksempel: 15 mønstre i alt, 12 bestået = Mønsterscore på 80.

Instruktionsscore

Instruktionsscoren bruger et vægtet pointsystem baseret på den iboende sværhedsgrad af hvert kriterium:

Iboende sværhedsgrad Point ved bestået Antal kriterier Maks. point
Høj 3 7 21
Mellem 2 6 12
Lav 1 2 2
I alt 15 35
Instruction Score = (Earned Points / 35) × 100
  • For hvert af de 15 kriterier tilføjes de indbyggede alvorlighedspoint, hvis der ikke konstateres nogen fejl i forbindelse med det pågældende kriterium.
  • Hvis "manglende instruktioner" opdages, opfyldes ingen kriterier, og scoren er 0.
  • Resultatet fastgøres til 100 og afrundes til det nærmeste heltal.

Eksempel: 3 høje og 2 mellemstore kriterier godkendes ikke:

  • Opnåede point: (4 × 3) + (4 × 2) + (2 × 1) = 12 + 8 + 2 = 22 point.
  • Score = (22 / 35) × 100 = 63.

Samlet score

Overall Score = (Pattern Score × 0.5) + (Instruction Score × 0.5)

Begge dimensioner har lige stor vægt. Hvis der kun er én dimension til rådighed (for eksempel hvis der ikke findes nogen instruktioner), anvendes denne dimensions score direkte.

Vejledning til scorefarve og -mærkat

Scoreinterval Mærkat Farve
80 og derover Udmærket Grøn
60 til 79 God Gul
40 til 59 Rimelig Rød
Under 40 Skal forbedres Rød

Gennemse resultater

Når gennemgangen er afsluttet, viser bedømmelsespanelet resultaterne. Panelet har tre faner.

Fanen Oversigt

Fanen Oversigt giver dig et overordnet overblik:

  • Samlet score: En cirkulær måler i grøn, rav eller rød.
  • Mønsterscore og instruktionsscore side om side.
  • Agentmetadata: Navn, miljø, sprog, godkendelsestilstand og AI-indstillinger.
  • AI-genereret resumé: En naturlig beskrivelse af de mest betydningsfulde resultater.
  • Vurderingstidsstempel og datakilde (live miljø eller ZIP-upload).

Skærmbillede af fanen Oversigt i panelet Vurdering, der viser den samlede score, mønster- og instruktionsscorer samt AI-oversigt.

Fanen Mønstre

Fanen Mønstre viser hele gitteret med alle 18 evaluerede mønstre med disse kolonner:

Column Beskrivelse
Status Bestået eller ikke bestået
Alvorlighedsgrad Mærke: Høj, Mellem eller Lav
Kategori Mønsterkategori (Modelnavngivning, Arkitektur osv.)
Mønsternavn Fuldt mønsternavn
Berørte emner Antal emner, der er påvirket af dette mønster
Handlinger Detaljeknappen til at åbne panelet Mønsterdetaljer

Du kan sortere gitteret efter enhver kolonne. Som standard vises fejlmønstre først, sorteret efter sværhedsgrad (Høj og derefter Mellem og Lav).

Fanen Overholdelse af angivne standarder

Fanen Overholdelse af angivne standarder viser alle 15 instruktionskriterier:

Column Beskrivelse
Status Bestået eller ikke bestået
Alvorlighedsgrad Mærke: Høj, Mellem eller Lav
Kategori Omfang, sikkerhed, kvalitet eller brugeroplevelse
Kriterienavn Fuldt kriterienavn
Der blev fundet problemer Antal specifikke problemer under dette kriterium
Handlinger Detaljeknappen til at åbne panelet Oplysninger om overholdelse af angivne standarder

Detaljeret oversigt over mønsteret

Når du vælger Detaljer på et mislykket mønster, åbner panelet Mønsterdetaljer . Det viser:

  • Mønsternavn og beskrivelse: Hvad dette mønster tjekker.
  • Hvorfor det er vigtigt: Effekten af dette anti-mønster for agentkvaliteten.
  • Tabel over berørte emner: Hvert emne med dets nuværende værdi og AI'ens foreslåede erstatning.
  • Anbefaling: En konkret handling for at løse problemet.
  • Læs mere: Et direkte link til den relevante Microsoft Learn-dokumentation.

Skærmbillede af panelet Mønsterdetaljer, der viser mønsterbeskrivelse, berørte emner, anbefalinger og linket Få mere at vide.

Detaljeret oversigt over overholdelse

Når du vælger Detaljer om et fejlramt overholdelseskriterium, åbnes panelet Detaljer om overholdelse . Det viser:

  • Kriteriums navn, kategori og alvorlighedsgrad
  • Hvad kriteriet tjekker: En forklaring på almindeligt dansk sprog
  • Specifikt problem fundet: AI'ens analyse af, hvad der mangler eller er forkert
  • Anbefaling: Præcist sprog eller mønstre, der skal tilføjes til agentens instruktioner
  • Eksempel: Hvor tilgængeligt: Et eksempel på en instruktion, der overholder kravene, hvis det er muligt
  • Få mere at vide: Link til den relevante vejledning fra Microsoft Learn

Eksportresultater

Du kan eksportere resultater i tre formater fra vurderingspanelets header.

PDF-rapport

En velformuleret, letlæselig PDF-rapport, der er velegnet til at blive delt med interessenter eller vedlagt en styringsrevision.

Indhold:

  • Ledelsesresumé med scorer og nøglemålinger
  • Resultater fra mønsterevaluering (status, alvorlighedsgrad og berørte personer)
  • Overholdelsesresultater (alle 15 kriterier)
  • Anbefalinger for hvert fundet problem
  • Agentmetadata (navn, miljø og vurderingsdato)

Filnavnsmønster: {AgentName}_review_{YYYY-MM-DD}.pdf

PDF'en genereres automatisk i slutningen af hver anmeldelse og gemmes i Dataverse sammen med vurderingsoplysningen. Efterfølgende downloads henter den gemte fil uden at gentage analysen.

SARIF-eksport

SARIF (Static Analysis Results Interchange Format v2.1.0) er et JSON-format designet til integration med udviklerværktøjer og CI/CD-pipelines.

Brugsscenarier:

  • Upload til GitHub Advanced Security for SARIF-baserede PR-annoteringer
  • Importer til Azure DevOps-kvalitetskontrol
  • Proces med tredjepartsværktøjer, der bruger SARIF (SonarQube, Visual Studio Code osv.)

Oversigt over struktur:

{
  "version": "2.1.0",
  "runs": [{
    "tool": {
      "driver": {
        "name": "Copilot Studio Agent Review Tool",
        "version": "1.0"
      }
    },
    "results": [
      {
        "ruleId": "pat-007",
        "level": "error",
        "message": { "text": "Excessive Tools Usage: 28 tools exceed the recommended limit of 25" },
        "properties": {
          "category": "Architecture",
          "recommendation": "Reduce tool count to 25 or fewer"
        }
      }
    ]
  }]
}

Tilknytning af alvorlighedsgrader til SARIF-niveauer:

  • Høj = "error"
  • Medium = "warning"
  • Lav = "note"

Filnavnsmønster: {AgentName}_review.sarif

Eksporter til Excel

En Excel-arbejdsbog med flere ark til dataanalyse, rapportering og arkivering.

Ark Indhold
Oversigt Én række pr. vurderet agent – navn, scorer, antal udgivelser og vurderingsdato
Mønstre Alle 18 mønstre – ID, navn, kategori, alvorlighedsgrad, status, berørte emner og anbefaling
Overholdelse Alle 15 kriterier – ID, navn, kategori, alvorlighedsgrad, status, antal problemer og anbefaling

Overskrifterne med fed skrift og baggrunde i logofarver. Score- og alvorlighedsgradsceller er med grønne, gule eller røde farvekoder. Kolonnebredderne justeres automatisk.

Filnavnsmønster: {AgentName}_review_{YYYY-MM-DD}.xlsx

En dybdegående gennemgang af beskrivende agenter

Beskrivende Microsoft 365-agenter er en anden type agenter end Copilot Studio-agenter. De er defineret udelukkende af en JSON-manifestfil og implementeret i Microsoft 365-økosystemet.

Dette tjekker den beskrivende agent

Vurderingen validerer først manifeststrukturen og kontrollerer, at alle nødvendige felter er til stede, og at skemaet er velformuleret. Derefter kører den en AI-evaluering mod fem kvalitetskriterier og genererer en PDF-rapport. Kontrollen af overholdelsen af de 15 kriterier (der gælder specifikt for Copilot Studio-agenter) gælder ikke her.

De 5 kriterier for vurdering af beskrivende agenter

Kriterium Vægt Hvad der vurderes
Instruktioner 30 % Agentens systemprompts tydelighed, specificitet og fuldstændighed
Viden 20 % Brug af forbundne videnskilder til jordforbindelse
Funktioner 15 % Brug af CodeInterpreter og OneDriveAndSharePoint-funktioner
Handlinger 15 % Forekomst og kvalitet af beskrivelser af værktøjets funktion
Samtalestartere 10 % Antal og kvalitet (minimum 3 – 6 anbefales)
Elegant fejlhåndtering 10 % Håndtering af ukendte input og fejltilstande

Kontrol af manifestkvaliteten (lokal validering)

Før den kunstige intelligens kører, validerer en deterministisk sundhedskontrol manifeststrukturen:

  • Påkrævede felter til stede (name, description, instructions)
  • Kompatibilitet mellem skemaversioner
  • Henvisninger til handlings-plugins er gyldige
  • Antallet af samtaleemner ligger inden for rammerne (3–12)
  • Korrekt udformede erklæringer om kapacitet

Eventuelle fejl i sundhedstjekket vises som problemer i resultaterne af vurderingen af den beskrivende agent, uafhængigt af AI-evalueringen.

Få en beskrivende agent vurderet

Via ZIP-upload (mest almindeligt):

  1. Eksporter den beskrivende agent fra dit forfatterværktøj som en ZIP-pakke.
  2. Vælg Upload ZIP i sideoverskriften til Agent-gennemgangsværktøjet.
  3. Hvis ZIP-filen indeholder flere agenter, kan du via et valgpanel vælge, hvilken du vil gennemgå.
  4. Gennemgangen kører automatisk.

Via Microsoft 365-kataloget (kræver opsætning af Graph API):

  1. Vælg Opret forbindelse til Microsoft 365 i fanen Microsoft 365-agenter.
  2. Fuldfør Graph API-godkendelsesguiden.
  3. Dine udsendte beskrivende agenter vises i gitteret Beskrivende agent.
  4. Vælg Vurdering ud for enhver beskrivende agent.

Skærmbillede af panelet til vurdering af beskrivende agenter, der viser resultater af manifestkontrollen og AI-evalueringen.

Sikkerhed og dataadgang

Dette afsnit beskriver, hvordan Agent-gennemgangsværktøj håndterer sikkerhed og dataadgang.

Datalagring

Alle gennemgangsresultater gemmes i cat_agentreviews Dataverse-tabellen . Hver post opbevarer:

Felt Indhold
cat_agentreviewsid Unikt gennemgangspost-ID
cat_botid Henvisning til den vurderede agent
cat_overallscore Samlet score: 0–100
cat_patternscore Mønsterevalueringsscore
cat_instructionscore Instruktionsoverholdelsesscore
cat_totalissues Samlet antal problemer
cat_reviewresultjson Fuldt gennemgangsresultat som JSON
cat_reviewpdfreport_name PDF-rapport (Dataverse-filkolonne)
cat_sourceenvironment URL til kildemiljøet eller zip
cat_agenttype 1 = Copilot Studio, 2 = beskrivende agent

Sikkerhed på rækkeniveau

Tabellen cat_agentreviews anvender læseomfang på brugerniveau (Basic) i Dataverse. Brugere kan kun se vurderinger, de selv har oprettet. En anden brugers vurdering er aldrig synlige – selv ikke i det samme miljø. Dataverse håndhæver denne sikkerhed integreret – ikke applikationskoden.

Kildemiljøer

Brugere kan gennemgå agenter fra miljøer, de har adgang til – ikke kun det nuværende miljø. Dashboardet understøtter vurderinger til flere miljøer via miljøvælgeren. Anmeldelser fra andre miljøer er tagget med kilde-miljøets URL, så de vises korrekt, når værktøjet indlæses.

Anmeldelser fra en ZIP-upload vises altid, uanset hvilket miljø værktøjet er forbundet til.

Hvilke data der forlader miljøet

  • Agentens konfiguration (emner, værktøjer og instruktioner) sendes til AI-modellerne via Dataverse PredictV2. Dette følger den almindelige Dataverse AI-modelaktiveringssti og er underlagt de samme dataopbevaringspolitikker som enhver Dataverse AI-handling.
  • Der sendes ingen data til tredjepartstjenester eller eksterne slutpunkter.
  • Vurderingsresultaterne (inklusive PDF'en) gemmes udelukkende i Dataverse.

Første oplevelse og velkomstrundvisning

Første gang en bruger åbner Agent-gennemgangsværktøj, guider en velkomstrundvisning brugeren gennem de vigtigste dele af grænsefladen:

  1. Dashboard-kortene med statistik, og hvad de repræsenterer
  2. Sådan læser du agentgitteret
  3. Sådan starter du en vurdering
  4. Sådan fortolker du resultaterne
  5. Eksportindstillingerne

Gennemgangen gemmes i Dataverse, så den gentages ikke, når den er afsluttet. Brugere kan genåbne rundvisningen når som helst i sektionen Hjælp/Hurtige links i sideoverskriften.

Ofte stillede spørgsmål

Dette afsnit omhandler almindelige spørgsmål om Agent-gennemgangsværktøj.

Hvor lang tid tager en vurdering?

En typisk agent med færre end 20 emner bliver vurderet på under 60 sekunder. Værktøjet har en 2-minutters hård timeout. Meget store agenter (mere end 50 emner og mange værktøjer) kan nærme sig grænsen.

Ændrer værktøjet min agent?

Antal Værktøjet er fuldstændig skrivebeskyttet med hensyn til agentdata. Det læser kun agentkonfigurationen. Alt, der skrives, overføres til cat_agentreviews-tabellen .

Kan jeg vurdere en agent igen, når jeg har lavet ændringer?

Ja. Hver vurdering opretter en ny post. Gitteret viser altid den seneste vurdering. Gamle vurderinger forbliver i Dataverse og kan tilgås programmatisk, hvis det er nødvendigt.

Hvad hvis min agent er i et andet miljø?

Brug miljøvælgeren på dashboardet til at pege værktøjet mod et andet miljø, du har adgang til. Vurderingen køres i forhold til dette miljø, og resultatet gemmes i det nuværende miljø.

Kan jeg vurdere agenter, jeg ikke har oprettet?

Ja. Du kan vurdere enhver agent, du har læseadgang til, i Dataverse. Du kan dog kun se vurderinger, du har oprettet (sikkerheden på rækkeniveau). Vurderinger fra andre brugere er ikke synlige.

Hvad er SARIF, og har jeg brug for det?

SARIF er et standardformat for statiske analyseresultater. Du har kun brug for det, hvis du integrerer agentens kvalitetskontrol i en CI/CD-pipeline (GitHub Actions eller Azure DevOps). For de fleste brugere er PDF- og Excel-eksport tilstrækkeligt.

Værktøjet siger, at min agent ikke har nogen instruktioner. Er det et problem?

Ja. Værktøjet viser kun agenter, der har generativ AI aktiveret, så hver agent i gitteret forventes at have instruktioner. Hvis overholdelseskontrollen ikke rapporterer nogen instruktioner, er agentens generative orkestrering aktiv, men der er endnu ikke skrevet systeminstruktioner. Det anbefales kraftigt at tilføje instruktioner.

Hvorfor er Lav alvorlighedsgrad for "Karakter og tone"?

Microsofts vejledning bemærker, at en professionel og høflig tone allerede er standardadfærden for Copilot Studio-agenter. Instruktioner til tone er kun nødvendige, hvis du ønsker en ikke-standard tone. Dette kriterium er lavt, fordi fejl sjældent forårsager problemer for brugere.

Koster det Copilot-kredit at udføre en vurdering?

Ja. Hver vurdering aktiverer AI-modeller tre gange – til mønsterevaluering, instruktionsoverholdelse og PDF-generering. Hver aktivering bruger Copilot-kredit fra din lejer. Nye vurderinger af den samme agent bruger også kredit, så lav dine ændringer først, og udfør vurderingen igen.

Kan jeg eksportere alle vurderinger på én gang?

Ja. Brug knappen Eksporter Alle i agentens gitterværktøjslinje til at generere en Excel-arbejdsbog, der dækker alle vurderede agenter i den aktuelle visning.