Bemærk
Adgang til denne side kræver godkendelse. Du kan prøve at logge på eller ændre mapper.
Adgang til denne side kræver godkendelse. Du kan prøve at ændre mapper.
Agent-vurderingsværktøj er et automatiseret system til kvalitetsvurderings- og vurdering af overholdelse til Microsoft Copilot Studio-agenter og beskrivende Microsoft 365-agenter. Det hjælper udviklere, administratorer og styringsteams med at identificere problemer, anti-mønstre og manglende overholdelse før de når ud til slutbrugerne.
Efterhånden som organisationer skalerer deres Copilot Studio-udrulninger, bliver det umuligt at gennemgå hver agents konfiguration, instruktioner og emnestruktur manuelt. Agent-vurderingsværktøj automatiserer denne vurdering via AI-drevet analyse, der typisk giver handlingsorienterede resultater på under 60 sekunder.
Det er til:
- Udviklere: Få handlingsorienteret feedback, og forbedr agenten før implementeringen.
- Administratorer og CoE-teams: Håndhæv styringsstandarder for alle agenter i et miljø.
- Sikkerheds- og overholdelsesansvarlige: Bekræft, at agenter følger retningslinjer for beskyttelse af personlige oplysninger, sikkerhed og nøjagtighed.
Nøglefunktioner
| Egenskab | Oplysninger |
|---|---|
| Agentdækning | Copilot Studio-agenter og deklarative Microsoft 365-agenter |
| Vurderingstid | Typisk under 60 sekunder pr. agent |
| Tjekkede mønstre | 18 mønstre (10 deterministiske + 8 AI-drevne) |
| Overholdelseskriterier | 15 undervisningskvalitetskriterier |
| Pointsystem | 0–100 samlet score (50 % mønstre, 50 % overholdelse) |
| Eksportér formater | PDF, SARIF og Excel |
| Datalagring | Microsoft Dataverse (med brugeromfang og håndhævelse af sikkerhed på rækkeniveau) |
| AI-motor | AI-prompter til Microsoft Copilot Studio via Dataverse PredictV2 |
Kom i gang: dashboardet
Når du åbner Agent-vurderingsværktøj, lander du på dashboardet, som er det centrale sted, der viser alle agenter i dit miljø og deres vurderingsstatus.
Dashboardlayout
Dashboardet viser alt med en oversigt: Fanelinjen, der skifter mellem Copilot Studio- og Microsoft 365-agenter, fire statistikkort der opsummerer porteføljens status, en søgeværktøjslinje, det sideinddelte agentgitter og knappen Upload ZIP-fil til offline-vurderinger.
Statistikkort
De fire statistikkort giver dig et hurtigt overblik over din agentporteføljes status:
| Kort | Hvad det viser | Hvordan det beregnes |
|---|---|---|
| Samlet antal agenter | Tæl alle aktive robotter i miljøet. | Spørg bot tabellen, hvor statecode = 0 |
| Gennemset | Antal og procentdel af agenter, der bliver gennemgået. | Antal færdige anmeldelser divideret med det samlede antal agenter |
| Gennemsnitlig score | Gennemsnitlig samlet score for alle gennemførte anmeldelser. | Summen af scorer divideret med gennemgået antal |
| Samlede problemer | Samlede problemer fundet hos alle gennemgåede agenter. | Summen af mønsterfejl plus overholdelsesfejl |
Agentgitter
| Column | Indhold |
|---|---|
| Navn | Agentens viste navn med ikon. |
| Score | Samlet vurderingsscore (0–100), eller -- hvis det endnu ikke er gennemgået. Farvekodet. |
| Problemer | Oversigt over fund ved høj, mellemhøj og lav alvorlighedsgrad.
--, hvis det ikke er gennemgået. |
| Sidst gennemgået | Relativ tid (for eksempel "for 2 timer siden" eller "for 1 uge siden") eller "Ikke gennemgået". |
| Handlinger | Vurdering for agenter, der ikke er gennemgået. Vis for agenter med nuværende gennemgange. |
Vælg et miljø
Som standard viser værktøjet agenter fra det miljø, hvor du installerede den. Hvis du skal gennemgå en agent fra et andet miljø, skal du bruge miljøvælgeren i dashboard-værktøjslinjen. Rullemenuen viser alle de Power Platform-miljøer, du har adgang til.
Når du har valgt et andet miljø, opdateres agentgitteret og viser agenter fra det pågældende miljø. Herefter kan du gennemgå en af disse agenter. Vurderingsresultatet gemmes i det nuværende miljø (start) – ikke i det, du har valgt.
Vurderingstilstande
Værktøjet understøtter to forskellige vurderingstilstande, som kan tilgås fra fanelinjen øverst på dashboardet.
Vurdering af Copilot Studio-agent
Denne tilstand gennemgår agenter, der er i Microsoft Copilot Studio. Den læses direkte fra Dataverse – ingen filupload er nødvendig.
Hvad den analyserer:
- Emnekonfigurationer (navne, beskrivelser og variabler).
- Værktøjs- og handlingskonfigurationer (antal, beskrivelser, routing).
- Typer af videnkilder.
- Testsagsdækning.
- Agentinstruktioner (generativ tilstand).
- Agentmetadata (sprog, godkendelse og AI-indstillinger).
Sådan startes en vurdering:
- Find din agent i gitteret.
- Vælg Gennemse. Analysen starter automatisk.
- Et statuspanel viser, hvad der sker i realtid.
- Resultaterne åbner i vurderingspanelet, når de er færdige.
Du kan altid gennemgå enhver agent igen. Hver vurdering opretter en ny post i Dataverse. Gitteret viser altid det seneste vurderingsresultat.
Vurdering af deklarativ Microsoft 365 Copilot-agent
Denne tilstand gennemgår deklarative Microsoft 365-agenter, som defineres af en JSON-manifestfil og implementeres i Microsoft 365 Copilot-økosystemet.
Du kan få en deklarativ agent vurderet på to måder:
| Metode | Hvordan | Bruges hvornår |
|---|---|---|
| Upload ZIP-fil | Vælg Upload ZIP-fil i sideoverskriften. Vælg den eksporterede pakke. | Agenten er fra en anden lejer eller ikke i dit katalog. |
| Fra Microsoft 365-kataloget | Opret forbindelse til Microsoft 365 via Graph API-opsætningsguiden, og gennemse agenter. | Agenten er udrullet i din Microsoft 365-lejer. |
Hvad den analyserer (5 kriterier – ikke 15):
| Kriterium | Vægt | Dette er tjekket |
|---|---|---|
| Instruktioner | 30 % | Klarhed, fuldstændighed og kvalitet i instruktionerne til agenten |
| Viden | 20 % | Forankring gennem forbundne videnskilder |
| Funktioner | 15 % | Brug af CodeInterpreter og OneDriveAndSharePoint |
| Handlinger | 15 % | Værktøjsrouting og handlingsbeskrivelser |
| Samtalestartere | 10 % | Minimum 3, anbefalet 6 (maksimum 12) |
| Elegant fejlhåndtering | 10 % | Fejlgendannelse og fallback-adfærd |
Bemærk!
Kontrollen af overholdelse af instruktionerne, der omfatter 15 kriterier, gælder udelukkende for Copilot Studio-agenter og gælder ikke for deklarative agenter.
Hvad der sker under en vurdering
Når du vælger Vurdering, kører værktøjet en automatiseret analyse, som typisk gennemføres på under 60 sekunder. Et statuspanel holder dig informeret, mens det arbejder.
Analysen dækker tre ting i rækkefølge:
- Konfigurationsanalyse: Værktøjet læser agentens komplette konfiguration fra Dataverse – hvert emne, værktøj, videnskilde, testsag og instruktion. Det søger efter manglende felter i alle komponenter og måler ting som værktøjsantal og testdækning i forhold til Microsofts dokumenterede bedste praksis.
- AI-drevet mønstervurdering: En AI-model vurdere den samme konfiguration for at evaluere kvalitet – ikke blot fuldstændighed. Den undersøger, om emnenavne og beskrivelser er klare nok til, at den generative organisator kan route korrekt, om flere emner overlapper på måder, der skaber routing-forvirring, og om værktøjsbeskrivelser giver den kunstige intelligens vejledning nok til at aktivere det rigtige værktøj på det rigtige tidspunkt.
- Kontrol af instruktionsoverholdelse: En anden AI-model læser agentens systeminstruktioner og kontrollerer dem i forhold til 15 kriterier for bedste praksis fra Microsofts generative tilstandsvejledning, der dækker omfang, sikkerhed, svarkvalitet og brugeroplevelse. Hvert kriterium, som instruktionerne ikke opfylder, resulterer i et specifikt fund og en konkret anbefaling.
Når alle tre trin er gennemført, genereres en PDF-rapport automatisk, og resultaterne åbnes i vurderingspanelet.
Vigtigt!
Hver vurdering bruger Copilot-credits. De AI-drevne trin (mønsterevaluering, instruktionsoverholdelseskontrol og PDF-generering) aktiverer hver især en AI-model via Dataverse. Planlæg derefter, hvis du gennemgår et stort antal agenter.
Registrerede mønstre
Mønstre identificerer specifikke anti-mønstre eller manglende bedste praksis i en agents konfiguration. Værktøjet tjekker 18 mønstre i syv kategorier.
Alle 18 mønstre
| Id | Mønsternavn | Kategori | Effekt |
|---|---|---|---|
pat-001 |
Manglende modelnavn | Modelnavngivning | Den generative organisator kan ikke videresende pålideligt til dette emne. |
pat-002 |
Manglende modelbeskrivelse | Modelbeskrivelse | Emnet kan blive sprunget over eller fejlagtigt udløst under routing. |
pat-003 |
Manglende navn på inputvariabel | Inputvariabler | Brugere ser unavngivne variabler, hvilket skaber forvirring i samtalen. |
pat-004 |
Beskrivelse af manglende inputvariabel | Inputvariabler | Den kunstige intelligens kan ikke udtrække den rigtige værdi korrekt fra brugerinput. |
pat-005 |
Manglende navn på outputvariabel | Outputvariabler | Outputværdierne er umærkede og svære for brugerne at tolke. |
pat-006 |
Beskrivelse af manglende outputvariabel | Outputvariabler | AI mangler kontekst til at udfylde variablen korrekt. |
pat-007 |
Overdreven brug af værktøjer | Arkitektur | For mange værktøjer forringer routing-nøjagtigheden og øger ventetiden. |
pat-008 |
Utilstrækkelige testtilfælde | Evaluering | Regressioner i emneadfærd opdages ikke før implementering. |
pat-009 |
Beskrivelse af manglende underordnet agent | Arkitektur | Organisatoren kan ikke beslutte, hvornår han den underordnede agent skal delegeres. |
pat-010 |
Udbredelse af underordnet agents arkitektur | Arkitektur | Overdreven delegering skaber orkestreringskompleksitet og ventetid. |
pat-011 |
Uklart modelnavn | Modelnavngivning | Vage navne får organisatoren til at gå til det forkerte emne. |
pat-012 |
Uklar modelbeskrivelse | Modelbeskrivelse | Dårlige beskrivelser fører til oversete eller forkerte emneudløsere. |
pat-013 |
Uklart navn på inputvariabel | Inputvariabler | Tvetydige navne gør det sværere for den kunstige intelligens at udfylde variablen korrekt. |
pat-014 |
Uklar beskrivelse af inputvariabelen | Inputvariabler | Den kunstige intelligens udtrækker den forkerte værdi eller stiller unødvendige opklarende spørgsmål. |
pat-015 |
Uklart navn på outputvariabel | Outputvariabler | Downstream-emner eller -flow, der forbruger denne variabel, kan misforstå den. |
pat-016 |
Uklar beskrivelse af outputvariabelen | Outputvariabler | Den kunstige intelligens kan ikke pålideligt producere forventet outputformat eller -værdi. |
pat-017 |
Overlappende emnebeskrivelser | Modelbeskrivelse | Flere emner konkurrerer om de samme brugerudtalelser, hvilket forårsager uforudsigelig routing. |
pat-018 |
Værktøjsrouting-mangel | Arkitektur | Den kunstige intelligens kan ikke beslutte, hvilket værktøj den skal kalde, hvilket fører til forkerte værktøjskald eller ingen handling. |
For hvert fejlramt mønster viser værktøjet, hvilke emner der er påvirket, den aktuelle værdi, der udløste resultatet, en foreslået forbedring og et link til den relevante Microsoft Learn-dokumentation.
Mønsterkategorier
Resultatgitteret grupperer mønstre i syv kategorier i følgende rækkefølge:
| # | Kategori | Inkluderede mønstre |
|---|---|---|
| 1 | Modelnavngivning |
pat-001, pat-011 |
| 2 | Modelbeskrivelse |
pat-002, pat-012, pat-017 |
| 3 | Inputvariabler |
pat-003, pat-004, pat-013, pat-014 |
| 4 | Outputvariabler |
pat-005, pat-006, pat-015, pat-016 |
| 5 | Arkitektur |
pat-007, pat-009, pat-010, pat-018 |
| 6 | Orkestrering | Reserveret til fremtidige mønstre, der registreres af den kunstige intelligens |
| 7 | Evaluering | pat-008 |
Alvorlighedslogik
Kombinationen af nøgleord, der matcher, og emneantal bestemmer mønsterets alvorlighedsgrad:
| Betingelse | Tildelt alvorlighedsgrad |
|---|---|
| Mønsternavnet indeholder "modelnavn" eller "modelbeskrivelse" | High |
| Mønsternavnet indeholder "variabel" | Medium (medmindre emnetællingen er 5 eller flere) |
| Antallet af emner er 5 eller flere | High |
| Antallet af emner er 2 eller flere | Medium |
| Antal emner: 1 | Lav |
Alvorligheden styrer både det visuelle mærke i resultatgitteret og SARIF-fejlniveauet i den eksporterede rapport.
Overholdelseskriterier
Denne del af vurderingen evaluerer kvaliteten af en agents systeminstruktioner – den naturlige tekst, som en udvikler leverer i Copilot Studios Generative indstillinger. Disse instruktioner definerer, hvordan agenten opfører sig i alle samtaler.
De 15 kriterier stammer fra Microsofts vejledning om generativ tilstand og repræsenterer de mest effektive bedste praksisser for undervisningskvalitet.
Alle 15 kriterier
| # | Id | Kriterienavn | Kategori | Alvorlighedsgrad | Hvad der kontrolleres |
|---|---|---|---|---|---|
| 1 | scope-definition |
Definition af omfang | Område | Høj | Agentinstruktioner definerer eksplicit, hvilke emner agenten bør og ikke bør svare på. |
| 2 | out-of-scope-handling |
Håndtering uden for område | Område | Mellem | Instruktioner angiver, hvad der skal siges, når en bruger spørger om noget uden for agentens område. |
| 3 | persona-and-tone |
Karakter og tone | UX | Lav | Instruktioner definerer tone for scenarier, der ikke er standard. (Professionelt/høfligt er allerede standard – spring dette over, hvis det ikke er nødvendigt.) |
| 4 | privacy-and-sensitive-data |
Beskyttelse af personlige oplysninger og følsomme data | Sikkerhed | Høj | Instruktionerne indeholder eksplicit vejledning om ikke at gemme, vise eller gentage personlige data. |
| 5 | fallback-when-uncertain |
Tilbagefald når det er usikkert | Kvalitet | Høj | Instruktionerne angiver, hvad der skal gøres, når agenten ikke har de nødvendige oplysninger til at svare. |
| 6 | citations-and-sources |
Citater og kilder | Kvalitet | Mellem | Instruktioner kræver, at agenten citerer dokumentnavne og sektioner, når der henvises til videnskilder. |
| 7 | formatting-guidelines |
Retningslinjer til formatering | UX | Lav | Instruktioner specificerer svarformat (punktlister, tabeller og nummererede trin) for struktureret output. |
| 8 | clarifying-questions |
Præciserende spørgsmål | UX | Mellem | Vejledningen beskriver, hvordan man tvetydige forespørgsler håndteres ved hjælp af afklarende opfølgningsspørgsmål. |
| 9 | prompt-injection-resilience |
Beskyttelse mod hurtig injektion | Sikkerhed | Høj | Instruktionerne indeholder eksplicitte sikkerhedsforanstaltninger mod jailbreak-forsøg eller hurtig injektion. |
| 10 | link-safety |
Linksikkerhed | Sikkerhed | Mellem | Instruktioner sørger for, at kun verificerede, sikre links deles med brugerne. |
| 11 | advice-disclaimers |
Rådgivningsansvarsfraskrivelser | Sikkerhed | Høj | Instruktionerne indeholder ansvarsfraskrivelser for følsomme rådgivningsområder (finans, sundhed eller jura). |
| 12 | accuracy-quality |
Nøjagtighed og kvalitet | Kvalitet | Høj | Instruktionerne forankrer eksplicit agenten i dens videnskilder og forbyder fabrikation eller gætteri. |
| 13 | tool-routing-hints |
Tip til routing af værktøj | Kvalitet | Mellem | Instruktionerne giver vejledning om, hvilke værktøjer eller videnskilder der skal bruges, når routing er tvetydig. |
| 14 | escalation-guidance |
Vejledning om eskalering | UX | Høj | Instruktioner definerer, hvad der skal gøres, når agenten ikke kan hjælpe: aflevere til et menneske, foreslå et alternativ eller afslutte på høflig vis. |
| 15 | deterministic-language |
Deterministisk sprog | Kvalitet | Mellem | I instruktionerne anvendes absolutte udtryk (altid, aldrig, kun og skal) frem for vage formuleringer (måske, normalt, prøv og nogle gange). |
Kategoriopdeling
| Kategori | Antal kriterier | Fokus |
|---|---|---|
| Område | 2 | Definerer, hvad agenten svarer på og ikke svarer på |
| Sikkerhed | 4 | Beskytter brugere mod misinformation, datalækager og manipulation |
| Kvalitet | 5 | Sikrer præcise, jordnære og velstrukturerede svar |
| UX | 4 | Former samtaleoplevelsen og eskaleringsvejene |
Hvordan scores beregnes
Alle scores er på en skala fra 0-100 og er deterministiske. De samme input giver altid samme score.
Mønsterscore
Pattern Score = (Passed Patterns / Total Patterns) × 100
- Samlede mønstre = 10 deterministiske + hvor mange AI-registrerede mønstre der returneres (op til 8).
-
Godkendte mønstre = optælling, hvor mønsterstatussen er
pass. - Resultatet afrundes til nærmeste heltal.
Eksempel: 15 mønstre i alt, 12 bestået = Mønsterscore på 80.
Instruktionsscore
Instruktionsscoren bruger et vægtet pointsystem baseret på den iboende sværhedsgrad af hvert kriterium:
| Iboende sværhedsgrad | Point ved bestået | Antal kriterier | Maks. point |
|---|---|---|---|
| Høj | 3 | 7 | 21 |
| Mellem | 2 | 6 | 12 |
| Lav | 1 | 2 | 2 |
| I alt | 15 | 35 |
Instruction Score = (Earned Points / 35) × 100
- For hvert af de 15 kriterier tilføjes de indbyggede alvorlighedspoint, hvis der ikke konstateres nogen fejl i forbindelse med det pågældende kriterium.
- Hvis "manglende instruktioner" opdages, opfyldes ingen kriterier, og scoren er 0.
- Resultatet fastgøres til 100 og afrundes til det nærmeste heltal.
Eksempel: 3 høje og 2 mellemstore kriterier godkendes ikke:
- Opnåede point: (4 × 3) + (4 × 2) + (2 × 1) = 12 + 8 + 2 = 22 point.
- Score = (22 / 35) × 100 = 63.
Samlet score
Overall Score = (Pattern Score × 0.5) + (Instruction Score × 0.5)
Begge dimensioner har lige stor vægt. Hvis der kun er én dimension til rådighed (for eksempel hvis der ikke findes nogen instruktioner), anvendes denne dimensions score direkte.
Vejledning til scorefarve og -mærkat
| Scoreinterval | Mærkat | Farve |
|---|---|---|
| 80 og derover | Udmærket | Grøn |
| 60 til 79 | God | Gul |
| 40 til 59 | Rimelig | Rød |
| Under 40 | Skal forbedres | Rød |
Gennemse resultater
Når gennemgangen er afsluttet, viser bedømmelsespanelet resultaterne. Panelet har tre faner.
Fanen Oversigt
Fanen Oversigt giver dig et overordnet overblik:
- Samlet score: En cirkulær måler i grøn, rav eller rød.
- Mønsterscore og instruktionsscore side om side.
- Agentmetadata: Navn, miljø, sprog, godkendelsestilstand og AI-indstillinger.
- AI-genereret resumé: En naturlig beskrivelse af de mest betydningsfulde resultater.
- Vurderingstidsstempel og datakilde (live miljø eller ZIP-upload).
Fanen Mønstre
Fanen Mønstre viser hele gitteret med alle 18 evaluerede mønstre med disse kolonner:
| Column | Beskrivelse |
|---|---|
| Status | Bestået eller ikke bestået |
| Alvorlighedsgrad | Mærke: Høj, Mellem eller Lav |
| Kategori | Mønsterkategori (Modelnavngivning, Arkitektur osv.) |
| Mønsternavn | Fuldt mønsternavn |
| Berørte emner | Antal emner, der er påvirket af dette mønster |
| Handlinger | Detaljeknappen til at åbne panelet Mønsterdetaljer |
Du kan sortere gitteret efter enhver kolonne. Som standard vises fejlmønstre først, sorteret efter sværhedsgrad (Høj og derefter Mellem og Lav).
Fanen Overholdelse af angivne standarder
Fanen Overholdelse af angivne standarder viser alle 15 instruktionskriterier:
| Column | Beskrivelse |
|---|---|
| Status | Bestået eller ikke bestået |
| Alvorlighedsgrad | Mærke: Høj, Mellem eller Lav |
| Kategori | Omfang, sikkerhed, kvalitet eller brugeroplevelse |
| Kriterienavn | Fuldt kriterienavn |
| Der blev fundet problemer | Antal specifikke problemer under dette kriterium |
| Handlinger | Detaljeknappen til at åbne panelet Oplysninger om overholdelse af angivne standarder |
Detaljeret oversigt over mønsteret
Når du vælger Detaljer på et mislykket mønster, åbner panelet Mønsterdetaljer . Det viser:
- Mønsternavn og beskrivelse: Hvad dette mønster tjekker.
- Hvorfor det er vigtigt: Effekten af dette anti-mønster for agentkvaliteten.
- Tabel over berørte emner: Hvert emne med dets nuværende værdi og AI'ens foreslåede erstatning.
- Anbefaling: En konkret handling for at løse problemet.
- Læs mere: Et direkte link til den relevante Microsoft Learn-dokumentation.
Detaljeret oversigt over overholdelse
Når du vælger Detaljer om et fejlramt overholdelseskriterium, åbnes panelet Detaljer om overholdelse . Det viser:
- Kriteriums navn, kategori og alvorlighedsgrad
- Hvad kriteriet tjekker: En forklaring på almindeligt dansk sprog
- Specifikt problem fundet: AI'ens analyse af, hvad der mangler eller er forkert
- Anbefaling: Præcist sprog eller mønstre, der skal tilføjes til agentens instruktioner
- Eksempel: Hvor tilgængeligt: Et eksempel på en instruktion, der overholder kravene, hvis det er muligt
- Få mere at vide: Link til den relevante vejledning fra Microsoft Learn
Eksportresultater
Du kan eksportere resultater i tre formater fra vurderingspanelets header.
PDF-rapport
En velformuleret, letlæselig PDF-rapport, der er velegnet til at blive delt med interessenter eller vedlagt en styringsrevision.
Indhold:
- Ledelsesresumé med scorer og nøglemålinger
- Resultater fra mønsterevaluering (status, alvorlighedsgrad og berørte personer)
- Overholdelsesresultater (alle 15 kriterier)
- Anbefalinger for hvert fundet problem
- Agentmetadata (navn, miljø og vurderingsdato)
Filnavnsmønster: {AgentName}_review_{YYYY-MM-DD}.pdf
PDF'en genereres automatisk i slutningen af hver anmeldelse og gemmes i Dataverse sammen med vurderingsoplysningen. Efterfølgende downloads henter den gemte fil uden at gentage analysen.
SARIF-eksport
SARIF (Static Analysis Results Interchange Format v2.1.0) er et JSON-format designet til integration med udviklerværktøjer og CI/CD-pipelines.
Brugsscenarier:
- Upload til GitHub Advanced Security for SARIF-baserede PR-annoteringer
- Importer til Azure DevOps-kvalitetskontrol
- Proces med tredjepartsværktøjer, der bruger SARIF (SonarQube, Visual Studio Code osv.)
Oversigt over struktur:
{
"version": "2.1.0",
"runs": [{
"tool": {
"driver": {
"name": "Copilot Studio Agent Review Tool",
"version": "1.0"
}
},
"results": [
{
"ruleId": "pat-007",
"level": "error",
"message": { "text": "Excessive Tools Usage: 28 tools exceed the recommended limit of 25" },
"properties": {
"category": "Architecture",
"recommendation": "Reduce tool count to 25 or fewer"
}
}
]
}]
}
Tilknytning af alvorlighedsgrader til SARIF-niveauer:
- Høj =
"error" - Medium =
"warning" - Lav =
"note"
Filnavnsmønster: {AgentName}_review.sarif
Eksporter til Excel
En Excel-arbejdsbog med flere ark til dataanalyse, rapportering og arkivering.
| Ark | Indhold |
|---|---|
| Oversigt | Én række pr. vurderet agent – navn, scorer, antal udgivelser og vurderingsdato |
| Mønstre | Alle 18 mønstre – ID, navn, kategori, alvorlighedsgrad, status, berørte emner og anbefaling |
| Overholdelse | Alle 15 kriterier – ID, navn, kategori, alvorlighedsgrad, status, antal problemer og anbefaling |
Overskrifterne med fed skrift og baggrunde i logofarver. Score- og alvorlighedsgradsceller er med grønne, gule eller røde farvekoder. Kolonnebredderne justeres automatisk.
Filnavnsmønster: {AgentName}_review_{YYYY-MM-DD}.xlsx
En dybdegående gennemgang af beskrivende agenter
Beskrivende Microsoft 365-agenter er en anden type agenter end Copilot Studio-agenter. De er defineret udelukkende af en JSON-manifestfil og implementeret i Microsoft 365-økosystemet.
Dette tjekker den beskrivende agent
Vurderingen validerer først manifeststrukturen og kontrollerer, at alle nødvendige felter er til stede, og at skemaet er velformuleret. Derefter kører den en AI-evaluering mod fem kvalitetskriterier og genererer en PDF-rapport. Kontrollen af overholdelsen af de 15 kriterier (der gælder specifikt for Copilot Studio-agenter) gælder ikke her.
De 5 kriterier for vurdering af beskrivende agenter
| Kriterium | Vægt | Hvad der vurderes |
|---|---|---|
| Instruktioner | 30 % | Agentens systemprompts tydelighed, specificitet og fuldstændighed |
| Viden | 20 % | Brug af forbundne videnskilder til jordforbindelse |
| Funktioner | 15 % | Brug af CodeInterpreter og OneDriveAndSharePoint-funktioner |
| Handlinger | 15 % | Forekomst og kvalitet af beskrivelser af værktøjets funktion |
| Samtalestartere | 10 % | Antal og kvalitet (minimum 3 – 6 anbefales) |
| Elegant fejlhåndtering | 10 % | Håndtering af ukendte input og fejltilstande |
Kontrol af manifestkvaliteten (lokal validering)
Før den kunstige intelligens kører, validerer en deterministisk sundhedskontrol manifeststrukturen:
- Påkrævede felter til stede (
name,description,instructions) - Kompatibilitet mellem skemaversioner
- Henvisninger til handlings-plugins er gyldige
- Antallet af samtaleemner ligger inden for rammerne (3–12)
- Korrekt udformede erklæringer om kapacitet
Eventuelle fejl i sundhedstjekket vises som problemer i resultaterne af vurderingen af den beskrivende agent, uafhængigt af AI-evalueringen.
Få en beskrivende agent vurderet
Via ZIP-upload (mest almindeligt):
- Eksporter den beskrivende agent fra dit forfatterværktøj som en ZIP-pakke.
- Vælg Upload ZIP i sideoverskriften til Agent-gennemgangsværktøjet.
- Hvis ZIP-filen indeholder flere agenter, kan du via et valgpanel vælge, hvilken du vil gennemgå.
- Gennemgangen kører automatisk.
Via Microsoft 365-kataloget (kræver opsætning af Graph API):
- Vælg Opret forbindelse til Microsoft 365 i fanen Microsoft 365-agenter.
- Fuldfør Graph API-godkendelsesguiden.
- Dine udsendte beskrivende agenter vises i gitteret Beskrivende agent.
- Vælg Vurdering ud for enhver beskrivende agent.
Sikkerhed og dataadgang
Dette afsnit beskriver, hvordan Agent-gennemgangsværktøj håndterer sikkerhed og dataadgang.
Datalagring
Alle gennemgangsresultater gemmes i cat_agentreviews Dataverse-tabellen . Hver post opbevarer:
| Felt | Indhold |
|---|---|
cat_agentreviewsid |
Unikt gennemgangspost-ID |
cat_botid |
Henvisning til den vurderede agent |
cat_overallscore |
Samlet score: 0–100 |
cat_patternscore |
Mønsterevalueringsscore |
cat_instructionscore |
Instruktionsoverholdelsesscore |
cat_totalissues |
Samlet antal problemer |
cat_reviewresultjson |
Fuldt gennemgangsresultat som JSON |
cat_reviewpdfreport_name |
PDF-rapport (Dataverse-filkolonne) |
cat_sourceenvironment |
URL til kildemiljøet eller zip |
cat_agenttype |
1 = Copilot Studio, 2 = beskrivende agent |
Sikkerhed på rækkeniveau
Tabellen cat_agentreviews anvender læseomfang på brugerniveau (Basic) i Dataverse. Brugere kan kun se vurderinger, de selv har oprettet. En anden brugers vurdering er aldrig synlige – selv ikke i det samme miljø. Dataverse håndhæver denne sikkerhed integreret – ikke applikationskoden.
Kildemiljøer
Brugere kan gennemgå agenter fra miljøer, de har adgang til – ikke kun det nuværende miljø. Dashboardet understøtter vurderinger til flere miljøer via miljøvælgeren. Anmeldelser fra andre miljøer er tagget med kilde-miljøets URL, så de vises korrekt, når værktøjet indlæses.
Anmeldelser fra en ZIP-upload vises altid, uanset hvilket miljø værktøjet er forbundet til.
Hvilke data der forlader miljøet
- Agentens konfiguration (emner, værktøjer og instruktioner) sendes til AI-modellerne via Dataverse PredictV2. Dette følger den almindelige Dataverse AI-modelaktiveringssti og er underlagt de samme dataopbevaringspolitikker som enhver Dataverse AI-handling.
- Der sendes ingen data til tredjepartstjenester eller eksterne slutpunkter.
- Vurderingsresultaterne (inklusive PDF'en) gemmes udelukkende i Dataverse.
Første oplevelse og velkomstrundvisning
Første gang en bruger åbner Agent-gennemgangsværktøj, guider en velkomstrundvisning brugeren gennem de vigtigste dele af grænsefladen:
- Dashboard-kortene med statistik, og hvad de repræsenterer
- Sådan læser du agentgitteret
- Sådan starter du en vurdering
- Sådan fortolker du resultaterne
- Eksportindstillingerne
Gennemgangen gemmes i Dataverse, så den gentages ikke, når den er afsluttet. Brugere kan genåbne rundvisningen når som helst i sektionen Hjælp/Hurtige links i sideoverskriften.
Ofte stillede spørgsmål
Dette afsnit omhandler almindelige spørgsmål om Agent-gennemgangsværktøj.
Hvor lang tid tager en vurdering?
En typisk agent med færre end 20 emner bliver vurderet på under 60 sekunder. Værktøjet har en 2-minutters hård timeout. Meget store agenter (mere end 50 emner og mange værktøjer) kan nærme sig grænsen.
Ændrer værktøjet min agent?
Antal Værktøjet er fuldstændig skrivebeskyttet med hensyn til agentdata. Det læser kun agentkonfigurationen. Alt, der skrives, overføres til cat_agentreviews-tabellen .
Kan jeg vurdere en agent igen, når jeg har lavet ændringer?
Ja. Hver vurdering opretter en ny post. Gitteret viser altid den seneste vurdering. Gamle vurderinger forbliver i Dataverse og kan tilgås programmatisk, hvis det er nødvendigt.
Hvad hvis min agent er i et andet miljø?
Brug miljøvælgeren på dashboardet til at pege værktøjet mod et andet miljø, du har adgang til. Vurderingen køres i forhold til dette miljø, og resultatet gemmes i det nuværende miljø.
Kan jeg vurdere agenter, jeg ikke har oprettet?
Ja. Du kan vurdere enhver agent, du har læseadgang til, i Dataverse. Du kan dog kun se vurderinger, du har oprettet (sikkerheden på rækkeniveau). Vurderinger fra andre brugere er ikke synlige.
Hvad er SARIF, og har jeg brug for det?
SARIF er et standardformat for statiske analyseresultater. Du har kun brug for det, hvis du integrerer agentens kvalitetskontrol i en CI/CD-pipeline (GitHub Actions eller Azure DevOps). For de fleste brugere er PDF- og Excel-eksport tilstrækkeligt.
Værktøjet siger, at min agent ikke har nogen instruktioner. Er det et problem?
Ja. Værktøjet viser kun agenter, der har generativ AI aktiveret, så hver agent i gitteret forventes at have instruktioner. Hvis overholdelseskontrollen ikke rapporterer nogen instruktioner, er agentens generative orkestrering aktiv, men der er endnu ikke skrevet systeminstruktioner. Det anbefales kraftigt at tilføje instruktioner.
Hvorfor er Lav alvorlighedsgrad for "Karakter og tone"?
Microsofts vejledning bemærker, at en professionel og høflig tone allerede er standardadfærden for Copilot Studio-agenter. Instruktioner til tone er kun nødvendige, hvis du ønsker en ikke-standard tone. Dette kriterium er lavt, fordi fejl sjældent forårsager problemer for brugere.
Koster det Copilot-kredit at udføre en vurdering?
Ja. Hver vurdering aktiverer AI-modeller tre gange – til mønsterevaluering, instruktionsoverholdelse og PDF-generering. Hver aktivering bruger Copilot-kredit fra din lejer. Nye vurderinger af den samme agent bruger også kredit, så lav dine ændringer først, og udfør vurderingen igen.
Kan jeg eksportere alle vurderinger på én gang?
Ja. Brug knappen Eksporter Alle i agentens gitterværktøjslinje til at generere en Excel-arbejdsbog, der dækker alle vurderede agenter i den aktuelle visning.