Agenten mit dem Agent-Überprüfungstool im Copilot Studio-Kit analysieren

Das Agent-Überprüfungstool ist ein automatisiertes Qualitätsbewertungs- und Compliance-Überprüfungssystem für Microsoft Copilot Studio-Agenten und Microsoft 365 deklarative Agenten. Es hilft Erstellern, Administratoren und Governance-Teams, Probleme, Anti-Muster und Compliance-Lücken zu erkennen, bevor sie Endnutzer erreichen.

Da Organisationen ihre Copilot Studio Bereitstellungen skalieren, wird es unmöglich, die Konfiguration, Anweisungen und die Themenstruktur jedes Agenten manuell zu überprüfen. Das Agent-Überprüfungstool automatisiert diese Überprüfung durch KI-gestützte Analyse und liefert in der Regel in weniger als 60 Sekunden umsetzbare Erkenntnisse.

Es ist für:

  • Ersteller: Holen Sie sich umsetzbares Feedback, um die Qualität der Agenten vor der Einführung zu verbessern.
  • Administratoren und CoE-Teams: Setzen Sie Governance-Standards über alle Agenten in einer Umgebung durch.
  • Sicherheits- und Compliance-Beauftragte: Überprüfen Sie, dass die Mitarbeiter Datenschutz-, Sicherheits- und Genauigkeitsrichtlinien einhalten.

Wichtige Funktionen

Funktion Einzelheiten
Agentabdeckung Copilot Studio-Agenten und Microsoft 365 deklarative Agenten
Überprüfungszeit Typischerweise weniger als 60 Sekunden pro Agent
Muster überprüft 18 Muster (10 deterministisch + 8 KI-gesteuert)
Konformitätskriterien 15 Qualitätskriterien für den Unterricht
Punktesystem Gesamtpunktzahl 0–100 (50 % Muster, 50 % Compliance)
Exportformate PDF, SARIF, Excel
Datenspeicher Microsoft Dataverse (benutzerbezogen, zeilenbasierte Sicherheit durchgesetzt)
KI-Modul Microsoft Copilot Studio KI-Eingabeaufforderungen über Dataverse PredictV2

Erste Schritte: Das Dashboard

Wenn Sie das Agent-Überprüfungstool öffnen, kommen Sie zum Dashboard, dem zentralen Hub, der alle Agenten in Ihrer Umgebung und ihren Bewertungsstatus anzeigt.

Dashboardlayout

Screenshot des Agent-Überprüfungstool-Dashboards mit Statistikkarten, Agentenraster und Schaltfläche zum Hochladen von ZIP-Dateien.

Das Dashboard zeigt alles auf einen Blick: die Registerkartenleiste, die zwischen Copilot Studio und Microsoft 365 Agenten wechselt, vier Stat-Karten mit der Zusammenfassung der Portfolio-Gesundheit, eine Suchleiste, das paginierte Agentenraster und die Schaltfläche ZIP hochladen für Offline-Bewertungen.

Statuskarten

Die vier Statuskarten geben eine Momentaufnahme der Integrität Ihres Agentenportfolios:

Card Was sie zeigt Wie wird es berechnet
Total Agenten Zählt alle aktiven Bots in der Umgebung. Fragen Sie die bot Tabelle wo statecode = 0
Geprüft Anzahl und Prozentsatz der überprüften Agenten. Anzahl der abgeschlossenen Bewertungen geteilt durch die Gesamtzahl der Agenten
Durchschnittlicher Score Durchschnittlicher Score über alle abgeschlossenen Rezensionen. Summe der Scores geteilt durch die überprüfte Anzahl
Probleme gesamt Kumulative Probleme wurden bei allen überprüften Agenten gefunden. Summe von Musterfehlern plus Konformitätsfehler

Agent-Raster

Spalte Inhalt
Name Agent-Anzeigename mit Symbol.
Ergebnis Gesamtbewertung (0–100) oder -- , falls noch nicht bewertet. Farbcodiert.
Probleme Zusammenfassung der Befunde bei hoher, mittlerer und niedriger Schweregrad. -- wenn nicht überprüft.
Zuletzt überprüft Relative Zeit (zum Beispiel vor 2 Stunden oder vor 1 Woche) oder Nicht überprüft.
Aktionen Überprüfung auf nicht geprüfte Agenten; Suchen Sie nach Agenten mit bestehenden Bewertungen.

Umgebung auswählen

Standardmäßig zeigt das Tool Agenten aus der Umgebung an, in der Sie diese installiert haben. Wenn Sie einen Agenten aus einer anderen Umgebung überprüfen müssen, verwenden Sie den Umgebungsauswahlmechanismus in der Dashboard-Toolbar. Das Dropdown-Menü listet alle Power Platform-Umgebungen auf, auf die Sie Zugriff haben.

Nachdem Sie eine andere Umgebung ausgewählt haben, aktualisiert sich das Agentenraster und zeigt Agenten aus dieser Umgebung an. Sie können dann jeden dieser Agenten prüfen. Das Bewertungsergebnis wird in der aktuellen (Heim-)Umgebung gespeichert, nicht in der von Ihnen ausgewählten.

Screenshot des Umgebungsauswahl-Dropdown-Menüs mit zugänglichen Power Platform-Umgebungen.

Überprüfungsmodi

Das Tool unterstützt zwei unterschiedliche Überprüfungsmodi, die über die Registerkarten-Leiste oben im Dashboard zugänglich sind.

Copilot Studio Agent Überprüfung

Dieser Modus überprüft Agenten, die in Microsoft Copilot Studio erstellt wurden. Er liest direkt aus Dataverse – kein Dateiupload erforderlich.

Was analysiert wird:

  • Themenkonfigurationen (Namen, Beschreibungen, Variablen).
  • Werkzeug- und Aktionskonfigurationen (Zählung, Beschreibungen, Routing).
  • Wissensquellenarten.
  • Testfallabdeckung.
  • AgentenAnweisungen (generativer Modus).
  • Agent-Metadaten (Sprache, Authentifizierung, KI-Einstellungen).

So starten Sie eine Überprüfung:

  1. Finden Sie Ihren Agent im Raster.
  2. Wählen Sie Überprüfen aus. Der Analyseauftrag startet automatisch.
  3. Ein Fortschrittsbereich zeigt in Echtzeit, was passiert.
  4. Die Ergebnisse werden nach Abschluss im Begutachtungsgremium geöffnet.

Sie können jederzeit jeden Agents erneut prüfen. Jede Bewertung erstellt einen neuen Datensatz in Dataverse. Das Raster zeigt immer das aktuellste Bewertungsergebnis an.

Deklarative Agentüberprüfung (Microsoft 365 Copilot)

Dieser Modus überprüft Microsoft 365 deklarative Agenten, die durch eine manifestierte JSON-Datei definiert und im Microsoft 365 Copilot-Ökosystem bereitgestellt werden.

Sie können einen deklarativen Agent auf zwei Arten zur Überprüfung einreichen:

Methode Wie? Verwenden des s
Upload-ZIP Wählen Sie im Seiten-Header Upload ZIP aus und wählen Sie das exportierte Paket aus. Der Agent stammt von einem anderen Mandant oder steht nicht in Ihrem Katalog.
Aus dem Microsoft 365-Katalog Verbinden Sie sich mit Microsoft 365 über den Graph-API-Einrichtungsassistenten und durchsuchen Sie dann die Agenten. Der Agent ist in Ihrem Microsoft 365 Mandant bereitgestellt.

Was analysiert wird (5 Kriterien, nicht 15):

Kriterium Gewichtung Was geprüft wird
Anweisungen 30 % Klarheit, Vollständigkeit und Qualität der Agent-Anweisungen
Wissen 20 % Verankerung durch verbundene Wissensquellen
Funktionalitäten 15 % Verwendung von CodeInterpreter und OneDriveAndSharePoint
Aktionen 15 % Werkzeug-Routing und Aktionsbeschreibungen
Gesprächseinstiege 10 % Mindestens 3, empfohlene 6 (maximal 12)
Elegante Fehlerbehandlung 10 % Fehlerwiederherstellung und Rückfallverhalten

Anmerkung

Die 15-Kriterium-Anweisungs-Compliance-Prüfung ist speziell für Copilot Studio-Agenten und gilt nicht für deklarative Agenten.

Was passiert bei einer Überprüfung

Wenn Sie Überprüfen auswählen, führt das Tool eine automatisierte Analyse durch, die in der Regel in weniger als 60 Sekunden abgeschlossen ist. Ein Fortschrittsbereich hält Sie auf dem Laufenden, während es ausgeführt wird.

Screenshot des Fortschrittsbereichs für die Überprüfung zeigt die Schritte, die während einer Agentenbewertung ausgeführt werden.

Die Analyse umfasst drei Dinge in der Reihenfolge:

  1. Konfigurationsanalyse: Das Tool liest die vollständige Konfiguration des Agenten aus Dataverse – jedes Thema, Werkzeug, jede Wissensquelle, jeden Testfall und jede Anweisung. Es prüft fehlende Felder in allen Komponenten und misst Dinge wie Werkzeuganzahl und Testabdeckung anhand der dokumentierten Best Practices von Microsoft.
  2. KI-gestützte Musterbewertung Ein KI-Modell überprüft dieselbe Konfiguration, um die Qualität zu bewerten, nicht nur die Vollständigkeit. Es untersucht, ob Themennamen und -beschreibungen klar genug sind, damit der generative Orchestrator sie korrekt routen kann, ob sich mehrere Themen auf eine Weise überschneiden, die zu Routing-Verwirrung führt, und ob Werkzeugbeschreibungen der KI genügend Anleitung geben, um das richtige Tool zur richtigen Zeit zu aktivieren.
  3. Anweisungs-Compliance-Prüfung: Ein zweites KI-Modell liest die Systemanweisungen des Agenten und prüft sie anhand von 15 Best-Practice-Kriterien aus Microsofts Generative-Mode-Leitlinien – einschließlich Umfang, Sicherheit, Antwortqualität und Nutzererfahrung. Für jedes Kriterium, das die Anweisungen nicht erfüllt, wird eine spezifische Erkenntnis und eine konkrete Empfehlung hervorgebracht.

Nachdem alle drei Schritte abgeschlossen sind, wird automatisch ein PDF-Bericht erstellt und die Ergebnisse werden im Prüfungsgremium geöffnet.

Wichtig

Jede Bewertung verbraucht Copilot-Credit. Die KI-gestützten Schritte (Musterbewertung, Befehlsüberprüfung und PDF-Generierung) rufen jeweils ein KI-Modell über Dataverse auf. Planen Sie entsprechend, wenn Sie eine große Anzahl von Mandanten überprüfen.

Erkannte Muster

Muster identifizieren spezifische Anti-Muster oder fehlende Best Practices in der Konfiguration eines Agenten. Das Tool prüft 18 Muster in 7 Kategorien.

Alle 18 Muster

ID Mustername Kategorie Auswirkungen
pat-001 Fehlender Modellname Modellbenennung Der generative Orchestrator kann nicht zuverlässig zu diesem Thema führen.
pat-002 Fehlende Modellbeschreibung Modellbeschreibung Das Thema könnte während des Routings übersprungen oder fälschlicherweise ausgelöst werden.
pat-003 Fehlender Name der Eingabevariablen Eingabevariablen Nutzer sehen unbenannte Variablen, was im Gespräch zu Verwirrung führt.
pat-004 Beschreibung fehlender Eingabevariablen Eingabevariablen KI kann den richtigen Wert aus Nutzereingaben nicht korrekt extrahieren.
pat-005 Fehlender Name der Ausgabevariablen Ausgabevariablen Die Ausgabewerte sind unbeschriftet und für Nutzer schwer zu interpretieren.
pat-006 Beschreibung fehlender Ausgabevariablen Ausgabevariablen KI fehlt der Kontext, um die Variable korrekt auszufüllen.
pat-007 Übermäßiger Einsatz von Werkzeugen Architektur Zu viele Werkzeuge beeinträchtigen die Routing-Genauigkeit und erhöhen die Latenz.
pat-008 Unzureichende Testfälle Beurteilung Regressionen im Themenverhalten bleiben vor der Einführung unbemerkt.
pat-009 Beschreibung des fehlenden untergeordneten Agents Architektur Der Orchestrator kann nicht entscheiden, wann er an den untergeordneten Agent delegiert.
pat-010 Untergeordnete Agent Architektur Ausbreitung Architektur Übermäßige Delegation führt zu Orchestrierungskomplexität und Latenz.
pat-011 Unklarer Modellname Modellbenennung Vage Namen führen dazu, dass der Orchestrator zum falschen Thema wechselt.
pat-012 Unklare Modellbeschreibung Modellbeschreibung Schlechte Beschreibungen führen zu übersehenen oder falschen Themen-Auslösern.
pat-013 Unklarer Name der Eingabevariablen Eingabevariablen Mehrdeutige Namen erschweren es der KI, die Variable korrekt auszufüllen.
pat-014 Unklare Beschreibung der Eingabevariablen Eingabevariablen KI extrahiert den falschen Wert oder stellt unnötige klärende Fragen.
pat-015 Unklarer Name der Ausgabevariablen Ausgabevariablen Downstream-Themen oder -flüsse, die diese Variable konsumieren, könnten sie falsch interpretieren.
pat-016 Unklare Beschreibung der Ausgabevariablen Ausgabevariablen KI kann das erwartete Ausgabeformat oder den Wert nicht zuverlässig erzeugen.
pat-017 Überlappende Themenbeschreibungen Modellbeschreibung Mehrere Themen konkurrieren um dieselben Nutzeräußerungen, was zu unvorhersehbarem Routing führt.
pat-018 Werkzeug-Routing-Lücke Architektur Die KI kann sich nicht entscheiden, welches Tool sie aufrufen soll, was zu falschen Tool-Invocations oder keiner Aktion führt.

Für jedes fehlerhafte Muster zeigt das Tool an, welche Themen betroffen sind, den aktuellen Wert, der die Entdeckung ausgelöst hat, eine vorgeschlagene Verbesserung und einen Link zur relevanten Microsoft Learn-Dokumentation.

Screenshot des Reiters „Muster“, der alle 18 Muster mit Status, Schweregrad, Kategorie und betroffenen Themen auflistet.

Musterkategorien

Das Ergebnisraster gruppiert Muster in sieben Kategorien, die in folgender Reihenfolge sortiert sind:

# Kategorie Integrierte Muster
1 Modellbenennung pat-001, pat-011
2 Modellbeschreibung pat-002, pat-012, pat-017
3 Eingabevariablen pat-003, pat-004, pat-013, pat-014
4 Ausgabevariablen pat-005, pat-006, pat-015, pat-016
5 Architektur pat-007, pat-009, pat-010, pat-018
6 Orchestrierung Reserviert für zukünftige KI-erkannte Muster
7 Beurteilung pat-008

Schweregrad-Logik

Die Kombination aus Schlüsselwort-Übereinstimmung und Themenanzahl bestimmt den Schweregrad des Musters:

Bedingung Schweregrad zugewiesen
Der Mustername enthält „Modellname“ oder „Modellbeschreibung“ Hoch
Der Mustername enthält „Variable“ Medium (außer die Themenzahl beträgt 5 oder mehr)
Themenzahl beträgt 5 oder mehr Hoch
Themenzahl beträgt 2 oder mehr Medium
Themenzahl beträgt 1 Niedrig

Der Schweregrat bestimmt sowohl das visuelle Abzeichen im Ergebnisraster als auch den SARIF-Fehlerstand im exportierten Bericht.

Konformitätskriterien

Dieser Teil der Überprüfung bewertet die Qualität der Systemanweisungen eines Agenten – des natürlichen Textes, den ein Ersteller in den generativen Einstellungen von Copilot Studio bereitstellt. Diese Anweisungen definieren, wie sich der Agent in allen Gesprächen verhält.

Die 15 Kriterien stammen aus Microsofts Leitlinien für den generativen Modus und stellen die wirkungsvollsten bewährten Methoden für die Qualität der Anweisung dar.

Alle 15 Kriterien

# ID Kriterienname Kategorie Schweregrad Was es überprüft
1 scope-definition Definition des Geltungsbereichs Geltungsbereich Hoch Die Agent-Anweisungen definieren explizit, auf welche Themen der Agent reagieren sollte und auf welche nicht.
2 out-of-scope-handling Abwicklung außerhalb des Bereichs Geltungsbereich Medium Anweisungen geben an, was gesagt werden soll, wenn ein Nutzer nach etwas außerhalb des Zuständigkeitsbereichs des Agenten fragt.
3 persona-and-tone Persona und Ton UX Niedrig Anweisungen definieren den Ton für Nicht-Standard-Szenarien. (Professionell/höflich ist bereits der Standard – überspringen, wenn nicht nötig.)
4 privacy-and-sensitive-data Datenschutz und vertrauliche Daten Safety Hoch Anweisungen enthalten explizite Hinweise, wann personenbezogene Daten nicht gespeichert, angezeigt oder wiederholt werden sollen.
5 fallback-when-uncertain Rückfalloption bei Unsicherheit Qualität Hoch Die Anweisungen geben an, was zu tun ist, wenn der Agent nicht über die nötigen Informationen verfügt, um zu antworten.
6 citations-and-sources Zitate und Quellen Qualität Medium Anweisungen verlangen, dass der Agent Dokumentnamen und Abschnitte zitiert, wenn er auf Wissensquellen verweist.
7 formatting-guidelines Formatierungsrichtlinien UX Niedrig Anweisungen geben das Antwortformat (Stichpunkte, Tabellen, nummerierte Schritte) für strukturierte Ausgaben an.
8 clarifying-questions Klärende Fragen UX Medium Die Anweisungen behandeln, wie man mit mehrdeutigen Fragen umgeht, indem sie klärende Nachfragen stellen.
9 prompt-injection-resilience Schutz vor Prompt-Injection-Angriffen Safety Hoch Die Anweisungen enthalten explizite Schutzmaßnahmen gegen Jailbreak-Versuche oder Prompt-Injection-Angriffen.
10 link-safety Link-Sicherheit Safety Medium Die Anweisungen stellen sicher, dass nur verifizierte, sichere Links mit den Nutzern geteilt werden.
11 advice-disclaimers Haftungsausschlüsse für Hinweise Safety Hoch Die Anweisungen enthalten Haftungsausschlüsse für vertrauliche Hinweisbereiche (Finanzen, Gesundheit, Recht).
12 accuracy-quality Genauigkeit und Qualität Qualität Hoch Anweisungen verankern den Agenten ausdrücklich in seinen Wissensquellen und verbieten Fälschung oder Raten.
13 tool-routing-hints Tipps zum Tool-Routing Qualität Medium Die Anweisungen geben Hinweise darauf, welche Tools oder Wissensquellen verwendet werden sollten, wenn das Routing unklar ist.
14 escalation-guidance Eskalationsleitfaden UX Hoch Anweisungen definieren, was zu tun ist, wenn der Agent nicht helfen kann: an einen Menschen übergeben, eine Alternative vorschlagen oder elegant beenden.
15 deterministic-language Deterministische Sprache Qualität Medium Anweisungen verwenden absolute Ansagen (immer, nie, nur, muss) statt vager Modifikatoren (könnte, gewöhnlich, versuchen, manchmal).

Screenshot der Compliance-Registerkarte, die die 15 Qualitätskriterien für Anweisungen mit Status und Schweregrad zeigt

Kategorienaufschlüsselung

Kategorie Kriterienzählung Fokus
Geltungsbereich 2 Definiert, was der Agent beantwortet und was nicht
Safety 4 Schützt Nutzer vor Fehlinformationen, Datenlecks und Manipulation
Qualität 5 Sichert präzise, begründete und gut strukturierte Antworten
UX 4 Prägt das Gesprächserlebnis und die Eskalationspfade

Die Art, wie Scores berechnet werden

Alle Scores liegen auf einer Skala von 0–100 und sind deterministisch. Die gleichen Eingaben liefern immer die gleiche Punktzahl.

Muster-Score

Pattern Score = (Passed Patterns / Total Patterns) × 100
  • Gesamtmuster = 10 deterministisch + wie viele KI-erkannte Muster zurückgegeben werden (bis zu 8).
  • Frühere Muster = Zählung, wo der Musterstatus ist pass.
  • Ergebnis wird auf die nächste ganze Zahl gerundet.

Beispiel: Insgesamt 15 Muster, 12 bestanden = Muster-Score von 80.

Anweisungs-Score

Der Anweisungs-Score verwendet ein gewichtetes Punktesystem, das auf der inhärenten Schwerestärke jedes Kriteriums basiert:

Inhärente Schwere Punkte, wenn bestanden Kriterienzählung Maximale Punktzahl
Hoch 3 7 21
Medium 2 6 12
Niedrig 1 2 2
Summe 15 35
Instruction Score = (Earned Points / 35) × 100
  • Für jedes der 15 Kriterien werden, falls kein Problem für dieses Kriterium festgestellt wird, dessen inhärente Schweregrad hinzugefügt.
  • Wenn „fehlende Anweisungen“ erkannt werden, fallen alle Kriterien durch und das Score ist 0.
  • Das Ergebnis wird auf 100 gerechnet und auf die nächstgelegene ganze Zahl gerundet.

Beispiel: 3 hohe und 2 mittlere Kriterien scheitern:

  • Erzielte Punkte: (4 × 3) + (4 × 2) + (2 × 1) = 12 + 8 + 2 = 22 Punkte.
  • Score = (22 / 35) × 100 = 63.

Gesamtscore

Overall Score = (Pattern Score × 0.5) + (Instruction Score × 0.5)

Beide Dimensionen werden gleich stark gewichtet. Wenn nur eine Dimension verfügbar ist (zum Beispiel existieren keine Anweisungen), wird der Score dieser Dimension direkt verwendet.

Farb- und Beschriftungshinweise zum Score

Score-Bereich Label Farbe
80 und höher Ausgezeichnet Grün
60 bis 79 Gut Amber
40 bis 59 Mittelmäßig Rot
Unter 40 Verbesserung erforderlich Rot

Ergebnisse überprüfen

Nach Abschluss der Überprüfung werden im Prüfungsfenster die Ergebnisse angezeigt. Das Fenster verfügt über drei Registerkarten.

Registerkarte Übersicht

Die Registerkarte Übersicht gibt Ihnen eine übergeordnete Zusammenfassung:

  • Gesamtscore: Ein kreisförmiges Messgerät in Grün, Bernstein oder Rot.
  • Muster-Score und Anweisungs-Score nebeneinander.
  • Agent-Metadaten: Name, Umgebung, Sprache, Authentifizierungsmodus, KI-Einstellungen.
  • KI-generierte Zusammenfassung: Eine Beschreibung der wichtigsten Ergebnisse in natürlicher Sprache.
  • Überprüfen Sie Zeitstempel und Datenquelle (Live-Umgebung oder ZIP-Upload).

Screenshot der Übersichts-Registerkarte des Überprüfungsbereichs, der die Gesamtpunktzahl, die Muster- und Anweisungs-Scoree sowie die KI-Zusammenfassung zeigt.

Muster-Registerkarte

Auf der Registerkarte Muster wird das vollständige Raster aller 18 ausgewerteten Muster mit den folgenden Spalten angezeigt:

Spalte Beschreibung des Dataflows
Status Bestanden oder Nicht bestanden
Schweregrad Höheres, mittleres oder niedriges Badge
Kategorie Musterkategorie (Modellnamen, Architektur usw.)
Mustername Vollständiger Mustername
Betroffene Themen Anzahl der von diesem Muster betroffenen Themen
Aktionen Detail-Schaltfläche zum Öffnen des Musterdetail-Bereichs

Sie können das Raster nach beliebigen Spalten sortieren. Standardmäßig erscheinen fehlerhafte Muster zuerst, sortiert nach Schweregrad (Hoch, dann Mittel, dann Niedrig).

Compliance-Registerkarte

Die Registerkarte Compliance zeigt alle 15 Anweigungskriterien an:

Spalte Beschreibung des Dataflows
Status Bestanden oder Nicht bestanden
Schweregrad Höheres, mittleres oder niedriges Badge
Kategorie Umfang, Sicherheit, Qualität oder UX
Kriterienname Vollständiger Kriterienname
Gefundene Probleme Anzahl der spezifischen Probleme unter diesem Kriterium
Aktionen Detail-Schaltfläche zum Öffnen des Compliance-Detail-Bereichs

Musterdetail-Drilldown

Wenn Sie Details bei einem fehlerhaften Muster auswählen, öffnet sich der Bereich Muster-Detail. Es zeigt:

  • Mustername und Beschreibung: Was dieses Muster überprüft.
  • Warum es wichtig ist: Die Auswirkungen dieses Anti-Musters auf die Qualität der Agenten.
  • Tabelle der betroffenen Themen: Jedes Thema mit seinem aktuellen Wert und dem von der KI vorgeschlagenen Ersatz.
  • Empfehlung: Eine konkrete Maßnahme zur Behebung des Problems.
  • Mehr erfahren: Ein direkter Link zur entsprechenden Microsoft Learn-Dokumentation.

Screenshot des Musterdetail-Bereichs mit Musterbeschreibung, betroffenen Themen, Empfehlungen und dem Link „Mehr erfahren“.

Compliance-Detail-Drilldown

Wenn Sie Details zu einem fehlerhaften Compliance-Kriterium auswählen, öffnet sich der Bereich Compliance Details. Es zeigt:

  • Kriteriumsname, Kategorie und Schweregrad
  • Was das Kriterium prüft: Eine einfache Erklärung
  • Spezifisches Problem gefunden: Die KI-Analyse, was fehlt oder falsch ist
  • Empfehlung: Exakte Sprache oder Muster, die den Anweisungen des Agenten hinzugefügt werden
  • Beispiel: Wo verfügbar, ein Beispiel für eine konforme Anweisung
  • Erfahren Sie mehr: Link zu den relevanten Microsoft Learn-Leitfäden

Exportieren von Ergebnissen

Sie können Ergebnisse in drei Formaten aus dem Prüfungsfenster-Header exportieren.

PDF-Bericht

Ein ausgefeilter, für Menschen lesbarer PDF-Bericht, der sich zum Teilen mit Stakeholdern oder zum Anhängen an ein Governance-Audit eignet.

Inhalt:

  • Zusammenfassung mit Scores und Schlüsselkennzahlen
  • Ergebnisse der Musterbewertung (Status, Schwere und betroffene Personen)
  • Konformitätsbefunde (alle 15 Kriterien)
  • Empfehlungen für jedes gefundene Problem
  • Metadaten des Agenten (Name, Umgebung, Bewertungsdatum)

Dateinamenmuster: {AgentName}_review_{YYYY-MM-DD}.pdf

Das PDF wird am Ende jeder Überprüfung automatisch generiert und in Dataverse zusammen mit dem Überprüfungs-Datensatz gespeichert. Nachfolgende Downloads rufen die gespeicherte Datei ab, ohne die Analyse erneut durchzuführen.

SARIF-Export

SARIF (Static Analysis Results Interchange Format v2.1.0) ist ein JSON-Format, das für die Integration mit Entwicklertools und CI/CD-Pipelines entwickelt wurde.

Anwendungsfälle:

  • Hochladen auf GitHub Advanced Security für SARIF-basierte PR-Annotationen
  • Import in Azure DevOps Quality Gate Checks
  • Prozessiere mit Drittanbieter-Tools, die SARIF (SonarQube, Visual Studio Code usw.) verbrauchen

Übersicht über die Struktur:

{
  "version": "2.1.0",
  "runs": [{
    "tool": {
      "driver": {
        "name": "Copilot Studio Agent Review Tool",
        "version": "1.0"
      }
    },
    "results": [
      {
        "ruleId": "pat-007",
        "level": "error",
        "message": { "text": "Excessive Tools Usage: 28 tools exceed the recommended limit of 25" },
        "properties": {
          "category": "Architecture",
          "recommendation": "Reduce tool count to 25 or fewer"
        }
      }
    ]
  }]
}

Severity-to-SARIF-Ebenen-Zuordnung:

  • High = "error"
  • Medium = "warning"
  • Low = "note"

Dateinamenmuster: {AgentName}_review.sarif

Exportieren nach Excel

Ein Excel-Arbeitsbuch mit mehreren Blättern für Datenanalyse, Berichterstattung und Archivierung.

Tabelle Inhalt
Zusammenfassung Eine Reihe pro überprüftem Agent – Name, Bewertungen, Ausgabenanzahl, Bewertungsdatum
Muster Alle 18 Muster – ID, Name, Kategorie, Schweregrad, Status, betroffene Themen, Empfehlung
Einhaltung Alle 15 Kriterien – Ausweis, Name, Kategorie, Schweregrad, Status, Problemanzahl, Empfehlung

Die Überschriften sind kräftig mit markenfarbenen Hintergründen. Punkte- und Schweregradzellen sind farblich gekennzeichnet in Grün, Bernstein oder Rot. Spaltenbreiten passen sich automatisch an.

Dateinamenmuster: {AgentName}_review_{YYYY-MM-DD}.xlsx

Deklarative Agentenbewertung, tiefgehende Recherche

Microsoft 365 deklarative Agenten sind eine andere Art von Agent als Copilot Studio Agents. Sie werden vollständig durch eine JSON-Manifestdatei definiert und im Microsoft 365-Ökosystem bereitgestellt.

Was die deklarative Agent-Überprüfung prüft

Die Überprüfung validiert zunächst die Manifeststruktur und prüft, dass alle erforderlichen Felder vorhanden sind und das Schema gut geformt ist. Anschließend wird eine KI-Bewertung anhand von fünf Qualitätskriterien durchgeführt und ein PDF-Bericht erstellt. Die 15-Kriterium-Compliance-Prüfung der Anweisungen (speziell für Copilot Studio-Agenten) gilt hier nicht.

Die 5 Bewertungskriterien des deklarativen Agenten

Kriterium Gewichtung Was bewertet wird
Anweisungen 30 % Klarheit, Spezifität und Vollständigkeit der Systemaufforderung des Agenten
Wissen 20 % Nutzung verbundener Wissensquellen zum Grounding
Funktionalitäten 15 % Verwendung von CodeInterpreter und OneDriveAndSharePoint-Funktionen
Aktionen 15 % Anwesenheit und Qualität der Werkzeugaktionsbeschreibungen
Gesprächseinstiege 10 % Anzahl und Qualität (mindestens 3, empfohlene 6)
Elegante Fehlerbehandlung 10 % Umgang mit unbekannten Eingaben und Fehlerzuständen

Manifest-Integritätsprüfung (lokale Validierung)

Bevor die KI ausgeführt wird, validiert eine deterministische Integritätsprüfung die Manifeststruktur:

  • Erforderliche Felder vorhanden (name, description, instructions)
  • Schema-Versionskompatibilität
  • Gültige Aktions-Plugin-Referenzen
  • Gesprächsstarter zählen innerhalb der Grenzen (3-12)
  • Korrekt geformte Fähigkeitserklärungen

Etwaige Integritätssüberprüfungsfehler erscheinen als Probleme in den Ergebnissen der Überprüfung des deklarativen Agenten, unabhängig von der KI-Bewertung.

Reichen Sie einen deklarativen Agent zur Überprüfung ein

Über ZIP-Upload (am häufigsten):

  1. Exportieren Sie den deklarativen Agent aus Ihrem Dokumenterstellungs-Tool als ZIP-Paket.
  2. Wählen Sie Upload ZIP im Seitenkopf des Agent-Überprüfungstools aus.
  3. Wenn die ZIP mehrere Agenten enthält, können Sie in einem Auswahlbereich auswählen, welchen Sie überprüfen möchten.
  4. Die Überprüfung läuft automatisch.

Über den Microsoft 365-Katalog (erfordert die Einrichtung der Graph-API):

  1. Wählen Sie auf der Registerkarte Microsoft 365 Agenten Mit Microsoft 365 verbinden aus.
  2. Schließen Sie den Graph-API-Autorisierungs-Assistenten ab.
  3. Ihre bereitgestellten deklarativen Agenten werden im deklarativen Agent-Raster angezeigt.
  4. Wählen Sie Bewertung für jeden deklarativen Agenten.

Screenshot des deklarativen Agent-Überprüfungsbereichs, das Ergebnisse der Manifest-Integritätsprüfung und der KI-Bewertung zeigt.

Sicherheit und Datenzugriff

Dieser Abschnitt beschreibt, wie das Agent Überprüfungs-Tool mit Sicherheit und Datenzugriff umgeht.

Datenspeicher

Alle Überprüfungsergebnisse werden in der cat_agentreviews Dataverse-Tabelle gespeichert. Jeder Datensatz speichert:

Feld Inhalt
cat_agentreviewsid Eindeutige Bewertungsdatensatz-ID
cat_botid Verweise auf den überprüften Agenten
cat_overallscore Gesamtpunktzahl 0-100
cat_patternscore Musterbewertungswert
cat_instructionscore Instruktionskonformitätswert
cat_totalissues Gesamtanzahl der Probleme
cat_reviewresultjson Vollständiges Überprüfungsergebnis als JSON
cat_reviewpdfreport_name PDF-Bericht (Dataverse-Dateispalte)
cat_sourceenvironment Quell-Umgebungs-URL oder zip
cat_agenttype 1= Copilot Studio, 2 = deklarativer Agent

Sicherheit auf Zeilenebene

Die cat_agentreviews Tabelle verwendet Leseumfang auf Benutzerebene (Basic) in Dataverse. Nutzer können nur Bewertungen sehen, die sie selbst erstellt haben. Die Bewertungen eines anderen Nutzers sind nie sichtbar, selbst nicht in derselben Umgebung. Dataverse erzwingt diese Sicherheit nativ, nicht den Anwendungscode.

Quellumgebungen

Nutzer können Agenten aus Umgebungen überprüfen, auf die sie Zugriff haben, nicht nur aus der aktuellen Umgebung. Das Dashboard unterstützt Umgebungsüberprüfungen über den Umweltselektor. Bewertungen aus anderen Umgebungen werden mit der URL der Quellumgebung markiert, sodass sie korrekt erscheinen, wenn das Tool geladen wird.

Überprüfungen, die aus einem ZIP-Upload stammen, werden immer angezeigt, unabhängig davon, mit welcher Umgebung das Tool verbunden ist.

Welche Daten verlassen die Umgebung

  • Die Konfiguration des Agenten (Themen, Werkzeuge, Anweisungen) wird über Dataverse PredictV2 an die KI-Modelle gesendet. Dieser durchläuft den standardmäßigen Aufrufpfad für das Dataverse-KI-Modell und unterliegt denselben Datenresidenzrichtlinien wie jeder Dataverse-KI-Vorgang.
  • Es werden keine Daten an einen Drittanbieterdienst oder externen Endpunkt gesendet.
  • Überprüfungsergebnisse (einschließlich des PDFs) werden ausschließlich in Dataverse gespeichert.

Erstmalige Erfahrung und Begrüßungstour

Beim ersten Öffnen des Agent-Überprüfungstools führt ein Nutzer durch die wichtigsten Teile der Benutzeroberfläche:

  1. Die Dashboard-Statistikkarten und was sie repräsentieren
  2. Wie man den Agentraster liest
  3. So starten Sie eine Überprüfung
  4. Wie die Ergebnisse interpretiert werden
  5. Die Exportoptionen

Der Tourfortschritt bleibt in Dataverse bestehen, sodass die Tour nach Abschluss nicht wiederholt wird. Nutzer können die Tour jederzeit im Bereich Hilfe / Schnelle Links im Seitenkopf wieder öffnen.

Häufig gestellte Fragen

Dieser Abschnitt behandelt häufige Fragen zum Agent Überprüfungs-Tool.

Wie lange dauert eine Überprüfung?

Ein typischer Agent mit weniger als 20 Themen ist in weniger als 60 Sekunden fertig. Das Tool hat eine 2-minütige Unterbrechung. Sehr große Agenten (mehr als 50 Themen, viele Werkzeuge) könnten an die Grenze kommen.

Verändert das Werkzeug meinen Agenten?

Nein. Das Werkzeug ist in Bezug auf Agentendaten vollständig schreibgeschützt. Es liest nur die Agentenkonfiguration. Alles Geschriebene geht in die cat_agentreviews Tabelle.

Kann ich einen Mandant nach Änderungen erneut überprüfen?

Ja. Jede Rezension schafft einen neuen Datensatz. Das Raster zeigt immer das aktuellste Bewertungsergebnis an. Alte Überprüfungen bleiben in Dataverse und können bei Bedarf programmatisch abgerufen werden.

Was ist, wenn mein Agent in einer anderen Umgebung ist?

Benutzen Sie den Umwelt-Selektor im Dashboard, um das Tool auf eine andere Umgebung zu richten, auf die Sie Zugriff haben. Die Überprüfung läuft gegen diese Umgebung ab und das Ergebnis wird in der aktuellen Umgebung gespeichert.

Kann ich Agenten überprüfen, die ich nicht erstellt habe?

Ja. Sie können jeden Agenten, auf den Sie Zugriff haben, in Dataverse überprüfen. Allerdings können Sie nur Bewertungen sehen, die Sie erstellt haben (Sicherheitsstufe auf Zeilenebene). Bewertungen anderer Nutzer sind nicht sichtbar.

Was ist SARIF und brauche ich es?

SARIF ist ein Standardformat für statische Analyseergebnisse. Sie brauchen es nur, wenn Sie Agent-Qualitätsprüfungen in eine CI/CD-Pipeline integrieren (GitHub Actions oder Azure DevOps). Für die meisten Nutzer reichen PDF- und Excel-Exporte aus.

Das Tool sagt, mein Agent hat keine Anweisungen. Ist das ein Problem?

Ja. Das Tool zeigt nur Agenten an, die generative KI aktiviert haben, daher wird erwartet, dass jeder Agent Raster Anweisungen bekommt. Wenn die Compliance-Prüfung keine Anweisungen meldet, ist die generative Orchestrierung des Agenten aktiv, aber es wurden noch keine SystemAnweisungen geschrieben. Das Hinzufügen von Anweisungen wird dringend empfohlen.

Warum ist „Persona und Tonfall“ so niedrig schwerwiegend?

Microsofts Leitlinien weisen darauf hin, dass ein professioneller, höflicher Ton bereits das Standardverhalten von Copilot Studio-Agenten ist. Tonanleitungen sind nur notwendig, wenn Sie einen nicht-standardmäßigen Ton möchten. Dieses Kriterium ist niedrig, da ein Nichtbestehen selten zu benutzerspezifischen Problemen führt.

Verbraucht das Durchführen einer Bewertung Copilot-Credits?

Ja. Jede Überprüfung ruft KI-Modelle dreimal auf – zur Musterbewertung, zur Einhaltung von Anweisungen und zur PDF-Generierung. Jeder Aufruf verbraucht Copilot-Credits von Ihrem Mandant. Die erneute Überprüfung desselben Agenten verbraucht ebenfalls Credits, also nehmen Sie zuerst Ihre Änderungen vor und überprüfen Sie dann erneut.

Kann ich alle Bewertungen auf einmal exportieren?

Ja. Verwenden Sie die Schaltfläche Alle Exportieren in der Agent-Rasterleiste, um ein Excel-Arbeitsbuch zu erstellen, das alle überprüften Agenten in der aktuellen Ansicht abdeckt.