Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Das Agent-Überprüfungstool ist ein automatisiertes Qualitätsbewertungs- und Compliance-Überprüfungssystem für Microsoft Copilot Studio-Agenten und Microsoft 365 deklarative Agenten. Es hilft Erstellern, Administratoren und Governance-Teams, Probleme, Anti-Muster und Compliance-Lücken zu erkennen, bevor sie Endnutzer erreichen.
Da Organisationen ihre Copilot Studio Bereitstellungen skalieren, wird es unmöglich, die Konfiguration, Anweisungen und die Themenstruktur jedes Agenten manuell zu überprüfen. Das Agent-Überprüfungstool automatisiert diese Überprüfung durch KI-gestützte Analyse und liefert in der Regel in weniger als 60 Sekunden umsetzbare Erkenntnisse.
Es ist für:
- Ersteller: Holen Sie sich umsetzbares Feedback, um die Qualität der Agenten vor der Einführung zu verbessern.
- Administratoren und CoE-Teams: Setzen Sie Governance-Standards über alle Agenten in einer Umgebung durch.
- Sicherheits- und Compliance-Beauftragte: Überprüfen Sie, dass die Mitarbeiter Datenschutz-, Sicherheits- und Genauigkeitsrichtlinien einhalten.
Wichtige Funktionen
| Funktion | Einzelheiten |
|---|---|
| Agentabdeckung | Copilot Studio-Agenten und Microsoft 365 deklarative Agenten |
| Überprüfungszeit | Typischerweise weniger als 60 Sekunden pro Agent |
| Muster überprüft | 18 Muster (10 deterministisch + 8 KI-gesteuert) |
| Konformitätskriterien | 15 Qualitätskriterien für den Unterricht |
| Punktesystem | Gesamtpunktzahl 0–100 (50 % Muster, 50 % Compliance) |
| Exportformate | PDF, SARIF, Excel |
| Datenspeicher | Microsoft Dataverse (benutzerbezogen, zeilenbasierte Sicherheit durchgesetzt) |
| KI-Modul | Microsoft Copilot Studio KI-Eingabeaufforderungen über Dataverse PredictV2 |
Erste Schritte: Das Dashboard
Wenn Sie das Agent-Überprüfungstool öffnen, kommen Sie zum Dashboard, dem zentralen Hub, der alle Agenten in Ihrer Umgebung und ihren Bewertungsstatus anzeigt.
Dashboardlayout
Das Dashboard zeigt alles auf einen Blick: die Registerkartenleiste, die zwischen Copilot Studio und Microsoft 365 Agenten wechselt, vier Stat-Karten mit der Zusammenfassung der Portfolio-Gesundheit, eine Suchleiste, das paginierte Agentenraster und die Schaltfläche ZIP hochladen für Offline-Bewertungen.
Statuskarten
Die vier Statuskarten geben eine Momentaufnahme der Integrität Ihres Agentenportfolios:
| Card | Was sie zeigt | Wie wird es berechnet |
|---|---|---|
| Total Agenten | Zählt alle aktiven Bots in der Umgebung. | Fragen Sie die bot Tabelle wo statecode = 0 |
| Geprüft | Anzahl und Prozentsatz der überprüften Agenten. | Anzahl der abgeschlossenen Bewertungen geteilt durch die Gesamtzahl der Agenten |
| Durchschnittlicher Score | Durchschnittlicher Score über alle abgeschlossenen Rezensionen. | Summe der Scores geteilt durch die überprüfte Anzahl |
| Probleme gesamt | Kumulative Probleme wurden bei allen überprüften Agenten gefunden. | Summe von Musterfehlern plus Konformitätsfehler |
Agent-Raster
| Spalte | Inhalt |
|---|---|
| Name | Agent-Anzeigename mit Symbol. |
| Ergebnis | Gesamtbewertung (0–100) oder -- , falls noch nicht bewertet. Farbcodiert. |
| Probleme | Zusammenfassung der Befunde bei hoher, mittlerer und niedriger Schweregrad.
-- wenn nicht überprüft. |
| Zuletzt überprüft | Relative Zeit (zum Beispiel vor 2 Stunden oder vor 1 Woche) oder Nicht überprüft. |
| Aktionen | Überprüfung auf nicht geprüfte Agenten; Suchen Sie nach Agenten mit bestehenden Bewertungen. |
Umgebung auswählen
Standardmäßig zeigt das Tool Agenten aus der Umgebung an, in der Sie diese installiert haben. Wenn Sie einen Agenten aus einer anderen Umgebung überprüfen müssen, verwenden Sie den Umgebungsauswahlmechanismus in der Dashboard-Toolbar. Das Dropdown-Menü listet alle Power Platform-Umgebungen auf, auf die Sie Zugriff haben.
Nachdem Sie eine andere Umgebung ausgewählt haben, aktualisiert sich das Agentenraster und zeigt Agenten aus dieser Umgebung an. Sie können dann jeden dieser Agenten prüfen. Das Bewertungsergebnis wird in der aktuellen (Heim-)Umgebung gespeichert, nicht in der von Ihnen ausgewählten.
Überprüfungsmodi
Das Tool unterstützt zwei unterschiedliche Überprüfungsmodi, die über die Registerkarten-Leiste oben im Dashboard zugänglich sind.
Copilot Studio Agent Überprüfung
Dieser Modus überprüft Agenten, die in Microsoft Copilot Studio erstellt wurden. Er liest direkt aus Dataverse – kein Dateiupload erforderlich.
Was analysiert wird:
- Themenkonfigurationen (Namen, Beschreibungen, Variablen).
- Werkzeug- und Aktionskonfigurationen (Zählung, Beschreibungen, Routing).
- Wissensquellenarten.
- Testfallabdeckung.
- AgentenAnweisungen (generativer Modus).
- Agent-Metadaten (Sprache, Authentifizierung, KI-Einstellungen).
So starten Sie eine Überprüfung:
- Finden Sie Ihren Agent im Raster.
- Wählen Sie Überprüfen aus. Der Analyseauftrag startet automatisch.
- Ein Fortschrittsbereich zeigt in Echtzeit, was passiert.
- Die Ergebnisse werden nach Abschluss im Begutachtungsgremium geöffnet.
Sie können jederzeit jeden Agents erneut prüfen. Jede Bewertung erstellt einen neuen Datensatz in Dataverse. Das Raster zeigt immer das aktuellste Bewertungsergebnis an.
Deklarative Agentüberprüfung (Microsoft 365 Copilot)
Dieser Modus überprüft Microsoft 365 deklarative Agenten, die durch eine manifestierte JSON-Datei definiert und im Microsoft 365 Copilot-Ökosystem bereitgestellt werden.
Sie können einen deklarativen Agent auf zwei Arten zur Überprüfung einreichen:
| Methode | Wie? | Verwenden des s |
|---|---|---|
| Upload-ZIP | Wählen Sie im Seiten-Header Upload ZIP aus und wählen Sie das exportierte Paket aus. | Der Agent stammt von einem anderen Mandant oder steht nicht in Ihrem Katalog. |
| Aus dem Microsoft 365-Katalog | Verbinden Sie sich mit Microsoft 365 über den Graph-API-Einrichtungsassistenten und durchsuchen Sie dann die Agenten. | Der Agent ist in Ihrem Microsoft 365 Mandant bereitgestellt. |
Was analysiert wird (5 Kriterien, nicht 15):
| Kriterium | Gewichtung | Was geprüft wird |
|---|---|---|
| Anweisungen | 30 % | Klarheit, Vollständigkeit und Qualität der Agent-Anweisungen |
| Wissen | 20 % | Verankerung durch verbundene Wissensquellen |
| Funktionalitäten | 15 % | Verwendung von CodeInterpreter und OneDriveAndSharePoint |
| Aktionen | 15 % | Werkzeug-Routing und Aktionsbeschreibungen |
| Gesprächseinstiege | 10 % | Mindestens 3, empfohlene 6 (maximal 12) |
| Elegante Fehlerbehandlung | 10 % | Fehlerwiederherstellung und Rückfallverhalten |
Anmerkung
Die 15-Kriterium-Anweisungs-Compliance-Prüfung ist speziell für Copilot Studio-Agenten und gilt nicht für deklarative Agenten.
Was passiert bei einer Überprüfung
Wenn Sie Überprüfen auswählen, führt das Tool eine automatisierte Analyse durch, die in der Regel in weniger als 60 Sekunden abgeschlossen ist. Ein Fortschrittsbereich hält Sie auf dem Laufenden, während es ausgeführt wird.
Die Analyse umfasst drei Dinge in der Reihenfolge:
- Konfigurationsanalyse: Das Tool liest die vollständige Konfiguration des Agenten aus Dataverse – jedes Thema, Werkzeug, jede Wissensquelle, jeden Testfall und jede Anweisung. Es prüft fehlende Felder in allen Komponenten und misst Dinge wie Werkzeuganzahl und Testabdeckung anhand der dokumentierten Best Practices von Microsoft.
- KI-gestützte Musterbewertung Ein KI-Modell überprüft dieselbe Konfiguration, um die Qualität zu bewerten, nicht nur die Vollständigkeit. Es untersucht, ob Themennamen und -beschreibungen klar genug sind, damit der generative Orchestrator sie korrekt routen kann, ob sich mehrere Themen auf eine Weise überschneiden, die zu Routing-Verwirrung führt, und ob Werkzeugbeschreibungen der KI genügend Anleitung geben, um das richtige Tool zur richtigen Zeit zu aktivieren.
- Anweisungs-Compliance-Prüfung: Ein zweites KI-Modell liest die Systemanweisungen des Agenten und prüft sie anhand von 15 Best-Practice-Kriterien aus Microsofts Generative-Mode-Leitlinien – einschließlich Umfang, Sicherheit, Antwortqualität und Nutzererfahrung. Für jedes Kriterium, das die Anweisungen nicht erfüllt, wird eine spezifische Erkenntnis und eine konkrete Empfehlung hervorgebracht.
Nachdem alle drei Schritte abgeschlossen sind, wird automatisch ein PDF-Bericht erstellt und die Ergebnisse werden im Prüfungsgremium geöffnet.
Wichtig
Jede Bewertung verbraucht Copilot-Credit. Die KI-gestützten Schritte (Musterbewertung, Befehlsüberprüfung und PDF-Generierung) rufen jeweils ein KI-Modell über Dataverse auf. Planen Sie entsprechend, wenn Sie eine große Anzahl von Mandanten überprüfen.
Erkannte Muster
Muster identifizieren spezifische Anti-Muster oder fehlende Best Practices in der Konfiguration eines Agenten. Das Tool prüft 18 Muster in 7 Kategorien.
Alle 18 Muster
| ID | Mustername | Kategorie | Auswirkungen |
|---|---|---|---|
pat-001 |
Fehlender Modellname | Modellbenennung | Der generative Orchestrator kann nicht zuverlässig zu diesem Thema führen. |
pat-002 |
Fehlende Modellbeschreibung | Modellbeschreibung | Das Thema könnte während des Routings übersprungen oder fälschlicherweise ausgelöst werden. |
pat-003 |
Fehlender Name der Eingabevariablen | Eingabevariablen | Nutzer sehen unbenannte Variablen, was im Gespräch zu Verwirrung führt. |
pat-004 |
Beschreibung fehlender Eingabevariablen | Eingabevariablen | KI kann den richtigen Wert aus Nutzereingaben nicht korrekt extrahieren. |
pat-005 |
Fehlender Name der Ausgabevariablen | Ausgabevariablen | Die Ausgabewerte sind unbeschriftet und für Nutzer schwer zu interpretieren. |
pat-006 |
Beschreibung fehlender Ausgabevariablen | Ausgabevariablen | KI fehlt der Kontext, um die Variable korrekt auszufüllen. |
pat-007 |
Übermäßiger Einsatz von Werkzeugen | Architektur | Zu viele Werkzeuge beeinträchtigen die Routing-Genauigkeit und erhöhen die Latenz. |
pat-008 |
Unzureichende Testfälle | Beurteilung | Regressionen im Themenverhalten bleiben vor der Einführung unbemerkt. |
pat-009 |
Beschreibung des fehlenden untergeordneten Agents | Architektur | Der Orchestrator kann nicht entscheiden, wann er an den untergeordneten Agent delegiert. |
pat-010 |
Untergeordnete Agent Architektur Ausbreitung | Architektur | Übermäßige Delegation führt zu Orchestrierungskomplexität und Latenz. |
pat-011 |
Unklarer Modellname | Modellbenennung | Vage Namen führen dazu, dass der Orchestrator zum falschen Thema wechselt. |
pat-012 |
Unklare Modellbeschreibung | Modellbeschreibung | Schlechte Beschreibungen führen zu übersehenen oder falschen Themen-Auslösern. |
pat-013 |
Unklarer Name der Eingabevariablen | Eingabevariablen | Mehrdeutige Namen erschweren es der KI, die Variable korrekt auszufüllen. |
pat-014 |
Unklare Beschreibung der Eingabevariablen | Eingabevariablen | KI extrahiert den falschen Wert oder stellt unnötige klärende Fragen. |
pat-015 |
Unklarer Name der Ausgabevariablen | Ausgabevariablen | Downstream-Themen oder -flüsse, die diese Variable konsumieren, könnten sie falsch interpretieren. |
pat-016 |
Unklare Beschreibung der Ausgabevariablen | Ausgabevariablen | KI kann das erwartete Ausgabeformat oder den Wert nicht zuverlässig erzeugen. |
pat-017 |
Überlappende Themenbeschreibungen | Modellbeschreibung | Mehrere Themen konkurrieren um dieselben Nutzeräußerungen, was zu unvorhersehbarem Routing führt. |
pat-018 |
Werkzeug-Routing-Lücke | Architektur | Die KI kann sich nicht entscheiden, welches Tool sie aufrufen soll, was zu falschen Tool-Invocations oder keiner Aktion führt. |
Für jedes fehlerhafte Muster zeigt das Tool an, welche Themen betroffen sind, den aktuellen Wert, der die Entdeckung ausgelöst hat, eine vorgeschlagene Verbesserung und einen Link zur relevanten Microsoft Learn-Dokumentation.
Musterkategorien
Das Ergebnisraster gruppiert Muster in sieben Kategorien, die in folgender Reihenfolge sortiert sind:
| # | Kategorie | Integrierte Muster |
|---|---|---|
| 1 | Modellbenennung |
pat-001, pat-011 |
| 2 | Modellbeschreibung |
pat-002, pat-012, pat-017 |
| 3 | Eingabevariablen |
pat-003, pat-004, pat-013, pat-014 |
| 4 | Ausgabevariablen |
pat-005, pat-006, pat-015, pat-016 |
| 5 | Architektur |
pat-007, pat-009, pat-010, pat-018 |
| 6 | Orchestrierung | Reserviert für zukünftige KI-erkannte Muster |
| 7 | Beurteilung | pat-008 |
Schweregrad-Logik
Die Kombination aus Schlüsselwort-Übereinstimmung und Themenanzahl bestimmt den Schweregrad des Musters:
| Bedingung | Schweregrad zugewiesen |
|---|---|
| Der Mustername enthält „Modellname“ oder „Modellbeschreibung“ | Hoch |
| Der Mustername enthält „Variable“ | Medium (außer die Themenzahl beträgt 5 oder mehr) |
| Themenzahl beträgt 5 oder mehr | Hoch |
| Themenzahl beträgt 2 oder mehr | Medium |
| Themenzahl beträgt 1 | Niedrig |
Der Schweregrat bestimmt sowohl das visuelle Abzeichen im Ergebnisraster als auch den SARIF-Fehlerstand im exportierten Bericht.
Konformitätskriterien
Dieser Teil der Überprüfung bewertet die Qualität der Systemanweisungen eines Agenten – des natürlichen Textes, den ein Ersteller in den generativen Einstellungen von Copilot Studio bereitstellt. Diese Anweisungen definieren, wie sich der Agent in allen Gesprächen verhält.
Die 15 Kriterien stammen aus Microsofts Leitlinien für den generativen Modus und stellen die wirkungsvollsten bewährten Methoden für die Qualität der Anweisung dar.
Alle 15 Kriterien
| # | ID | Kriterienname | Kategorie | Schweregrad | Was es überprüft |
|---|---|---|---|---|---|
| 1 | scope-definition |
Definition des Geltungsbereichs | Geltungsbereich | Hoch | Die Agent-Anweisungen definieren explizit, auf welche Themen der Agent reagieren sollte und auf welche nicht. |
| 2 | out-of-scope-handling |
Abwicklung außerhalb des Bereichs | Geltungsbereich | Medium | Anweisungen geben an, was gesagt werden soll, wenn ein Nutzer nach etwas außerhalb des Zuständigkeitsbereichs des Agenten fragt. |
| 3 | persona-and-tone |
Persona und Ton | UX | Niedrig | Anweisungen definieren den Ton für Nicht-Standard-Szenarien. (Professionell/höflich ist bereits der Standard – überspringen, wenn nicht nötig.) |
| 4 | privacy-and-sensitive-data |
Datenschutz und vertrauliche Daten | Safety | Hoch | Anweisungen enthalten explizite Hinweise, wann personenbezogene Daten nicht gespeichert, angezeigt oder wiederholt werden sollen. |
| 5 | fallback-when-uncertain |
Rückfalloption bei Unsicherheit | Qualität | Hoch | Die Anweisungen geben an, was zu tun ist, wenn der Agent nicht über die nötigen Informationen verfügt, um zu antworten. |
| 6 | citations-and-sources |
Zitate und Quellen | Qualität | Medium | Anweisungen verlangen, dass der Agent Dokumentnamen und Abschnitte zitiert, wenn er auf Wissensquellen verweist. |
| 7 | formatting-guidelines |
Formatierungsrichtlinien | UX | Niedrig | Anweisungen geben das Antwortformat (Stichpunkte, Tabellen, nummerierte Schritte) für strukturierte Ausgaben an. |
| 8 | clarifying-questions |
Klärende Fragen | UX | Medium | Die Anweisungen behandeln, wie man mit mehrdeutigen Fragen umgeht, indem sie klärende Nachfragen stellen. |
| 9 | prompt-injection-resilience |
Schutz vor Prompt-Injection-Angriffen | Safety | Hoch | Die Anweisungen enthalten explizite Schutzmaßnahmen gegen Jailbreak-Versuche oder Prompt-Injection-Angriffen. |
| 10 | link-safety |
Link-Sicherheit | Safety | Medium | Die Anweisungen stellen sicher, dass nur verifizierte, sichere Links mit den Nutzern geteilt werden. |
| 11 | advice-disclaimers |
Haftungsausschlüsse für Hinweise | Safety | Hoch | Die Anweisungen enthalten Haftungsausschlüsse für vertrauliche Hinweisbereiche (Finanzen, Gesundheit, Recht). |
| 12 | accuracy-quality |
Genauigkeit und Qualität | Qualität | Hoch | Anweisungen verankern den Agenten ausdrücklich in seinen Wissensquellen und verbieten Fälschung oder Raten. |
| 13 | tool-routing-hints |
Tipps zum Tool-Routing | Qualität | Medium | Die Anweisungen geben Hinweise darauf, welche Tools oder Wissensquellen verwendet werden sollten, wenn das Routing unklar ist. |
| 14 | escalation-guidance |
Eskalationsleitfaden | UX | Hoch | Anweisungen definieren, was zu tun ist, wenn der Agent nicht helfen kann: an einen Menschen übergeben, eine Alternative vorschlagen oder elegant beenden. |
| 15 | deterministic-language |
Deterministische Sprache | Qualität | Medium | Anweisungen verwenden absolute Ansagen (immer, nie, nur, muss) statt vager Modifikatoren (könnte, gewöhnlich, versuchen, manchmal). |
Kategorienaufschlüsselung
| Kategorie | Kriterienzählung | Fokus |
|---|---|---|
| Geltungsbereich | 2 | Definiert, was der Agent beantwortet und was nicht |
| Safety | 4 | Schützt Nutzer vor Fehlinformationen, Datenlecks und Manipulation |
| Qualität | 5 | Sichert präzise, begründete und gut strukturierte Antworten |
| UX | 4 | Prägt das Gesprächserlebnis und die Eskalationspfade |
Die Art, wie Scores berechnet werden
Alle Scores liegen auf einer Skala von 0–100 und sind deterministisch. Die gleichen Eingaben liefern immer die gleiche Punktzahl.
Muster-Score
Pattern Score = (Passed Patterns / Total Patterns) × 100
- Gesamtmuster = 10 deterministisch + wie viele KI-erkannte Muster zurückgegeben werden (bis zu 8).
-
Frühere Muster = Zählung, wo der Musterstatus ist
pass. - Ergebnis wird auf die nächste ganze Zahl gerundet.
Beispiel: Insgesamt 15 Muster, 12 bestanden = Muster-Score von 80.
Anweisungs-Score
Der Anweisungs-Score verwendet ein gewichtetes Punktesystem, das auf der inhärenten Schwerestärke jedes Kriteriums basiert:
| Inhärente Schwere | Punkte, wenn bestanden | Kriterienzählung | Maximale Punktzahl |
|---|---|---|---|
| Hoch | 3 | 7 | 21 |
| Medium | 2 | 6 | 12 |
| Niedrig | 1 | 2 | 2 |
| Summe | 15 | 35 |
Instruction Score = (Earned Points / 35) × 100
- Für jedes der 15 Kriterien werden, falls kein Problem für dieses Kriterium festgestellt wird, dessen inhärente Schweregrad hinzugefügt.
- Wenn „fehlende Anweisungen“ erkannt werden, fallen alle Kriterien durch und das Score ist 0.
- Das Ergebnis wird auf 100 gerechnet und auf die nächstgelegene ganze Zahl gerundet.
Beispiel: 3 hohe und 2 mittlere Kriterien scheitern:
- Erzielte Punkte: (4 × 3) + (4 × 2) + (2 × 1) = 12 + 8 + 2 = 22 Punkte.
- Score = (22 / 35) × 100 = 63.
Gesamtscore
Overall Score = (Pattern Score × 0.5) + (Instruction Score × 0.5)
Beide Dimensionen werden gleich stark gewichtet. Wenn nur eine Dimension verfügbar ist (zum Beispiel existieren keine Anweisungen), wird der Score dieser Dimension direkt verwendet.
Farb- und Beschriftungshinweise zum Score
| Score-Bereich | Label | Farbe |
|---|---|---|
| 80 und höher | Ausgezeichnet | Grün |
| 60 bis 79 | Gut | Amber |
| 40 bis 59 | Mittelmäßig | Rot |
| Unter 40 | Verbesserung erforderlich | Rot |
Ergebnisse überprüfen
Nach Abschluss der Überprüfung werden im Prüfungsfenster die Ergebnisse angezeigt. Das Fenster verfügt über drei Registerkarten.
Registerkarte Übersicht
Die Registerkarte Übersicht gibt Ihnen eine übergeordnete Zusammenfassung:
- Gesamtscore: Ein kreisförmiges Messgerät in Grün, Bernstein oder Rot.
- Muster-Score und Anweisungs-Score nebeneinander.
- Agent-Metadaten: Name, Umgebung, Sprache, Authentifizierungsmodus, KI-Einstellungen.
- KI-generierte Zusammenfassung: Eine Beschreibung der wichtigsten Ergebnisse in natürlicher Sprache.
- Überprüfen Sie Zeitstempel und Datenquelle (Live-Umgebung oder ZIP-Upload).
Muster-Registerkarte
Auf der Registerkarte Muster wird das vollständige Raster aller 18 ausgewerteten Muster mit den folgenden Spalten angezeigt:
| Spalte | Beschreibung des Dataflows |
|---|---|
| Status | Bestanden oder Nicht bestanden |
| Schweregrad | Höheres, mittleres oder niedriges Badge |
| Kategorie | Musterkategorie (Modellnamen, Architektur usw.) |
| Mustername | Vollständiger Mustername |
| Betroffene Themen | Anzahl der von diesem Muster betroffenen Themen |
| Aktionen | Detail-Schaltfläche zum Öffnen des Musterdetail-Bereichs |
Sie können das Raster nach beliebigen Spalten sortieren. Standardmäßig erscheinen fehlerhafte Muster zuerst, sortiert nach Schweregrad (Hoch, dann Mittel, dann Niedrig).
Compliance-Registerkarte
Die Registerkarte Compliance zeigt alle 15 Anweigungskriterien an:
| Spalte | Beschreibung des Dataflows |
|---|---|
| Status | Bestanden oder Nicht bestanden |
| Schweregrad | Höheres, mittleres oder niedriges Badge |
| Kategorie | Umfang, Sicherheit, Qualität oder UX |
| Kriterienname | Vollständiger Kriterienname |
| Gefundene Probleme | Anzahl der spezifischen Probleme unter diesem Kriterium |
| Aktionen | Detail-Schaltfläche zum Öffnen des Compliance-Detail-Bereichs |
Musterdetail-Drilldown
Wenn Sie Details bei einem fehlerhaften Muster auswählen, öffnet sich der Bereich Muster-Detail. Es zeigt:
- Mustername und Beschreibung: Was dieses Muster überprüft.
- Warum es wichtig ist: Die Auswirkungen dieses Anti-Musters auf die Qualität der Agenten.
- Tabelle der betroffenen Themen: Jedes Thema mit seinem aktuellen Wert und dem von der KI vorgeschlagenen Ersatz.
- Empfehlung: Eine konkrete Maßnahme zur Behebung des Problems.
- Mehr erfahren: Ein direkter Link zur entsprechenden Microsoft Learn-Dokumentation.
Compliance-Detail-Drilldown
Wenn Sie Details zu einem fehlerhaften Compliance-Kriterium auswählen, öffnet sich der Bereich Compliance Details. Es zeigt:
- Kriteriumsname, Kategorie und Schweregrad
- Was das Kriterium prüft: Eine einfache Erklärung
- Spezifisches Problem gefunden: Die KI-Analyse, was fehlt oder falsch ist
- Empfehlung: Exakte Sprache oder Muster, die den Anweisungen des Agenten hinzugefügt werden
- Beispiel: Wo verfügbar, ein Beispiel für eine konforme Anweisung
- Erfahren Sie mehr: Link zu den relevanten Microsoft Learn-Leitfäden
Exportieren von Ergebnissen
Sie können Ergebnisse in drei Formaten aus dem Prüfungsfenster-Header exportieren.
PDF-Bericht
Ein ausgefeilter, für Menschen lesbarer PDF-Bericht, der sich zum Teilen mit Stakeholdern oder zum Anhängen an ein Governance-Audit eignet.
Inhalt:
- Zusammenfassung mit Scores und Schlüsselkennzahlen
- Ergebnisse der Musterbewertung (Status, Schwere und betroffene Personen)
- Konformitätsbefunde (alle 15 Kriterien)
- Empfehlungen für jedes gefundene Problem
- Metadaten des Agenten (Name, Umgebung, Bewertungsdatum)
Dateinamenmuster: {AgentName}_review_{YYYY-MM-DD}.pdf
Das PDF wird am Ende jeder Überprüfung automatisch generiert und in Dataverse zusammen mit dem Überprüfungs-Datensatz gespeichert. Nachfolgende Downloads rufen die gespeicherte Datei ab, ohne die Analyse erneut durchzuführen.
SARIF-Export
SARIF (Static Analysis Results Interchange Format v2.1.0) ist ein JSON-Format, das für die Integration mit Entwicklertools und CI/CD-Pipelines entwickelt wurde.
Anwendungsfälle:
- Hochladen auf GitHub Advanced Security für SARIF-basierte PR-Annotationen
- Import in Azure DevOps Quality Gate Checks
- Prozessiere mit Drittanbieter-Tools, die SARIF (SonarQube, Visual Studio Code usw.) verbrauchen
Übersicht über die Struktur:
{
"version": "2.1.0",
"runs": [{
"tool": {
"driver": {
"name": "Copilot Studio Agent Review Tool",
"version": "1.0"
}
},
"results": [
{
"ruleId": "pat-007",
"level": "error",
"message": { "text": "Excessive Tools Usage: 28 tools exceed the recommended limit of 25" },
"properties": {
"category": "Architecture",
"recommendation": "Reduce tool count to 25 or fewer"
}
}
]
}]
}
Severity-to-SARIF-Ebenen-Zuordnung:
- High =
"error" - Medium =
"warning" - Low =
"note"
Dateinamenmuster: {AgentName}_review.sarif
Exportieren nach Excel
Ein Excel-Arbeitsbuch mit mehreren Blättern für Datenanalyse, Berichterstattung und Archivierung.
| Tabelle | Inhalt |
|---|---|
| Zusammenfassung | Eine Reihe pro überprüftem Agent – Name, Bewertungen, Ausgabenanzahl, Bewertungsdatum |
| Muster | Alle 18 Muster – ID, Name, Kategorie, Schweregrad, Status, betroffene Themen, Empfehlung |
| Einhaltung | Alle 15 Kriterien – Ausweis, Name, Kategorie, Schweregrad, Status, Problemanzahl, Empfehlung |
Die Überschriften sind kräftig mit markenfarbenen Hintergründen. Punkte- und Schweregradzellen sind farblich gekennzeichnet in Grün, Bernstein oder Rot. Spaltenbreiten passen sich automatisch an.
Dateinamenmuster: {AgentName}_review_{YYYY-MM-DD}.xlsx
Deklarative Agentenbewertung, tiefgehende Recherche
Microsoft 365 deklarative Agenten sind eine andere Art von Agent als Copilot Studio Agents. Sie werden vollständig durch eine JSON-Manifestdatei definiert und im Microsoft 365-Ökosystem bereitgestellt.
Was die deklarative Agent-Überprüfung prüft
Die Überprüfung validiert zunächst die Manifeststruktur und prüft, dass alle erforderlichen Felder vorhanden sind und das Schema gut geformt ist. Anschließend wird eine KI-Bewertung anhand von fünf Qualitätskriterien durchgeführt und ein PDF-Bericht erstellt. Die 15-Kriterium-Compliance-Prüfung der Anweisungen (speziell für Copilot Studio-Agenten) gilt hier nicht.
Die 5 Bewertungskriterien des deklarativen Agenten
| Kriterium | Gewichtung | Was bewertet wird |
|---|---|---|
| Anweisungen | 30 % | Klarheit, Spezifität und Vollständigkeit der Systemaufforderung des Agenten |
| Wissen | 20 % | Nutzung verbundener Wissensquellen zum Grounding |
| Funktionalitäten | 15 % | Verwendung von CodeInterpreter und OneDriveAndSharePoint-Funktionen |
| Aktionen | 15 % | Anwesenheit und Qualität der Werkzeugaktionsbeschreibungen |
| Gesprächseinstiege | 10 % | Anzahl und Qualität (mindestens 3, empfohlene 6) |
| Elegante Fehlerbehandlung | 10 % | Umgang mit unbekannten Eingaben und Fehlerzuständen |
Manifest-Integritätsprüfung (lokale Validierung)
Bevor die KI ausgeführt wird, validiert eine deterministische Integritätsprüfung die Manifeststruktur:
- Erforderliche Felder vorhanden (
name,description,instructions) - Schema-Versionskompatibilität
- Gültige Aktions-Plugin-Referenzen
- Gesprächsstarter zählen innerhalb der Grenzen (3-12)
- Korrekt geformte Fähigkeitserklärungen
Etwaige Integritätssüberprüfungsfehler erscheinen als Probleme in den Ergebnissen der Überprüfung des deklarativen Agenten, unabhängig von der KI-Bewertung.
Reichen Sie einen deklarativen Agent zur Überprüfung ein
Über ZIP-Upload (am häufigsten):
- Exportieren Sie den deklarativen Agent aus Ihrem Dokumenterstellungs-Tool als ZIP-Paket.
- Wählen Sie Upload ZIP im Seitenkopf des Agent-Überprüfungstools aus.
- Wenn die ZIP mehrere Agenten enthält, können Sie in einem Auswahlbereich auswählen, welchen Sie überprüfen möchten.
- Die Überprüfung läuft automatisch.
Über den Microsoft 365-Katalog (erfordert die Einrichtung der Graph-API):
- Wählen Sie auf der Registerkarte Microsoft 365 Agenten Mit Microsoft 365 verbinden aus.
- Schließen Sie den Graph-API-Autorisierungs-Assistenten ab.
- Ihre bereitgestellten deklarativen Agenten werden im deklarativen Agent-Raster angezeigt.
- Wählen Sie Bewertung für jeden deklarativen Agenten.
Sicherheit und Datenzugriff
Dieser Abschnitt beschreibt, wie das Agent Überprüfungs-Tool mit Sicherheit und Datenzugriff umgeht.
Datenspeicher
Alle Überprüfungsergebnisse werden in der cat_agentreviews Dataverse-Tabelle gespeichert. Jeder Datensatz speichert:
| Feld | Inhalt |
|---|---|
cat_agentreviewsid |
Eindeutige Bewertungsdatensatz-ID |
cat_botid |
Verweise auf den überprüften Agenten |
cat_overallscore |
Gesamtpunktzahl 0-100 |
cat_patternscore |
Musterbewertungswert |
cat_instructionscore |
Instruktionskonformitätswert |
cat_totalissues |
Gesamtanzahl der Probleme |
cat_reviewresultjson |
Vollständiges Überprüfungsergebnis als JSON |
cat_reviewpdfreport_name |
PDF-Bericht (Dataverse-Dateispalte) |
cat_sourceenvironment |
Quell-Umgebungs-URL oder zip |
cat_agenttype |
1= Copilot Studio, 2 = deklarativer Agent |
Sicherheit auf Zeilenebene
Die cat_agentreviews Tabelle verwendet Leseumfang auf Benutzerebene (Basic) in Dataverse. Nutzer können nur Bewertungen sehen, die sie selbst erstellt haben. Die Bewertungen eines anderen Nutzers sind nie sichtbar, selbst nicht in derselben Umgebung. Dataverse erzwingt diese Sicherheit nativ, nicht den Anwendungscode.
Quellumgebungen
Nutzer können Agenten aus Umgebungen überprüfen, auf die sie Zugriff haben, nicht nur aus der aktuellen Umgebung. Das Dashboard unterstützt Umgebungsüberprüfungen über den Umweltselektor. Bewertungen aus anderen Umgebungen werden mit der URL der Quellumgebung markiert, sodass sie korrekt erscheinen, wenn das Tool geladen wird.
Überprüfungen, die aus einem ZIP-Upload stammen, werden immer angezeigt, unabhängig davon, mit welcher Umgebung das Tool verbunden ist.
Welche Daten verlassen die Umgebung
- Die Konfiguration des Agenten (Themen, Werkzeuge, Anweisungen) wird über Dataverse PredictV2 an die KI-Modelle gesendet. Dieser durchläuft den standardmäßigen Aufrufpfad für das Dataverse-KI-Modell und unterliegt denselben Datenresidenzrichtlinien wie jeder Dataverse-KI-Vorgang.
- Es werden keine Daten an einen Drittanbieterdienst oder externen Endpunkt gesendet.
- Überprüfungsergebnisse (einschließlich des PDFs) werden ausschließlich in Dataverse gespeichert.
Erstmalige Erfahrung und Begrüßungstour
Beim ersten Öffnen des Agent-Überprüfungstools führt ein Nutzer durch die wichtigsten Teile der Benutzeroberfläche:
- Die Dashboard-Statistikkarten und was sie repräsentieren
- Wie man den Agentraster liest
- So starten Sie eine Überprüfung
- Wie die Ergebnisse interpretiert werden
- Die Exportoptionen
Der Tourfortschritt bleibt in Dataverse bestehen, sodass die Tour nach Abschluss nicht wiederholt wird. Nutzer können die Tour jederzeit im Bereich Hilfe / Schnelle Links im Seitenkopf wieder öffnen.
Häufig gestellte Fragen
Dieser Abschnitt behandelt häufige Fragen zum Agent Überprüfungs-Tool.
Wie lange dauert eine Überprüfung?
Ein typischer Agent mit weniger als 20 Themen ist in weniger als 60 Sekunden fertig. Das Tool hat eine 2-minütige Unterbrechung. Sehr große Agenten (mehr als 50 Themen, viele Werkzeuge) könnten an die Grenze kommen.
Verändert das Werkzeug meinen Agenten?
Nein. Das Werkzeug ist in Bezug auf Agentendaten vollständig schreibgeschützt. Es liest nur die Agentenkonfiguration. Alles Geschriebene geht in die cat_agentreviews Tabelle.
Kann ich einen Mandant nach Änderungen erneut überprüfen?
Ja. Jede Rezension schafft einen neuen Datensatz. Das Raster zeigt immer das aktuellste Bewertungsergebnis an. Alte Überprüfungen bleiben in Dataverse und können bei Bedarf programmatisch abgerufen werden.
Was ist, wenn mein Agent in einer anderen Umgebung ist?
Benutzen Sie den Umwelt-Selektor im Dashboard, um das Tool auf eine andere Umgebung zu richten, auf die Sie Zugriff haben. Die Überprüfung läuft gegen diese Umgebung ab und das Ergebnis wird in der aktuellen Umgebung gespeichert.
Kann ich Agenten überprüfen, die ich nicht erstellt habe?
Ja. Sie können jeden Agenten, auf den Sie Zugriff haben, in Dataverse überprüfen. Allerdings können Sie nur Bewertungen sehen, die Sie erstellt haben (Sicherheitsstufe auf Zeilenebene). Bewertungen anderer Nutzer sind nicht sichtbar.
Was ist SARIF und brauche ich es?
SARIF ist ein Standardformat für statische Analyseergebnisse. Sie brauchen es nur, wenn Sie Agent-Qualitätsprüfungen in eine CI/CD-Pipeline integrieren (GitHub Actions oder Azure DevOps). Für die meisten Nutzer reichen PDF- und Excel-Exporte aus.
Das Tool sagt, mein Agent hat keine Anweisungen. Ist das ein Problem?
Ja. Das Tool zeigt nur Agenten an, die generative KI aktiviert haben, daher wird erwartet, dass jeder Agent Raster Anweisungen bekommt. Wenn die Compliance-Prüfung keine Anweisungen meldet, ist die generative Orchestrierung des Agenten aktiv, aber es wurden noch keine SystemAnweisungen geschrieben. Das Hinzufügen von Anweisungen wird dringend empfohlen.
Warum ist „Persona und Tonfall“ so niedrig schwerwiegend?
Microsofts Leitlinien weisen darauf hin, dass ein professioneller, höflicher Ton bereits das Standardverhalten von Copilot Studio-Agenten ist. Tonanleitungen sind nur notwendig, wenn Sie einen nicht-standardmäßigen Ton möchten. Dieses Kriterium ist niedrig, da ein Nichtbestehen selten zu benutzerspezifischen Problemen führt.
Verbraucht das Durchführen einer Bewertung Copilot-Credits?
Ja. Jede Überprüfung ruft KI-Modelle dreimal auf – zur Musterbewertung, zur Einhaltung von Anweisungen und zur PDF-Generierung. Jeder Aufruf verbraucht Copilot-Credits von Ihrem Mandant. Die erneute Überprüfung desselben Agenten verbraucht ebenfalls Credits, also nehmen Sie zuerst Ihre Änderungen vor und überprüfen Sie dann erneut.
Kann ich alle Bewertungen auf einmal exportieren?
Ja. Verwenden Sie die Schaltfläche Alle Exportieren in der Agent-Rasterleiste, um ein Excel-Arbeitsbuch zu erstellen, das alle überprüften Agenten in der aktuellen Ansicht abdeckt.