Tests in Copilot Agent Kit konfigurieren

Tests sind unerlässlich, um sicherzustellen, dass Ihre individuellen Agenten im Copilot Agent Kit wie erwartet reagieren und sich verhalten. Dieser Artikel erklärt, wie man verschiedene Arten von Tests erstellt, verwaltet und validiert, einschließlich Mehrrundenszenarien. Sie können auch Massenoperationen mit Excel und doppelten Testsätzen durchführen.

Testtypen

Sie können verschiedene Arten von Tests erstellen, um Ihre Agenten zu validieren.

Testtyp Beschreibung des Dataflows
Antwortübereinstimmung Dieser Test ist der einfachste Testtyp. Es vergleicht die Antwort des Agenten mit der erwarteten Antwort unter Verwendung des ausgewählten Vergleichsoperators.
Standardmäßig wird die exakte Übereinstimmung („gleich“) verwendet. Andere verfügbare Vergleichsoperatoren sind „Nicht gleich“, „Enthält“, „Enthält nicht“, „Beginnt mit“, „Beginnt nicht mit“, „Endet mit“ und „Endet nicht mit“.
Anlagen (wie adaptive Karten usw.) Vergleicht die JSON-Antwort der Agent-Anhänge mit dem erwarteten Anhänge-JSON (vollständiges Array der Anhänge).
Standardmäßig wird die exakte Übereinstimmung („gleich“) verwendet. Andere verfügbare Vergleichsoperatoren sind „Nicht gleich“, „Enthält“, „Enthält nicht“. Ein spezieller Vergleichsoperator namens „KI Validierung“ verwendet Sprachmodelle, um die Anlage basierend auf Validierungsanweisungen zu überprüfen, die vom Hersteller bereitgestellt werden, ähnlich wie generative Antworten.
Themenabgleich Nur verfügbar, wenn die Dataverse-Anreicherung (Bereicherung mit Gesprächstranskripten) konfiguriert ist.
Wenn der Dataverse-Anreicherungsschritt abgeschlossen ist, vergleicht dieser Test den erwarteten Themennamen mit dem ausgelösten Themennamen. Das Testen der Themenübereinstimmung unterstützt auch mehrere Themen mit benutzerdefinierten Agents, für die die generative Orchestrierung aktiviert ist. Beim Multi-Themenabgleich sind die Themen durch Kommas getrennt; zum Beispiel: "Topic1,Topic2".
Generative Antworten Nur verfügbar, wenn AI Builder-Anreicherung (Analyze Generated Answers) konfiguriert ist.
Verwendet ein großes Sprachmodell, um zu beurteilen, ob die KI-generierte Antwort einer Musterantwort nahekommt oder Validierungsanweisungen beachtet.
Wenn Enrich With Azure-Anwendung Insights konfiguriert ist, können auch negative Tests, wie Moderation oder keine Suchergebnisse, durchgeführt werden. Weitere Informationen finden Sie unter Rubriken in Tests.
Multidrehung Besteht aus mindestens einem Testfall anderer Typen, wie generative Antworten, Antwortabgleich, Anhänge und Themenabgleich. Alle untergeordneten Tests in einem mehrstufigen Test werden innerhalb desselben Unterhaltungskontexts in der angegebenen Reihenfolge ausgeführt. Verwenden Sie mehrstufige Tests, um ein Szenario End-zu-End zu testen und benutzerdefinierte Agents mit generativer Orchestrierung zu testen. Erfahren Sie mehr in Multi-turn-Tests.
Prüfungsplan Ermöglicht es dem Ersteller, zu überprüfen, ob der dynamische Plan des benutzerdefinierten Agents die erwarteten Tools enthält. Dieser Testtyp ist für Copilot Studio benutzerdefinierte Agenten vorgesehen, bei denen die generative Orchestrierung aktiviert ist. Erfahren Sie mehr in Plan Validation-Tests.

Einen neuen Testsatz erstellen

Verwenden Sie Testsätze, um mehrere Tests zu gruppieren. Wenn Sie Tests ausführen, wählen Sie einen „Testsatz“ aus, um alle Tests in diesem Satz auszuführen.

  1. Zugriff auf die Copilot Agent Kit-Anwendung.
  2. Gehen Sie zu Testsatz.
  3. Erstellen Sie einen neuen Datensatz für den Agent-Testsatz.
  4. Geben Sie einen Namen ein.
  5. Wählen Sie Speichern aus.

Neuen Test erstellen

Nachdem Sie einen Testsatz erstellt haben, können Sie ihm Tests hinzufügen. Im Test-Unterraster wählen Sie + neuer Agent.

Screenshot der Oberfläche zur Erstellung eines Agententests im Copilot Agent Kit mit der hervorgehobenen Schaltfläche „Neuer Agententest“.

In der folgenden Tabelle werden die Felder beschrieben.

Spaltenname Erforderlich BESCHREIBUNG
Name Ja Name des Tests. Dieser Name kann eine interne Referenz-ID sein, wie z. B. TST-001.
Agent-Testsatz Ja Übergeordneter Testsatz für den Test.
Testtyp Ja Einer der verfügbaren Testtypen.
startConversation-Ereignis senden Nein Wenn diese Option aktiviert ist, empfängt der Agent das startConversation-Ereignis, sodass er die Unterhaltung proaktiv startet, und die Testäußerung wird danach gesendet. Diese Einstellung ist typischerweise erforderlich, wenn das Thema Gesprächsbeginn eine Logik enthält, die vor der Antwort auf den Benutzer oder die Testäußerung ausgeführt werden muss.
Erwartete Position der Antwortnachricht Nein Setzen Sie keinen Wert, wenn Sie unsicher sind. Mit dieser Option können Sie eine bestimmte Antwort des Agenten erfassen, wenn er mehrere Nachrichten sendet. Wenn der Agent zum Beispiel zuerst „Hallo“ und dann „Wie kann ich dir helfen?“ sagt und du die zweite Nachricht testen möchtest, stelle den Wert auf 1. Die Reihenfolge ist nullbasiert, daher erhält die erste Nachricht den Index 0, die zweite Antwort den Index 1 und so weiter.
Testäußerung Ja Die Nachricht, die Sie dem Agent als Teil des Tests senden möchten.
Erwartete Antwort Abhängig von Obligatorisch für die Antwort „Testtyp-Übereinstimmung“. Erwartete Antwort des Agenten. Für einen Generativen Antworttest geben Sie eine Beispielantwort oder Ihre eigenen Validierungsanweisungen für das Sprachmodell an.
Externe Variablen JSON Nein JSON-Objekt für jeden externen oder kontextuellen Wert, den Sie im Rahmen des Tests an den Agenten übergeben möchten. Beispiel: { "Language": "fr" }
Sekunden bis zum Antworterhalt Nein Anzahl der Sekunden, die vor der Bewertung der Bot-Antwort verstreichen müssen. In den meisten Fällen können Sie diesen Wert leer lassen, aber er ist nützlich in Situationen, in denen der Agent eine API aufruft und die Antwort mehr Zeit in Anspruch nimmt als üblich.
Erwartetes Ergebnis generativer Antworten Abhängig von Erforderlich für den Generative Answers-Testtyp. Sollte entweder beantwortet oder nicht beantwortet sein. Wenn die Azure-Anwendung Insights-Anreicherung aktiviert ist, können Sie Moderiert oder Keine Suchergebnisse auswählen.
Erwarteter Themenname Abhängig von Obligatorisch für den Testtyp „Thema-Übereinstimmung“. Name des Themas, von dem Sie erwarten, dass es ausgelöst wird. Die Übereinstimmung mit mehreren Themen wird für benutzerdefinierte Agents unterstützt, für die die generative Orchestrierung aktiviert ist. Für den Mehrfach-Thema-Abgleich verwenden Sie eine durch Kommas getrennte Liste; zum Beispiel: „Thema1,Thema2“. Keine zusätzlichen Leerzeichen hinzufügen. Mehrfach-Thema-Abgleich stellt sicher, dass die erwarteten Themen zu den Themen im Plan gehören.
Erwartete Anhänge JSON Abhängig von Verpflichtend für Anlagen-Testtypen (Adaptive Karten, etc). Vollständiges Anhänge-JSON-Array, das von der Agentenantwort erwartet wird.
Erwartete Werkzeuge Abhängig von Erforderlich für den Planvalidierungstest. Komma-separierte Liste erwarteter Tools (Tools, Aktionen und verbundene Agenten). Keine zusätzlichen Leerzeichen hinzufügen. Die Reihenfolge ist nicht relevant. Beispiel: „Wetter,Klimawandel“
Schwellenwert % für Bestehen Abhängig von Erforderlich für den Planvalidierungstest. Der Prozentsatz der erwarteten Tools, die im dynamischen Plan enthalten sein müssen, damit der Test besteht. Wenn der Prozentsatz 100 beträgt, müssen alle erwarteten Tools im dynamischen Plan enthalten sein, damit der Test erfolgreich ist. Zusätzliche Tools im dynamischen Plan beeinflussen das Testergebnis nicht.

Mehrfach-Runden-Tests

Für den mehrteiligen Testtyp können Sie einen oder mehrere untergeordnete Tests regulärer Typen angeben. Jeder untergeordnete Test verfügt über eine Reihenfolge und Kritikalität. Die Reihenfolge definiert die Ausführungsabfolge innerhalb des gleichen Unterhaltungskontexts (im mehrstufigen Testfall). Die Kritikalität definiert, ob der untergeordnete Testfall bestehen muss, damit die mehrstufige Testausführung fortgesetzt wird.

Screenshot der Mehrfach-Runden-Testkonfiguration in Copilot Agent Kit.

Wenn ein untergeordneter Test eine Auswertung nach dem Testen erfordert, wie zum Beispiel Themenabgleich oder generative Antworten, bleiben die Test im ausstehenden Status, und die Testausführung wird unabhängig vom Kritikalitätsstatus fortgesetzt. Wenn einer der kritischen Tests fehlschlägt, wird die Durchführung des Mehrrundentests gestoppt und das Ergebnis gilt als fehlgeschlagen. Wenn alle kritischen untergeordneten Tests erfolgreich abgeschlossen werden, ist das Ergebnis des mehrstufigen Tests erfolgreich.

Screenshot der Mehrrunden-Ergebnisansicht im Copilot Agent Kit.

Verwenden Sie nicht kritische untergeordnete Testfälle, um Informationen an benutzerdefinierte Agents zur generativen Orchestrierung weiterzuleiten. Sie können diese Testfälle auch verwenden, wenn die Antwort keine Rolle spielt und Sie auf kritische Tests aufbauen möchten.

Planvalidierungstests

Bei der Planvalidierung steht die Tool-Korrektheit im Vordergrund. Anstatt zu bewerten, was der Agent sagt, prüft dieser Testtyp, ob die erwarteten Tools während des Plans verwendet wurden.

Wenn Sie einen Planvalidierungstest definieren, geben Sie an:

  • Eine Testäußerung
  • Eine komma-getrennte Liste erwarteter Werkzeuge, die in den dynamischen Plan aufgenommen Greifen Sie auf die Copilot Studio Kit App zu
  • Eine Bestehensschwelle, die angibt, wie viel Abweichung von der Liste toleriert werden soll

Dieser Test verwendet GesprächsTranskripte und wird nach dem eigentlichen Testlauf als Anreicherungsaktivität ausgewertet.

Behalten Sie Folgendes im Hinterkopf:

  • Erwartete Werkzeuge: Sie können Werkzeuge, Aktionen und verbundene Agenten in die kommagetrennte Liste einschließen. Keine zusätzlichen Leerzeichen hinzufügen. Die Reihenfolge spielt keine Rolle.

  • Schwellenwert für Bestehen %: Der „Schwellenwert für Bestehen“ gibt den erforderlichen Anteil der erwarteten Werkzeuge an, die im dynamischen Plan enthalten sein müssen, damit der Test erfolgreich ist.

Die Planvalidierung ist ein deterministischer Test: Sie berechnet die Abweichung der tatsächlich verwendeten Werkzeuge von den erwarteten Werkzeugen und vergleicht sie mit dem Schwellenwert für Bestehen. Liegt die Abweichung innerhalb des Schwellenwerts, besteht der Test; andernfalls fällt er durch.

Screenshot des Testtyps Planvalidierung im Copilot Agent Kit.

Mehr erfahren unter Agent-Verhalten mit generativer KI orchestrieren.

Testagenten, die eine Connector-Autorisierung erfordern

Wenn ein Agent eine externe Datenquelle wie SharePoint oder Dataverse verwendet, wird in der ersten Konversation typischerweise eine Connect to continue-Autorisierungskarte angezeigt. Der Benutzer muss zulassen auswählen, bevor der Agent den Connector aufrufen kann. Um diesen Ablauf in einem automatisierten Test zu üben, modellieren Sie den Prompt und die Antwort des Nutzers als zwei Kindertests innerhalb eines Mehrrundentests.

Anmerkung

Dies ist eine einmalige Einrichtung pro Testset. Nachdem die Verbindung für den Testnutzer autorisiert wurde, müssen Sie die Autorisierungsschritte in späteren Tests nicht wiederholen.

Der Mehrrundentest enthält zwei geordnete Kindtests:

Auftrag Testtyp Vorgangsart Verwendungszweck
1 Anlagen (adaptive Karten usw.) Vergleichsoperator Sendet die Äußerung, die den Connector auslöst, und setzt auf das JSON der Autorisierungskarte eine Forderung aus.
2 Anlagen (adaptive Karten usw.) Aktionen aufrufen Übermittelt Erlaubnis auf der Autorisierungskarte, damit der Agent den Anruf beenden kann.

Erstellen einer Testausführung:

  1. Wählen Sie im Testsatz + neuer Agenttest, geben einen Namen ein und legen den Testtyp auf Mehrteilig und wählen Speichern.

  2. Im mehrteiligen untergeordneten Testraster wählen Sie + Neuer Agenttest aus und konfigurieren Sie den ersten untergeordneten Test:

    Feld Wert
    Testtyp Anlagen (adaptive Karten usw.)
    Auftrag 1
    Testäußerung Die Äußerung, die den Connector auslöst, zum Beispiel List Fourth Coffee Brands.
    Vorgangstyp Vergleichsoperator
    Vergleichsoperator Gleich
    Erwartete Anhänge JSON [] (Platzhalter – wird nach dem ersten Durchlauf ersetzt)

    Wählen Sie Test speichern aus.

  3. Speichern Sie den Test und führen Sie ihn aus. Der erste untergeordnete Test scheitert wie erwartet, weil das Platzhalter-JSON nicht mit der Autorisierungskarte übereinstimmt.

  4. Öffnen Sie die Testergebnisse, wählen Sie den mehrteiligen untergeordneten Test und suchen Sie den Abschnitt Anhänge und kopieren Sie den aktuellen JSON-Anhang in die Zwischenablage.

  5. Bearbeiten Sie den ersten untergeordneten Test, fügen Sie das kopierte JSON in erwartete Anhänge JSON ein und wählen Sie Test speichern.

  6. Im mehrteiligen untergeordneten Testraster wählen Sie erneut + Neuer Agenttest aus und konfigurieren Sie den zweiten untergeordneten Test:

    Feld Wert
    Testtyp Anlagen (adaptive Karten usw.)
    Auftrag 2
    Vorgangstyp Aktionen aufrufen
    Adaptive Kartennutzlast {"action": "Allow", "id": "submit", "shouldAwaitUserInput": true}
    Vergleichsoperator Enthält Daten (oder Gleich, je nachdem, welche Antwort Sie bestätigen möchten)
    Erwartete Antwort Lassen Sie diese leer oder setzen Sie sie basierend auf den Daten fest, die Sie nach der Erlaubnis der Verbindung erwarten.

    Die Payload-Werte stammen aus dem adaptiven Karten JSON, das Sie in Schritt 4 erfasst haben. Passen Sie die action und id Felder an, wenn Ihre Connector-Karte unterschiedliche Kennungen verwendet.

    Wählen Sie Test speichern aus.

  7. Speichern Sie den Test und führen Sie ihn erneut aus. Beide untergeordneten Tests sollten nun bestehen.

Nachdem dieser mehrteilige Test einmal erfolgreich durchgeführt wurde, wird die Verbindung für den Testnutzer autorisiert und nachfolgende Tests gegen denselben Connector können als reguläre einteilige Tests erstellt werden.

Verwenden Sie Excel, um eine Massenerstellung der Tests zu erstellen oder zu aktualisieren

Nachdem Sie einen Testsatz erstellt haben, können Sie Excel nutzen, um die Massenerstellung von Tests vorzunehmen oder zu aktualisieren.

  1. Wechseln Sie vom Testdatensatz zur Unterrasteransicht Tests zu Export-/Import-Ansicht.
  2. Wählen Sie Export-Agent-Tests in Excel Online aus.
  3. Fügen Sie Tests hinzu und nehmen Sie Änderungen nach Bedarf vor.
  4. Wählen Sie Speichern aus.

Wenn Sie mehrstufige Tests für untergeordnete Aufgaben importieren, müssen Sie zuerst den entsprechenden übergeordneten mehrstufigen Test erstellen oder importieren. Importieren Sie dann die untergeordneten Testfälle.

Erfahren Sie mehr über Excel-Import und -Export in Power Apps modellgesteuerten Apps.

Duplizieren von Tests und Testsätzen

Sie können sowohl Testsätze als auch einzelne Tests duplizieren.

  • Um einen einzelnen Testfall zu duplizieren, öffnen Sie den Agent-Testdatensatz und wählen Sie Testfall duplizieren. Diese Aktion ist besonders hilfreich, wenn Sie Varianten eines Testfalls erstellen, z. B. durch Änderung des Ortes, der Zeit oder der Menge.

  • Um einen kompletten Testsatz zu duplizieren, öffnen Sie den Testsatz-Datensatz und wählen Sie in der Kommandoleiste Testsatz duplizieren. Diese Aktion erstellt eine Kopie des Testsatzes und aller dazugehörigen untergeordneten Tests.

Nächster Schritt