Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
I test sono essenziali per garantire che gli agenti personalizzati nel kit agente Copilot rispondano e si comportino come previsto. Questo articolo spiega come creare, gestire e convalidare diversi tipi di test, inclusi scenari a più turni. Puoi anche eseguire operazioni di blocco con Excel e duplicare set di test.
Tipi di test
Crea diversi tipi di test per convalidare gli agenti.
| Tipo di test | Descrizione |
|---|---|
| Corrispondenze delle risposte | Questo tipo di test è il più semplice. Confronta la risposta dell'agente con la risposta prevista usando l'operatore di confronto selezionato. Per impostazione predefinita, viene usata la corrispondenza esatta ("uguale a"). Altri operatori di confronto disponibili sono "Non è uguale a", "Contiene", "Non contiene", "Inizia con", "Non inizia con", "Termina con" e "Non termina con". |
| Allegati (come Schede adattive) | Confronta la risposta JSON degli allegati dell'agente con il JSON degli allegati previsti (l'intera matrice di allegati). Per impostazione predefinita, viene usata la corrispondenza esatta ("uguale a"). Altri operatori di confronto disponibili sono "Non è uguale a", "contiene" e "non contiene". Un operatore di confronto speciale chiamato "AI Validation" usa i modelli linguistici per convalidare l'allegato in base alle istruzioni di convalida specificate dal creatore, in modo simile alle risposte generative. |
| Corrispondenza dell'argomento |
Disponibile solo quando è configurato l'arricchimento di Dataverse (Arricchisci con trascrizioni di conversazione). Quando il passaggio di arricchimento di Dataverse si completa, questo test confronta il nome dell'argomento previsto con quello attivato. Il test delle corrispondenze degli argomenti supporta anche la corrispondenza di più argomenti con degli agenti personalizzati con orchestrazione generativa abilitata. Nella corrispondenza con più argomenti, gli argomenti sono separati da virgole; ad esempio: "Topic1,Topic2". |
| Risposte generative |
Disponibile solo se è configurato l'arricchimento di AI Builder (Analizza risposte generative). Usa un modello linguistico di grandi dimensioni per valutare se la risposta generata dall'IA è vicina a una risposta campione o rispetta le istruzioni di convalida. Quando è configurata Arricchisci con applicazione Azure Insights, è possibile testare anche gli scenari negativi, come la moderazione o nessun risultato di ricerca. Per altre informazioni, vediUsare i criteri di valutazione nei test. |
| Elementi con più turni | Consiste in uno o più test case di altri tipi, come corrispondenza delle risposte, allegati, corrispondenza dei temi e risposte generative. Tutti i test figlio in un test su più turni vengono eseguiti nello stesso contesto di conversazione nell'ordine specificato. Usa i test a più turno per testare uno scenario end-to-end e per testare agenti personalizzati con orchestrazione generativa. Per altre informazioni, vediTest su più turni. |
| Convalida del piano | Permette al creatore di convalidare che il piano dinamico dell'agente personalizzato includa gli strumenti previsti. Questo tipo di test è pensato per gli agenti Copilot Studio personalizzati con l'orchestrazione generativa abilitata. Per altre informazioni, vediTest di convalida del piano. |
Creare un nuovo set di test
Usa i set di test per raggruppare più test. Quando esegui i test, seleziona un set di test per eseguire tutti i test inclusi nel set.
- Accedi all'applicazione kit agente Copilot.
- Vai a Set di test.
- Crea un nuovo Record del set di test dell'agente.
- Immetti un valore per Nome.
- Seleziona Salva.
Creare un nuovo test
Dopo aver creato un set di test, puoi aggiungervi i test. Nella griglia secondaria Test seleziona + Nuovo test agente.
Nella seguente tabella vengono descritti i campi.
| Nome colonna | Obbligatorio | Descrizione |
|---|---|---|
| Nome | Sì | Nome del test. Il nome può essere un ID di riferimento interno, come TST-001. |
| Set di test agente | Sì | Set di test principale per il test. |
| Tipo di test | Sì | Uno dei tipi di test disponibili. |
| Invia Evento startConversation | No | Se abilitata, l'agente riceve l'evento startConversation e avvia proattivamente la conversazione. L'espressione del test viene inviata dopo. Questa impostazione è in genere richiesta quando l'argomento Avvio conversazione include una logica che deve essere eseguita prima di rispondere all'utente o all'espressione del test. |
| Posizione attesa del messaggio di risposta | No | Non impostare un valore se non hai certezza. Questa opzione ti permette di acquisire una risposta dell'agente specifica quando l'agente invia più messaggi. Ad esempio, se l'agente dice prima "Ciao" e poi "Come posso aiutarti?" e vuoi testare il secondo messaggio, imposta il valore su 1. L'ordine parte da 0, quindi il primo messaggio ha indice 0, la seconda risposta ha indice 1, e così via. |
| Espressione di test | Sì | Messaggio che vuoi inviare all'agente come parte del test. |
| Risposta prevista | Dipende da | Obbligatorio per il tipo di test Corrispondenza delle risposte. Risposta prevista dall'agente. Per un test Risposte generative, imposta una risposta campione o le istruzioni di convalida per il modello linguistico di grandi dimensioni. |
| JSON variabili esterne | No | Record JSON per qualsiasi valore contestuale o esterno che vuoi passare all'agente come parte del test. Ad esempio: { "Language": "fr" } |
| Secondi prima di ricevere la risposta | No | Numero di secondi da attendere prima di valutare la risposta dal bot. Nella maggior parte dei casi, puoi lasciare questo valore vuoto, ma è utile impostarlo in situazioni in cui l'agente chiama un'API e la risposta potrebbe richiedere più tempo del solito. |
| Esito atteso delle risposte generative | Dipende da | Obbligatorio per il tipo di test Risposte generative. Dovrebbe essere Risposto o Non Risposto. Quando è abilitato l'arricchimento di applicazione Azure Insights, puoi scegliere Moderato oppure Nessun risultato di ricerca. |
| Nome atteso dell'argomento | Dipende da | Obbligatorio per il tipo di test Corrispondenza dell'argomento. Nome dell'argomento che ti aspetti venga attivato. La corrispondenza su più argomenti è supportata per gli agenti personalizzati con abilitazione all'orchestrazione generativa. Per la corrispondenza di più argomenti, usa un elenco separato da virgole; ad esempio: "Topic1,Topic2". Non aggiungere spazi vuoti extra. La corrispondenza di più argomenti garantisce che gli argomenti previsti siano tra quelli indicati nel piano. |
| Allegati JSON previsti | Dipende da | Obbligatorio per il tipo di test Allegati (schede adattive e così via). Matrice JSON di tutti gli allegati previsti dalla risposta dell'agente. |
| Strumenti previsti | Dipende da | Obbligatorio per il tipo di test di convalida del piano. Elenco separato da virgole di strumenti previsti (strumenti, azioni e agenti connessi). Non aggiungere spazi vuoti extra. L'ordine non è rilevante. Esempio: "Meteo,Cambiamento climatico" |
| % della soglia di superamento | Dipende da | Obbligatorio per il tipo di test di convalida del piano. La percentuale di strumenti previsti che devono essere presenti nel piano dinamico perché il test venga superato. Se la percentuale è 100, tutti gli strumenti previsti devono essere nel piano dinamico perché il test sia superato. Strumenti aggiuntivi nel piano dinamico non influiscono sul risultato del test. |
Test su più turni
Per il tipo di test su più turni, specifica uno o più test figlio di tipi regolari. Ogni test figlio ha un ordine e un'importanza critica. L'ordine definisce l'ordine di esecuzione all'interno dello stesso contesto di conversazione (all'interno del test case per le conversazioni a più turni). La criticità definisce se il test case figlio deve superare per continuare l'esecuzione del test su più turni.
Se un test figlio richiede una valutazione successiva all'esecuzione, come "corrispondenza argomento" o "risposte generative", il test rimane in stato di attesa e la sua esecuzione prosegue indipendentemente dallo stato di criticità. Se uno dei test critici fallisce, l’esecuzione del test su più turni viene interrotta e il suo risultato è ritenuto fallito. Se tutti i test figlio critici vengono superati, il risultato del test su più turni è un successo.
Usa test case figlio non critici per trasmettere informazioni agli agenti personalizzati con orchestrazione generativa. Puoi anche usare questi test case quando la risposta non è importante e vuoi preparare il terreno per i test critici.
Test di convalida del piano
La convalida del piano si concentra sulla correttezza degli strumenti. Invece di valutare ciò che dice l'agente, questo tipo di test verifica se durante il piano sono stati usati gli strumenti previsti.
Quando definisci un test di convalida del piano, specifica:
- Un'espressione di test
- Un elenco separato da virgole degli strumenti previsti da includere nel piano dinamico
- Una soglia di superamento, che indica la percentuale di deviazione tollerata rispetto all'elenco
Questo test usa le trascrizioni delle conversazioni e viene valutato dopo l'esecuzione dei test effettivi come attività di arricchimento.
Tieni presente i seguenti punti:
Strumenti previsti: include strumenti, azioni e agenti connessi nell'elenco separato da virgole. Non aggiungere spazi vuoti extra. L'ordine non ha importanza.
% della soglia di superamento: la soglia di superamento specifica la porzione necessaria di strumenti previsti che deve essere presente nel piano dinamico perché il testo sia superato.
La convalida del piano è un test deterministico: calcola la deviazione degli strumenti effettivi dagli strumenti previsti e la confronta con la soglia di superamento. Se la deviazione rientra nella soglia, il test è superato; in caso contrario, fallisce.
Altre informazioni in Orchestrare il comportamento dell'agente con l'IA generativa.
Agenti di test che richiedono l'autorizzazione del connettore
Quando un agente utilizza un'origine dati esterna come SharePoint o Dataverse, la prima conversazione di solito presenta una scheda di autorizzazione "Connetti per continuare". L'utente deve selezionare Consenti prima che l'agente possa chiamare il connettore. Per esercitare questo flusso in un test automatizzato, modella il prompt e la risposta dell'utente come due test figlio all'interno di un test a più turni.
Nota
Questa è una configurazione una tantum per ogni set di test. Dopo che la connessione è stata autorizzata per l'utente di test, non è necessario ripetere i passaggi di autorizzazione nei test successivi.
Il test multi-turno contiene due test figlio ordinati:
| Ordine | Tipo di test | Tipo di operazione | Scopo |
|---|---|---|---|
| 1 | Allegati, ad esempio Schede adattive e così via | Operatore di confronto | Invia l'espressione che attiva il connettore ed esegue un'asserzione sul JSON della scheda di autorizzazione. |
| 2 | Allegati, ad esempio Schede adattive e così via | Richiama azioni | Invia Consenti sulla scheda di autorizzazione così l'agente può completare la chiamata. |
Per creare un test:
Nel set di test seleziona + Nuovo test dell'agente, inserisci un nome, imposta Tipo di test su Multi-turno, quindi seleziona Salva.
Nella griglia figlio del test multi-turno, seleziona + Nuovo test dell'agente e configura il primo test figlio:
Campo Valore Tipo di test Allegati, ad esempio Schede adattive e così via Ordine 1 Espressione di test L'espressione che attiva il connettore, ad esempio List Fourth Coffee Brands.Tipo di operazione Operatore di confronto Operatore di confronto Uguale a Allegati JSON previsti [](segnaposto - da sostituire dopo la prima esecuzione)Seleziona Salva test.
Salva il set di test ed eseguilo. Il primo test figlio fallisce come previsto, perché il codice JSON segnaposto non corrisponde alla scheda di autorizzazione.
Apri i risultati del test, seleziona il test figlio multi-turno, trova la sezione Allegati e copia il codice JSON dell'allegato effettivo negli Appunti.
Modifica il primo test figlio, incolla il codice JSON copiato in JSON allegati previsti e seleziona Salva test.
Nella griglia figlio del test multi-turno, seleziona di nuovo + Nuovo test dell'agente e configura il secondo test figlio:
Campo Valore Tipo di test Allegati, ad esempio Schede adattive e così via Ordine 2 Tipo di operazione Richiama azioni Payload della scheda adattiva {"action": "Allow", "id": "submit", "shouldAwaitUserInput": true}Operatore di confronto Contiene dati (o Uguale, a seconda della risposta da affermare) Risposta prevista Lascia vuoto oppure imposta in base ai dati che ti aspetti dopo che la connessione è stata consentita. I valori del payload provengono dal codice JSON della scheda adattativa acquista nel passaggio 4. Modifica i campi
actioneidse la tua scheda connettore usa identificatori diversi.Seleziona Salva test.
Salva il set di test ed eseguilo di nuovo. Entrambi i test figlio dovrebbero ora essere superati.
Dopo che questo test multi-turno viene eseguito con successo una volta, la connessione viene autorizzata per l'utente di prova e i test successivi sullo stesso connettore possono essere creati come normali test a turno singolo.
Usare Excel per creare o aggiornare test in blocco
Dopo aver creato un set di test, puoi usare Excel per creare o aggiornare i test in blocco.
- Dal record del set di test, cambia la visualizzazione della griglia secondaria da Test a Vista Esportazione/Importazione.
- Seleziona Esporta i test dell'agente in Excel Online.
- Aggiungi e modifica i test in base alle esigenze.
- Seleziona Salva.
Se si importano test figlio su più turni, è necessario prima creare o importare il test padre su più turni effettivo. Quindi, importa i test case figli.
Altre informazioni in Importazione ed esportazione Excel nelle app basate su modello di Power Apps.
Duplicare i test e i set di test
Puoi duplicare sia i set di test sia i singoli test.
Per duplicare un singolo test case, apri il record di test dell'agente e seleziona Duplica test case. Questa azione è utile quando crei varianti di un test case, ad esempio cambiando posizione, orario o importo.
Per duplicare un intero set di test, apri il record del set di test e seleziona Duplica set di test dalla barra dei comandi. Questa azione crea una copia del set di test e di tutti i relativi test figlio.