Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
Le sezioni seguenti si applicano a ogni cambiamento di modello, sia che si tratti di un aggiornamento proattivo sia di una risposta a un pensionamento. Definisci prima le porte, cattura una base dal modello corrente e poi lavora attraverso le fasi.
Definisci porte di accettazione della migrazione
Definire i criteri di accettazione prima di valutare il modello candidato, in modo che la valutazione dell'agente produca una decisione invece che solo un insieme di punteggi. Includere:
- Tasso minimo complessivo di superamento
- Tasso di superamento richiesto per scenari critici per il business
- Fallimenti critici che bloccano la migrazione indipendentemente dal punteggio aggregato
- Latenza consentita e variazione di affidabilità
- Sicurezza, conformità e approvazione regionale
- Consumo accettabile o impatto sui costi
- Richiesta di approvazione del proprietario e del rilascio
Confronta il modello attuale e quello candidato utilizzando la stessa configurazione dell'agente, dati di test, set di test, profili utente e assunzioni ambientali. Indagare sulle regressioni individuali invece di affidarsi solo a un punteggio medio.
I risultati dei modelli sono probabilistici. Esegui scenari importanti più di una volta quando la variabilità può influenzare la decisione.
Stabilire una base di valutazione riutilizzabile
Prima di cambiare modello, crea un set di test che rappresenti gli scenari critici per il business e ad alta frequenza dell'agente. Esegui il set di test con il modello di produzione attuale per stabilire una baseline.
Usa sia la chat di prova che la valutazione degli agenti:
- Usa la chat di prova per esplorare conversazioni complete e ispezionare l'orchestrazione con la mappa delle attività.
- Usa la valutazione degli agenti per eseguire set di test ripetibili, misurare i risultati e confrontare le esecuzioni nel tempo.
I metodi di prova a tua disposizione dipendono dall'imbracatura dell'agente, quindi confermali prima di progettare il set di test. Scopri di più in Conferma quali metodi di prova il tuo agente supporta.
Valuta l'intero comportamento dell'agente
Non approvare un modello sostitutivo solo perché il suo tasso aggregato di superamento è simile a quello attuale.
Copri le seguenti aree. Ognuno è un comportamento che cambia comunemente quando il modello cambia, quindi un set di test che omette un'area non può rilevare una regressione.
| Area di valutazione | Cosa può rompere un cambiamento di modello | Come controllarla |
|---|---|---|
| Qualità delle risposte | Rilevanza, completezza, accuratezza, chiarezza e coerenza sulle domande che l'agente riceve più spesso. | Qualità generale |
| Radicamento e conoscenza | Il modello risponde dai dati di addestramento invece che dalla fonte di conoscenza configurata, elimina citazioni o gestisce fonti incomplete o contrastanti in modo diverso. | Qualità generale |
| Astensione | Il modello risponde a una domanda fuori campo invece di declinare o intensificare. | Qualità generale, o personalizzata con etichette Risposte e Rifiutate |
| Istruzioni seguenti | Le istruzioni che il modello ha seguito in modo affidabile vengono saltate, come regole di escalation, limiti, comportamenti vietati o una dichiarazione obbligatoria. | Abbinamento delle parole chiave sulle frasi richieste, oppure Personalizzato con etichette specifiche per istruzioni |
| Valori fissi e formato di uscita | Un valore preciso come un numero di telefono, codice o ID viene parafrasato o inventato, oppure la forma dell'output cambia e interrompe un parser a valle o un'integrazione di canale. | Corrispondenza esatta, o corrispondenza per parole chiave nel formato richiesto |
| Selezione degli utensili e contenimento | Il modello seleziona uno strumento diverso, non ne chiama nessuno, oppure chiama uno strumento quando non è necessario nessuno strumento. | Uso degli strumenti con gli strumenti o gli argomenti attesi definiti, più una revisione della mappa dell'attività |
| Input degli utensili e sequenziamento | I parametri vengono estratti, formattati o predefiniti in modo diverso, oppure i passaggi in un compito multitool vengono riordinati, uniti o eliminati. | Uso degli utensili con tutti gli strumenti previsti, più qualità generale |
| Conferma e gestione dei guasti | Il modello smette di chiedere conferme prima di un'azione conseguente, oppure un errore dello strumento viene emerso in modo diverso invece che riportato. | Personalizzato con etichette di conferma, più corrispondenza per parole chiave nel linguaggio di errore previsto |
| Comportamento multiturn | Il contesto dei turni precedenti viene perso o reinterpretato, oppure chiarimenti, cambi di argomento e recupero vengono gestiti in modo diverso. | Qualità generale su un set di test di conversazione |
| Input caotico e avversario | Gestione più debole di errori di battitura, frammenti e intenti poco chiari, oppure una risposta diversa a tentativi di iniezione immediata e sovrascrittura del ruolo. | Qualità generale, più Custom con etichette Rifiutate e Conformate |
| Sicurezza e conformità | Gestione di contenuti dannosi, accesso ai dati, permessi, elaborazione regionale e requisiti di IA responsabile. | Etichette personalizzate, insieme a una revisione responsabile dell'IA |
| Latenza e affidabilità | Tempi di risposta, timeout, variabilità, chiamate fallite e tentativi di ritorno in condizioni rappresentative. | Non riportato dalla valutazione. Misura nel chat di test e nel monitoraggio della produzione. |
| Consumo e costi | Copilot Consumo di credito o altri costi legati al modello per scenari rappresentativi. | Non riportato dalla valutazione. Misura la capacità e il consumo di report. |
| Lingue e canali | Qualità e comportamento tra lingue supportate, profili utente e canali di distribuzione. | Esegui il set di test per ogni lingua, profilo utente e canale che conta |
Presta particolare attenzione al seguito delle istruzioni e alla latenza. Un modello candidato può migliorare la qualità delle risposte ma introdurre risposte più lente, comportamenti di selezione degli strumenti diversi o fallimenti nelle istruzioni affidabili con il modello precedente.
Conferma quali metodi di prova supporta il tuo agente
I metodi di prova disponibili per il tuo agente dipendono dal suo imbracaggio.
Ulteriori informazioni in:
- Valuta gli agenti alimentati dall'imbracatura standard
- Valuta gli agenti alimentati dal harness GitHub Copilot
Costruisci e mantieni il set di test
- Copri prima i percorsi positivi critici per il business e le richieste ad alto volume, poi i casi difficili: casi limite, input avversariali, richieste che dovrebbero essere rifiutate o escalate, fallimenti degli strumenti, lunghe conversazioni e richieste multilingue.
- Inizia dal traffico reale. I temi analitici e le conversazioni registrate producono casi di test più rappresentativi rispetto a quelli inventati.
- Preferisci la copertura rispetto alla lucidatura. Un insieme più ampio di casi imperfetti trova più regressioni rispetto a un piccolo insieme di casi perfettamente formulati.
- Valuta prima il modello attuale, poi il candidato. Il confronto, non il numero assoluto, ti dice se la migrazione è sicura.
- Mantieni il set con l'agente nel controllo versione e rieseguilo invariato per ogni modifica del modello.
- Dividi il set per area di rischio. Un set di test alimentato dall'harness standard contiene fino a 100 casi di test, quindi utilizzare set separati per l'accuratezza delle conoscenze, il comportamento degli strumenti e scenari sensibili alla sicurezza.
- Esportare i risultati. I risultati della valutazione vengono conservati per 89 giorni, quindi esportali in CSV per tenere traccia del punteggio ottenuto da ciascun modello al momento della migrazione.
- Converti gli incidenti di produzione e i feedback degli utenti in nuovi test di regressione.
Scopri di più su Progettare e operazionalizzare l'analisi degli agenti.
Note
La valutazione degli agenti misura la correttezza e le prestazioni, non l'etica dell'IA o i problemi di sicurezza. Un agente può superare ogni caso di prova e comunque fornire una risposta inappropriata. Utilizza recensioni responsabili con l'IA e filtri di sicurezza dei contenuti insieme alla valutazione.
Automatizza le valutazioni ricorrenti
Copilot Studio supporta l'esecuzione delle valutazioni tramite l'API Power Platform, così puoi integrare la validazione del modello nei flussi di lavoro di rilascio e nelle pipeline di integrazione continua. Per un grande patrimonio di agenti, l'automazione rende sostenibili i test ripetuti dei candidati invece che manuali. Scopri di più sulle valutazioni di Automate con l'API di Power Platform.
Aggiorna gli artefatti dell'agente che un cambiamento del modello influenza
Un cambiamento di modello raramente riguarda solo l'impostazione del modello. Traduci le indicazioni del fornitore applicabili negli artefatti dell'agente che controlli, e poi valida ogni modifica rispetto alla tua base di valutazione. Una bonifica che non viene ritestata è solo un'ipotesi.
| Artefatto | Cambiamento tipico |
|---|---|
| Istruzioni dell'agente | Rendi esplicite le aspettative implicite, rimuovi le soluzioni aggirate per il modello precedente, riformula i confini, le regole di escalation e i comportamenti proibiti in modo inequivocabile, risolvi le istruzioni contrastanti e calibra quanta azione indipendente l'agente dovrebbe intraprendere. |
| Istruzioni per argomento e nodo | Applica lo stesso trattamento a livello di argomento e verifica che i nodi di risposta generativa si comportino ancora come previsto. |
| Descrizioni degli strumenti e delle azioni | Riscrivere per maggiore chiarezza. Questa descrizione è ciò che il modello legge per decidere se e quando chiamare uno strumento, e descrizioni vaghe causano sia sovrachiamate che sottochiamate. |
| Descrizioni dei parametri di input e output | Stringi il formato, le unità, gli esempi e la semantica obbligatoria o opzionale in modo che la generazione dei parametri rimanga corretta. |
| Configurazione dell'origine delle informazioni | Ricontrolla la selezione della fonte, le istruzioni di ambito e di grounding, e verifica il comportamento delle citazioni. |
| Istruzioni per la formattazione delle risposte | Riformulare esplicitamente la struttura, la lunghezza, le dichiarazioni di non responsabilità e i valori esatti richiesti, perché i modelli più recenti modificano la verbosità predefinita. |
| Cancelli di conferma e sicurezza | Riaffermare i requisiti espliciti di conferma prima delle azioni conseguenti. |
| Consumatori a valle | Aggiorna i flussi di Power Automate, le schede adattivive, le integrazioni dei canali e qualsiasi parser che legga l'output dell'agente. |
| Il set di prova stesso | Aggiungi i nuovi modelli di guasto riscontrati durante la migrazione. |
Fasi di migrazione
Le fasi successive mettono le sezioni precedenti in ordine di esecuzione. Usali come piano operativo per il cambiamento di modello di un singolo agente, sia che il cambiamento sia proattivo sia guidato da un pensionamento.
Fase 0: Prepararsi
- Conferma che il modello candidato sia valido rispetto ai prerequisiti: generalmente disponibile o predefinito, disponibile in regione, postura cross-geo accettabile, abilitato dall'amministratore e la categoria d'uso corretta per lo scopo dell'agente.
- Leggi le indicazioni di aggiornamento del fornitore di modelli e annota le istruzioni e le modifiche agli strumenti che implicano.
- Identificare gli agenti interessati dall'inventario, dall'ambiente di registrazione, dai proprietari e dalla criticità.
- Conferma quali metodi di valutazione supporta l'imbracatura dell'agente.
- Definire e approvare i cancelli di accettazione della migrazione.
Fase 1: Base del modello attuale
- Costruisci o aggiorna il set di test di regressione in modo che copra scenari critici per il business e ad alta frequenza.
- Esegui il set di test con il modello di produzione attuale per stabilire la base. Fallo finché il modello attuale è ancora in posizione, perché dopo che il modello cambia la base non può essere ricostruita.
- Registra separatamente la latenza e il consumo di crediti Copilot. Le valutazioni non li segnalano.
- Esporta i risultati in CSV per preservare il record oltre la finestra di conservazione.
Fase 2: Valutare il candidato in un ambiente non produttivo
Prepara una copia non produttiva dell'agente, seguendo le indicazioni di Copilot Studio per la gestione del ciclo di vita dell'applicazione e i test dell'agente. Configura l'ambiente in modo che rappresenti la produzione:
- Usa le stesse istruzioni dell'agente, argomenti, configurazione delle conoscenze, strumenti, flusso, connettori, linguaggi e assunzioni di sicurezza.
- Usa identità e connessioni rappresentative per i test.
- Applicare le stesse politiche sui dati e i relativi controlli amministrativi.
- Confermare la disponibilità regionale e se è necessario un movimento di dati tra le zone geografiche.
- Annota eventuali differenze tra test e produzione che potrebbero influenzare il risultato.
Cambia modello. Vai alla pagina Panoramica dell'agente e seleziona il modello principale candidato nella sezione Modello . Esistono impostazioni separate per il ragionamento profondo, le risposte generative e il creatore di prompt, quindi verifica se l'agente utilizza queste funzionalità e se anche queste devono cambiarle.
Riesegui lo stesso set di test, invariato, contro il modello candidato.
Confronta le due corse con le porte di accettazione per identificare miglioramenti e regressioni.
Ispezionare l'orchestrazione qualitativamente nella chat di test, utilizzando la mappa di attività per confermare quali strumenti sono stati selezionati, in quale ordine e con quali parametri.
Misura la latenza e il consumo per il candidato e confrontali con la linea di base.
Fase 3: Correzione
- Aggiorna gli artefatti dell'agente che la modifica del modello colpisce, poi riesegui il set di test sull'agente rimosso. Scopri di più in Migliorare gli agenti utilizzando il triage e la bonifica guidati dalla valutazione.
- Iterare finché non sono soddisfatti i limiti di accettazione, oppure concludere che il modello candidato non è adatto e documentare il motivo. Decidere di non aggiornare è un risultato legittimo e basato su evidenze.
Fase 4: Approvazione e distribuzione
- Ottieni l'approvazione delle porte di accettazione dal proprietario dell'agente e dall'approvatore del rilascio, inclusa l'approvazione di sicurezza e conformità quando sono coinvolti modelli cross-geo o esterni.
- Implementare tramite il processo ALM consolidato, promuovendo la soluzione dal test alla produzione. Non modificare manualmente l'agente di produzione.
- Fasea il rollout quando il canale lo permette. Pubblica prima a un pubblico pilota o a un singolo canale, osserva il risultato, poi amplia.
Fase 5: Monitorare e chiudere
- Monitorare il comportamento produttivo rispetto ai cancelli di accettazione.
- Aggiungi nuovi pattern di guasto scoperti al set di test di regressione.
- Chiudi la migrazione solo dopo che i criteri di accettazione saranno soddisfatti in produzione.
- Preservare le prove di valutazione e il record decisionale di migrazione per l'audit e per il prossimo evento del ciclo di vita.
Importante
Il percorso di rollback per una modifica del modello consiste nel ridistribuire la versione della soluzione precedentemente validata, che è più lenta di un toggle di configurazione. Questa differenza rende così importante il portale di valutazione nella fase 2 . Individuare una regressione prima del dispiegamento è meno costoso che invertirne una dopo.
Monitoraggio dopo la migrazione
Il lavoro sul ciclo di vita del modello continua dopo il deployment. Monitoraggio:
- Risultati di valutazione degli agenti e tassi di superamento degli scenari critici.
- Analisi di produzione, trascrizioni, attività, errori e feedback degli utenti.
- Errori nel seguire le istruzioni e nella selezione degli strumenti.
- Latenza, timeout e affidabilità.
- Il consumo cambia.
- Questioni di sicurezza, conformità e elaborazione regionale.
Quando il monitoraggio della produzione identifica un nuovo schema di guasto, aggiungere un caso rappresentativo al set di test di regressione. Questa pratica migliora la valutazione successiva del modello e trasforma l'apprendimento in produzione in una base di qualità duratura.
La telemetria a livello di ambiente emette OpenTelemetry GenAI che si estende fino alle Application Insights, incluso il modello utilizzato per ogni invocazione di agente. Usalo per confermare su quale modello viene effettivamente utilizzato il traffico di produzione e per confrontare la selezione degli strumenti e l'affidabilità prima e dopo una migrazione.