Esegui e valida una migrazione di un modello AI per gli agenti di Copilot Studio

Le sezioni seguenti si applicano a ogni cambiamento di modello, sia che si tratti di un aggiornamento proattivo sia di una risposta a un pensionamento. Definisci prima le porte, cattura una base dal modello corrente e poi lavora attraverso le fasi.

Definisci porte di accettazione della migrazione

Definire i criteri di accettazione prima di valutare il modello candidato, in modo che la valutazione dell'agente produca una decisione invece che solo un insieme di punteggi. Includere:

  • Tasso minimo complessivo di superamento
  • Tasso di superamento richiesto per scenari critici per il business
  • Fallimenti critici che bloccano la migrazione indipendentemente dal punteggio aggregato
  • Latenza consentita e variazione di affidabilità
  • Sicurezza, conformità e approvazione regionale
  • Consumo accettabile o impatto sui costi
  • Richiesta di approvazione del proprietario e del rilascio

Confronta il modello attuale e quello candidato utilizzando la stessa configurazione dell'agente, dati di test, set di test, profili utente e assunzioni ambientali. Indagare sulle regressioni individuali invece di affidarsi solo a un punteggio medio.

I risultati dei modelli sono probabilistici. Esegui scenari importanti più di una volta quando la variabilità può influenzare la decisione.

Stabilire una base di valutazione riutilizzabile

Prima di cambiare modello, crea un set di test che rappresenti gli scenari critici per il business e ad alta frequenza dell'agente. Esegui il set di test con il modello di produzione attuale per stabilire una baseline.

Usa sia la chat di prova che la valutazione degli agenti:

I metodi di prova a tua disposizione dipendono dall'imbracatura dell'agente, quindi confermali prima di progettare il set di test. Scopri di più in Conferma quali metodi di prova il tuo agente supporta.

Valuta l'intero comportamento dell'agente

Non approvare un modello sostitutivo solo perché il suo tasso aggregato di superamento è simile a quello attuale.

Copri le seguenti aree. Ognuno è un comportamento che cambia comunemente quando il modello cambia, quindi un set di test che omette un'area non può rilevare una regressione.

Area di valutazione Cosa può rompere un cambiamento di modello Come controllarla
Qualità delle risposte Rilevanza, completezza, accuratezza, chiarezza e coerenza sulle domande che l'agente riceve più spesso. Qualità generale
Radicamento e conoscenza Il modello risponde dai dati di addestramento invece che dalla fonte di conoscenza configurata, elimina citazioni o gestisce fonti incomplete o contrastanti in modo diverso. Qualità generale
Astensione Il modello risponde a una domanda fuori campo invece di declinare o intensificare. Qualità generale, o personalizzata con etichette Risposte e Rifiutate
Istruzioni seguenti Le istruzioni che il modello ha seguito in modo affidabile vengono saltate, come regole di escalation, limiti, comportamenti vietati o una dichiarazione obbligatoria. Abbinamento delle parole chiave sulle frasi richieste, oppure Personalizzato con etichette specifiche per istruzioni
Valori fissi e formato di uscita Un valore preciso come un numero di telefono, codice o ID viene parafrasato o inventato, oppure la forma dell'output cambia e interrompe un parser a valle o un'integrazione di canale. Corrispondenza esatta, o corrispondenza per parole chiave nel formato richiesto
Selezione degli utensili e contenimento Il modello seleziona uno strumento diverso, non ne chiama nessuno, oppure chiama uno strumento quando non è necessario nessuno strumento. Uso degli strumenti con gli strumenti o gli argomenti attesi definiti, più una revisione della mappa dell'attività
Input degli utensili e sequenziamento I parametri vengono estratti, formattati o predefiniti in modo diverso, oppure i passaggi in un compito multitool vengono riordinati, uniti o eliminati. Uso degli utensili con tutti gli strumenti previsti, più qualità generale
Conferma e gestione dei guasti Il modello smette di chiedere conferme prima di un'azione conseguente, oppure un errore dello strumento viene emerso in modo diverso invece che riportato. Personalizzato con etichette di conferma, più corrispondenza per parole chiave nel linguaggio di errore previsto
Comportamento multiturn Il contesto dei turni precedenti viene perso o reinterpretato, oppure chiarimenti, cambi di argomento e recupero vengono gestiti in modo diverso. Qualità generale su un set di test di conversazione
Input caotico e avversario Gestione più debole di errori di battitura, frammenti e intenti poco chiari, oppure una risposta diversa a tentativi di iniezione immediata e sovrascrittura del ruolo. Qualità generale, più Custom con etichette Rifiutate e Conformate
Sicurezza e conformità Gestione di contenuti dannosi, accesso ai dati, permessi, elaborazione regionale e requisiti di IA responsabile. Etichette personalizzate, insieme a una revisione responsabile dell'IA
Latenza e affidabilità Tempi di risposta, timeout, variabilità, chiamate fallite e tentativi di ritorno in condizioni rappresentative. Non riportato dalla valutazione. Misura nel chat di test e nel monitoraggio della produzione.
Consumo e costi Copilot Consumo di credito o altri costi legati al modello per scenari rappresentativi. Non riportato dalla valutazione. Misura la capacità e il consumo di report.
Lingue e canali Qualità e comportamento tra lingue supportate, profili utente e canali di distribuzione. Esegui il set di test per ogni lingua, profilo utente e canale che conta

Presta particolare attenzione al seguito delle istruzioni e alla latenza. Un modello candidato può migliorare la qualità delle risposte ma introdurre risposte più lente, comportamenti di selezione degli strumenti diversi o fallimenti nelle istruzioni affidabili con il modello precedente.

Conferma quali metodi di prova supporta il tuo agente

I metodi di prova disponibili per il tuo agente dipendono dal suo imbracaggio.

Ulteriori informazioni in:

Costruisci e mantieni il set di test

  • Copri prima i percorsi positivi critici per il business e le richieste ad alto volume, poi i casi difficili: casi limite, input avversariali, richieste che dovrebbero essere rifiutate o escalate, fallimenti degli strumenti, lunghe conversazioni e richieste multilingue.
  • Inizia dal traffico reale. I temi analitici e le conversazioni registrate producono casi di test più rappresentativi rispetto a quelli inventati.
  • Preferisci la copertura rispetto alla lucidatura. Un insieme più ampio di casi imperfetti trova più regressioni rispetto a un piccolo insieme di casi perfettamente formulati.
  • Valuta prima il modello attuale, poi il candidato. Il confronto, non il numero assoluto, ti dice se la migrazione è sicura.
  • Mantieni il set con l'agente nel controllo versione e rieseguilo invariato per ogni modifica del modello.
  • Dividi il set per area di rischio. Un set di test alimentato dall'harness standard contiene fino a 100 casi di test, quindi utilizzare set separati per l'accuratezza delle conoscenze, il comportamento degli strumenti e scenari sensibili alla sicurezza.
  • Esportare i risultati. I risultati della valutazione vengono conservati per 89 giorni, quindi esportali in CSV per tenere traccia del punteggio ottenuto da ciascun modello al momento della migrazione.
  • Converti gli incidenti di produzione e i feedback degli utenti in nuovi test di regressione.

Scopri di più su Progettare e operazionalizzare l'analisi degli agenti.

Note

La valutazione degli agenti misura la correttezza e le prestazioni, non l'etica dell'IA o i problemi di sicurezza. Un agente può superare ogni caso di prova e comunque fornire una risposta inappropriata. Utilizza recensioni responsabili con l'IA e filtri di sicurezza dei contenuti insieme alla valutazione.

Automatizza le valutazioni ricorrenti

Copilot Studio supporta l'esecuzione delle valutazioni tramite l'API Power Platform, così puoi integrare la validazione del modello nei flussi di lavoro di rilascio e nelle pipeline di integrazione continua. Per un grande patrimonio di agenti, l'automazione rende sostenibili i test ripetuti dei candidati invece che manuali. Scopri di più sulle valutazioni di Automate con l'API di Power Platform.

Aggiorna gli artefatti dell'agente che un cambiamento del modello influenza

Un cambiamento di modello raramente riguarda solo l'impostazione del modello. Traduci le indicazioni del fornitore applicabili negli artefatti dell'agente che controlli, e poi valida ogni modifica rispetto alla tua base di valutazione. Una bonifica che non viene ritestata è solo un'ipotesi.

Artefatto Cambiamento tipico
Istruzioni dell'agente Rendi esplicite le aspettative implicite, rimuovi le soluzioni aggirate per il modello precedente, riformula i confini, le regole di escalation e i comportamenti proibiti in modo inequivocabile, risolvi le istruzioni contrastanti e calibra quanta azione indipendente l'agente dovrebbe intraprendere.
Istruzioni per argomento e nodo Applica lo stesso trattamento a livello di argomento e verifica che i nodi di risposta generativa si comportino ancora come previsto.
Descrizioni degli strumenti e delle azioni Riscrivere per maggiore chiarezza. Questa descrizione è ciò che il modello legge per decidere se e quando chiamare uno strumento, e descrizioni vaghe causano sia sovrachiamate che sottochiamate.
Descrizioni dei parametri di input e output Stringi il formato, le unità, gli esempi e la semantica obbligatoria o opzionale in modo che la generazione dei parametri rimanga corretta.
Configurazione dell'origine delle informazioni Ricontrolla la selezione della fonte, le istruzioni di ambito e di grounding, e verifica il comportamento delle citazioni.
Istruzioni per la formattazione delle risposte Riformulare esplicitamente la struttura, la lunghezza, le dichiarazioni di non responsabilità e i valori esatti richiesti, perché i modelli più recenti modificano la verbosità predefinita.
Cancelli di conferma e sicurezza Riaffermare i requisiti espliciti di conferma prima delle azioni conseguenti.
Consumatori a valle Aggiorna i flussi di Power Automate, le schede adattivive, le integrazioni dei canali e qualsiasi parser che legga l'output dell'agente.
Il set di prova stesso Aggiungi i nuovi modelli di guasto riscontrati durante la migrazione.

Fasi di migrazione

Le fasi successive mettono le sezioni precedenti in ordine di esecuzione. Usali come piano operativo per il cambiamento di modello di un singolo agente, sia che il cambiamento sia proattivo sia guidato da un pensionamento.

Fase 0: Prepararsi

  1. Conferma che il modello candidato sia valido rispetto ai prerequisiti: generalmente disponibile o predefinito, disponibile in regione, postura cross-geo accettabile, abilitato dall'amministratore e la categoria d'uso corretta per lo scopo dell'agente.
  2. Leggi le indicazioni di aggiornamento del fornitore di modelli e annota le istruzioni e le modifiche agli strumenti che implicano.
  3. Identificare gli agenti interessati dall'inventario, dall'ambiente di registrazione, dai proprietari e dalla criticità.
  4. Conferma quali metodi di valutazione supporta l'imbracatura dell'agente.
  5. Definire e approvare i cancelli di accettazione della migrazione.

Fase 1: Base del modello attuale

  1. Costruisci o aggiorna il set di test di regressione in modo che copra scenari critici per il business e ad alta frequenza.
  2. Esegui il set di test con il modello di produzione attuale per stabilire la base. Fallo finché il modello attuale è ancora in posizione, perché dopo che il modello cambia la base non può essere ricostruita.
  3. Registra separatamente la latenza e il consumo di crediti Copilot. Le valutazioni non li segnalano.
  4. Esporta i risultati in CSV per preservare il record oltre la finestra di conservazione.

Fase 2: Valutare il candidato in un ambiente non produttivo

  1. Prepara una copia non produttiva dell'agente, seguendo le indicazioni di Copilot Studio per la gestione del ciclo di vita dell'applicazione e i test dell'agente. Configura l'ambiente in modo che rappresenti la produzione:

    • Usa le stesse istruzioni dell'agente, argomenti, configurazione delle conoscenze, strumenti, flusso, connettori, linguaggi e assunzioni di sicurezza.
    • Usa identità e connessioni rappresentative per i test.
    • Applicare le stesse politiche sui dati e i relativi controlli amministrativi.
    • Confermare la disponibilità regionale e se è necessario un movimento di dati tra le zone geografiche.
    • Annota eventuali differenze tra test e produzione che potrebbero influenzare il risultato.
  2. Cambia modello. Vai alla pagina Panoramica dell'agente e seleziona il modello principale candidato nella sezione Modello . Esistono impostazioni separate per il ragionamento profondo, le risposte generative e il creatore di prompt, quindi verifica se l'agente utilizza queste funzionalità e se anche queste devono cambiarle.

  3. Riesegui lo stesso set di test, invariato, contro il modello candidato.

  4. Confronta le due corse con le porte di accettazione per identificare miglioramenti e regressioni.

  5. Ispezionare l'orchestrazione qualitativamente nella chat di test, utilizzando la mappa di attività per confermare quali strumenti sono stati selezionati, in quale ordine e con quali parametri.

  6. Misura la latenza e il consumo per il candidato e confrontali con la linea di base.

Fase 3: Correzione

  1. Aggiorna gli artefatti dell'agente che la modifica del modello colpisce, poi riesegui il set di test sull'agente rimosso. Scopri di più in Migliorare gli agenti utilizzando il triage e la bonifica guidati dalla valutazione.
  2. Iterare finché non sono soddisfatti i limiti di accettazione, oppure concludere che il modello candidato non è adatto e documentare il motivo. Decidere di non aggiornare è un risultato legittimo e basato su evidenze.

Fase 4: Approvazione e distribuzione

  1. Ottieni l'approvazione delle porte di accettazione dal proprietario dell'agente e dall'approvatore del rilascio, inclusa l'approvazione di sicurezza e conformità quando sono coinvolti modelli cross-geo o esterni.
  2. Implementare tramite il processo ALM consolidato, promuovendo la soluzione dal test alla produzione. Non modificare manualmente l'agente di produzione.
  3. Fasea il rollout quando il canale lo permette. Pubblica prima a un pubblico pilota o a un singolo canale, osserva il risultato, poi amplia.

Fase 5: Monitorare e chiudere

  1. Monitorare il comportamento produttivo rispetto ai cancelli di accettazione.
  2. Aggiungi nuovi pattern di guasto scoperti al set di test di regressione.
  3. Chiudi la migrazione solo dopo che i criteri di accettazione saranno soddisfatti in produzione.
  4. Preservare le prove di valutazione e il record decisionale di migrazione per l'audit e per il prossimo evento del ciclo di vita.

Importante

Il percorso di rollback per una modifica del modello consiste nel ridistribuire la versione della soluzione precedentemente validata, che è più lenta di un toggle di configurazione. Questa differenza rende così importante il portale di valutazione nella fase 2 . Individuare una regressione prima del dispiegamento è meno costoso che invertirne una dopo.

Monitoraggio dopo la migrazione

Il lavoro sul ciclo di vita del modello continua dopo il deployment. Monitoraggio:

  • Risultati di valutazione degli agenti e tassi di superamento degli scenari critici.
  • Analisi di produzione, trascrizioni, attività, errori e feedback degli utenti.
  • Errori nel seguire le istruzioni e nella selezione degli strumenti.
  • Latenza, timeout e affidabilità.
  • Il consumo cambia.
  • Questioni di sicurezza, conformità e elaborazione regionale.

Quando il monitoraggio della produzione identifica un nuovo schema di guasto, aggiungere un caso rappresentativo al set di test di regressione. Questa pratica migliora la valutazione successiva del modello e trasforma l'apprendimento in produzione in una base di qualità duratura.

La telemetria a livello di ambiente emette OpenTelemetry GenAI che si estende fino alle Application Insights, incluso il modello utilizzato per ogni invocazione di agente. Usalo per confermare su quale modello viene effettivamente utilizzato il traffico di produzione e per confrontare la selezione degli strumenti e l'affidabilità prima e dopo una migrazione.