Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Följande avsnitt gäller för varje modellbyte, oavsett om det är en proaktiv uppgradering eller ett svar på en pensionering. Definiera grindarna först, fånga en baslinje från den aktuella modellen och arbeta sedan igenom faserna.
Definiera migrationsaccepteringsgrindar
Definiera acceptanskriterier innan du utvärderar kandidatmodellen, så att agentens utvärdering ger ett beslut istället för bara en uppsättning poäng. Inkluderar:
- Minsta totala godkändhet
- Nödvändig godkändhet för affärskritiska scenarier
- Kritiska fel som blockerar migration oavsett aggregerad poäng
- Tillåten latens och tillförlitlighetsvarians
- Säkerhets-, efterlevnads- och regionalt godkännande
- Acceptabel konsumtion eller kostnadspåverkan
- Kräver godkännande från ägare och godkännande
Jämför nuvarande och kandidatmodell genom att använda samma agentkonfiguration, testdata, testuppsättning, användarprofiler och miljöantaganden. Undersök individuella regressioner istället för att bara förlita dig på ett genomsnittligt resultat.
Modellutdata är probabilistiska. Kör viktiga scenarier mer än en gång när variation kan påverka beslutet.
Etablera en återanvändbar utvärderingsbaslinje
Innan du ändrar modellen, skapa en testuppsättning som representerar agentens affärskritiska och högfrekventa scenarier. Kör testuppsättningen mot den aktuella produktionsmodellen för att etablera en baslinje.
Använd både testchatt och agentutvärdering:
- Använd testchatt för att utforska kompletta konversationer och inspektera orkestrering med aktivitetskartan.
- Använd agentutvärdering för att köra upprepbara testset, mäta resultat och jämföra körningar över tid.
De testmetoder som finns tillgängliga för dig beror på agentens sele, så bekräfta dem innan du designar testsetet. Läs mer i Bekräfta vilka testmetoder din agent stödjer.
Utvärdera hela agentens beteende
Godkänn inte en ersättningsmodell bara för att dess samlade godkännandefrekvens är lik den nuvarande modellen.
Täck följande områden. Varje metod är ett beteende som ofta ändras när modellen ändras, så en testmängd som utelämnar ett område kan inte upptäcka en regression i det.
| Utvärderingsområde | Vad en modellförändring kan förstöra | Hur man kontrollerar det |
|---|---|---|
| Svarskvalitet | Relevans, fullständighet, noggrannhet, tydlighet och konsekvens i de frågor agenten oftast får. | Allmän kvalitet |
| Grundad och kunskap | Modellen svarar från träningsdata istället för den konfigurerade kunskapskällan, släpper citeringar eller hanterar ofullständiga eller motstridiga källor annorlunda. | Allmän kvalitet |
| Avhållsamhet | Modellen besvarar en fråga utanför omfattningen istället för att avvisa eller eskalera. | Allmän kvalitet, eller Anpassad med besvarade och nekade etiketter |
| Instruktion som följer | Instruktioner som modellen pålitligt följde hoppas över, såsom eskaleringsregler, gränser, förbjudna beteenden eller en obligatorisk ansvarsfriskrivning. | Nyckelordsmatchning på nödvändiga fraser, eller Anpassad med instruktionsspecifika etiketter |
| Fasta värden och utdataformat | Ett exakt värde som ett telefonnummer, kod eller ID omformuleras eller uppfinns, eller så ändras utdataformen och bryter en nedströms parser eller kanalintegration. | Exakt matchning, eller nyckelordsmatchning i det önskade formatet |
| Verktygsval och begränsning | Modellen väljer ett annat verktyg, anropar inget eller anropar ett verktyg när inget verktyg behövs. | Verktygsanvändning med de förväntade verktygen eller ämnena definierade, plus en genomgång av aktivitetskartan |
| Verktygsinmatningar och sekvensering | Parametrar extraheras, formateras eller standardiseras annorlunda, eller så omordnas stegen i en multiverktygsuppgift, slås ihop eller tas bort. | Verktygsanvändning med alla förväntade verktyg, plus allmän kvalitet |
| Bekräftelse och felhantering | Modellen slutar be om bekräftelse innan en avgörande åtgärd, eller så framkommer ett verktygsfel på ett annat sätt istället för att rapporteras. | Anpassad med bekräftelseetiketter, plus nyckelordsmatchning på det förväntade felspråket |
| Multi-tur-beteende | Kontexten från tidigare omgångar förloras eller tolkas om, eller förtydligande, ämnesbyten och återhämtning hanteras på olika sätt. | Allmän kvalitet på ett konversationstestset |
| Rörig och adversariell input | Svagare hantering av stavfel, fragment och oklar avsikt, eller en annan reaktion på promptinjektion och rollöverskrivningsförsök. | Allmän kvalitet, plus Custom med Refuused- och Complied-etiketter |
| Säkerhet och efterlevnad | Hantering av skadligt innehåll, dataåtkomst, behörigheter, regional bearbetning och ansvarsfulla krav på AI. | Anpassade etiketter, tillsammans med en ansvarsfull AI-granskning |
| Latens och tillförlitlighet | Svarstid, timeouts, variation, misslyckade samtal och omförsök under representativa förhållanden. | Inte rapporterat genom utvärdering. Mät i testchatt och produktionsövervakning. |
| Konsumtion och kostnad | Copilot Credit-konsumtion eller andra modellrelaterade kostnader för representativa scenarier. | Inte rapporterat genom utvärdering. Mät i kapacitets- och konsumtionsrapportering. |
| Språk och kanaler | Kvalitet och beteende över stödda språk, användarprofiler och distributionskanaler. | Kör testuppsättningen för varje språk, användarprofil och kanal som är viktig |
Var särskilt uppmärksam på instruktionsföljning och latens. En kandidatmodell kan förbättra svarskvaliteten men introducera långsammare svar, annorlunda verktygsvalbeteende eller fel i instruktioner som var pålitliga med den tidigare modellen.
Bekräfta vilka testmetoder din agent stödjer
Testmetoderna som är tillgängliga för din agent beror på dess ledningsnät.
Läs mer i:
Bygg och underhåll testuppsättningen
- Täck först affärskritiska lyckliga vägar och stora volymförfrågningar, sedan svåra fall: kantfall, motsatta inmatningar, förfrågningar som bör avslås eller eskaleras, verktygsfel, långa samtal och flerspråkiga förfrågningar.
- Börja från riktig trafik. Analysteman och inspelade samtal ger mer representativa testfall än påhittade.
- Föredra täckning framför polish. En större uppsättning ofullkomliga fall ger fler regressioner än en liten uppsättning perfekt formulerade.
- Betygsätt den nuvarande modellen först, sedan kandidaten. Jämförelsen, inte det absoluta antalet, visar om migrationen är säker.
- Behåll setet med agenten i versionskontrollen och kör om det oförändrat för varje modellbyte.
- Dela upp setet efter riskområde. En testuppsättning som drivs av standardkabeln rymmer upp till 100 testfall, så använd separata uppsättningar för kunskapsnoggrannhet, verktygsbeteende och säkerhetskänsliga scenarier.
- Exportera resultat. Utvärderingsresultaten sparas i 89 dagar, så exportera dem till CSV för att hålla en redovisning av vad varje modell fick vid migreringen.
- Omvandla produktionsincidenter och användarfeedback till nya regressionstester.
Läs mer i Design och operationalisera agentutvärdering.
Note
Agentutvärdering mäter korrekthet och prestanda, inte AI-etik eller säkerhetsproblem. En agent kan klara varje testfall och ändå ge ett olämpligt svar. Använd ansvarsfulla AI-granskningar och innehållssäkerhetsfilter tillsammans med utvärdering.
Automatisera återkommande utvärderingar
Copilot Studio stödjer att köra utvärderingar via Power Platform API, så du kan integrera modellvalidering i releasearbetsflöden och kontinuerliga integrationspipelines. För en stor mäklareestate är automatisering det som gör upprepad kandidattestning hållbar istället för manuell. Läs mer i Automate evaluations med Power Platform API.
Uppdatera agentartefakterna som en modelländring påverkar
En modelländring påverkar sällan bara modellinställningen. Översätt den relevanta vägledningen från leverantören till de agentartefakter du kontrollerar, och verifiera sedan varje förändring mot din utvärderingsbaslinje. En sanering som inte testas igen är en gissning.
| Artifact | Typisk förändring |
|---|---|
| Instruktioner för handläggare | Gör implicita förväntningar tydliga, ta bort lösningar skrivna för den tidigare modellen, omformulera gränser och eskaleringsregler och förbjudna beteenden entydigt, lösa motstridiga instruktioner och kalibrera hur mycket självständig handling agenten bör vidta. |
| Ämnes- och nodinstruktioner | Tillämpa samma behandling på ämnesnivå och kontrollera att generativa svarsnoder fortfarande beter sig som förväntat. |
| Verktygs- och aktionsbeskrivningar | Skriv om för tydlighetens skull. Denna beskrivning är vad modellen läser för att avgöra om och när ett verktyg ska anropas, och vaga beskrivningar orsakar både över- och underanrop. |
| Beskrivningar av in- och utmatningsparametrar | Strama åt formatet, enheterna, exemplen och nödvändig eller valfri semantik så att parametergenereringen förblir korrekt. |
| Konfiguration av kunskapskälla | Kontrollera källval, avgränsning och jordningsinstruktioner igen, och verifiera referensbeteendet. |
| Instruktioner för svarsformatering | Upprepa den nödvändiga strukturen, längden, ansvarsfriskrivningarna och exakta värden explicit, eftersom nyare modeller ändrar standardordrikedom. |
| Bekräftelse och säkerhetsgrindar | Bekräfta uttryckliga bekräftelsekrav innan följdåtgärder. |
| Nedströmskonsumenter | Uppdatera Power Automate-flöden, adaptiva kort, kanalintegrationer och alla parsers som läser agentens utdata. |
| Testsetet självt | Lägg till de nya felmönstren som upptäcktes under migrationen. |
Migreringsfaser
Följande faser placerar de föregående sektionerna i utförandeordning. Använd dem som arbetsplan för en enskild agents modellförändring, oavsett om förändringen är proaktiv eller drivs av pensionering.
Fas 0: Förbered
- Bekräfta att kandidatmodellen är giltig mot förutsättningarna: allmänt tillgänglig eller standard, tillgänglig i regionen, cross-geo posture acceptabel, administratörsaktiverad och rätt användningskategori för agentens syfte.
- Läs modellleverantörens uppgraderingsråd och notera vilka instruktioner och verktygsändringar det innebär.
- Identifiera de drabbade ämnena från inventariet, registreringsmiljön, ägare och kritikalitet.
- Bekräfta vilka utvärderingstestmetoder agentens harness stödjer.
- Definiera och godkänn migrationsacceptansgrindarna.
Fas 1: Basline-modell
- Bygg eller uppdatera regressionstestuppsättningen så att den täcker affärskritiska och högfrekventa scenarier.
- Kör testuppsättningen mot den nuvarande produktionsmodellen för att fastställa baslinjen. Gör detta medan den nuvarande modellen fortfarande är kvar, eftersom baslinjen inte kan rekonstrueras efter att modellen ändrats.
- Registrera latens och konsumtion av Copilot Credit separat. Utvärderingar rapporterar dem inte.
- Exportera resultaten till CSV för att bevara posten bortom lagringsfönstret.
Fas 2: Utvärdera kandidaten i en icke-produktionsmiljö
Förbered en icke-produktionskopia av agenten, enligt Copilot Studio:s riktlinjer för applikationslivscykelhantering och agenttestning. Konfigurera miljön så att den representerar produktion:
- Använd samma agentinstruktioner, ämnen, kunskapskonfiguration, verktyg, flöden, kopplingar, språk och säkerhetsantaganden.
- Använd representativa testidentiteter och kopplingar.
- Tillämpa samma datapolicys och relevanta administratörskontroller.
- Bekräfta regional tillgänglighet och om överföring av data över geografiska områden krävs.
- Dokumentera eventuella skillnader mellan test och produktion som kan påverka resultatet.
Byt modell. Gå till agentens översiktssida och välj kandidatens primärmodell i avsnittet Modell . Separata inställningar finns för djup resonemang, generativa svar och promptbyggaren, så kontrollera om agenten använder dessa funktioner och om de också behöver ändras.
Kör samma testuppsättning om igen, oförändrad, mot kandidatmodellen.
Jämför de två körningarna mot acceptansgrindarna för att identifiera förbättringar och regressioner.
Inspektera orkestreringen kvalitativt i testchatten, med aktivitetskarten för att bekräfta vilka verktyg som valts, i vilken ordning och med vilka parametrar.
Mät latens och förbrukning för kandidaten och jämför dem med baslinjen.
Fas 3: Sanering
- Uppdatera agentartefakterna som modelländringen påverkar, kör sedan testuppsättningen mot den åtgärdade agenten. Läs mer i Förbättra agenter med utvärderingsdriven triage och åtgärd.
- Iterera tills acceptansgränserna är uppfyllda, eller dra slutsatsen att kandidatmodellen inte är lämplig och dokumentera varför. Att välja att inte uppgradera är ett legitimt, evidensbaserat resultat.
Fas 4: Godkänn och distribuera
- Få godkännande av acceptansgrindarna från agentägaren och godkännande-godkännandet, inklusive säkerhets- och efterlevnadsgodkännande när cross-geo eller externa modeller är inblandade.
- Distribuera via den etablerade ALM-processen och marknadsför lösningen från test till produktion. Redigera inte produktionsagenten manuellt.
- Igång utrullningen när kanalen tillåter det. Publicera först till en pilotpublik eller en enda kanal, observera resultatet, och bredda sedan.
Fas 5: Övervaka och stäng
- Övervaka produktionsbeteendet mot acceptansgränserna.
- Lägg till nyupptäckta felmönster i regressionstestuppsättningen.
- Stäng migrationen först när acceptanskriterierna är uppfyllda i produktionen.
- Bevara utvärderingsbevisen och migrationsbeslutsregistret för revision och för nästa livscykelhändelse.
Important
Rollback-vägen för en modelländring är att återdistribuera den tidigare validerade lösningsversionen, som är långsammare än en konfigurationsväxel. Denna skillnad gör utvärderingsporten i fas 2 så viktig. Att upptäcka en regression innan utplacering är billigare än att vända en efteråt.
Övervaka efter migration
Arbetet med modelllivscykeln fortsätter efter utrullning. Övervaka:
- Resultat av agentutvärdering och godkännandefrekvenser i kritiska scenarier.
- Produktionsanalys, transkriptioner, aktivitet, fel och användarfeedback.
- Felsteg i instruktionsföljning och verktygsval.
- Latens, timeouts och tillförlitlighet.
- Konsumtionen förändras.
- Säkerhets-, efterlevnads- och regionala hanteringsfrågor.
När produktionsövervakning identifierar ett nytt felmönster, lägg till ett representativt fall i regressionstestuppsättningen. Denna praxis förbättrar nästa modellutvärdering och omvandlar produktionsinlärning till en hållbar kvalitetsbaslinje.
Telemetri på miljönivå sänder OpenTelemetry GenAI till Application Insights, inklusive modellen som används för varje agentanrop. Använd det för att bekräfta vilken modell produktionstrafik som faktiskt körs på, och för att jämföra verktygsval och tillförlitlighet före och efter en migrering.