Uruchom i zweryfikuj migrację modelu AI dla agentów Copilot Studio

Poniższe sekcje dotyczą każdej zmiany modelu, niezależnie od tego, czy jest to proaktywna aktualizacja, czy reakcja na emeryturę. Najpierw zdefiniuj bramki, uchwyć punkt bazowy z obecnego modelu, a następnie przejdź przez fazy.

Zdefiniuj bramy akceptacji migracji

Zdefiniuj kryteria akceptacji przed oceną modelu kandydata, tak aby ocena agenta prowadziła do decyzji, a nie tylko do zestawu ocen. Załącz:

  • Minimalny ogólny wskaźnik zdawalności
  • Wymagany wskaźnik zdawalności w scenariuszach krytycznych dla biznesu
  • Krytyczne awarie, które blokują migrację niezależnie od łącznego wyniku
  • Dopuszczalne opóźnienia i zmienność niezawodności
  • Zatwierdzenie bezpieczeństwa, zgodności i przetwarzania regionalnego
  • Akceptowalna konsumpcja lub wpływ kosztów
  • Wymagane podpisanie właściciela i zgody na zgodę

Porównaj obecny i kandydacyjny model, używając tej samej konfiguracji agenta, danych testowych, zestawu testów, profili użytkowników oraz założeń środowiskowych. Zbadaj pojedyncze regresje, zamiast polegać wyłącznie na średnim wyniku.

Wyniki modeli są probabilistyczne. Powtarzaj ważne scenariusze więcej niż raz, gdy zmienność może wpłynąć na decyzję.

Ustal wielokrotnego użytku punkt odniesienia do oceny

Zanim zmienisz model, stwórz zestaw testowy reprezentujący scenariusze biznesowo krytyczne i często występujące przez agenta. Uruchom zestaw testów na bieżącym modelu produkcyjnym, aby ustalić punkt odniesienia.

Korzystaj zarówno z czatu testowego, jak i oceny agentów:

Dostępne metody testowe zależą od uprzęży agenta, więc popewnij je przed zaprojektowaniem zestawu testowego. Dowiedz się więcej w sekcji Potwierdź, które metody testowania obsługuje Twój agent.

Oceniaj pełne zachowanie agenta

Nie zatwierdzaj modelu zastępczego tylko dlatego, że jego łączna zdawalność jest podobna do obecnego modelu.

Omówi następujące obszary. Każde z nich to zachowanie, które często zmienia się wraz ze zmianą modelu, więc zestaw testowy pomijający obszar nie może wykryć regresji w nim.

Obszar oceny Co może zepsuć zmiana modelu Jak to sprawdzić
Jakość odpowiedzi Trafność, kompletność, dokładność, jasność i spójność w pytaniach, które agent otrzymuje najczęściej. Ogólna jakość
Ugruntowanie i wiedza Model odpowiada na podstawie danych treningowych zamiast skonfigurowanego źródła wiedzy, pomija cytowania lub inaczej obsługuje niekompletne lub sprzeczne źródła. Ogólna jakość
Wstrzymanie się od głosu Model odpowiada na pytanie poza zakresem działania, zamiast spadać lub eskalować. Ogólna jakość lub Custom z etykietami Answered i Refused
Instrukcja następująca Instrukcje, których model niezawodnie przestrzegał, są pomijane, takie jak zasady eskalacji, granice, zakazane zachowania czy obowiązkowe zastrzeżenie. Dopasowanie słów kluczowych do wymaganych fraz lub Custom z etykietami specyficznymi dla instrukcji
Stałe wartości i format wyjściowy Precyzyjna wartość, taka jak numer telefonu, kod czy identyfikator, jest parafrazowana lub wymyślana, albo kształt wyjściowy zmienia się i przerywa dalszy parser lub integrację kanałową. Dokładne dopasowanie lub dopasowanie słów kluczowych w wymaganym formacie
Wybór narzędzi i ograniczenia Model wybiera inne narzędzie, nie wywołuje żadnego lub wywołuje narzędzie, gdy nie jest potrzebne. Użycie narzędzi z określonymi oczekiwanymi narzędziami lub tematami oraz przegląd mapy aktywności
Wkłady narzędziowe i sekwencjonowanie Parametry są inaczej wyodrębniane, formatowane lub domyślne, a kroki w zadaniu multitool są zmieniane, łączone lub usuwane. Użycie narzędzi ze wszystkimi oczekiwanymi narzędziami, plus ogólna jakość
Potwierdzenie i obsługa awarii Model przestaje prosić o potwierdzenie przed podjęciem działań lub błąd narzędzia jest ujawniany inaczej zamiast zgłaszany. Niestandardowe z etykietami potwierdzającymi oraz dopasowanie słów kluczowych do języka oczekiwanego błędu
Zachowanie wieloobrotowe Kontekst z wcześniejszych zwrotów jest tracony lub reinterpretowany, albo wyjaśnienia, zmiany tematu i odzyskiwanie są traktowane inaczej. Ogólna jakość na zestawie testowym konwersacji
Nieuporządkowane i konfrontacyjne działania Słabsze traktowanie literówek, fragmentów i niejasnych zamiarów lub inna reakcja na szybkie wstrzykiwanie i próby nadpisania roli. Ogólna jakość, plus Custom z etykietami Odrzucone i Zgodne
Bezpieczeństwo i zgodność Obsługa szkodliwych treści, dostęp do danych, uprawnienia, przetwarzanie regionalne oraz odpowiedzialne wymagania dotyczące AI. Etykiety na zamówienie, wraz z odpowiedzialną recenzją AI
Opóźnienia i niezawodność Czas reakcji, timeouty, zmienność, nieudane połączenia i powtórki w reprezentatywnych warunkach. Nie zgłaszane przez ocenę. Mierz w czacie testowym i monitorowaniu produkcji.
Zużycie i koszt Copilot Koszty kredytowe lub inne koszty związane z modelem dla reprezentatywnych scenariuszy. Nie zgłaszane przez ocenę. Mierz w raportowaniu mocy i zużycia.
Języki i kanały Jakość i zachowanie we wszystkich obsługiwanych językach, profilach użytkowników i kanałach wdrożenia. Uruchom zestaw testowy dla każdego języka, profilu użytkownika i kanału, który ma znaczenie

Zwróć szczególną uwagę na śledzenie instrukcji i opóźnienia. Model kandydacki może poprawić jakość odpowiedzi, ale wprowadzać wolniejsze odpowiedzi, inne zachowania przy wyborze narzędzi lub błędy instrukcji, które były wiarygodne w poprzednim modelu.

Potwierdź, które metody testowania Twój agent obsługuje

Metody testowe dostępne dla Twojego agenta zależą od jego uprzęży.

Dowiedz się więcej w:

Buduj i utrzymuj zestaw testowy

  • Najpierw omawiaj szczęśliwe ścieżki krytyczne dla biznesu i duże liczne zgłoszenia, a potem trudne przypadki: przypadki graniczne, sporne informacje, które należy odrzucić lub eskalować, awarie narzędzi, długie rozmowy i wielojęzyczne prośby.
  • Zacznij od prawdziwego ruchu. Tematy analityczne i nagrane rozmowy tworzą bardziej reprezentatywne przypadki testowe niż wymyślone.
  • Wolej pokrycie zamiast polerowania. Większy zestaw przypadków niedoskonałych wykrywa więcej regresji niż niewielki zestaw perfekcyjnie sformułowanych.
  • Najpierw oceniaj obecny model, potem kandydata. Porównanie, a nie liczba absolutna, mówi, czy migracja jest bezpieczna.
  • Zachowaj zestaw z agentem w kontroli wersji i uruchamiaj go bez zmian przy każdej zmianie modelu.
  • Podziel zestaw według obszaru ryzyka. Zestaw testowy zasilany standardową wiązką mieści do 100 przypadków testowych, dlatego używaj oddzielnych zestawów do dokładności danych, zachowania narzędzi oraz scenariuszy wrażliwych na bezpieczeństwo.
  • Eksportowanie wyników. Wyniki oceny są przechowywane przez 89 dni, więc eksportuj je do CSV, aby prowadzić zapis wyników każdego modelu podczas migracji.
  • Przekształc incydenty produkcyjne i opinie użytkowników na nowe testy regresyjne.

Dowiedz się więcej w Projektowaniu i operacjonalizacji oceny agentów.

Note

Ocena agentów mierzy poprawność i wydajność, a nie problemy etyki czy bezpieczeństwa AI. Agent może przejść każdy przypadek testowy i nadal uzyskać nieodpowiednią odpowiedź. Stosuj odpowiedzialne recenzje AI i filtry bezpieczeństwa treści obok oceny.

Automatyzacja powtarzających się ocen

Copilot Studio obsługuje przeprowadzanie ewaluacji przez API Power Platform, dzięki czemu można integrować walidację modeli z workflow wydań i ciągłą integracją. W przypadku dużej grupy agentów automatyzacja sprawia, że powtarzane testowanie kandydatów jest trwałe, a nie ręczne. Dowiedz się więcej w Automate evaluations with the Power Platform API.

Aktualizuj artefakty agentów, na które wpływa zmiana modelu

Zmiana modelu rzadko dotyczy wyłącznie ustawienia modelu. Przełóż odpowiednie wytyczne dla dostawców na artefakty agentów, które kontrolujesz, a następnie zweryfikowaj każdą zmianę względem swojego poziomu wyjściowego oceny. Naprawa, która nie jest ponownie testowana, to przypuszczenie.

Artifact Typowa zmiana
Instrukcje dla agenta Jasno uczyń ukryte oczekiwania, usuń obejścia napisane dla poprzedniego modelu, jednoznacznie odnow granice, zasady eskalacji i zakazane zachowania, rozwiąż sprzeczne instrukcje i skalibruj, ile niezależnych działań agent powinien podjąć.
Instrukcje dotyczące tematu i węzła Zastosuj to samo traktowanie na poziomie tematu i sprawdź, czy generatywne węzły odpowiedzi nadal zachowują się zgodnie z oczekiwaniami.
Opisy narzędzi i akcji Zapisz ponownie dla jasności. Ten opis jest tym, co model odczytuje, aby zdecydować, czy i kiedy wywołać narzędzie, a niejasne opisy powodują zarówno nadwywołanie, jak i niedowywołanie.
Opisy parametrów wejściowych i wyjściowych Dopracuj format, jednostki, przykłady oraz wymaganą lub opcjonalną semantykę, aby generowanie parametrów pozostało poprawne.
Konfiguracja źródła wiedzy Ponownie sprawdź instrukcje dotyczące wyboru źródła, zakresu i ugruntowania oraz zweryfikowaj zachowanie cytowań.
Instrukcje formatowania odpowiedzi Wyraźnie powtórz wymaganą strukturę, długość, zastrzeżenia i dokładne wartości, ponieważ nowsze modele zmieniają domyślną rozwlekłość.
Bramy potwierdzające i bezpieczne Przed podjęciem działań należy ponownie zaznaczyć wyraźne wymagania potwierdzania.
Konsumenci w sektorze downstream Aktualizuj przepływy Power Automate, karty adaptacyjne, integracje kanałów oraz każdy parser, który odczytuje wyjście agenta.
Sam zestaw testowy Dodaj nowe wzorce awarii wykryte podczas migracji.

Fazy migracji

Kolejne etapy uporządkowują poprzednie sekcje w kolejności realizacji. Wykorzystaj je jako plan roboczy dla zmiany modelu pojedynczego agenta, niezależnie od tego, czy zmiana jest proaktywna, czy wywołana emeryturą.

Faza 0: Przygotowanie

  1. Potwierdź, że model kandydata spełnia wymagania wstępne: ogólnie dostępny lub domyślny, dostępny w regionie, akceptowalny stan cross-geo, uprawnienia administratora oraz odpowiednia kategoria użycia dla celu agenta.
  2. Przeczytaj wytyczne dotyczące aktualizacji dostawcy modelu i zwróć uwagę na instrukcje oraz zmiany w narzędziu, które one sugerują.
  3. Zidentyfikuj dotkniętych agentów na podstawie zapasów, środowiska rejestracji, właścicieli oraz krytyczności.
  4. Potwierdź, które metody testów oceniających obsługuje uprząż agenta.
  5. Zdefiniuj i zatwierdzaj bramki akceptacji migracji.

Faza 1: Podstawa obecnego modelu

  1. Zbuduj lub odśwież zestaw testów regresji , aby obejmował scenariusze krytyczne dla biznesu i o wysokiej częstotliwości.
  2. Uruchom zestaw testów na bieżącym modelu produkcyjnym , aby ustalić poziom bazowy. Rób to, póki obecny model jest jeszcze w mocy, ponieważ po zmianie modelu bazowa linia nie może być odtworzona.
  3. Rejestruj opóźnienia i zużycie kredytów Copilot osobno. Oceny ich nie zgłaszają.
  4. Eksportuj wyniki do CSV , aby zachować rekord poza upływem okna przechowywania.

Faza 2: Ocena kandydata w środowisku nieprodukcyjnym

  1. Przygotuj kopię agenta nieprodukcyjną, zgodnie z wytycznymi Copilot Studio dotyczącymi zarządzania cyklem życia aplikacji i testowania agentów. Konfiguruj środowisko tak, aby reprezentowało produkcję:

    • Używaj tych samych instrukcji agenta, tematów, konfiguracji wiedzy, narzędzi, przepływów, łączników, języków i założeń bezpieczeństwa.
    • Używaj reprezentatywnych tożsamości testowych i połączeń.
    • Stosuj te same polityki dotyczące danych i odpowiednie kontrole administratora.
    • Potwierdź dostępność regionalną oraz czy wymagany jest ruch danych między obszarami geograficznymi.
    • Zapisz wszelkie różnice między testem a produkcją, które mogłyby wpłynąć na wynik.
  2. Zmień model. Przejdź do strony Przegląd agenta i wybierz kandydata na model podstawowy w sekcji Model. Istnieją osobne ustawienia dla głębokiego rozumowania, odpowiedzi generatywnych i kreatora promptów, więc sprawdź, czy agent korzysta z tych możliwości i czy też muszą się zmienić.

  3. Uruchom ten sam zestaw testów bez zmian na modelu kandydackim.

  4. Porównaj oba przebiegi z bramkami akceptacji, aby zidentyfikować poprawy i regresje.

  5. Sprawdź orkiestrację jakościowo na czacie testowym, korzystając z mapy aktywności, aby potwierdzić, które narzędzia zostały wybrane, w jakiej kolejności i z jakimi parametrami.

  6. Zmierz opóźnienia i zużycie dla kandydata oraz porównaj je z poziomem wyjściowym.

Faza 3: Remediacja

  1. Aktualizuj artefakty agenta, na które wpływa zmiana modelu, a następnie ponownie uruchom zestaw testów na remediowanym agencie. Dowiedz się więcej w Improve agents korzystając z triage i remediacji opartej na ocenie.
  2. Iteruj, aż zostaną spełnione kryteria przyjęcia, albo doszę do wniosku, że model kandydata nie jest odpowiedni i dokumentuj dlaczego. Decyzja o nieaktualizacji jest uzasadnionym, opartym na dowodach rezultatem.

Faza 4: Zatwierdzenie i wdrożenie

  1. Uzyskaj zgodę właściciela agenta na bramki akceptacyjne i zatwierdzającą zatwierdzenie, w tym zatwierdzenie bezpieczeństwa i zgodności, gdy w grę wchodzą modele cross-geo lub zewnętrzne.
  2. Wdrażaj w ramach ustalonego procesu ALM, promującrozwiązanie od testów do produkcji. Nie edytuj ręcznie agenta produkcyjnego.
  3. Rozwinięcie zainscenizuj wtedy, gdy kanał na to pozwala. Najpierw publikuj dla pilotażowej publiczności lub jednego kanału, obserwuj efekty, a potem poszerzaj temat.

Faza 5: Monitorowanie i zamknięcie

  1. Monitoruj zachowanie produkcyjne względem bramek akceptacyjnych.
  2. Dodaj nowo odkryte wzorce awarii do zbioru testów regresji.
  3. Zamknąć migrację dopiero po spełnieniu kryteriów akceptacji w produkcji.
  4. Zachowanie dowodów oceny oraz zapisu decyzji migracyjnych na potrzeby audytu i na kolejne wydarzenie cyklu życia.

Ważna

Ścieżką cofnięcia dla zmiany modelu jest ponowne wdrożenie wcześniej zweryfikowanej wersji rozwiązania, co jest wolniejsze niż przełącznik konfiguracji. Ta różnica sprawia, że bramka oceny w fazie 2 jest tak ważna. Wychwycenie regresji przed wdrożeniem jest tańsze niż jej odwrócenie później.

Monitorowanie po migracji

Prace nad cyklem życia modelu trwają po wdrożeniu. Monitorowanie:

  • Wyniki oceny agentów oraz wskaźniki zdawalności scenariuszy krytycznych.
  • Analiza produkcyjna, transkrypcje, aktywność, błędy i opinie użytkowników.
  • Niepowodzenia w podążaniu za instrukcjami i wyborze narzędzi.
  • Opóźnienia, timeouty i niezawodność.
  • Konsumpcja się zmienia.
  • Kwestia bezpieczeństwa, zgodności i przetwarzania regionalnego.

Gdy monitorowanie produkcji identyfikuje nowy wzorzec awarii, dodaj reprezentatywny przypadek do zestawu testów regresji. Ta praktyka poprawia ocenę kolejnego modelu i zamienia naukę produkcyjną w trwały punkt odniesienia jakości.

Telemetria na poziomie środowiska emituje OpenTelemetry. GenAI obejmuje Application Insights, w tym model używany dla każdego wywołania agenta. Używaj go do potwierdzenia, na którym modelu faktycznie działa ruch produkcyjny, oraz do porównania wyboru narzędzi i niezawodności przed i po migracji.