Szybki start: oceń hostowanego agenta

Note

Środowisko ewaluacyjne narzędzia Azure Developer CLI jest obecnie dostępne w wersji zapoznawczej.

W tym przewodniku Szybki start ocenisz hostowanego agenta wdrożonego w temacie Wdrażanie pierwszego hostowanego agenta. Udostępniasz testowy zestaw danych, wybierasz ewaluatorów, uruchamiasz ocenę dla wdrożonego agenta i przeglądasz wyniki. Każdy krok przedstawia pięć sposobów wykonywania tego samego zadania: interfejs wiersza polecenia dewelopera Azure (azd), portal Microsoft Foundry, zestaw SDK Python, zestaw SDK języka C# i zestaw SDK języka JavaScript/TypeScript.

Ewaluacja określa bazowy poziom jakości Twojego agenta i pozwala ustawić progi akceptacji, takie jak wskaźnik zaliczenia zgodności z zadaniem, przed udostępnieniem zmian użytkownikom.

Wymagania wstępne

Przed rozpoczęciem potrzebne są następujące elementy:

  • Wdrożony agent hostowany, który można wywołać, z Wdróż pierwszego agenta hostowanego. W przypadku ścieżki Azure Developer CLI potrzebny jest również katalog projektu azd, utworzony w tym przewodniku Szybki start.

  • Rola Użytkownika usługi Foundry w zasobie Foundry.

  • Wdrożenie modelu do uzupełniania czatu w tym samym projekcie Foundry, używanego jako model oceniający odpowiedzi. Możesz ponownie wykorzystać wdrożenie modelu, z którego agent już korzysta, w tym to z poprzedniego przewodnika Szybki start, dzięki czemu nie potrzebujesz oddzielnego wdrożenia.

    Important

    Niedawno zmieniono nazwy ról RBAC w usłudze Foundry. Użytkownik Foundry, właściciel Foundry, właściciel konta Foundry i menedżer projektu Foundry były wcześniej nazywane odpowiednio użytkownikiem Azure AI, właścicielem Azure AI, właścicielem konta Azure AI i menedżerem projektu Azure AI. Poprzednie nazwy mogą być nadal widoczne w niektórych miejscach, podczas gdy zmiana nazwy jest wdrażana. Identyfikatory ról i uprawnienia podstawowe są niezmienione przez zmianę nazwy.

Każdy krok oferuje pięć ścieżek. Użyj tego, co wolisz:

  • Azure Developer CLI: rozszerzenie azd ai agent (azure.ai.agents) w wersji 0.1.40-preview lub nowszej, które udostępnia polecenia azd ai agent eval. To rozszerzenie jest zawarte w rozszerzeniu microsoft.foundry, które zainstalowano w poprzednim przewodniku Szybki start. Sprawdź zainstalowaną wersję za pomocą azd ext list, a w razie potrzeby uruchom azd ext upgrade microsoft.foundry. Zaloguj się przy użyciu polecenia azd auth login.
  • Portal Foundry: Dostęp do portalu Foundry.
  • Python SDK: Python w wersji 3.10 lub nowszej oraz Azure CLI zalogowane przy użyciu az login, aby DefaultAzureCredential mógł się uwierzytelnić. Aby uzyskać informacje na temat instalacji, zobacz Instalowanie interfejsu wiersza polecenia platformy Azure.
  • SDK języka C#: SDK platformy .NET 10 lub nowszy oraz interfejs wiersza polecenia platformy Azure (Azure CLI) zalogowany przy użyciu az login, aby DefaultAzureCredential mogło się uwierzytelnić.
  • SDK języka JavaScript/TypeScript: Node.js 20 LTS lub nowszy oraz narzędzie Azure CLI z zalogowanym kontem przy użyciu az login, aby DefaultAzureCredential mogło się uwierzytelnić.

Krok 1. Potwierdzenie wdrożonego agenta

Ocena jest uruchamiana względem wdrożonego, wywoływanego agenta. Przed skonfigurowaniem oceny upewnij się, że agent jest wdrożony i dostępny.

azd Z katalogu projektu sprawdź, czy agent jest wdrożony i można go wywołać:

azd ai agent show

Wyślij monit testowy:

azd ai agent invoke "Write a haiku about deploying cloud applications."

Powinna zostać wyświetlona odpowiedź w ciągu kilku sekund.

Krok 2. Konfigurowanie wbudowanych ewaluatorów

Zacznij od wbudowanych ewaluatorów, aby ocenić agenta względem zestawu danych testowych.

Najpierw utwórz plik JSONL zapytań testowych dla agenta. Każdy wiersz jest obiektem JSON z polem query . Zapisz go w folderze źródłowym agenta jako src/<your-agent-name>/tests/queries.jsonl:

{"query": "Write a haiku about deploying cloud applications."}

Następnie utwórz eval.yaml plik w tym samym folderze źródłowym agenta, co src/<your-agent-name>/eval.yaml. Wskazuje na Twój zestaw danych i wyświetla listę wbudowanych ewaluatorów, które mają zostać zastosowane. Ścieżka dataset.local_uri jest względna względem tego folderu. Zastąp element <your-agent-name> nazwą hostowanego agenta, a element <your-chat-completion-deployment> wdrożeniem modelu oceniającego:

name: agent-eval
agent:
  name: <your-agent-name>
  kind: hosted
dataset:
  local_uri: tests/queries.jsonl
evaluators:
  - builtin.intent_resolution
  - builtin.task_adherence
options:
  eval_model: <your-chat-completion-deployment>
max_samples: 15

Wartość eval_model oznacza model oceniający odpowiedzi; możesz użyć ponownie wdrożenia, z którego agent już korzysta.

Krok 3. Uruchamianie oceny

Uruchom zestaw na wdrożonym agencie. Usługa wysyła każde zapytanie testowe do agenta, przechwytuje odpowiedź i ocenia je przy użyciu wybranych ewaluatorów.

Note

Ocena oparta na elementach docelowych wywołuje bezpośrednio hostowanego agenta. Współpracuje z agentami korzystającymi z protokołu responses lub invocations przy synchronicznym wykonywaniu bez strumieniowania. Aby ocenić agentów korzystających z protokołu A2A lub Activity albo z innych wzorców wykonywania, takich jak procesy długotrwałe lub strumieniowe, oceń zamiast tego ślady generowane przez agenta. Zobacz Ocena śladu.

Uruchom ocenę z poziomu katalogu głównego obszaru roboczego azd:

azd ai agent eval run --config eval.yaml

Note

azd ai agent eval run rozpoznaje ścieżkę --config względną do folderu źródłowego agenta w obszarze src/ (na przykład src/<your-agent-name>/eval.yaml), a nie bieżącego katalogu. Przechowuj eval.yaml i zbiór danych, na który wskazuje element local_uri, w tym folderze.

Polecenie odczytuje eval.yaml, wysyła każde zapytanie do Twojego agenta, ocenia odpowiedzi i wyświetla podsumowanie po zakończeniu działania:

Eval run started
   Eval: eval_b36748dede424e4ba3f8e6c99ca2cf27
   Run:  evalrun_5f72ef189ad24790a32128e6f230b131
   (✓) Done  Eval run

Results:    1 total, 1 passed, 0 failed, 0 errored

Per-criteria results:
  intent_resolution: 1 passed, 0 failed, 0 errored
  task_adherence: 1 passed, 0 failed, 0 errored

Krok 4. Przeglądanie wyników

Oceny zazwyczaj są wykonywane w ciągu kilku minut, w zależności od liczby zapytań.

Lista ostatnich ocen:

azd ai agent eval list
    Eval ID                                Name        Status of last run  Runs
    -------                                ----        ------------------  ----
*   eval_b36748dede424e4ba3f8e6c99ca2cf27  agent-eval  Completed           1

* = active eval in current environment

Pokaż najnowszą ocenę i jego przebiegi:

azd ai agent eval show
Eval:   eval_b36748dede424e4ba3f8e6c99ca2cf27
Name:   agent-eval
Agent:  <your-agent-name>
Runs:   1

Recent runs:
  Run ID                                    Status     Passed  Failed  Created
  ------                                    ------     ------  ------  -------
  evalrun_5f72ef189ad24790a32128e6f230b131  Completed  1/1     0       2026-06-17 14:52 UTC

Użyj wyników, aby potwierdzić, która wersja agenta została oceniona i jakie wyniki oceny zostały wygenerowane. Aby wyświetlić szczegóły poszczególnych ewaluatorów i link do raportu w portalu Foundry, uruchom polecenie azd ai agent eval show <eval-id> --eval-run-id <run-id>.

Uprzątnij zasoby

W tym przewodniku Szybki start rejestrowane są zestaw danych, ewaluacja i historia uruchomień w Twoim projekcie Foundry. Te aktywa wiążą się z niewielkimi lub zerowymi bieżącymi kosztami.

Aby usunąć hostowanego agenta i utworzone zasoby Azure, wykonaj kroki oczyszczania opisane w temacie Wdrażanie pierwszego hostowanego agenta.

Troubleshooting

Issue Rozwiązanie
Nie znaleziono polecenia azd ai agent eval Uruchom polecenie azd ext list i sprawdź, czy rozszerzenie azd ai agent ma wersję 0.1.40-preview lub nowszą. Zaktualizuj za pomocą azd ext upgrade microsoft.foundry.
azd ai agent eval run Nie można odnaleźć agenta Upewnij się, że agent jest wdrożony i wywoływany za pomocą polecenia azd ai agent show. W razie potrzeby wdroż ponownie azd deploy.
ModuleNotFoundError dla azure.ai.projects lub azure.identity Zainstaluj zestaw SDK: pip install "azure-ai-projects>=2.0.0" azure-identity.
C#: The type or namespace name 'Evals' (or 'AIProjectClient') could not be found Dodaj pakiety: dotnet add package Azure.AI.Projects --prerelease, dotnet add package OpenAIi dotnet add package Azure.Identity.
AuthenticationError, DefaultAzureCredentiallub Forbidden niepowodzenie Zaloguj się za pomocą az login (lub azd auth login w przypadku ścieżki CLI) i upewnij się, że masz w projekcie rolę Użytkownik Foundry. Przesyłanie zbiorów danych wymaga również uprawnień do zapisu w pamięci projektu.
Nie znaleziono celu agenta Sprawdź nazwę i wersję agenta za pomocą polecenia project_client.agents.get("<your-agent-name>") lub project_client.agents.list().
Wiele błędów wierszy lub nieoczekiwanie niskich wyników Otwórz adres URL raportu i sprawdź, czy wiersze zawierają błędy odpowiedzi agenta lub błędy ewaluatora. Napraw błędy bazowe, a następnie uruchom ponownie ocenę.
Nie można odnaleźć wdrożenia modelu oceny Sprawdź, czy wdrożenie modelu sędziego (FOUNDRY_MODEL_NAME dla pakietu SDK lub eval_model w eval.yaml) istnieje w projekcie w sekcji Kompilacja>Wdrożenia.

Czego się nauczyłeś

W ramach tego szybkiego przewodnika wykonasz następujące czynności:

  • Utworzono testowy zestaw danych i wybrano ewaluatorów dla hostowanego agenta.
  • Przeprowadzono ocenę na wdrożonym agencie.
  • Przejrzano wyniki zagregowane i wyniki na poziomie wiersza.
  • Wykonano każde zadanie za pomocą interfejsu wiersza polecenia dewelopera Azure, portalu Foundry, zestawu SDK Python, zestawu SDK języka C# lub zestawu SDK języka JavaScript/TypeScript.

Następne kroki

Kontynuuj ulepszanie procesu oceny: