Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Note
Środowisko ewaluacyjne narzędzia Azure Developer CLI jest obecnie dostępne w wersji zapoznawczej.
W tym przewodniku Szybki start ocenisz hostowanego agenta wdrożonego w temacie Wdrażanie pierwszego hostowanego agenta. Udostępniasz testowy zestaw danych, wybierasz ewaluatorów, uruchamiasz ocenę dla wdrożonego agenta i przeglądasz wyniki. Każdy krok przedstawia pięć sposobów wykonywania tego samego zadania: interfejs wiersza polecenia dewelopera Azure (azd), portal Microsoft Foundry, zestaw SDK Python, zestaw SDK języka C# i zestaw SDK języka JavaScript/TypeScript.
Ewaluacja określa bazowy poziom jakości Twojego agenta i pozwala ustawić progi akceptacji, takie jak wskaźnik zaliczenia zgodności z zadaniem, przed udostępnieniem zmian użytkownikom.
Wymagania wstępne
Przed rozpoczęciem potrzebne są następujące elementy:
Wdrożony agent hostowany, który można wywołać, z Wdróż pierwszego agenta hostowanego. W przypadku ścieżki Azure Developer CLI potrzebny jest również katalog projektu
azd, utworzony w tym przewodniku Szybki start.Rola Użytkownika usługi Foundry w zasobie Foundry.
Wdrożenie modelu do uzupełniania czatu w tym samym projekcie Foundry, używanego jako model oceniający odpowiedzi. Możesz ponownie wykorzystać wdrożenie modelu, z którego agent już korzysta, w tym to z poprzedniego przewodnika Szybki start, dzięki czemu nie potrzebujesz oddzielnego wdrożenia.
Important
Niedawno zmieniono nazwy ról RBAC w usłudze Foundry. Użytkownik Foundry, właściciel Foundry, właściciel konta Foundry i menedżer projektu Foundry były wcześniej nazywane odpowiednio użytkownikiem Azure AI, właścicielem Azure AI, właścicielem konta Azure AI i menedżerem projektu Azure AI. Poprzednie nazwy mogą być nadal widoczne w niektórych miejscach, podczas gdy zmiana nazwy jest wdrażana. Identyfikatory ról i uprawnienia podstawowe są niezmienione przez zmianę nazwy.
Każdy krok oferuje pięć ścieżek. Użyj tego, co wolisz:
-
Azure Developer CLI: rozszerzenie
azd ai agent(azure.ai.agents) w wersji 0.1.40-preview lub nowszej, które udostępnia poleceniaazd ai agent eval. To rozszerzenie jest zawarte w rozszerzeniumicrosoft.foundry, które zainstalowano w poprzednim przewodniku Szybki start. Sprawdź zainstalowaną wersję za pomocąazd ext list, a w razie potrzeby uruchomazd ext upgrade microsoft.foundry. Zaloguj się przy użyciu poleceniaazd auth login. - Portal Foundry: Dostęp do portalu Foundry.
-
Python SDK: Python w wersji 3.10 lub nowszej oraz Azure CLI zalogowane przy użyciu
az login, abyDefaultAzureCredentialmógł się uwierzytelnić. Aby uzyskać informacje na temat instalacji, zobacz Instalowanie interfejsu wiersza polecenia platformy Azure. -
SDK języka C#: SDK platformy .NET 10 lub nowszy oraz interfejs wiersza polecenia platformy Azure (Azure CLI) zalogowany przy użyciu
az login, abyDefaultAzureCredentialmogło się uwierzytelnić. -
SDK języka JavaScript/TypeScript: Node.js 20 LTS lub nowszy oraz narzędzie Azure CLI z zalogowanym kontem przy użyciu
az login, abyDefaultAzureCredentialmogło się uwierzytelnić.
Krok 1. Potwierdzenie wdrożonego agenta
Ocena jest uruchamiana względem wdrożonego, wywoływanego agenta. Przed skonfigurowaniem oceny upewnij się, że agent jest wdrożony i dostępny.
- Interfejs wiersza poleceń Azure dla deweloperów
- Portal usługi Foundry
- SDK języka Python
- C# SDK
- JavaScript/TypeScript SDK
azd Z katalogu projektu sprawdź, czy agent jest wdrożony i można go wywołać:
azd ai agent show
Wyślij monit testowy:
azd ai agent invoke "Write a haiku about deploying cloud applications."
Powinna zostać wyświetlona odpowiedź w ciągu kilku sekund.
Krok 2. Konfigurowanie wbudowanych ewaluatorów
Zacznij od wbudowanych ewaluatorów, aby ocenić agenta względem zestawu danych testowych.
- Interfejs wiersza poleceń Azure dla deweloperów
- Portal usługi Foundry
- SDK języka Python
- C# SDK
- JavaScript/TypeScript SDK
Najpierw utwórz plik JSONL zapytań testowych dla agenta. Każdy wiersz jest obiektem JSON z polem query . Zapisz go w folderze źródłowym agenta jako src/<your-agent-name>/tests/queries.jsonl:
{"query": "Write a haiku about deploying cloud applications."}
Następnie utwórz eval.yaml plik w tym samym folderze źródłowym agenta, co src/<your-agent-name>/eval.yaml. Wskazuje na Twój zestaw danych i wyświetla listę wbudowanych ewaluatorów, które mają zostać zastosowane. Ścieżka dataset.local_uri jest względna względem tego folderu. Zastąp element <your-agent-name> nazwą hostowanego agenta, a element <your-chat-completion-deployment> wdrożeniem modelu oceniającego:
name: agent-eval
agent:
name: <your-agent-name>
kind: hosted
dataset:
local_uri: tests/queries.jsonl
evaluators:
- builtin.intent_resolution
- builtin.task_adherence
options:
eval_model: <your-chat-completion-deployment>
max_samples: 15
Wartość eval_model oznacza model oceniający odpowiedzi; możesz użyć ponownie wdrożenia, z którego agent już korzysta.
Krok 3. Uruchamianie oceny
Uruchom zestaw na wdrożonym agencie. Usługa wysyła każde zapytanie testowe do agenta, przechwytuje odpowiedź i ocenia je przy użyciu wybranych ewaluatorów.
Note
Ocena oparta na elementach docelowych wywołuje bezpośrednio hostowanego agenta. Współpracuje z agentami korzystającymi z protokołu responses lub invocations przy synchronicznym wykonywaniu bez strumieniowania. Aby ocenić agentów korzystających z protokołu A2A lub Activity albo z innych wzorców wykonywania, takich jak procesy długotrwałe lub strumieniowe, oceń zamiast tego ślady generowane przez agenta. Zobacz Ocena śladu.
- Interfejs wiersza poleceń Azure dla deweloperów
- Portal usługi Foundry
- SDK języka Python
- C# SDK
- JavaScript/TypeScript SDK
Uruchom ocenę z poziomu katalogu głównego obszaru roboczego azd:
azd ai agent eval run --config eval.yaml
Note
azd ai agent eval run rozpoznaje ścieżkę --config względną do folderu źródłowego agenta w obszarze src/ (na przykład src/<your-agent-name>/eval.yaml), a nie bieżącego katalogu. Przechowuj eval.yaml i zbiór danych, na który wskazuje element local_uri, w tym folderze.
Polecenie odczytuje eval.yaml, wysyła każde zapytanie do Twojego agenta, ocenia odpowiedzi i wyświetla podsumowanie po zakończeniu działania:
Eval run started
Eval: eval_b36748dede424e4ba3f8e6c99ca2cf27
Run: evalrun_5f72ef189ad24790a32128e6f230b131
(✓) Done Eval run
Results: 1 total, 1 passed, 0 failed, 0 errored
Per-criteria results:
intent_resolution: 1 passed, 0 failed, 0 errored
task_adherence: 1 passed, 0 failed, 0 errored
Krok 4. Przeglądanie wyników
Oceny zazwyczaj są wykonywane w ciągu kilku minut, w zależności od liczby zapytań.
- Interfejs wiersza poleceń Azure dla deweloperów
- Portal usługi Foundry
- SDK języka Python
- C# SDK
- JavaScript/TypeScript SDK
Lista ostatnich ocen:
azd ai agent eval list
Eval ID Name Status of last run Runs
------- ---- ------------------ ----
* eval_b36748dede424e4ba3f8e6c99ca2cf27 agent-eval Completed 1
* = active eval in current environment
Pokaż najnowszą ocenę i jego przebiegi:
azd ai agent eval show
Eval: eval_b36748dede424e4ba3f8e6c99ca2cf27
Name: agent-eval
Agent: <your-agent-name>
Runs: 1
Recent runs:
Run ID Status Passed Failed Created
------ ------ ------ ------ -------
evalrun_5f72ef189ad24790a32128e6f230b131 Completed 1/1 0 2026-06-17 14:52 UTC
Użyj wyników, aby potwierdzić, która wersja agenta została oceniona i jakie wyniki oceny zostały wygenerowane. Aby wyświetlić szczegóły poszczególnych ewaluatorów i link do raportu w portalu Foundry, uruchom polecenie azd ai agent eval show <eval-id> --eval-run-id <run-id>.
Uprzątnij zasoby
W tym przewodniku Szybki start rejestrowane są zestaw danych, ewaluacja i historia uruchomień w Twoim projekcie Foundry. Te aktywa wiążą się z niewielkimi lub zerowymi bieżącymi kosztami.
Aby usunąć hostowanego agenta i utworzone zasoby Azure, wykonaj kroki oczyszczania opisane w temacie Wdrażanie pierwszego hostowanego agenta.
Troubleshooting
| Issue | Rozwiązanie |
|---|---|
Nie znaleziono polecenia azd ai agent eval |
Uruchom polecenie azd ext list i sprawdź, czy rozszerzenie azd ai agent ma wersję 0.1.40-preview lub nowszą. Zaktualizuj za pomocą azd ext upgrade microsoft.foundry. |
azd ai agent eval run Nie można odnaleźć agenta |
Upewnij się, że agent jest wdrożony i wywoływany za pomocą polecenia azd ai agent show. W razie potrzeby wdroż ponownie azd deploy. |
ModuleNotFoundError dla azure.ai.projects lub azure.identity |
Zainstaluj zestaw SDK: pip install "azure-ai-projects>=2.0.0" azure-identity. |
C#: The type or namespace name 'Evals' (or 'AIProjectClient') could not be found |
Dodaj pakiety: dotnet add package Azure.AI.Projects --prerelease, dotnet add package OpenAIi dotnet add package Azure.Identity. |
AuthenticationError, DefaultAzureCredentiallub Forbidden niepowodzenie |
Zaloguj się za pomocą az login (lub azd auth login w przypadku ścieżki CLI) i upewnij się, że masz w projekcie rolę Użytkownik Foundry. Przesyłanie zbiorów danych wymaga również uprawnień do zapisu w pamięci projektu. |
| Nie znaleziono celu agenta | Sprawdź nazwę i wersję agenta za pomocą polecenia project_client.agents.get("<your-agent-name>") lub project_client.agents.list(). |
| Wiele błędów wierszy lub nieoczekiwanie niskich wyników | Otwórz adres URL raportu i sprawdź, czy wiersze zawierają błędy odpowiedzi agenta lub błędy ewaluatora. Napraw błędy bazowe, a następnie uruchom ponownie ocenę. |
| Nie można odnaleźć wdrożenia modelu oceny | Sprawdź, czy wdrożenie modelu sędziego (FOUNDRY_MODEL_NAME dla pakietu SDK lub eval_model w eval.yaml) istnieje w projekcie w sekcji Kompilacja>Wdrożenia. |
Czego się nauczyłeś
W ramach tego szybkiego przewodnika wykonasz następujące czynności:
- Utworzono testowy zestaw danych i wybrano ewaluatorów dla hostowanego agenta.
- Przeprowadzono ocenę na wdrożonym agencie.
- Przejrzano wyniki zagregowane i wyniki na poziomie wiersza.
- Wykonano każde zadanie za pomocą interfejsu wiersza polecenia dewelopera Azure, portalu Foundry, zestawu SDK Python, zestawu SDK języka C# lub zestawu SDK języka JavaScript/TypeScript.
Następne kroki
Kontynuuj ulepszanie procesu oceny:
- Skonfiguruj ciągłe i zaplanowane oceny , aby śledzić jakość agenta w środowisku produkcyjnym.
Treści powiązane
- Ocena agentów sztucznej inteligencji
- Wykonywanie ewaluacji wsadowych z zestawu SDK
- Wygeneruj syntetyczny zestaw danych oceny, aby automatycznie tworzyć zapytania testowe i ewaluatory.
- Rozwiązywanie problemów z oceną i obserwacją
- Referencja ewaluatorów agentów
- Co to są hostowani agenci?