Notitie
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen u aan te melden of de directory te wijzigen.
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen de mappen te wijzigen.
Een evaluatiegegevensset is een herbruikbare verzameling testcases voor het meten van model- of agentkwaliteit. Evaluatiegegevenssets gebruiken doorgaans JSONL, met één JSON-object per regel. In dit artikel wordt uitgelegd wanneer u een herbruikbare gegevensset gebruikt, hoe evaluatiegegevens worden georganiseerd en de beschikbare manieren om deze voor te bereiden.
Hebt u een evaluatiegegevensset nodig?
Maak een gegevensset wanneer u een stabiele testset wilt die u opnieuw kunt uitvoeren op basis van verschillende model-, prompt- of agentversies. Herbruikbare datasets zijn zeer geschikt voor regressietests, quality gates in CI/CD en vergelijkingen tussen evaluatieruns.
U hebt niet altijd een gegevensset nodig. Als uw Foundry-agent al antwoorden heeft of als uw toepassing traceringen naar Application Insights verzendt, kunt u die gegevens evalueren waar deze zich bevinden. Zie Interacties evalueren op antwoord-id en Traceringen evalueren.
Hoe Foundry evaluatiegegevens gebruikt
In een JSONL-gegevensset vertegenwoordigt het messages veld model- of agentinteracties. Elk bericht identificeert een rol en de inhoud ervan.
Als uw gegevensset voltooide antwoorden bevat, evalueert Foundry deze antwoorden rechtstreeks. Als u de evaluatie uitvoert op basis van een model of agent, genereert Foundry een nieuw antwoord voor elke invoer en evalueert dat antwoord. Elk antwoord dat al in de gegevensset is opgeslagen, wordt genegeerd.
Denk bijvoorbeeld aan een gebruiker die zich niet kan aanmelden. De agent vraagt welke fout wordt weergegeven, de gebruiker zegt dat het wachtwoord wordt geweigerd en de agent raadt het opnieuw instellen van een wachtwoord aan. Evaluatie op turn-level beoordeelt een reactie van een afzonderlijke agent, zoals de richtlijnen voor het opnieuw instellen van wachtwoorden, door voorgaande berichten als context te gebruiken. Evaluatie op gespreksniveau beoordeelt de volledige interactie.
De instelling evaluation_level van de uitvoering bepaalt de granulariteit van de scoreberekening.
De gegevensset en geselecteerde evaluators moeten dat niveau ondersteunen. Zie Een evaluatieniveau kiezen voor meer informatie.
Zie Het schema van de evaluatiegegevensset voor standaardkolommen en -voorbeelden.
Kiezen hoe u evaluatiegegevens voorbereidt
| Situation | Aanbevolen aanpak |
|---|---|
| U hebt gecureerde evaluatiegegevens | Upload deze als een versie van foundry-gegevensset of geef een kleine gegevensset inline op. Zie Invoergegevens voorbereiden. |
| U wilt gegenereerde testcases controleren en opnieuw gebruiken voordat u een evaluatie uitvoert | Genereer een synthetische evaluatiegegevensset op basis van een agentdefinitie, inlineprompt of referentiebestand. |
| U wilt een herbruikbare gegevensset op basis van productieverkeer | Traces omzetten in een dataset. |
| U wilt gesimuleerde scenario's met meerdere bochten testen | Genereer een seed-gegevensset voor simulatie of schrijf scenario's voor testcases als JSONL en simuleer vervolgens gesprekken. |
| U heeft Foundry-antwoord-id's | Evalueer interacties op antwoord-id zonder een gegevensset te maken. |
| U wilt bestaande Application Insights-traceringen evalueren | Evalueer traceringen zonder een gegevensset te maken. |
| U wilt query's genereren, een doel aanroepen en de antwoorden in één werkstroom evalueren | Genereer synthetische query's tijdens de evaluatieuitvoering. Foundry slaat de gegenereerde query's op als een gegevensset voor hergebruik. |