Evaluaties uitvoeren vanuit de Microsoft Foundry-portal

Belangrijk

Items die in dit artikel zijn gemarkeerd (preview) zijn momenteel beschikbaar als openbare preview. Deze preview wordt aangeboden zonder een service level agreement en we raden deze niet aan voor productieworkloads. Bepaalde functies worden mogelijk niet ondersteund of hebben mogelijk beperkte mogelijkheden. Zie Aanvullende gebruiksvoorwaarden voor Microsoft Azure previews voor meer informatie.

Test uw generatieve AI-modellen en -agents door evaluaties uit te voeren die de prestaties, kwaliteit en veiligheid meten. Gebruik evaluaties vóór de implementatie om gedrag te valideren of na de implementatie om de productiekwaliteit te bewaken. Evaluaties voeren uw model of agent uit op basis van testgegevens en beoordelen de uitvoer met behulp van ingebouwde of aangepaste evaluators.

In dit artikel leest u hoe u evaluaties maakt en uitvoert in de Foundry-portal.

Voorwaarden

  • Een Azure-abonnement. Maak er gratis een.

  • Een Microsoft Foundry-project. Maak een project als u er nog geen hebt.

  • Een van de volgende opties, afhankelijk van uw evaluatiedoel:

    • Agentevaluatie: een agent in uw project.
    • Modelevaluatie: een geïmplementeerd model of een model dat beschikbaar is met directe toegang.
    • Evaluatie van gegevensset: een testgegevensset in CSV- of JSONL-indeling die bestaande model- of agentuitvoer bevat.
  • Een Azure OpenAI-verbinding met een geïmplementeerd GPT-model (bijvoorbeeld gpt-4.1-mini). Vereist voor door AI ondersteunde kwaliteitsevaluaties.

  • Foundry User-rol in het Foundry-project. Zie Toegangsbeheer op basis vanRole voor Microsoft Foundry voor meer informatie.

    Belangrijk

    De rollen Foundry RBAC zijn onlangs hernoemd. Foundry User, Foundry Owner, Foundry Account Owner en Foundry Project Manager zijn eerder benoemd Azure AI-gebruiker, Azure AI-eigenaar Azure AI-accounteigenaar en Azure AI Project Manager. Het kan zijn dat u op sommige plekken nog steeds de vorige namen ziet terwijl de naamswijziging wordt doorgevoerd. De rol-id's en basismachtigingen worden niet gewijzigd door de naamswijziging.

Een evaluatiebenadering kiezen

Selecteer een evaluatiebenadering op basis van wat u wilt testen:

Target Scope Gegevensbron Ideaal voor
Agent Volledige gesprekken Gesimuleerde gegevens Testen van end-to-end agentgedrag met synthetische scenario's vóór de implementatie.
Agent Volledige gesprekken Bestaande gesprekken Echte gebruikersinteracties evalueren om de productiekwaliteit te bewaken.
Agent Afzonderlijke bochten Bestaande gegevensset Foutopsporing van specifieke agentreacties, gebruik van testhulpprogramma's, gedetailleerde analyse.
Agent Afzonderlijke bochten Synthetische gegevens Q&A- of RAG-scenario's met één draai testen met gegenereerde query's.
Agent Afzonderlijke bochten Bestaande traceringen Historische agenttraces van uw project evalueren.
Model Afzonderlijke bochten Synthetische gegevens Het testen van modelvoltooiingen met gegenereerde prompts.
Model Afzonderlijke bochten Bestaande gegevensset Benchmarking van modelprestaties op basis van een gecureerde testset.
Gegevensset Afzonderlijke bochten (Dataset is het doel) Evaluatie van bestaande uitvoer zonder het model of de agent opnieuw uit te voeren.

Tip

Begin met volledige gesprekken > van agent > gesimuleerde gegevens om het gedrag van uw agent in gecontroleerde scenario's te testen. Gebruik bestaande gesprekken zodra uw agent in productie is om de werkelijke prestaties te bewaken.

Een evaluatie maken

U kunt een evaluatie starten vanaf verschillende locaties in de Foundry-portal:

  • Evaluatiepagina: Selecteer evaluatie>maken in het linkerdeelvenster.
  • De pagina Modellen: Ga naar uw model, selecteer het tabblad Evaluatie, en selecteer Maken.
  • Pagina Agents: Ga naar uw agent, selecteer het tabblad Evaluatie en selecteer Maken.
  • Agent playground: Ga naar uw agent, selecteer het tabblad Playground en selecteer vervolgens MetricsVolledige evaluatie uitvoeren.

Stap 1: Evaluatiedoel selecteren

Wanneer u een evaluatie maakt, kiest u eerst het evaluatiedoel. Het doel bepaalt de parameter voor de evaluatie:

Target Description
Agent Evalueert de uitvoer die wordt gegenereerd door de geselecteerde agent en door de gebruiker gedefinieerde invoer. Werkt voor zowel promptagenten als gehoste agenten.
Model Evalueert de uitvoer die wordt gegenereerd door het geselecteerde model en de door de gebruiker gedefinieerde prompt.
Gegevensset Evalueert vooraf bestaande model- of agentuitvoer van een testgegevensset.
Traces Evalueert agentinteracties die al zijn vastgelegd in Application Insights. Selecteer de agent en het tijdsbereik en de portal haalt de overeenkomende traceringen voor evaluatie op. Zie Trace-evaluatie voor het equivalent van de SDK.

Tip

Directe toegang: Directe toegang zijn implementatieloze modellen die u direct kunt gebruiken zonder een implementatie te maken. Wanneer u een evaluatie maakt, kunt u rechtstreeks in de modelkiezer een instantmodel selecteren als evaluatiedoel of als beoordelaarsmodel.

Stap 2: Evaluatiebereik selecteren

Opmerking

Deze stap wordt alleen weergegeven voor agent - en gegevenssetdoelen . Modelevaluaties maken altijd gebruik van afzonderlijke draaiingen.

Kies hoe u de prestaties van uw agent wilt evalueren:

Scope Description Ideaal voor
Volledige gesprekken (preview) Beoordeelt volledige gesprekken met meerdere beurten van begin tot eind. Meet de algehele gesprekskwaliteit, taakvoltooiing en gebruikerstevredenheid. End-to-end agentervaringen, klanttevredenheid en gespreksstroom testen.
Afzonderlijke bochten Evalueert afzonderlijke agentreacties binnen gesprekken. Meet metingen per beurt, zoals de nauwkeurigheid van de selectie van hulpmiddelen en de kwaliteit van antwoorden. Foutopsporing van specifieke agentgedrag, gebruik van testhulpprogramma's en gedetailleerde analyse.

Stap 3: Gegevensbron selecteren

De opties voor gegevensbronnen zijn afhankelijk van uw evaluatiedoel en bereik.

Voor gespreksevaluaties (volledige gesprekken van agent >) (previewversie)

Kies waar uw gespreksgegevens vandaan komen:

Gesimuleerde gegevens

Genereer synthetische gesprekken door uw agent tegen scenariobeschrijvingen uit een dataset te laten draaien. Gebruik deze optie om het gedrag van uw agent te testen in gecontroleerde scenario's vóór de implementatie.

  1. Selecteer Gesimuleerde gegevens.

  2. Selecteer Genereren om het dialoogvenster simulatieconfiguratie te openen.

  3. Selecteer uw bestand: Kies een gegevensset met scenariobeschrijvingen. Elke rij in uw gegevensset beschrijft een scenario dat u gebruikt om een gesimuleerd gesprek te genereren.

    Schermopname van de voorbeeldweergave van de gegevensset in het simulatiedialoogvenster.

  4. Model selecteren: kies het model waarmee de gebruiker in het gesprek wordt gesimuleerd:

    • gpt-4.1 (aanbevolen voor complexe scenario's)
    • gpt-4o
    • gpt-4o-mini
    • gpt-4.1-mini
  5. Simulatie-instellingen configureren:

    • Aantal gesimuleerde gesprekken per scenario: hoeveel gesprekken moeten worden gegenereerd voor elke rij in uw gegevensset (1-5). Meerdere gesprekken per scenario helpen bij het identificeren van afwijkingen in agentgedrag.
    • Aantal beurten per gesprek: Maximum aantal beurten toegestaan per gesprek (1-50). Het gesprek eindigt wanneer de taak is voltooid of deze limiet is bereikt.
  6. Selecteer Bevestigen om de simulatieconfiguratie op te slaan.

Bestaande gesprekken

Evalueer echte gesprekken die uw agent al met gebruikers had.

  1. Selecteer Bestaande gesprekken.
  2. Filteropties configureren:
    • Aantal gesprekken: Maximum aantal gesprekken dat moet worden genomen uit het datumbereik (1-100).
    • Tijdsbereik: Gesprekken filteren op tijdsperiode. Gebruik snelle filters (laatste dag, 7D, 1M, 3M) of selecteer een aangepast datumbereik.
  3. Blader en selecteer specifieke gesprekken die u wilt opnemen in de evaluatie.

Voor evaluaties van afzonderlijke turns

Kies waar uw evaluatiegegevens vandaan komen:

Synthetische gegevens

Testquery's genereren met behulp van AI. Selecteer Synthetisch en configureer het aantal rijen en een prompt waarin de gegevens worden beschreven die moeten worden gegenereerd. U kunt ook bestanden uploaden om de relevantie te verbeteren.

Opmerking

Voor het genereren van synthetische gegevens is een model met de mogelijkheid van de Response-API vereist. Zie beschikbaarheid van de antwoorden-API-regio voor beschikbaarheid.

Bestaande gegevensset

Gebruik een voorbereide gegevensset in CSV- of JSONL-indeling. Selecteer Bestaande gegevensset en kies een bestand uit de gegevensassets van uw project. Alleen CSV- en JSONL-bestandsindelingen worden ondersteund.

Bestaande traces (alleen voor agent)

Evalueer historische agenttraceringen van uw project. Selecteer Bestaande traceringen en filter op datumbereik om traceringen te selecteren.

Multimodale inhoud (preview)

Alle evaluatiedoelen ondersteunen afbeeldings- en audio-inhoud. Elk inhoudstype maakt gebruik van een specifiek JSONL-schema:

Afbeeldingsinhoud:

  • image_url: De afbeelding als gegevens-URI (bijvoorbeeld data:image/png;base64,...) of een openbaar toegankelijke URL.
  • caption: Een tekstbeschrijving van de inhoud van de afbeelding.
{"image_url": "data:image/png;base64,iVBOR...", "caption": "A red to blue color gradient"}

Audio-inhoud:

  • audio_data: De audio als gegevens-URI met met base64 gecodeerde WAV-gegevens (bijvoorbeeld data:audio/wav;base64,...).
  • expected: Een tekstbeschrijving van de verwachte audio-inhoud.

Opmerking

Momenteel wordt alleen de WAV-audio-indeling ondersteund.

{"audio_data": "data:audio/wav;base64,UklGR...", "expected": "A short beep tone at 440 Hz"}

Gegevenssets kunnen ook de gespreksindeling van chatberichten gebruiken, waarbij audio- en afbeeldingsgegevens worden ingesloten in een enkele kolom voor chatberichten als gegevens-URI's of openbaar toegankelijke URL's.

In het volgende voorbeeld ziet u een kolom met een gegevensset voor gesprekken met ingesloten afbeelding en audio-inhoud:

[
  {
    "role": "system",
    "content": "..."
  },
  {
    "role": "user",
    "content": [
      {
        "type": "text",
        "text": "What are in these images?"
      },
      {
        "type": "image_url",
        "image_url": {
          "url": "https://example.com/path/image.png"
        }
      },
      {
        "type": "image_url",
        "image_url": {
          "url": "data:image/png;base64,iVBORw0KGgo..."
        }
      }
    ]
  },
  {
    "role": "assistant",
    "content": "..."
  },
  {
    "role": "user",
    "content": [
      {
        "type": "text",
        "text": "Tell me the tones for the voices?"
      },
      {
        "type": "input_audio",
        "input_audio": {
          "data": "https://example.com/path/voice.wav",
          "format": "wav"
        }
      },
      {
        "type": "input_audio",
        "input_audio": {
          "data": "data:audio/wav;base64,UklGRigAAA...",
          "format": "wav"
        }
      }
    ]
  }
]

U kunt afbeeldingen bekijken en audioclips rechtstreeks afspelen in de stroom voor het maken van de evaluatie en in de weergave met evaluatieresultaten.

Stap 4: Agents configureren

Opmerking

Deze stap wordt alleen weergegeven voor agentevaluaties .

Pas aan hoe uw agent zich gedraagt tijdens de evaluatie:

  1. Bekijk de lijst met agents die betrokken zijn bij uw evaluatie.
  2. Voor elke agent selecteert u Configureren om het gedrag ervan aan te passen:
    • Systeemprompt: Wijzig de instructies van de agent voor de evaluatie.
    • Gebruikersprompt: Geef op hoe elk gegevenssetitem tijdens de evaluatie naar uw agent wordt verzonden.
  3. De evaluatieuitvoering behoudt agentconfiguraties.

Configuratie van gebruikersprompt

De gebruikersprompt definieert hoe testinvoer wordt doorgegeven aan uw agent. De portal gebruikt {{item.query}} standaard om de gegevenssetquery rechtstreeks door te geven aan uw agent.

In de meeste gevallen kunt u de standaardwaarde gebruiken. Wijzig deze waarde alleen als uw agent een andere invoerindeling verwacht. Als uw agent bijvoorbeeld gebruikmaakt van een gehost agentprotocol of gestructureerde invoer met extra velden vereist.

Algemene patronen:

Format Wanneer gebruiken
{{item.query}} Default. Hiermee wordt het queryveld rechtstreeks vanuit uw gegevensset doorgegeven.
{{item.messages}} Voor agents die gespreksgeschiedenis verwachten als invoer.
Aangepaste JSON Voor gehoste agents of API's waarvoor gestructureerde aanvraaginstanties zijn vereist.

Tip

Gebruik aangepaste prompts om edge-aanvragen of specifieke scenario's te testen die mogelijk niet van nature voorkomen in uw gegevensset.

Stap 5: Veldtoewijzing configureren

Opmerking

Deze stap wordt weergegeven wanneer u bestaande gegevens gebruikt (bestaande gesprekken, bestaande gegevensset of bestaande traceringen).

Wijs uw gegevensvelden toe aan de velden die elke evaluator verwacht. De vereiste velden zijn afhankelijk van uw evaluatiebereik.

Voor gespreksevaluaties (met meerdere beurten)

Veld Description Verplicht
messages De gespreksberichten in chatindeling. Ja
tool_definitions Definities van hulpmiddelen of functies die beschikbaar zijn voor de agent. Ja

Voor afzonderlijke evaluaties per beurt (één beurt)

Veld Description Verplicht
query De zoekopdracht of prompt van de gebruiker. Ja
response Het antwoord van het model of de agent. Ja
context Opgehaalde context voor RAG-scenario's. No
ground_truth Verwacht correct antwoord voor vergelijking. No
tool_calls Aanroepen van hulpprogramma's door de agent. No
tool_definitions Definities van beschikbare hulpprogramma's. No

De portal probeert automatisch de velden in uw gegevensset te koppelen. Als een veld wordt weergegeven als Niet-toegewezen, selecteert u de vervolgkeuzelijst om handmatig een kolom uit uw gegevensset toe te wijzen.

Opmerking

Vereiste velden worden aangegeven met een sterretje (*). Evaluators mislukken wanneer vereiste velden niet zijn toegewezen.

Stap 6: Testcriteria selecteren

Selecteer de evaluators die u voor uw evaluatie wilt gebruiken. Microsoft Foundry biedt drie categorieën ingebouwde evaluators. De beschikbare evaluators zijn afhankelijk van uw evaluatiebereik.

Agentevaluatoren

Beoordeel hoe effectief agenten taken, hulpmiddelen en de intentie van de gebruiker afhandelen. Alleen beschikbaar voor afzonderlijke beurtbereiken .

Beoordelaar Description
Intentiebepaling Geeft aan of de agent de bedoeling van de gebruiker correct heeft geïdentificeerd en erop heeft ingespeeld.
Taakgerichtheid Meet hoe goed de agent instructies en beperkingen heeft gevolgd.
Geslaagde aanroep van hulpprogramma Beoordeelt of toolaanroepen succesvol zijn uitgevoerd.
Selectie van hulpmiddel Meet of de agent geschikte hulpprogramma's voor de taak heeft geselecteerd.
Uitvoergebruik van hulpprogramma's Beoordeelt hoe effectief de agent tooluitvoer in reacties heeft gebruikt.
Nauwkeurigheid van toolinvoer Meet of de agent de juiste invoer voor hulpprogramma's heeft ingevoerd.
Nauwkeurigheid van toolaanroepen Algemene nauwkeurigheid van het gebruik van hulpprogramma's.

Kwaliteitscontroleurs

Meet de algehele kwaliteit van gegenereerde antwoorden. De meeste kwaliteitsevaluaties zijn beschikbaar voor alle evaluatiebereiken. Evaluators die met een ★ zijn gemarkeerd, ondersteunen zowel analyse op gespreksniveau als op beurtniveau.

Beoordelaar Description Gespreksondersteuning
Klanttevredenheid Voorspelt de tevredenheid van de gebruiker met de interactie van de agent.
Taakvoltooiing Evalueert of de agent de aangevraagde taak heeft voltooid.
Samenhang Meet de logische stroom en consistentie van reacties.
Groundedness Meet of reacties zijn gebaseerd op de verstrekte context.
Volledigheid van antwoord Evalueert of antwoorden gebruikersquery's volledig aanpakken.
Fluency Evalueert kwaliteit van natuurlijke taal.
Relevance Evalueert hoe relevante antwoorden voor de query zijn.

Veiligheids evaluatoren

Potentiële inhouds- en beveiligingsrisico's identificeren. Alleen beschikbaar voor afzonderlijke beurtbereiken .

Beoordelaar Description
Geweld Detecteert gewelddadige inhoud in reacties.
Seksuele Detecteert seksuele inhoud.
Zelfschade Detecteert zelfbeschadigde gerelateerde inhoud.
Haat/oneerlijkheid Detecteert haatvolle of bevooroordeende inhoud.

De portal selecteert aanbevolen evaluators vooraf op basis van uw evaluatiedoel en bereik:

  • Volledige gesprekken: Klanttevredenheid, Taakvoltooiing, Coherentie, Geaardheid
  • Afzonderlijke beurten (bestaande gegevens): alle Agent-beoordelaars en kwaliteits- en veiligheidsbeoordelaars
  • Individuele beurten (synthetisch/traces): Relevantie, Onderbouwing, Vloeiendheid, Coherentie

Tip

U kunt indien nodig evaluators toevoegen of verwijderen. Selecteer Aangepaste evaluators om evaluators te gebruiken die u in uw project hebt gedefinieerd.

Stap 7: Controleren en verzenden

  1. Voer een naam in voor uw evaluatie.
  2. Controleer uw configuratie:
    • Evaluatiedoel en -bereik
    • Gegevensbron en gegevensset
    • Geselecteerde evaluators
    • Veldtoewijzingen (indien van toepassing)
  3. Selecteer Verzenden om de evaluatie te starten.

Nadat u de evaluatie hebt ingediend, wordt de evaluatieuitvoering gestart. Evaluaties worden doorgaans binnen een paar minuten voltooid, afhankelijk van de grootte van de gegevensset en het aantal gesprekken dat wordt gesimuleerd.

Ga als volgende te werk om te controleren of uw evaluatie is gestart:

  1. Selecteer Evaluatie in het linkerdeelvenster.
  2. Zoek uw evaluatie in de lijst. In de kolom Status wordt de huidige status weergegeven:
    • Wordt uitgevoerd: de evaluatie wordt uitgevoerd.
    • Voltooid: De evaluatie is voltooid.
    • Gedeeltelijk: Sommige evaluaties zijn afgerond, maar andere zijn mislukt.
    • Mislukt: er is een fout opgetreden in de evaluatie.

Als u gedetailleerde resultaten wilt bekijken, selecteert u de naam van de evaluatie of bekijkt u de evaluatieresultaten.

Tip

Gebruik de Azure AI Evaluation SDK voor programmatische evaluatiewerkstromen. Zie Batch-evaluatie uitvoeren met de SDK.

Troubleshooting

Er treedt een time-out op voor de evaluatie of wordt langzaam uitgevoerd

  • Verminder het aantal gesprekken of gegevenssetrijen.
  • Voor simulaties verlaagt u de maximum beurten per gesprek.
  • Controleer of uw rechtermodel voldoende quotum heeft.

Veldtoewijzingsfouten

  • Controleer of uw gegevensset de vereiste kolommen bevat voor uw evaluatiebereik.
  • Voor gespreksevaluaties moet u ervoor zorgen dat de berichtenkolom goed opgemaakte chatberichten bevat.
  • Controleer of kolomnamen in uw gegevensset overeenkomen met de verwachte veldnamen.

Modelquotum overschreden

  • Het rechtermodel dat wordt gebruikt voor ai-ondersteunde evaluaties telt mee voor uw Azure OpenAI-quotum.
  • Gebruik een kleinere gegevensset of wacht tot het quotum is vernieuwd.
  • Overweeg het gebruik gpt-4.1-mini ervan in plaats van gpt-4.1 voor rendabele evaluaties.

Beste praktijken

Voor evaluaties op basis van simulatie

  • Begin klein: Begin met 1 gesprek per scenario en 5-10 keer om uw installatie te valideren voordat u omhoog schaalt.
  • Diverse scenario's: neem verschillende scenariobeschrijvingen op om verschillende agentmogelijkheden te testen.
  • Herhalen bij prompts: als agents onverwacht gedrag vertonen, gebruikt u de stap Agents configureren om de prompts aan te passen.

Voor bestaande gespreksevaluaties

  • Representatief voorbeeld: Selecteer gesprekken die typische gebruikersinteracties vertegenwoordigen.
  • Neem randgevallen op: evalueer niet alleen succesvolle gesprekken, maar neem ook uitdagende scenario's mee.
  • Regelmatige evaluatie: plan terugkerende evaluaties om de prestaties van agents in de loop van de tijd bij te houden.

Voor modelevaluaties

  • Benchmarkdatasets: Gebruik gestandaardiseerde datasets om modelprestaties in verschillende versies te vergelijken.
  • Test zowel geïmplementeerde als directe toegang: vergelijk uw verfijnde implementaties met basismodellen.

Voor evaluaties van gegevenssets

  • Uitvoer vooraf berekenen: uitvoer offline genereren en bulksgewijs evalueren voor kostenefficiëntie.
  • Versie van uw gegevenssets: bijhouden welke gegevenssetversie welke evaluatieresultaten hebben geproduceerd.

Algemene tips

  • Vergelijk evaluators: voer dezelfde gegevens uit via meerdere evaluators om een uitgebreide weergave te krijgen.
  • Trends bijhouden: gebruik evaluatiegeschiedenis om prestatieverbeteringen of regressies te identificeren.
  • Reageren op resultaten: gebruik evaluatie-inzichten om agentprompts, hulpprogrammadefinities en configuraties te verfijnen.

Meer informatie over het evalueren van uw generatieve AI-modellen en -agents: