Conjuntos de datos de evaluación en Microsoft Foundry

Un conjunto de datos de evaluación es una colección reutilizable de casos de prueba para medir la calidad del modelo o agente. Los conjuntos de datos de evaluación suelen usar JSONL, con un objeto JSON por línea. En este artículo se explica cuándo usar un conjunto de datos reutilizable, cómo se organizan los datos de evaluación y las formas disponibles de prepararlos.

¿Necesita un conjunto de datos de evaluación?

Cree un conjunto de datos cuando desee un conjunto de pruebas estable que pueda volver a ejecutar en diferentes versiones de modelo, solicitud o agente. Los conjuntos de datos reutilizables son útiles para las pruebas de regresión, los controles de calidad de CI/CD y las comparaciones entre distintas ejecuciones de evaluación.

No siempre necesita un conjunto de datos. Si tu agente de Foundry ya dispone de respuestas o tu aplicación envía trazas a Application Insights, puedes evaluar esos datos allí donde se encuentren. Consulte Evaluate interactions by response ID (Evaluar interacciones por identificador de respuesta ) y Evaluate traces (Evaluar seguimientos).

Cómo utiliza Foundry los datos de evaluación

En un conjunto de datos JSONL, el messages campo representa interacciones de modelo o agente. Cada mensaje identifica un rol y su contenido.

Si el conjunto de datos contiene respuestas completadas, Foundry evalúa esas respuestas directamente. Si ejecuta la evaluación en un modelo o agente, Foundry genera una nueva respuesta para cada entrada y evalúa esa respuesta. Cualquier respuesta ya almacenada en el conjunto de datos se omite.

Por ejemplo, considere un usuario que no puede iniciar sesión. El agente pregunta qué error aparece, el usuario dice que se rechaza su contraseña y el agente recomienda un restablecimiento de contraseña. La evaluación por turno evalúa una respuesta individual de un agente, como la guía para restablecer la contraseña, utilizando los mensajes anteriores como contexto. La evaluación a nivel de conversación puntúa la interacción completa.

La configuración evaluation_level de la ejecución controla la granularidad de la puntuación. El conjunto de datos y los evaluadores seleccionados deben ser compatibles con ese nivel. Para obtener más información, consulte Elegir un nivel de evaluación. Para ver columnas y ejemplos estándar, consulte Esquema del conjunto de datos de evaluación.

Elección de cómo preparar los datos de evaluación

Situación Enfoque recomendado
Ha seleccionado los datos de evaluación Súbelo como un conjunto de datos de Foundry con versiones o proporciona un pequeño conjunto de datos en línea. Consulte Preparación de los datos de entrada.
Quiere revisar y reutilizar los casos de prueba generados antes de ejecutar una evaluación. Generar un conjunto de datos sintético de evaluación a partir de una definición de agente, un prompt integrado o un archivo de referencia.
Quiere un conjunto de datos reutilizable basado en el tráfico de producción. Convertir trazas en un conjunto de datos.
Quiere probar escenarios de varios turnos simulados. Genere un conjunto de datos de inicialización de simulación o cree escenarios de casos de prueba como JSONL y, a continuación, simule conversaciones.
Tienes ID de respuesta de Foundry Evalúe las interacciones por identificador de respuesta sin crear un conjunto de datos.
Quiere evaluar los seguimientos existentes de Application Insights. Evalúe los seguimientos sin crear un conjunto de datos.
Quiere generar consultas, invocar un destino y evaluar sus respuestas en un flujo de trabajo. Generar consultas sintéticas durante el proceso de evaluación. Foundry guarda las consultas generadas como un conjunto de datos para su reutilización.

Paso siguiente