Capa 1: Interpretar las puntuaciones de las evaluaciones y evaluar la preparación del agente

Tras evaluar a un agente, normalmente tienes puntuaciones pero no una respuesta inmediata a la pregunta más importante: ¿Está el agente listo para desplegar?

Esta capa se centra en interpretar las puntuaciones de evaluación y evaluar la preparación antes de investigar los fallos individuales de los casos de prueba. Utiliza puntuaciones como señales de decisión para determinar si puedes implementar el agente, si debes seguir iterando o si debes bloquear la implementación. Este paso también te ayuda a identificar dónde se requiere un análisis más profundo.

Finalidad de la interpretación de las puntuaciones

Esta capa te ayuda a responder preguntas clave sobre el estado de preparación, incluyendo:

  • ¿Está el agente listo para desplegar?
  • Si no, ¿qué áreas requieren atención prioritaria?
  • ¿Hay algún problema bloqueante que deba abordarse antes de continuar con la iteración?

Este paso es intencionalmente ligero. En la mayoría de los casos, se puede completar en 10–15 minutos usando los resultados de evaluación que ya tienes.

Antes de comenzar

Antes de comenzar esta capa, asegúrese de tener:

  • Resultados de aprobado o rechazo para casos de prueba individuales.
  • Puntuaciones agregadas para uno o varios conjuntos de evaluación (por ejemplo, seguridad, anclaje, exactitud empresarial o uso de herramientas).

Si los resultados de la evaluación aún no están disponibles, ejecuta primero tus conjuntos de evaluación y vuelve a este paso una vez que las puntuaciones estén disponibles.

Interpretar puntuaciones en el nivel de conjunto de evaluación

Comienza revisando las puntuaciones de los conjuntos de evaluación en lugar de los casos de prueba individuales.

Los conjuntos de evaluación representan diferentes áreas de riesgo y capacidad, como la seguridad, el comportamiento empresarial central, la fundamentación del conocimiento o la invocación de herramientas. Interpretar las puntuaciones a este nivel ayuda a determinar si las fallas son aisladas o sistémicas.

Considere las preguntas siguientes:

  • ¿Hay puntuaciones de seguridad o cumplimiento por debajo de los umbrales aceptables?
  • ¿Los principales conjuntos de evaluación empresarial cumplen las expectativas mínimas?
  • ¿Qué conjunto de evaluación tiene el desempeño más bajo respecto a su importancia?

En esta etapa, céntrate en la señal, no en la causa raíz.

Interpreta las tasas de aprobado en dos niveles:

  • Por conjunto de evaluación: ¿Qué significa este porcentaje para la capacidad específica que se está probando?
  • Por señal de calidad: ¿Qué indica este porcentaje a través de todos los conjuntos de evaluación que evalúan la misma señal?

Una tasa baja de aprobados no significa automáticamente que el agente sea incorrecto. Indica que es necesaria una investigación. El problema puede estar en el agente, en la configuración de evaluación o en la plataforma.

Establecer umbrales basados en riesgo

No se deben aplicar los mismos umbrales a todos los agentes. Establece umbrales basados en el perfil de riesgo del agente. Tenga en cuenta los siguientes factores.

Factor Preguntas que debe formularse Impacto en el umbral
Consecuencia del fallo ¿Qué pasa si el agente se equivoca en esto? ¿Inconveniente? ¿Pérdida financiera? ¿Riesgo para la seguridad? Mayor consecuencia → umbral más alto
Frecuencia de uso ¿Con qué frecuencia generan los usuarios esta señal de calidad? Frecuencia más alta → umbral más alto (más exposición)
Disponibilidad de respaldo Si el agente falla, ¿hay un respaldo humano? ¿Con qué rapidez? Sin respaldo → umbral más alto
Público ¿Empleados internos? ¿Clientes externos? ¿Industria regulada? Externo o regulado → umbral más alto

Umbrales basados en riesgos de ejemplo

Esta tabla muestra ejemplos de puntos de partida, no estándares universales.

Perfil de riesgo Description Seguridad y cumplimiento Negocio principal Capacidades
Herramienta interna de bajo riesgo Solo para uso interno, revisión humana de todos los resultados, dominio de bajo impacto 90 %+ 75 %+ 65 %+
Agente de atención al cliente de riesgo medio Usuarios externos, algo de automatización, errores recuperables 95 %+ 85 %+ 75 %+
Agente regulado/financiero de alto riesgo Usuarios externos, decisiones consecuentes, exposición regulatoria 98 %+ 92 %+ 85 %+
Agente crítico para la seguridad Asesoramiento en salud, legal o financiero con supervisión humana limitada 99 %+ 95 %+ 90 %+

Utilice estos ejemplos como referencia y luego ajuste según sus consideraciones específicas de riesgo.

Ejemplo de calibración de umbral

El siguiente ejemplo muestra una posible calibración para un agente de atención al cliente de riesgo medio.

Señal de calidad Umbral inicial Umbral de bloqueo Justificación
Seguridad y datos personales 95-100 % < 95 %, se bloquea el envío Cualquier fallo de seguridad es de alto riesgo
Cumplimiento y contenido literal 95-100 % < 95 %, se bloquea el envío Exposición regulatoria o legal
Exactitud de los hechos (negocio principal) 85-95 % < 80 %, se bloquea el envío Propuesta de valor principal
Fundamentación del conocimiento 85-95 % < 80 %, se bloquea el envío Base de precisión
Invocación de herramientas 90-95 % < 85 %, se bloquea el envío Fiabilidad en la ejecución de tareas
Enrutamiento de desencadenadores 85-95 % < 80 %, se bloquea el envío Corrección del flujo de conversación
Escalación y elegancia 90-95 % < 85 %, se bloquea el envío Red de seguridad de la experiencia del usuario
Tono y calidad de respuesta 80-90 % < 75 %, se bloquea el envío Señal subjetiva

Sugerencia

Calibre, no copie. Los umbrales deben reflejar un riesgo aceptable para el caso de uso específico.

Determinar el estado de preparación

Utiliza las puntuaciones del conjunto de evaluación para determinar el estado general de preparación. Los estados de preparación comunes incluyen:

  • Bloqueo: Fallos de seguridad, cumplimiento o críticos de negocio impiden el despliegue.
  • Iterar: el agente muestra la promesa, pero requiere mejoras dirigidas.
  • Despliegue condicional: El agente puede desplegarse con limitaciones documentadas y monitorizadas.
  • Implementar: el agente cumple los umbrales en todos los conjuntos de evaluación necesarios.

Base las decisiones de preparación en la tolerancia al riesgo y el contexto de uso, no en una única puntuación universal.

Sugerencia

El despliegue condicional con limitaciones conocidas es un resultado legítimo. Documenta las limitaciones aceptadas y haz un seguimiento de ellas a lo largo del tiempo utilizando la plantilla del registro de fallos.

Determina cuándo se completa la iteración

Utiliza los siguientes criterios para determinar cuándo puedes pasar del triaje al despliegue o monitorización.

La iteración se completa cuando:

  • Todos los conjuntos de evaluación están por encima de sus umbrales, incluidos los umbrales ajustados.
  • Las brechas conocidas se documentan con propietarios y plazos.
  • Las nuevas ejecuciones producen puntuaciones coherentes con menos del 5 % de varianza entre ejecuciones.
  • No quedan problemas bloqueantes clasificados como problemas de configuración del agente.

La iteración no está completa cuando:

  • Los umbrales se alcanzan sin comprender los fallos restantes.
  • Las puntuaciones mejoran solo porque se eliminaron los casos de prueba difíciles.
  • Las limitaciones de la plataforma se aceptan implícitamente sin documentación.

Manejo del indeterminismo en las puntuaciones

Los agentes y evaluadores basados en modelos de lenguaje producen resultados variables. Aplique las siguientes prácticas:

  • Establezca líneas base: Ejecute el conjunto completo de evaluación al menos tres veces antes de considerar cualquier puntuación como línea base. Usa la media como puntuación de trabajo. Con menos de tres ejecuciones, no puede distinguir la señal real del ruido.
  • Variación de puntuación entre ejecuciones: Hasta un 5% de variación entre ejecuciones es normal para los evaluadores de modelos de lenguaje. Si los resultados varían en un 10 % o más, investigue la confiabilidad del calificador antes de diagnosticar problemas del agente. Obtenga más información en Validación de calificador.
  • Interpretar los cambios en la puntuación después de la remediación: Para conjuntos de evaluación con menos de 30 casos de prueba, un solo caso de prueba que cambie de fallido a aprobado modifica la puntuación en un 3% o más. No sobreinterpretes los cambios pequeños. Para conjuntos de evaluación con 50 o más casos de prueba, considera significativo un cambio del 5% o más. En caso de duda, repite la evaluación tres veces y compara el promedio con tu promedio de referencia.
  • Identificar casos de prueba inestables (a veces pasan, a veces fallan): un caso de prueba que supera dos de tres ejecuciones es casi aceptable. Siga investigando. ¿El valor esperado es demasiado rígido (la configuración de evaluación), o el agente es realmente inconsistente (la configuración del agente)? Si el agente produce dos respuestas diferentes pero ambas aceptables, la evaluación es demasiado rígida.

Pasos siguientes

Una vez que interpretes tus puntuaciones e identifiques dónde centrarte:

Si más de 10 casos de prueba están fallando, analiza los patrones antes de clasificar fallos individuales.