Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
Cuando los resultados de la evaluación revelan fallos, el siguiente desafío es saber qué hacer con ellos. El marco de clasificación y corrección le ofrece una forma estructurada de interpretar las puntuaciones, diagnosticar fallos, determinar la responsabilidad e identificar soluciones concretas para cada problema, sin tener que buscar la causa raíz errónea ni optimizar las puntuaciones de forma aislada. En este artículo se presentan los objetivos, la estructura y los requisitos previos del marco para que pueda trabajar sistemáticamente con los resultados de evaluación y mover el agente hacia la preparación de producción.
En qué le ayuda este marco de trabajo
El marco de trabajo proporciona una forma estructurada de pasar de los resultados a la acción al ayudarle a:
- Interpretar las puntuaciones de la evaluación en contexto
- Priorizar los fallos según el riesgo y el impacto
- Diagnosticar por qué un caso de prueba falló
- Distinguir entre:
- Problemas en la configuración de la evaluación
- Problemas de configuración del agente
- Limitaciones de la plataforma o de las capacidades
Cada problema diagnosticado corresponde a una acción de remediación específica y verificable.
El objetivo no es optimizar las puntuaciones de forma aislada, sino enfocar los esfuerzos donde realmente mejoren el comportamiento del agente en el mundo real.
En el ciclo de vida más amplio, este marco apoya la mejora continua:
- Diseñe y construya el agente.
- Evalúe el comportamiento con pruebas estructuradas.
- Priorice y remedie problemas utilizando este conjunto de artículos.
- Reevalúe e itere a medida que el agente evoluciona.
Al tratar los resultados de la evaluación como señales accionables, avanza eficientemente de la experimentación a agentes repetibles y listos para producción.
Estructura del marco de trabajo
El marco de trabajo está organizado en cuatro capas de triaje. Cada capa corresponde a un nivel de análisis más profundo, desde la interpretación de las puntuaciones hasta el diagnóstico de causas raíz y la identificación de patrones sistémicos.
- Capa 1: Interpretar las puntuaciones de evaluación y evaluar la preparación: ¿Qué significan los resultados y está el agente listo para desplegarse?
- Capa 2: Clasificación de errores: ¿Por qué se ha producido este error y quién tiene que actuar?
- Capa 3: Relacionar los patrones de fallo con las estrategias de remediación: ¿Qué debería cambiarse específicamente?
- Capa 4: Analizar patrones y mejorar: ¿Qué cuestiones sistémicas revelan los fallos?
El marco también incluye ejemplos prácticos que ilustran el uso del marco de principio a fin, y una plantilla de registro de fallos para ayudarle a dar seguimiento a hallazgos y decisiones.
La referencia rápida proporciona una versión condensada del proceso de triaje y corrección para su uso durante las sesiones activas.
Tipos de causas raíz
Los fallos de evaluación se asignan a uno de tres tipos de causas raíz según el responsable o quién deba actuar.
| Tipo de causa raíz | Propietario | Description |
|---|---|---|
| Problema de configuración de la evaluación | Autor de la evaluación | El caso de prueba, la respuesta esperada o el evaluador automático es incorrecto. Es posible que el agente esté funcionando correctamente. |
| Problema de configuración del agente | Generador de agente | El agente produce una respuesta incorrecta que puede corregirse mediante cambios de configuración. |
| Problema de limitación de plataforma | Equipo de plataforma | El comportamiento de la plataforma está causando el problema y no se puede resolver mediante la configuración. |
Principios de diseño
Los principios de diseño guían cómo aplicar el marco en la práctica para garantizar una clasificación y remediación efectivas.
| Principio | Qué significa en la práctica |
|---|---|
| Empiece por los resultados de la evaluación | Comience con las tasas reales de aprobados y los casos de prueba fallidos, no con suposiciones abstractas. |
| Eliminar el trabajo incorrecto primero | Verifique la configuración de la evaluación antes de investigar al agente para evitar esfuerzo innecesario. |
| Causa raíz → propietario → acción | Asegúrese de que cada camino diagnóstico identifique un propietario claro y una acción concreta. |
| Verificar clasificación | Vuelva a ejecutar las evaluaciones después de la remediación. Si los fallos persisten, vuelva a hacer el triaje. |
| Esperar causas compuestas | Reconozca que un solo fallo puede tener múltiples causas que contribuyen. |
| Tener en cuenta la variabilidad | Tenga en cuenta la variabilidad del modelo y del evaluador. Vuelva a ejecutar las evaluaciones para confirmar los resultados. |
Arquitectura de conjuntos de evaluación
La efectividad del triaje depende de cómo se estructuran los conjuntos de evaluación.
- Conjuntos bien estructurados (organizados por señal de calidad o escenario) producen puntuaciones interpretables y un triaje efectivo.
- Conjuntos mal estructurados (señales confusas, límites poco claros) producen resultados ruidosos y diagnósticos ambiguos.
Si resulta difícil interpretar las puntuaciones, considere la posibilidad de reestructurar los conjuntos de evaluación antes de clasificar los fallos individuales.
Antes de comenzar
Debe disponer de los resultados de la evaluación, incluyendo si cada caso de prueba se ha superado o no. Si aún no ha ejecutado evaluaciones, siga los pasos en Automatizar pruebas con evaluación de agentes y consulte Diseño y puesta en operación de la evaluación de agentes para obtener más orientación.
Paso siguiente
Comience por interpretar los resultados de su evaluación para determinar su grado de preparación.