Aplicar el marco de triaje de evaluación a través de escenarios prácticos

Estos recorridos de un extremo a otro ilustran cómo operan en conjunto las capas del marco de evaluación de triaje en la práctica. Cada recorrido parte de un escenario de evaluación diferente y sigue una trayectoria diagnóstica distinta.

Los recorridos muestran cómo aplicar el marco de triaje de evaluación paso a paso. Utilice estos ejemplos para entender cómo pasar de los resultados de la evaluación a diagnóstico, remediación y verificación en escenarios reales de evaluación de agentes.

Sugerencia

Antes de trabajar en estos ejemplos, revise los objetivos del marco, incluyendo los conceptos y principios fundamentales.

Viaje Situación inicial Lo que demuestra
Recorrido 1 Primera ejecución de evaluación Flujo de extremo a extremo: Interpretar → Priorizar → Triaje → Remediar → Verificar
Recorrido 2 Las puntuaciones se estancan después de múltiples iteraciones Análisis de patrones, reclasificación y soluciones alternativas para limitaciones de la plataforma
Recorrido 3 Las puntuaciones retroceden tras un cambio Detección de regresión, diagnóstico de conflictos de instrucciones y resolución de compensaciones

Nota

Estos ejemplos son ilustrativos y están basados en patrones comunes observados en múltiples ejecuciones de evaluación de clientes. Los casos de prueba, las puntuaciones y los detalles del agente son ejemplos representativos, no registros de una sola intervención. Los enfoques diagnósticos y las estrategias de remediación mostrados reflejan prácticas empleadas en implementaciones reales.

Recorrido 1: Primera ejecución de evaluación

Ejecuta su conjunto de evaluación por primera vez en un agente de soporte al cliente. He aquí los resultados:

Conjunto de evaluaciones Tasa de éxito
Seguridad y datos personales 100 %
Preguntas y respuestas sobre el negocio central 87%
Fundamentación del conocimiento El 71 %
Invocación de herramientas 92 %
Enrutamiento de desencadenadores 88 %
Tono y calidad 83 %
Escalación 90 %
General 85 %

Paso 1: Interpretar las puntuaciones (Capa 1)

Utilice la tabla de interpretación de puntuaciones para calibrar los umbrales e identificar qué conjuntos de evaluación están por debajo de los umbrales de bloqueo.

Conjunto de evaluaciones Puntuación Umbral Estado
Seguridad y datos personales 100 % Bloqueo del 95 % Sin errores
Preguntas y respuestas sobre el negocio central 87% Bloqueo del 80 % Sin errores
Fundamentación del conocimiento El 71 % Bloqueo del 80 % Bloqueo inferior
Invocación de herramientas 92 % Bloqueo del 85 % Sin errores
Enrutamiento de desencadenadores 88 % Bloqueo del 80 % Sin errores
Tono y calidad 83 % Bloqueo del 75 % Sin errores
Escalación 90 % Bloqueo del 85 % Sin errores

Evaluación de preparación: iteración. La base de conocimiento está por debajo de su umbral de bloqueo. Centre la remediación en ese punto.

Paso 2: Priorizar fallos (Capa 2, Paso 0)

Situación: la base del conocimiento tiene siete casos de prueba. Dos casos de prueba fallan: KG-003 y KG-005. Ambos casos de prueba están en un conjunto de evaluación del negocio principal, por lo que son prioridad 2. Puesto que solo hay dos, clasificar ambos.

Referencia: Priorizar fallos (Capa 2, Paso 0)

Paso 3: Triaje KG-003 (capa 2, pasos 1-2)

Caso de prueba KG-003:

  • Ejemplo de entrada: "¿Cuál es su política de devoluciones?"
  • Respuesta esperada: "Ofrecemos un plazo de devolución de 30 días para todas las compras."
  • Respuesta del agente: "Nuestra política de devoluciones permite realizar devoluciones dentro de los 15 días laborables posteriores a la compra."
  • Método de evaluación: Coincidencia de palabras clave
  • Resultado: Fallido (esperado "30 días", el agente dijo "15 días laborables")

Verificar la configuración de la evaluación (paso 1 de la Capa 2):

Question Respuesta Resultado
¿Es aceptable la respuesta del agente? Hay que revisar el documento de la fuente. Revise primero el documento de la fuente.
¿La respuesta esperada sigue siendo actual? El documento de la fuente dice "15 días laborables". La política fue actualizada. No. La respuesta esperada está desactualizada.

Clasificación: Problema de configuración de evaluación. Respuesta esperada desactualizada. El agente es correcto. La evaluación es incorrecta.

Paso 4: Triaje KG-005 (capa 2, pasos 1-2)

Caso de prueba KG-005:

  • Ejemplo de entrada: "¿El plan Premium incluye una garantía extendida?"
  • Respuesta esperada: "El plan Premium incluye una garantía estándar de dos años." Las opciones de garantía extendida están disponibles para su compra por separado."
  • Respuesta del agente: "Sí, el plan Premium incluye una garantía extendida de tres años que cubre todas las piezas y mano de obra."
  • Método de evaluación: Comparación de significado
  • Resultado: Fallo (detalles de garantía fabricados por el agente)

Verificar la configuración de la evaluación (paso 1 de la Capa 2):

Question Respuesta Resultado
¿Es aceptable la respuesta del agente? No. Se fabrica una "garantía extendida de tres años". Continuar
¿Está actualizada la respuesta esperada? Sí. El origen confirma la garantía estándar de dos años. Continuar
¿Es realista el caso de prueba? Sí. Pregunta frecuente de clientes. Continuar
¿Podría ser válida una respuesta alternativa? No. Los detalles de la garantía son exactos. Continuar
¿Es adecuado el método de evaluación? Sí.Comparar significado es correcto para la precisión semántica. La evaluación es válida.

Diagnosticar el agente (paso 2 de la Capa 2):

Question Respuesta
¿El contenido de origen es incorrecto? No. El origen dice "garantía estándar de dos años".
¿El agente contradijo la información del origen? Sí. El origen dice "garantía estándar de dos años", pero el agente dijo "garantía extendida de tres años".
¿El agente respondió sin usar ningún origen? Probablemente sí. El detalle de "garantía extendida de tres años que cubre todas las piezas y mano de obra" no existe en ningún origen.

Clasificación: Problema de configuración del agente. Brecha en la fundamentación del conocimiento. El agente produjo detalles de la garantía que no están presentes en los orígenes de conocimientos configurados.

Paso 5: Remediar (Capa 3)

KG-003 (Remediación de la configuración de evaluación):

  • Cambio: Actualizar el valor esperado de "ventana de devolución de 30 días" a "15 días hábiles"
  • Reejecutar: KG-003 solo
  • Esperado: Aprobado

KG-005 (Corrección de la configuración del agente):

  • Cambio: agregue instrucciones de contextualización a la solicitud del sistema: "Responda solo en función de la información encontrada en sus orígenes de conocimiento. Si la información no está disponible, indíquelo.
  • Vuelve a ejecutar: el conjunto completo de evaluación de fundamentación de conocimiento (el cambio de configuración del agente puede tener efectos más amplios)
  • Se espera: KG-005 aprobados. Los otros casos de prueba no deberían presentar regresiones.

Paso 6: Verificar

Tras ambos cambios, vuelva a ejecutar el conjunto de evaluación de fundamentación de conocimiento:

Antes Después de
71 % (5/7 aprobados) 86 % (6/7 aprobados)

Evaluación: la contextualización de conocimiento está ahora por encima del umbral de bloqueo de 80 %. Hay un fallo (KG-007) que permanece y no bloquea el estado de preparación. Revíselo en la próxima iteración.

Paso 7: Documentar (Capa 4)

Registre en el registro de errores:

Caso de prueba Tipo de causa raíz Problema observado Cambio aplicado Resuelto
KG-003 Configuración de evaluación Respuesta esperada desactualizada (la política cambió de 30 días a 15 días laborables). Valor esperado actualizado
KG-005 Configuración del agente Detalles incorrectos de la garantía que no están en ningún origen. Se agregó la instrucción de fundamentación a la indicación del sistema

Nota del patrón: verifique los valores esperados frente a los documentos de origen antes de cada ejecución de evaluación. Agregue este paso a la lista de verificación previa a la evaluación.

Volver a comprobar la preparación: todos los conjuntos de evaluación ahora están por encima de los umbrales de bloqueo.

Evaluación de la preparación: implemente el agente con brechas conocidas (documentado KG-007, plan de supervisión implementado).

Referencia: Capa 4: Analizar patrones y mejorar continuamente el agente

Recorrido 2: Meseta de puntuación

Situación: Se ejecutan cuatro iteraciones en un agente de soporte de producto. La precisión factual permanece en el 78 % durante las cuatro ejecuciones. Realiza cambios rápidos después de cada ejecución, pero no ve ninguna mejora.

Paso 1: Comprobar patrones (Capa 4)

Revise el registro de errores de las cuatro iteraciones:

Iteración Puntuación Cambio aplicado Resultado
1 78 % (línea base)
2 79 % Se agregó "Sea preciso con las especificaciones del producto" Ningún cambio significativo
3 El 77 % Se reorganizó la indicación para poner las instrucciones sobre precisión primero Ningún cambio significativo
4 78 % Se agregaron ejemplos de respuestas correctas sobre productos Ningún cambio significativo

Tendencia: Estable. La remediación no está abordando la verdadera causa raíz.

Referencia: Capa 4: Analizar patrones y mejorar continuamente el agente

Paso 2: Analizar casos de prueba fallidos

Examine los seis errores persistentes en todas las iteraciones.

Caso de prueba Error desde Problema observado
FA-002 Iteración 1 El agente cita la página de preguntas frecuentes en lugar del manual del producto
FA-005 Iteración 1 El agente cita la página de preguntas frecuentes en lugar del manual del producto
FA-008 Iteración 1 El agente cita la página de preguntas frecuentes en lugar del manual del producto
FA-011 Iteración 1 El agente cita la página de preguntas frecuentes en lugar del manual del producto
FA-014 Iteración 1 El agente cita la página de preguntas frecuentes en lugar del manual del producto
FA-019 Iteración 2 El agente da una respuesta parcial basada en las preguntas frecuentes y omite detalles del manual

Análisis de concentración: en cinco de seis errores (83 %) interviene la misma causa raíz: el agente obtiene información de la página de preguntas frecuentes en lugar del manual del producto.

Paso 3: Nuevo triaje (Capa 2)

Inicialmente, clasifique los errores como Problema de configuración del agente: se recuperó el origen incorrecto.

Aplique varios cambios de configuración del agente, incluyendo la reformulación de indicaciones, el reordenamiento y la adición de ejemplos. Estos cambios no suponen una mejora medible. En este punto, verifique el errores con los indicadores de limitación de plataforma.

Indicador Comprobación
El error persiste en múltiples variaciones de indicación o configuración Sí. Cuatro iteraciones sin cambios.
La recuperación devuelve de manera constante documentos incorrectos a pesar de la configuración correcta del origen Sí. Las preguntas frecuentes se recuperan de forma constante en lugar del manual del producto.

Reclasificación: este problema es una limitación de la plataforma relacionada con la clasificación de recuperación. La plataforma prioriza sistemáticamente las preguntas frecuentes en lugar del manual del producto para estas consultas, y los cambios adicionales en indicaciones o instrucciones no afectan al comportamiento de recuperación.

Referencia: Capa 2: errores del agente de evaluación de prioridades

Paso 4: Remediar (Capa 3—Limitación de plataforma)

Cuando clasifique un error como limitación de la plataforma, centre la remediación en soluciones alternativas y documentación en lugar de realizar cambios en la configuración del agente.

Referencia: Respuesta a limitaciones de la plataforma

Estrategia alternativa: aplique uno o varios de los siguientes enfoques de mitigación para reducir el impacto:

  • Reestructure el manual del producto con encabezados de sección más claros que se alineen con el vocabulario utilizado en las consultas de los usuarios.
  • Duplique las especificaciones críticas del producto del manual en la sección de preguntas frecuentes para crear rutas de recuperación redundantes.
  • Refactorice el contenido del manual para que cada sección aborde una única pregunta bien definida y así mejorar la coincidencia de fragmentos de recuperación.

Estos enfoques buscan influir en el comportamiento de recuperación sin depender de cambios en indicaciones o instrucciones.

Escalada y seguimiento: si la limitación persiste, documente y escale el asunto al equipo de la plataforma.

  • Documente la limitación de la siguiente manera: "Las consultas sobre <especificaciones del producto> recuperan constantemente la página de preguntas frecuentes (última actualización: <fecha>, <n> páginas) en lugar del manual del producto (última actualización: <fecha>, <N> páginas), a pesar de que el manual contiene la información de referencia."
  • Proporcione pruebas de apoyo: incluya múltiples casos de prueba que muestren la consulta, el origen esperado y el origen real recuperado.
  • Enviar para investigación.
  • Comparta la limitación documentada y la evidencia con el equipo de la plataforma para seguimiento y control.

Paso 5: Verificar

Tras reestructurar el manual del producto y agregar entradas redundantes de preguntas frecuentes, vuelva a ejecutar el conjunto de evaluación correspondiente para verificar el impacto.

Antes Después de
78 % (sin cambios en cuatro iteraciones) 89 %

Evaluación: la solución alternativa mejora el rendimiento global. Queda un error (FA-019). La consulta es demasiado ambigua para recuperar de forma fiable el origen correcto, incluso con contenido reestructurado. Este error se registra como una limitación conocida.

Paso 6: Documentar

Actualice el registro de errores para reflejar la clasificación final y los resultados.

Caso de prueba Tipo de causa raíz Problema observado Cambio aplicado Resuelto
FA-002, 005, 008, 011, 014 Limitación de la plataforma La clasificación de recuperación prioriza las preguntas frecuentes sobre el manual del producto Encabezados del manual reestructurados; especificaciones críticas duplicadas en las preguntas frecuentes
FA-019 Limitación de la plataforma La consulta ambigua no puede recuperar de forma fiable el origen correcto Documentado como limitación conocida No

Conclusiones clave: si las puntuaciones de evaluación se mantienen constantes entre varios cambios de mensajes o instrucciones, es poco probable que la causa principal sea el mensaje. Valide el comportamiento de la infraestructura y la plataforma antes de invertir más en diseño de indicaciones.

Recorrido 3: Regresión tras la actualización

Situación: ha actualizado la indicación del sistema para mejorar el tono y la empatía. Las puntuaciones de tono han aumentado, pero la precisión fáctica cayó por debajo de su umbral de bloqueo, introduciendo una regresión.

Antes del cambio:

Conjunto de evaluaciones Puntuación
Precisión factual El 91 %
Tono y calidad 83 %
Todos los demás Por encima del umbral

Ha agregado la siguiente instrucción a la indicación del sistema: "Reconozca siempre la preocupación del cliente y muestre empatía antes de dar una respuesta." Comience cada respuesta validando la experiencia del cliente."

Después del cambio:

Conjunto de evaluaciones Antes Después de Delta
Precisión factual El 91 % 76% -15 %
Tono y calidad 83 % El 91 % +8 %

Paso 1: Interpretar (Capa 1)

La precisión factual está ahora por debajo del umbral de bloqueo del 80 %. Este cambio introduce una regresión y bloquea la preparación.

Referencia: Capa 1: Interpretar las puntuaciones e identificar los errores

Paso 2: Comprobar patrones (Capa 4)

Coincidencia de patrones entre señales: el tono mejora mientras la exactitud se degrada.

Causa raíz indicada: conflicto de instrucciones.

La orientación de tono recién agregada compite con instrucciones de precisión para la atención del modelo.

Referencia: Capa 4: Analizar patrones y mejorar continuamente el agente

Paso 3: Clasificar los nuevos fallos (Capa 2)

Revise los casos de prueba de precisión fáctica que se aprobaron antes del cambio y ahora fallan.

Caso de prueba FA-007:

  • Entrada: "¿Cuál es el tamaño máximo de carga de archivo?"
  • Esperado: "El tamaño máximo de subida de archivo es de 25 MB para cuentas estándar y 100 MB para cuentas empresariales."
  • Agente antes: "El tamaño máximo de carga de archivo es de 25 MB para cuentas estándar y 100 MB para cuentas empresariales."
  • Agente después: "Entiendo perfectamente su preocupación por el tamaño de carga de archivos; puede resultar frustrante al intentar cargar documentos importantes. Quiero asegurarme de que tiene toda la información que necesita. El tamaño máximo de carga es de 25 MB para los planes estándar."

Paso 1. Verifique la evaluación: La respuesta esperada es correcta y la evaluación es válida. La respuesta posterior a la actualización omite el detalle de la cuenta empresarial.

Paso 2. Diagnosticar: La nueva instrucción sobre el tono requiere un preámbulo de empatía en cada respuesta. Este requisito consume el presupuesto de respuesta y la atención del modelo, y genera respuestas fácticas incompletas.

Clasificación: Problema de configuración del agente. Conflicto de instrucciones entre tono y orientación sobre exactitud.

Referencia: Capa 2: errores del agente de evaluación de prioridades

Paso 4: Remediar (Capa 3)

El problema no es la orientación de tono en sí, sino las prioridades que compiten entre sí en la indicación del sistema. La remediación se centra en separar y priorizar las instrucciones.

Instrucción antigua (única, compitiendo): "Reconozca siempre la preocupación del cliente y muestre empatía antes de proporcionar su respuesta. Comience cada respuesta validando la experiencia del cliente."

Nueva instrucción (separada, priorizada): "Incluya siempre la respuesta completa y fáctica a la pregunta del cliente." No omita detalles por brevedad. Además, cuando el cliente exprese frustración o preocupación, reconózcalo brevemente."

Cambios principales:

  • Se prioriza explícitamente la precisión.
  • La integridad de las respuestas fácticas se indica directamente.
  • La empatía es condicional, no universal.
  • "Brevemente" restringe la empatía para evitar el truncamiento de contenido.

Referencia: Capa 3: Asignar patrones de error a estrategias de corrección

Paso 5: Verificar

Vuelva a ejecutar el conjunto de evaluación completo, ya que los cambios en los mensajes del sistema pueden tener un gran impacto.

Conjunto de evaluaciones Antes del cambio Después de la regresión Después del cambio
Precisión factual El 91 % 76% 90 %
Tono y calidad 83 % El 91 % 89 %
Todos los demás Por encima del umbral Por encima del umbral Por encima del umbral

Evaluación: Ambas señales ahora superan sus umbrales de bloqueo. El tono no vuelve completamente a su punto máximo, pero se mantiene por encima del umbral de bloqueo del 75 % y mejora respecto a la línea base original.

Paso 6: Documentar

Caso de prueba Tipo de causa raíz Problema observado Cambio aplicado Resuelto
FA-007, FA-012, FA-018 (y otros) Configuración del agente La orientación del tono sustituyó la integridad fáctica Indicación reestructurada para priorizar la exactitud y aplicar empatía condicional

Conclusiones clave: valide siempre los cambios en los mensajes del sistema en el conjunto de evaluación completo, no solo la señal de destino. Las instrucciones compiten por la atención del modelo, y las mejoras en un área pueden introducir regresiones en otras.

Patrón a observar: Este escenario es una instancia del problema del presupuesto de instrucciones. A medida que crecen las indicaciones, los conflictos entre instrucciones son más probables. La consolidación periódica y la simplificación ayudan a mantener la estabilidad.

Patrones comunes a lo largo de los recorridos

Cada recorrido comienza desde un escenario diferente para ilustrar un camino de diagnóstico distinto. Para ver cómo un solo agente progresa a lo largo de todo el ciclo de evaluación—interpretación de puntuaciones, triaje de errores, remediación y verificación—consulte el Recorrido 1, que proporciona la explicación más completa de extremo a extremo.

Esta tabla destaca patrones recurrentes observados a lo largo de los recorridos y las lecciones prácticas que refuerzan.

Patrón Dónde aparece Conclusión principal
Validar la evaluación antes del agente Recorrido 1 Un origen común de esfuerzo inútil es resolver problemas en el comportamiento del agente cuando la evaluación en sí es incorrecta.
Las puntuaciones planas indican una causa raíz mal clasificada Recorrido 2 Si la remediación repetida no mejora los resultados, reclasifique el problema. Puede que esté abordando la causa raíz equivocada.
Vuelva a ejecutar el conjunto de evaluación completo después de los cambios en los mensajes Recorrido 3 Los cambios en la indicación pueden afectar a múltiples señales de calidad. Revise siempre si hay regresiones fuera del área objetivo.
Documentar resultados y decisiones Todos los recorridos Mantener un registro de errores impide redescubrir las mismas causas raíz en iteraciones posteriores.
Las lagunas conocidas pueden ser aceptables Recorrido 1 (KG-007), Recorrido 2 (FA-019) No todos los errores deben resolverse antes del envío. Documente las lagunas conocidas y vigílelas a lo largo del tiempo.

Pasos siguientes

Después de revisar estos ejemplos, elija la siguiente acción que más se ajuste a su situación actual: