Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
Estos recorridos de un extremo a otro ilustran cómo operan en conjunto las capas del marco de evaluación de triaje en la práctica. Cada recorrido parte de un escenario de evaluación diferente y sigue una trayectoria diagnóstica distinta.
Los recorridos muestran cómo aplicar el marco de triaje de evaluación paso a paso. Utilice estos ejemplos para entender cómo pasar de los resultados de la evaluación a diagnóstico, remediación y verificación en escenarios reales de evaluación de agentes.
Sugerencia
Antes de trabajar en estos ejemplos, revise los objetivos del marco, incluyendo los conceptos y principios fundamentales.
| Viaje | Situación inicial | Lo que demuestra |
|---|---|---|
| Recorrido 1 | Primera ejecución de evaluación | Flujo de extremo a extremo: Interpretar → Priorizar → Triaje → Remediar → Verificar |
| Recorrido 2 | Las puntuaciones se estancan después de múltiples iteraciones | Análisis de patrones, reclasificación y soluciones alternativas para limitaciones de la plataforma |
| Recorrido 3 | Las puntuaciones retroceden tras un cambio | Detección de regresión, diagnóstico de conflictos de instrucciones y resolución de compensaciones |
Nota
Estos ejemplos son ilustrativos y están basados en patrones comunes observados en múltiples ejecuciones de evaluación de clientes. Los casos de prueba, las puntuaciones y los detalles del agente son ejemplos representativos, no registros de una sola intervención. Los enfoques diagnósticos y las estrategias de remediación mostrados reflejan prácticas empleadas en implementaciones reales.
Recorrido 1: Primera ejecución de evaluación
Ejecuta su conjunto de evaluación por primera vez en un agente de soporte al cliente. He aquí los resultados:
| Conjunto de evaluaciones | Tasa de éxito |
|---|---|
| Seguridad y datos personales | 100 % |
| Preguntas y respuestas sobre el negocio central | 87% |
| Fundamentación del conocimiento | El 71 % |
| Invocación de herramientas | 92 % |
| Enrutamiento de desencadenadores | 88 % |
| Tono y calidad | 83 % |
| Escalación | 90 % |
| General | 85 % |
Paso 1: Interpretar las puntuaciones (Capa 1)
Utilice la tabla de interpretación de puntuaciones para calibrar los umbrales e identificar qué conjuntos de evaluación están por debajo de los umbrales de bloqueo.
| Conjunto de evaluaciones | Puntuación | Umbral | Estado |
|---|---|---|---|
| Seguridad y datos personales | 100 % | Bloqueo del 95 % | Sin errores |
| Preguntas y respuestas sobre el negocio central | 87% | Bloqueo del 80 % | Sin errores |
| Fundamentación del conocimiento | El 71 % | Bloqueo del 80 % | Bloqueo inferior |
| Invocación de herramientas | 92 % | Bloqueo del 85 % | Sin errores |
| Enrutamiento de desencadenadores | 88 % | Bloqueo del 80 % | Sin errores |
| Tono y calidad | 83 % | Bloqueo del 75 % | Sin errores |
| Escalación | 90 % | Bloqueo del 85 % | Sin errores |
Evaluación de preparación: iteración. La base de conocimiento está por debajo de su umbral de bloqueo. Centre la remediación en ese punto.
Paso 2: Priorizar fallos (Capa 2, Paso 0)
Situación: la base del conocimiento tiene siete casos de prueba. Dos casos de prueba fallan: KG-003 y KG-005. Ambos casos de prueba están en un conjunto de evaluación del negocio principal, por lo que son prioridad 2. Puesto que solo hay dos, clasificar ambos.
Referencia: Priorizar fallos (Capa 2, Paso 0)
Paso 3: Triaje KG-003 (capa 2, pasos 1-2)
Caso de prueba KG-003:
- Ejemplo de entrada: "¿Cuál es su política de devoluciones?"
- Respuesta esperada: "Ofrecemos un plazo de devolución de 30 días para todas las compras."
- Respuesta del agente: "Nuestra política de devoluciones permite realizar devoluciones dentro de los 15 días laborables posteriores a la compra."
- Método de evaluación: Coincidencia de palabras clave
- Resultado: Fallido (esperado "30 días", el agente dijo "15 días laborables")
Verificar la configuración de la evaluación (paso 1 de la Capa 2):
| Question | Respuesta | Resultado |
|---|---|---|
| ¿Es aceptable la respuesta del agente? | Hay que revisar el documento de la fuente. | Revise primero el documento de la fuente. |
| ¿La respuesta esperada sigue siendo actual? | El documento de la fuente dice "15 días laborables". La política fue actualizada. | No. La respuesta esperada está desactualizada. |
Clasificación: Problema de configuración de evaluación. Respuesta esperada desactualizada. El agente es correcto. La evaluación es incorrecta.
Paso 4: Triaje KG-005 (capa 2, pasos 1-2)
Caso de prueba KG-005:
- Ejemplo de entrada: "¿El plan Premium incluye una garantía extendida?"
- Respuesta esperada: "El plan Premium incluye una garantía estándar de dos años." Las opciones de garantía extendida están disponibles para su compra por separado."
- Respuesta del agente: "Sí, el plan Premium incluye una garantía extendida de tres años que cubre todas las piezas y mano de obra."
- Método de evaluación: Comparación de significado
- Resultado: Fallo (detalles de garantía fabricados por el agente)
Verificar la configuración de la evaluación (paso 1 de la Capa 2):
| Question | Respuesta | Resultado |
|---|---|---|
| ¿Es aceptable la respuesta del agente? | No. Se fabrica una "garantía extendida de tres años". | Continuar |
| ¿Está actualizada la respuesta esperada? | Sí. El origen confirma la garantía estándar de dos años. | Continuar |
| ¿Es realista el caso de prueba? | Sí. Pregunta frecuente de clientes. | Continuar |
| ¿Podría ser válida una respuesta alternativa? | No. Los detalles de la garantía son exactos. | Continuar |
| ¿Es adecuado el método de evaluación? | Sí.Comparar significado es correcto para la precisión semántica. | La evaluación es válida. |
Diagnosticar el agente (paso 2 de la Capa 2):
| Question | Respuesta |
|---|---|
| ¿El contenido de origen es incorrecto? | No. El origen dice "garantía estándar de dos años". |
| ¿El agente contradijo la información del origen? | Sí. El origen dice "garantía estándar de dos años", pero el agente dijo "garantía extendida de tres años". |
| ¿El agente respondió sin usar ningún origen? | Probablemente sí. El detalle de "garantía extendida de tres años que cubre todas las piezas y mano de obra" no existe en ningún origen. |
Clasificación: Problema de configuración del agente. Brecha en la fundamentación del conocimiento. El agente produjo detalles de la garantía que no están presentes en los orígenes de conocimientos configurados.
Paso 5: Remediar (Capa 3)
KG-003 (Remediación de la configuración de evaluación):
- Cambio: Actualizar el valor esperado de "ventana de devolución de 30 días" a "15 días hábiles"
- Reejecutar: KG-003 solo
- Esperado: Aprobado
KG-005 (Corrección de la configuración del agente):
- Cambio: agregue instrucciones de contextualización a la solicitud del sistema: "Responda solo en función de la información encontrada en sus orígenes de conocimiento. Si la información no está disponible, indíquelo.
- Vuelve a ejecutar: el conjunto completo de evaluación de fundamentación de conocimiento (el cambio de configuración del agente puede tener efectos más amplios)
- Se espera: KG-005 aprobados. Los otros casos de prueba no deberían presentar regresiones.
Paso 6: Verificar
Tras ambos cambios, vuelva a ejecutar el conjunto de evaluación de fundamentación de conocimiento:
| Antes | Después de |
|---|---|
| 71 % (5/7 aprobados) | 86 % (6/7 aprobados) |
Evaluación: la contextualización de conocimiento está ahora por encima del umbral de bloqueo de 80 %. Hay un fallo (KG-007) que permanece y no bloquea el estado de preparación. Revíselo en la próxima iteración.
Paso 7: Documentar (Capa 4)
Registre en el registro de errores:
| Caso de prueba | Tipo de causa raíz | Problema observado | Cambio aplicado | Resuelto |
|---|---|---|---|---|
| KG-003 | Configuración de evaluación | Respuesta esperada desactualizada (la política cambió de 30 días a 15 días laborables). | Valor esperado actualizado | Sí |
| KG-005 | Configuración del agente | Detalles incorrectos de la garantía que no están en ningún origen. | Se agregó la instrucción de fundamentación a la indicación del sistema | Sí |
Nota del patrón: verifique los valores esperados frente a los documentos de origen antes de cada ejecución de evaluación. Agregue este paso a la lista de verificación previa a la evaluación.
Volver a comprobar la preparación: todos los conjuntos de evaluación ahora están por encima de los umbrales de bloqueo.
Evaluación de la preparación: implemente el agente con brechas conocidas (documentado KG-007, plan de supervisión implementado).
Referencia: Capa 4: Analizar patrones y mejorar continuamente el agente
Recorrido 2: Meseta de puntuación
Situación: Se ejecutan cuatro iteraciones en un agente de soporte de producto. La precisión factual permanece en el 78 % durante las cuatro ejecuciones. Realiza cambios rápidos después de cada ejecución, pero no ve ninguna mejora.
Paso 1: Comprobar patrones (Capa 4)
Revise el registro de errores de las cuatro iteraciones:
| Iteración | Puntuación | Cambio aplicado | Resultado |
|---|---|---|---|
| 1 | 78 % | (línea base) | — |
| 2 | 79 % | Se agregó "Sea preciso con las especificaciones del producto" | Ningún cambio significativo |
| 3 | El 77 % | Se reorganizó la indicación para poner las instrucciones sobre precisión primero | Ningún cambio significativo |
| 4 | 78 % | Se agregaron ejemplos de respuestas correctas sobre productos | Ningún cambio significativo |
Tendencia: Estable. La remediación no está abordando la verdadera causa raíz.
Referencia: Capa 4: Analizar patrones y mejorar continuamente el agente
Paso 2: Analizar casos de prueba fallidos
Examine los seis errores persistentes en todas las iteraciones.
| Caso de prueba | Error desde | Problema observado |
|---|---|---|
| FA-002 | Iteración 1 | El agente cita la página de preguntas frecuentes en lugar del manual del producto |
| FA-005 | Iteración 1 | El agente cita la página de preguntas frecuentes en lugar del manual del producto |
| FA-008 | Iteración 1 | El agente cita la página de preguntas frecuentes en lugar del manual del producto |
| FA-011 | Iteración 1 | El agente cita la página de preguntas frecuentes en lugar del manual del producto |
| FA-014 | Iteración 1 | El agente cita la página de preguntas frecuentes en lugar del manual del producto |
| FA-019 | Iteración 2 | El agente da una respuesta parcial basada en las preguntas frecuentes y omite detalles del manual |
Análisis de concentración: en cinco de seis errores (83 %) interviene la misma causa raíz: el agente obtiene información de la página de preguntas frecuentes en lugar del manual del producto.
Paso 3: Nuevo triaje (Capa 2)
Inicialmente, clasifique los errores como Problema de configuración del agente: se recuperó el origen incorrecto.
Aplique varios cambios de configuración del agente, incluyendo la reformulación de indicaciones, el reordenamiento y la adición de ejemplos. Estos cambios no suponen una mejora medible. En este punto, verifique el errores con los indicadores de limitación de plataforma.
| Indicador | Comprobación |
|---|---|
| El error persiste en múltiples variaciones de indicación o configuración | Sí. Cuatro iteraciones sin cambios. |
| La recuperación devuelve de manera constante documentos incorrectos a pesar de la configuración correcta del origen | Sí. Las preguntas frecuentes se recuperan de forma constante en lugar del manual del producto. |
Reclasificación: este problema es una limitación de la plataforma relacionada con la clasificación de recuperación. La plataforma prioriza sistemáticamente las preguntas frecuentes en lugar del manual del producto para estas consultas, y los cambios adicionales en indicaciones o instrucciones no afectan al comportamiento de recuperación.
Referencia: Capa 2: errores del agente de evaluación de prioridades
Paso 4: Remediar (Capa 3—Limitación de plataforma)
Cuando clasifique un error como limitación de la plataforma, centre la remediación en soluciones alternativas y documentación en lugar de realizar cambios en la configuración del agente.
Referencia: Respuesta a limitaciones de la plataforma
Estrategia alternativa: aplique uno o varios de los siguientes enfoques de mitigación para reducir el impacto:
- Reestructure el manual del producto con encabezados de sección más claros que se alineen con el vocabulario utilizado en las consultas de los usuarios.
- Duplique las especificaciones críticas del producto del manual en la sección de preguntas frecuentes para crear rutas de recuperación redundantes.
- Refactorice el contenido del manual para que cada sección aborde una única pregunta bien definida y así mejorar la coincidencia de fragmentos de recuperación.
Estos enfoques buscan influir en el comportamiento de recuperación sin depender de cambios en indicaciones o instrucciones.
Escalada y seguimiento: si la limitación persiste, documente y escale el asunto al equipo de la plataforma.
- Documente la limitación de la siguiente manera: "Las consultas sobre <especificaciones del producto> recuperan constantemente la página de preguntas frecuentes (última actualización: <fecha>, <n> páginas) en lugar del manual del producto (última actualización: <fecha>, <N> páginas), a pesar de que el manual contiene la información de referencia."
- Proporcione pruebas de apoyo: incluya múltiples casos de prueba que muestren la consulta, el origen esperado y el origen real recuperado.
- Enviar para investigación.
- Comparta la limitación documentada y la evidencia con el equipo de la plataforma para seguimiento y control.
Paso 5: Verificar
Tras reestructurar el manual del producto y agregar entradas redundantes de preguntas frecuentes, vuelva a ejecutar el conjunto de evaluación correspondiente para verificar el impacto.
| Antes | Después de |
|---|---|
| 78 % (sin cambios en cuatro iteraciones) | 89 % |
Evaluación: la solución alternativa mejora el rendimiento global. Queda un error (FA-019). La consulta es demasiado ambigua para recuperar de forma fiable el origen correcto, incluso con contenido reestructurado. Este error se registra como una limitación conocida.
Paso 6: Documentar
Actualice el registro de errores para reflejar la clasificación final y los resultados.
| Caso de prueba | Tipo de causa raíz | Problema observado | Cambio aplicado | Resuelto |
|---|---|---|---|---|
| FA-002, 005, 008, 011, 014 | Limitación de la plataforma | La clasificación de recuperación prioriza las preguntas frecuentes sobre el manual del producto | Encabezados del manual reestructurados; especificaciones críticas duplicadas en las preguntas frecuentes | Sí |
| FA-019 | Limitación de la plataforma | La consulta ambigua no puede recuperar de forma fiable el origen correcto | Documentado como limitación conocida | No |
Conclusiones clave: si las puntuaciones de evaluación se mantienen constantes entre varios cambios de mensajes o instrucciones, es poco probable que la causa principal sea el mensaje. Valide el comportamiento de la infraestructura y la plataforma antes de invertir más en diseño de indicaciones.
Recorrido 3: Regresión tras la actualización
Situación: ha actualizado la indicación del sistema para mejorar el tono y la empatía. Las puntuaciones de tono han aumentado, pero la precisión fáctica cayó por debajo de su umbral de bloqueo, introduciendo una regresión.
Antes del cambio:
| Conjunto de evaluaciones | Puntuación |
|---|---|
| Precisión factual | El 91 % |
| Tono y calidad | 83 % |
| Todos los demás | Por encima del umbral |
Ha agregado la siguiente instrucción a la indicación del sistema: "Reconozca siempre la preocupación del cliente y muestre empatía antes de dar una respuesta." Comience cada respuesta validando la experiencia del cliente."
Después del cambio:
| Conjunto de evaluaciones | Antes | Después de | Delta |
|---|---|---|---|
| Precisión factual | El 91 % | 76% | -15 % |
| Tono y calidad | 83 % | El 91 % | +8 % |
Paso 1: Interpretar (Capa 1)
La precisión factual está ahora por debajo del umbral de bloqueo del 80 %. Este cambio introduce una regresión y bloquea la preparación.
Referencia: Capa 1: Interpretar las puntuaciones e identificar los errores
Paso 2: Comprobar patrones (Capa 4)
Coincidencia de patrones entre señales: el tono mejora mientras la exactitud se degrada.
Causa raíz indicada: conflicto de instrucciones.
La orientación de tono recién agregada compite con instrucciones de precisión para la atención del modelo.
Referencia: Capa 4: Analizar patrones y mejorar continuamente el agente
Paso 3: Clasificar los nuevos fallos (Capa 2)
Revise los casos de prueba de precisión fáctica que se aprobaron antes del cambio y ahora fallan.
Caso de prueba FA-007:
- Entrada: "¿Cuál es el tamaño máximo de carga de archivo?"
- Esperado: "El tamaño máximo de subida de archivo es de 25 MB para cuentas estándar y 100 MB para cuentas empresariales."
- Agente antes: "El tamaño máximo de carga de archivo es de 25 MB para cuentas estándar y 100 MB para cuentas empresariales."
- Agente después: "Entiendo perfectamente su preocupación por el tamaño de carga de archivos; puede resultar frustrante al intentar cargar documentos importantes. Quiero asegurarme de que tiene toda la información que necesita. El tamaño máximo de carga es de 25 MB para los planes estándar."
Paso 1. Verifique la evaluación: La respuesta esperada es correcta y la evaluación es válida. La respuesta posterior a la actualización omite el detalle de la cuenta empresarial.
Paso 2. Diagnosticar: La nueva instrucción sobre el tono requiere un preámbulo de empatía en cada respuesta. Este requisito consume el presupuesto de respuesta y la atención del modelo, y genera respuestas fácticas incompletas.
Clasificación: Problema de configuración del agente. Conflicto de instrucciones entre tono y orientación sobre exactitud.
Referencia: Capa 2: errores del agente de evaluación de prioridades
Paso 4: Remediar (Capa 3)
El problema no es la orientación de tono en sí, sino las prioridades que compiten entre sí en la indicación del sistema. La remediación se centra en separar y priorizar las instrucciones.
Instrucción antigua (única, compitiendo): "Reconozca siempre la preocupación del cliente y muestre empatía antes de proporcionar su respuesta. Comience cada respuesta validando la experiencia del cliente."
Nueva instrucción (separada, priorizada): "Incluya siempre la respuesta completa y fáctica a la pregunta del cliente." No omita detalles por brevedad. Además, cuando el cliente exprese frustración o preocupación, reconózcalo brevemente."
Cambios principales:
- Se prioriza explícitamente la precisión.
- La integridad de las respuestas fácticas se indica directamente.
- La empatía es condicional, no universal.
- "Brevemente" restringe la empatía para evitar el truncamiento de contenido.
Referencia: Capa 3: Asignar patrones de error a estrategias de corrección
Paso 5: Verificar
Vuelva a ejecutar el conjunto de evaluación completo, ya que los cambios en los mensajes del sistema pueden tener un gran impacto.
| Conjunto de evaluaciones | Antes del cambio | Después de la regresión | Después del cambio |
|---|---|---|---|
| Precisión factual | El 91 % | 76% | 90 % |
| Tono y calidad | 83 % | El 91 % | 89 % |
| Todos los demás | Por encima del umbral | Por encima del umbral | Por encima del umbral |
Evaluación: Ambas señales ahora superan sus umbrales de bloqueo. El tono no vuelve completamente a su punto máximo, pero se mantiene por encima del umbral de bloqueo del 75 % y mejora respecto a la línea base original.
Paso 6: Documentar
| Caso de prueba | Tipo de causa raíz | Problema observado | Cambio aplicado | Resuelto |
|---|---|---|---|---|
| FA-007, FA-012, FA-018 (y otros) | Configuración del agente | La orientación del tono sustituyó la integridad fáctica | Indicación reestructurada para priorizar la exactitud y aplicar empatía condicional | Sí |
Conclusiones clave: valide siempre los cambios en los mensajes del sistema en el conjunto de evaluación completo, no solo la señal de destino. Las instrucciones compiten por la atención del modelo, y las mejoras en un área pueden introducir regresiones en otras.
Patrón a observar: Este escenario es una instancia del problema del presupuesto de instrucciones. A medida que crecen las indicaciones, los conflictos entre instrucciones son más probables. La consolidación periódica y la simplificación ayudan a mantener la estabilidad.
Patrones comunes a lo largo de los recorridos
Cada recorrido comienza desde un escenario diferente para ilustrar un camino de diagnóstico distinto. Para ver cómo un solo agente progresa a lo largo de todo el ciclo de evaluación—interpretación de puntuaciones, triaje de errores, remediación y verificación—consulte el Recorrido 1, que proporciona la explicación más completa de extremo a extremo.
Esta tabla destaca patrones recurrentes observados a lo largo de los recorridos y las lecciones prácticas que refuerzan.
| Patrón | Dónde aparece | Conclusión principal |
|---|---|---|
| Validar la evaluación antes del agente | Recorrido 1 | Un origen común de esfuerzo inútil es resolver problemas en el comportamiento del agente cuando la evaluación en sí es incorrecta. |
| Las puntuaciones planas indican una causa raíz mal clasificada | Recorrido 2 | Si la remediación repetida no mejora los resultados, reclasifique el problema. Puede que esté abordando la causa raíz equivocada. |
| Vuelva a ejecutar el conjunto de evaluación completo después de los cambios en los mensajes | Recorrido 3 | Los cambios en la indicación pueden afectar a múltiples señales de calidad. Revise siempre si hay regresiones fuera del área objetivo. |
| Documentar resultados y decisiones | Todos los recorridos | Mantener un registro de errores impide redescubrir las mismas causas raíz en iteraciones posteriores. |
| Las lagunas conocidas pueden ser aceptables | Recorrido 1 (KG-007), Recorrido 2 (FA-019) | No todos los errores deben resolverse antes del envío. Documente las lagunas conocidas y vigílelas a lo largo del tiempo. |
Pasos siguientes
Después de revisar estos ejemplos, elija la siguiente acción que más se ajuste a su situación actual:
- Comience con la interpretación de puntuaciones si tiene resultados de evaluación listos para evaluar.
- Comience el triaje de errores si necesita diagnosticar errores específicos de casos de prueba.
- Aplique análisis de patrones si trabaja con múltiples errores y quiere identificar problemas sistémicos.
- Configure el registro de errores para realizar seguimiento de decisiones, resultados y problemas recurrentes.
- Vuelva a los objetivos del marco de trabajo para revisar el proceso completo de triaje de evaluación.