Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
Las siguientes secciones se aplican a cada cambio de modelo, ya sea una actualización proactiva o una respuesta a una retirada. Define primero las puertas, captura una línea base del modelo actual y luego trabaja las fases.
Definir puertas de aceptación migratoria
Definir criterios de aceptación antes de evaluar el modelo candidato, de modo que la evaluación del agente produzca una decisión en lugar de solo un conjunto de puntuaciones. Inclusión:
- Tasa mínima global de aprobados
- Tasa de aprobación requerida para escenarios críticos para el negocio
- Fallos críticos que bloquean la migración independientemente de la puntuación agregada
- Latencia permitida y variación de fiabilidad
- Seguridad, cumplimiento y aprobación regional de procesamiento
- Consumo aceptable o impacto en el coste
- Aprobación requerida del propietario y del aprobador de liberación
Compara el modelo actual y el candidato utilizando la misma configuración de agente, datos de prueba, conjunto de pruebas, perfiles de usuario y supuestos del entorno. Investigar regresiones individuales en lugar de basarse únicamente en una puntuación media.
Los resultados del modelo son probabilísticos. Ejecuta escenarios importantes más de una vez cuando la variabilidad pueda afectar la decisión.
Establecer una línea base de evaluación reutilizable
Antes de cambiar el modelo, crea un conjunto de pruebas que represente los escenarios críticos para el negocio y de alta frecuencia del agente. Ejecuta el conjunto de pruebas con el modelo de producción actual para establecer una línea base.
Utiliza tanto el chat de prueba como la evaluación de agentes:
- Usa el chat de prueba para explorar conversaciones completas e inspeccionar la orquestación con el mapa de actividades.
- Utiliza la evaluación de agentes para ejecutar conjuntos de pruebas repetibles, medir resultados y comparar ejecuciones a lo largo del tiempo.
Los métodos de prueba disponibles dependen del aprovechamiento del agente, así que confírmalos antes de diseñar el conjunto de pruebas. Infórmate más en Confirmar qué métodos de prueba apoya tu agente.
Evalúa el comportamiento completo del agente
No apruebes un modelo de reemplazo solo porque su tasa de aprobados es similar a la actual.
Cubre las siguientes áreas. Cada uno es un comportamiento que suele cambiar cuando cambia el modelo, por lo que un conjunto de pruebas que omite un área no puede detectar una regresión en ella.
| Área de evaluación | Lo que puede romper un cambio de modelo | Cómo comprobarlo |
|---|---|---|
| Calidad de la respuesta | Relevancia, integridad, precisión, claridad y coherencia en las preguntas que el agente recibe con mayor frecuencia. | Calidad general |
| Estabilidad y conocimiento | El modelo responde a partir de datos de entrenamiento en lugar de la fuente de conocimiento configurada, omite citas o gestiona fuentes incompletas o contradictorias de forma diferente. | Calidad general |
| Abstención | El modelo responde a una pregunta fuera de alcance en lugar de declinar o escalar. | Calidad general, o personalizada con etiquetas de Respondido y Rechazado |
| Instrucciones siguientes | Se saltan las instrucciones que el modelo siguió de forma fiable, como las normas de escalada, límites, conductas prohibidas o una advertencia obligatoria. | Coincidencia de palabras clave en frases requeridas, o Personalizado con etiquetas específicas para instrucciones |
| Valores fijos y formato de salida | Se parafrasea o inventa un valor preciso como un número de teléfono, código o ID, o la forma de salida cambia y rompe un analizador o integración de canal aguas abajo. | Coincidencia exacta, o coincidencia por palabra clave en el formato requerido |
| Selección de herramientas y sujeción | El modelo selecciona una herramienta diferente, no llama a ninguna, o llama a una herramienta cuando no se necesita ninguna herramienta. | Uso de herramientas con las herramientas o temas esperados definidos, además de una revisión del mapa de actividad |
| Entradas de herramientas y secuenciación | Los parámetros se extraen, formatean o predeterminan de forma diferente, o los pasos en una tarea multiherramienta se reordenan, fusionan o eliminan. | Uso de herramientas con todas las herramientas esperadas, además de calidad general |
| Confirmación y manejo de fallos | El modelo deja de pedir confirmación antes de una acción consecuente, o un error de herramienta se muestra de forma diferente en lugar de reportarse. | Personalizado con etiquetas de confirmación, además de coincidencia de palabras clave en el lenguaje de error esperado |
| Comportamiento multigiro | El contexto de turnos anteriores se pierde o reinterpreta, o la aclaración, los cambios de tema y la recuperación se gestionan de forma diferente. | Calidad general en un conjunto de pruebas de conversación |
| Entrada desordenada y adversarial | Manejo más débil de errores tipográficos, fragmentos e intención poco clara, o una respuesta diferente a intentos de inyección inmediata y anulación de rol. | Calidad general, además de etiquetas personalizadas con Rechazado y Cumplido |
| Seguridad y cumplimiento | Gestión de contenidos dañinos, acceso a datos, permisos, procesamiento regional y requisitos responsables de IA. | Etiquetas personalizadas, junto con una revisión responsable de IA |
| Latencia y fiabilidad | Tiempo de respuesta, tiempos de espera, variabilidad, llamadas fallidas y repeticiones bajo condiciones representativas. | No reportado por la evaluación. Mide en el chat de prueba y la monitorización de producción. |
| Consumo y coste | Copilot: Consumo de crédito u otros costes relacionados con el modelo para escenarios representativos. | No reportado por la evaluación. Mide en los informes de capacidad y consumo. |
| Idiomas y canales | Calidad y comportamiento en lenguajes soportados, perfiles de usuario y canales de despliegue. | Ejecuta el conjunto de pruebas para cada idioma, perfil de usuario y canal que importe |
Presta especial atención al seguimiento de las instrucciones y a la latencia. Un modelo candidato puede mejorar la calidad de las respuestas pero introducir respuestas más lentas, diferentes comportamientos de selección de herramientas o fallos en instrucciones que eran fiables con el modelo anterior.
Confirma qué métodos de prueba apoya tu agente
Los métodos de prueba disponibles para tu agente dependen de su aprovechamiento.
Más información en:
- Evalúa agentes impulsados por el arnés estándar
- Evalúa agentes impulsados por el arnés GitHub Copilot
Construye y mantén el conjunto de pruebas
- Cubre primero los caminos positivos críticos para el negocio y las solicitudes de alto volumen, luego los casos difíciles: casos límite, entradas adversariales, solicitudes que deben ser rechazadas o escaladas, fallos de herramientas, largas conversaciones y peticiones multilingües.
- Empieza por el tráfico real. Los temas analíticos y las conversaciones grabadas producen casos de prueba más representativos que los inventados.
- Prefiere la cobertura sobre el pulido. Un conjunto mayor de casos imperfectos encuentra más regresiones que un conjunto pequeño de casos perfectamente formulados.
- Puntua primero el modelo actual y luego el candidato. La comparación, no el número absoluto, te dice si la migración es segura.
- Mantén el set con el agente en control de versiones y reejecuta sin cambios para cada cambio de modelo.
- Divide el conjunto por área de riesgo. Un conjunto de pruebas alimentado por el arnés estándar contiene hasta 100 casos de prueba, por lo que se usan conjuntos separados para la precisión del conocimiento, el comportamiento de la herramienta y escenarios sensibles a la seguridad.
- Exporte los resultados. Los resultados de la evaluación se conservan durante 89 días, así que expórtalos a CSV para llevar un registro de la puntuación de cada modelo en el momento de la migración.
- Convertir los incidentes de producción y la retroalimentación de los usuarios en nuevas pruebas de regresión.
Aprende más sobre Diseño y operacionalización de la evaluación de agentes.
Note
La evaluación del agente mide la corrección y el rendimiento, no la ética de la IA ni los problemas de seguridad. Un agente puede aprobar todos los casos de prueba y aun así dar una respuesta inapropiada. Utiliza revisiones responsables de IA y filtros de seguridad de contenido junto con la evaluación.
Automatizar evaluaciones recurrentes
Copilot Studio soporta ejecutar evaluaciones a través de la API de Power Platform, por lo que puedes integrar la validación de modelos en flujos de trabajo de lanzamiento y pipelines de integración continua. Para una gran herencia de agentes, la automatización es lo que hace que las pruebas repetidas de candidatos sean sostenibles en lugar de manuales. Aprende más en Evaluaciones de Automate con la API de Power Platform.
Actualizar los artefactos del agente que afecta un cambio de modelo
Un cambio de modelo rara vez afecta solo al entorno del modelo. Traduce la orientación del proveedor correspondiente en los artefactos del agente que controlas y luego valida cada cambio con tu línea base de evaluación. Una remediación que no se vuelva a analizar es una suposición.
| Artefacto | Cambio típico |
|---|---|
| Instrucciones del agente | Haz explícitas las expectativas implícitas, elimina las soluciones alternativas escritas para el modelo anterior, reformula los límites, las reglas de escalada y los comportamientos prohibidos de forma inequívoca, resuelve instrucciones contradictorias y calibra cuánta acción independiente debe tomar el agente. |
| Instrucciones de tema y nodo | Aplica el mismo tratamiento a nivel de tema y verifica que los nodos de respuesta generativa sigan comportándose como se espera. |
| Descripciones de herramientas y acciones | Vuelva a escribir para mayor claridad. Esta descripción es lo que el modelo interpreta para decidir si y cuándo llamar a una herramienta, y las descripciones vagas provocan tanto sobrellamada como infrallamada. |
| Descripciones de parámetros de entrada y salida | Ajusta el formato, las unidades, los ejemplos y la semántica requerida u opcional para que la generación de parámetros se mantenga correcta. |
| Configuración del origen de conocimiento | Revisa las instrucciones de selección de fuentes, alcance y conexión a tierra, y verifica el comportamiento de las citas. |
| Instrucciones de formato de respuesta | Reformula explícitamente la estructura, longitud, avisos y valores exactos requeridos, porque los modelos más recientes cambian la verbosidad por defecto. |
| Confirmación y puertas de seguridad | Reafirmar los requisitos explícitos de confirmación antes de las acciones consecuenciales. |
| Consumidores aguas abajo | Actualiza los flujos de Power Automate, tarjetas adaptativas, integraciones de canales y cualquier analizador que lea la salida del agente. |
| El propio conjunto de pruebas | Sumamos los nuevos patrones de fallo descubiertos durante la migración. |
Fases de migración
Las fases siguientes ponen las secciones anteriores en orden de ejecución. Úsalos como plan de trabajo para el cambio de modelo de un solo agente, ya sea que sea proactivo o impulsado por una jubilación.
Fase 0: Prepararse
- Confirma que el modelo candidato es válido respecto a los requisitos previos: disponible o por defecto, disponible dentro de la región, postura cross-geo aceptable, habilitada por el administrador y la categoría de uso adecuada para el propósito del agente.
- Lee la guía de actualización del proveedor de modelos y apunta a las instrucciones y cambios de herramienta que implica.
- Identificar los agentes afectados del inventario, el entorno de registro, los propietarios y la criticidad.
- Confirma qué métodos de evaluación soporta el arnés del agente.
- Define y aprueba las puertas de aceptación de migración.
Fase 1: Referencia del modelo actual
- Construye o actualiza el conjunto de pruebas de regresión para que cubra escenarios críticos para el negocio y de alta frecuencia.
- Ejecuta el conjunto de pruebas con el modelo de producción actual para establecer la línea base. Haz esto mientras el modelo actual sigue en su lugar, porque después de que el modelo cambia la línea base no se puede reconstruir.
- Registrar la latencia y el consumo de crédito Copilot por separado. Las evaluaciones no los reportan.
- Exporta los resultados a CSV para preservar el registro más allá de la ventana de retención.
Fase 2: Evaluar al candidato en un entorno no productivo
Prepara una copia no productiva del agente, siguiendo las directrices de Copilot Studio para la gestión del ciclo de vida de la aplicación y las pruebas del agente. Configura el entorno para que represente la producción:
- Utiliza las mismas instrucciones del agente, temas, configuración de conocimientos, herramientas, flujos, conectores, lenguajes y supuestos de seguridad.
- Utiliza identidades y conexiones representativas en el examen.
- Aplica las mismas políticas de datos y los controles de administrador relevantes.
- Confirmar la disponibilidad regional y si es necesario mover datos entre geogeometrías.
- Registra cualquier diferencia entre la prueba y la producción que pueda afectar al resultado.
Cambia el modelo. Ve a la página de Resumen del agente y selecciona el modelo principal candidato en la sección de Modelos . Existen configuraciones separadas para razonamiento profundo, respuestas generativas y el generador de prompts, así que comprueba si el agente utiliza esas capacidades y si también necesitan cambiarlas.
Repite el mismo conjunto de pruebas, sin cambios, contra el modelo candidato.
Compara ambas pruebas con las puertas de aceptación para identificar mejoras y regresiones.
Inspecciona la orquestación cualitativamente en el chat de prueba, usando el mapa de actividad para confirmar qué herramientas se seleccionaron, en qué orden y con qué parámetros.
Mide la latencia y el consumo del candidato y compáralos con la línea base.
Fase 3: Corrección
- Actualiza los artefactos del agente que afecta el cambio de modelo, luego vuelve a ejecutar el conjunto de pruebas contra el agente remediado. Aprende más en Mejorar agentes utilizando triaje y remediación basados en evaluaciones.
- Iterar hasta que se cumplan las barreras de aceptación, o concluir que el modelo candidato no es adecuado y documentar por qué. Decidir no mejorar es un resultado legítimo y basado en la evidencia.
Fase 4: Aprobación y despliegue
- Obtén la aprobación de las puertas de aceptación por parte del propietario del agente y del aprobador de liberación, incluyendo la aprobación de seguridad y cumplimiento cuando hay modelos cross-geo o externos involucrados.
- Despliega a través del proceso ALM establecido, promoviendo la solución desde la prueba hasta la producción. No edites manualmente el agente de producción.
- Haz el despliegue por etapas cuando el canal lo permita. Publica primero para una audiencia piloto o un solo canal, observa el resultado y luego amplía.
Fase 5: Monitorizar y cerrar
- Monitoriza el comportamiento de la producción frente a las puertas de aceptación.
- Añadir patrones de fallo recién descubiertos al conjunto de pruebas de regresión.
- Cerrar la migración solo después de que se cumplan los criterios de aceptación en la producción.
- Preservar la evidencia de evaluación y el registro de decisiones migratorias para la auditoría y para el siguiente evento del ciclo de vida.
Importante
El camino de rollback para un cambio de modelo es volver a desplegar la versión de la solución previamente validada, que es más lenta que un interruptor de configuración. Esta diferencia hace que la puerta de evaluación en la fase 2 sea tan importante. Detectar una regresión antes del despliegue es menos costoso que revertir una después.
Monitorizar después de la migración
El trabajo sobre el ciclo de vida del modelo continúa tras el despliegue. Supervisión:
- Resultados de evaluación de agentes y tasas de aprobación de escenarios críticos.
- Análisis de producción, transcripciones, actividad, errores y comentarios de los usuarios.
- Fallos en el seguimiento de instrucciones y en la selección de herramientas.
- Latencia, tiempos de espera y fiabilidad.
- El consumo cambia.
- Preocupaciones sobre seguridad, cumplimiento normativo y procesamiento regional.
Cuando la monitorización de producción identifique un nuevo patrón de fallo, añade un caso representativo al conjunto de pruebas de regresión. Esta práctica mejora la siguiente evaluación del modelo y convierte el aprendizaje en producción en una línea base de calidad duradera.
La telemetría a nivel de entorno emite OpenTelemetry GenAI que abarca hasta Application Insights, incluyendo el modelo utilizado para cada invocación de agente. Úsalo para confirmar en qué modelo se ejecuta realmente el tráfico de producción y para comparar la selección y fiabilidad de la herramienta antes y después de una migración.