Analice sus agentes usando la Herramienta de revisión del agente del Copilot Agent Kit

La Herramienta de revisión del agente es un sistema automatizado de evaluación de calidad y revisión de cumplimiento para agentes Microsoft Copilot Studio y Agentes Declarativos de Microsoft 365. Ayuda a creadores, administradores y equipos de gobernanza a identificar problemas, antipatrones y brechas de cumplimiento antes de que lleguen a los usuarios finales.

A medida que las organizaciones escalan sus implementaciones de Copilot Studio, revisar manualmente la configuración, las instrucciones y la estructura de los temas de cada agente se vuelve imposible. Herramienta de revisión del agente automatiza esa revisión mediante análisis impulsados por IA, normalmente mostrando resultados procesables en menos de 60 segundos.

Es para:

  • Creadores: Obtén retroalimentación procesable para mejorar la calidad del agente antes de la implementación.
  • Administradores y equipos de CoE: Hacer cumplir los estándares de gobernanza a todos los agentes de un entorno.
  • Responsables de seguridad y cumplimiento: Verifica que los agentes cumplan las directrices de privacidad, seguridad y precisión.

Capacidades clave

Capacidad Detalles
Cobertura de agentes Agentes de Copilot Studio y Agentes Declarativos de Microsoft 365
Hora de revisión Normalmente menos de 60 segundos por agente
Patrones comprobados 18 patrones (10 deterministas + 8 potenciados por IA)
Criterios de cumplimiento 15 criterios de calidad de las instrucciones
Sistema de puntuación Puntuación global de 0–100 (50 % patrones, 50 % cumplimiento)
Formatos de exportación PDF, SARIF, Excel
Almacenamiento de datos Microsoft Dataverse (se aplica seguridad de nivel de fila con ámbito de usuario)
Motor de IA Indicaciones de IA de Microsoft Copilot Studio a través de Dataverse PredictV2

Introducción: el panel

Cuando abres la Herramienta de revisión del agente, llegas al Panel, el centro que muestra a todos los agentes en tu entorno y su estado de evaluación.

Diseño del panel

Captura de pantalla del panel de Herramienta de revisión del agente con tarjetas de estadísticas, cuadrícula de agentes y el botón Cargar ZIP.

El panel muestra todo de un vistazo: la barra de pestañas que cambia entre agentes de Copilot Studio y Microsoft 365, cuatro tarjetas de estadísticas que resumen la salud del portafolio, una barra de búsqueda, la cuadrícula de agentes paginada y el botón Cargar ZIP para revisiones sin conexión.

Tarjetas de estadísticas

Las cuatro tarjetas de estadísticas te ofrecen una instantánea de salud de tu cartera de agentes:

Ficha Lo que muestra Cómo se calcula
Agentes totales Recuento de todos los bots activos en el entorno. Consultar la tabla bot donde statecode = 0
Revisado Número y porcentaje de agentes que se revisan. Recuento de revisiones completadas dividido por el total de agentes
Puntuación media Puntuación media global en todas las revisiones completadas. Suma de las puntuaciones dividida por el recuento revisado
Total de problemas Problemas acumulativos encontrados en todos los agentes revisados. Suma de fallos de patrón más fallos de cumplimiento

Cuadrícula de agentes

Columna Contenido
Nombre Nombre para mostrar del agente con icono.
Puntuación Puntuación de revisión global (0–100), o -- si aún no se ha revisado. Codificado por colores.
Problemas Resumen de hallazgos de gravedad alta, media y baja. -- si no están revisados.
Última revisión Tiempo relativo (por ejemplo, "hace 2 horas" o "hace 1 semana"), o "No revisado".
Acciones Revisión para agentes no revisados; Vista para agentes con revisiones existentes.

Seleccionar un entorno

Por defecto, la herramienta muestra agentes del entorno donde la instalaste. Si necesitas revisar un agente de otro entorno, usa el selector de entornos en la barra de instrumentos del panel. El menú desplegable enumera todos los entornos de Power Platform a los que tiene acceso.

Después de seleccionar un entorno diferente, la cuadrícula de agentes se actualiza para mostrar los agentes de ese entorno. Luego puedes revisar cualquiera de esos agentes. El resultado de la revisión se almacena en el entorno actual (de origen), no en el que seleccionaste.

Captura de pantalla del selector de entornos que lista entornos accesibles de Power Platform.

Modos de revisión

La herramienta admite dos modos de revisión distintos, accesibles desde la barra de pestañas situada en la parte superior del panel.

Revisión de agentes de Copilot Studio

Este modo revisa agentes integrados en Microsoft Copilot Studio. Lee directamente desde Dataverse—no es necesario subir archivos.

Qué analiza:

  • Configuraciones de temas (nombres, descripciones, variables).
  • Configuraciones de herramientas y acciones (recuento, descripciones, enrutamiento).
  • Tipos de fuentes de conocimientos.
  • Cobertura de casos de prueba.
  • Instrucciones de agentes (modo generativo).
  • Metadatos de agentes (idioma, autenticación, configuración de IA).

Para iniciar una revisión:

  1. Busque el agente en la cuadrícula.
  2. Seleccione Revisar. El análisis se inicia automáticamente.
  3. Un panel de progreso muestra lo que está ocurriendo en tiempo real.
  4. Los resultados se abren en el panel de revisión cuando estén completos.

Puedes revisar cualquier agente en cualquier momento. Cada revisión crea un nuevo registro en Dataverse. La cuadrícula siempre muestra el resultado de la revisión más reciente.

Revisión de agentes declarativos (Microsoft 365 Copilot)

Este modo revisa los agentes declarativos de Microsoft 365, que se definen mediante un archivo JSON manifiesto y se implementan en el ecosistema de Microsoft 365 Copilot.

Puedes presentar un agente declarativo para revisión de dos maneras:

método Cómo Cuándo usar
Cargar ZIP Seleccione Cargar ZIP en el encabezado de la página; seleccione el paquete exportado. El agente es de otro inquilino o no está en tu catálogo.
Del catálogo de Microsoft 365 Conéctate a Microsoft 365 a través del asistente de configuración de la Graph API y luego navega por los agentes. El agente está implementado en tu tenant de Microsoft 365.

Lo que analiza (5 criterios, no 15):

Criterio Peso Qué se comprueba
Instrucciones 30 % Claridad, integridad y calidad de las instrucciones del agente
Conocimiento 20 % Fundamentación a través de fuentes de conocimiento conectadas
Capacidades 15 % Uso de CodeInterpreter y OneDriveAndSharePoint
Acciones 15 % Descripción de enrutamiento de herramientas y acciones
Ideas para iniciar una conversación 10 % Mínimo 3, recomendado 6 (máximo 12)
Manejo elegante de errores 10 % Recuperación de errores y comportamientos alternativos

Nota

La comprobación de cumplimiento de instrucciones de 15 criterios es específica de los agentes de Copilot Studio y no se aplica a los agentes declarativos.

¿Qué sucede durante una revisión?

Cuando seleccionas Revisión, la herramienta ejecuta un análisis automatizado que normalmente se completa en menos de 60 segundos. Un panel de progreso te mantiene informado mientras funciona.

Captura de pantalla del panel de progreso de la revisión mostrando los pasos que se ejecutan durante una revisión de agente.

El análisis abarca tres cosas en secuencia:

  1. Análisis de configuración: La herramienta lee la configuración completa del agente desde Dataverse: cada tema, herramienta, fuente de conocimiento, caso de prueba e instrucciones. Verifica si faltan campos en todos los componentes y mide cosas como el número de herramientas y la cobertura de pruebas según los procedimientos recomendados documentados de Microsoft.
  2. Evaluación de patrones impulsada por IA: Un modelo de IA revisa la misma configuración para evaluar la calidad, no solo la integridad. Analiza si los nombres y descripciones de los temas son lo suficientemente claros para que el orquestador generativo enrute correctamente, si varios temas se solapan de forma que cause confusión en el enrutamiento, y si las descripciones de las herramientas proporcionan a la IA la guía suficiente para invocar la herramienta adecuada en el momento adecuado.
  3. Comprobación de cumplimiento de instrucciones: Un segundo modelo de IA lee las instrucciones del sistema del agente y las compara con 15 criterios de mejores prácticas de la guía de modo generativo de Microsoft, que abarcan ámbito, seguridad, calidad de respuesta y experiencia de usuario. Para cada criterio que las instrucciones no cumplen, surge un hallazgo específico y una recomendación concreta.

Tras completar los tres pasos, se genera automáticamente un informe en PDF y los resultados se abren en el panel de revisión.

Importante

Cada revisión consume créditos de Copilot. Los pasos impulsados por IA (evaluación de patrones, comprobación de cumplimiento de instrucciones y generación de PDF) invocan un modelo de IA a través de Dataverse. Planifica en consecuencia si estás revisando a un gran número de agentes.

Patrones detectados

Los patrones identifican antipatrones específicos o procedimientos recomendados que faltan en la configuración de un agente. La herramienta revisa 18 patrones en 7 categorías.

Los 18 patrones

Id. Nombre del patrón Categoría Impacto
pat-001 Falta nombre del modelo Denominación de modelos El orquestador generativo no puede enrutarse de forma fiable a este tema.
pat-002 Falta descripción del modelo Descripción del modelo El tema puede saltarse o activarse incorrectamente durante el enrutamiento.
pat-003 Falta nombre de variable de entrada Variables de entrada Los usuarios ven variables sin nombre, lo que genera confusión en la conversación.
pat-004 Falta descripción de variable de entrada Variables de entrada La IA no puede extraer correctamente el valor correcto de la entrada del usuario.
pat-005 Falta nombre de variable de salida Variables de salida Los valores de salida no están etiquetados y son difíciles de interpretar para los usuarios.
pat-006 Falta descripción de variable de salida Variables de salida La IA carece de contexto para rellenar correctamente la variable.
pat-007 Uso excesivo de herramientas Arquitectura Demasiadas herramientas degradan la precisión del enrutamiento y aumentan la latencia.
pat-008 Casos de prueba no adecuados Evaluación Las regresiones en el comportamiento del tema pasan desapercibidas antes de la implementación.
pat-009 Falta descripción del agente secundario Arquitectura El orquestador no puede decidir cuándo delegar en el agente secundario.
pat-010 Proliferación de arquitectura de agente secundario Arquitectura Una delegación excesiva genera complejidad y latencia en la orquestación.
pat-011 Nombre del modelo poco claro Denominación de modelos Nombres vagos hacen que el orquestador se dirija al tema equivocado.
pat-012 Descripción del modelo poco clara Descripción del modelo Las malas descripciones producen desencadenadores de temas incorrectos o que faltan.
pat-013 Nombre de variable de entrada poco claro Variables de entrada Los nombres ambiguos dificultan que la IA complete correctamente la variable.
pat-014 Descripción de variable de entrada poco clara Variables de entrada La IA extrae el valor incorrecto o hace preguntas aclaratorias innecesarias.
pat-015 Nombre de variable de salida poco claro Variables de salida Los temas o flujos posteriores que consumen esta variable podrían malinterpretarla.
pat-016 Descripción de variable de salida poco clara Variables de salida La IA no puede producir de forma fiable el formato de salida o el valor esperado.
pat-017 Descripciones de temas superpuestas Descripción del modelo Múltiples temas compiten por las mismas expresiones del usuario, causando un enrutamiento impredecible.
pat-018 Brecha de enrutamiento de herramientas Arquitectura La IA no puede decidir a qué herramienta llamar, lo que produce invocaciones erróneas o a una falta de acciones.

Para cada patrón que falla, la herramienta muestra qué temas se ven afectados, el valor actual que desencadenó el hallazgo, una mejora sugerida y un enlace a la documentación relevante de Microsoft Learn.

Captura de pantalla de la pestaña Patrones que lista los 18 patrones con estado, gravedad, categoría y conteo de temas afectados.

Categorías de patrones

La cuadrícula de resultados agrupa los patrones en siete categorías, ordenadas en el siguiente orden:

# Categoría Patrones incluidos
1 Denominación de modelos pat-001, pat-011
2 Descripción del modelo pat-002, pat-012, pat-017
3 Variables de entrada pat-003, pat-004, pat-013, pat-014
4 Variables de salida pat-005, pat-006, pat-015, pat-016
5 Arquitectura pat-007, pat-009, pat-010, pat-018
6 Orquestación Reservado para futuros patrones detectados por IA
7 Evaluación pat-008

Lógica de gravedad

La combinación de la coincidencia de palabras clave y el número de temas determina la gravedad del patrón:

Condición Gravedad asignada
El nombre del patrón contiene "nombre del modelo" o "descripción del modelo" Elevado
El nombre del patrón contiene "variable" Medio (a menos que el número de temas sea 5 o más)
El número de temas es 5 o más Elevado
El número de temas es 2 o más Medio
El número de temas es 1 Baja

La gravedad impulsa tanto la notificación visual en la cuadrícula de resultados como el nivel de error SARIF en el informe exportado.

Criterios de cumplimiento

Esta parte de la revisión evalúa la calidad de las instrucciones del sistema de un agente: el texto en lenguaje natural que un creador proporciona en los ajustes generativos de Copilot Studio. Estas instrucciones definen cómo se comporta el agente en todas las conversaciones.

Los 15 criterios se derivan de la guía de modo generativo de Microsoft y representan los procedimientos recomendados más impactantes para la calidad de la instrucción.

Los 15 criterios

# Id. Nombre del criterio Categoría Gravedad Qué comprueba
1 scope-definition Definición de ámbito Ámbito Alto Las instrucciones del agente definen explícitamente a qué temas debe y no debe responder el agente.
2 out-of-scope-handling Control fuera de ámbito Ámbito Medio Las instrucciones especifican qué decir cuando un usuario pregunta sobre algo fuera del alcance del agente.
3 persona-and-tone Rol y tono UX Bajo Las instrucciones definen el tono para escenarios no predeterminados. (Profesional/educado ya es lo predeterminado —salta si no es necesario.)
4 privacy-and-sensitive-data Privacidad y datos confidenciales Seguridad Alto Las instrucciones contienen indicaciones explícitas sobre no almacenar, mostrar ni repetir datos personales.
5 fallback-when-uncertain Alternativa en caso de duda Calidad Alto Las instrucciones especifican qué hacer cuando el agente no tiene la información necesaria para responder.
6 citations-and-sources Citas y fuentes Calidad Medio Las instrucciones requieren que el agente cite nombres y secciones de documentos al referenciar fuentes de conocimiento.
7 formatting-guidelines Directrices de formato UX Bajo Las instrucciones especifican el formato de respuesta (viñetas, tablas, pasos numerados) para una salida estructurada.
8 clarifying-questions Preguntas de clarificación UX Medio Las instrucciones abordan cómo gestionar consultas ambiguas haciendo preguntas de seguimiento aclaratorias.
9 prompt-injection-resilience Protección de la inyección de indicaciones Seguridad Alto Las instrucciones incluyen salvaguardas explícitas contra intentos de jailbreak o inyecciones de indicaciones.
10 link-safety Seguridad de vínculos Seguridad Medio Las instrucciones aseguran que solo se compartan enlaces verificados y seguros con los usuarios.
11 advice-disclaimers Descargo de responsabilidades de consejos Seguridad Alto Las instrucciones incluyen descargos de responsabilidades para ámbitos de consejos sensibles (finanzas, salud, legal).
12 accuracy-quality Precisión y calidad Calidad Alto Las instrucciones fundamentan explícitamente al agente en sus fuentes de conocimiento y prohíben falsificaciones o conjeturas.
13 tool-routing-hints Consejos para enrutamiento de herramientas Calidad Medio Las instrucciones proporcionan orientación sobre qué herramientas o fuentes de conocimiento utilizar cuando el enrutamiento es ambiguo.
14 escalation-guidance Directrices de escalación UX Alto Las instrucciones definen qué hacer cuando el agente no puede ayudar: entregar a un humano, sugerir una alternativa o salir con elegancia.
15 deterministic-language Lenguaje determinista Calidad Medio Las instrucciones usan directivas absolutas (siempre, nunca, solo, deben) en lugar de modificadores vagos (podría, normalmente, intentar, a veces).

Captura de pantalla de la pestaña Cumplimiento que muestra los 15 criterios de calidad de instrucciones con estado y gravedad.

Desglose por categorías

Categoría Recuento de criterios Foco
Ámbito 2 Define qué responde el agente y qué no
Seguridad 4 Protege a los usuarios contra la desinformación, filtraciones de datos y manipulación
Calidad 5 Garantiza respuestas precisas, fundamentadas y bien estructuradas
UX 4 Moldea la experiencia conversacional y las rutas de escalación

Cómo se calculan las puntuaciones

Todas las puntuaciones están en una escala de 0 a 100 y son deterministas. Las mismas entradas siempre producen la misma puntuación.

Puntuación del patrón

Pattern Score = (Passed Patterns / Total Patterns) × 100
  • Patrones totales = 10 deterministas y, sin embargo, muchos patrones detectados por la IA se devuelvan (hasta 8).
  • Patrones pasados = contar donde el estado del patrón es pass.
  • El resultado se redondea al entero más cercano.

Ejemplo: 15 patrones en total, 12 aprobados = Puntuación del patrón de 80.

Puntuación de la instrucción

La puntuación de la instrucción utiliza un sistema de puntos ponderado basado en la gravedad inherente de cada criterio:

Gravedad inherente Puntos si se superan Recuento de criterios Puntos máximos
Alto 3 7 21
Medio 2 6 12
Bajo 1 2 2
Total 15 35
Instruction Score = (Earned Points / 35) × 100
  • Para cada uno de los 15 criterios, si no se encuentra ningún problema para ese criterio, se añaden sus puntos de gravedad inherentes.
  • Si se detecta "instrucciones que faltan", todos los criterios fallan y la puntuación es 0.
  • El resultado se fija en 100 y se redondea al entero más cercano.

Ejemplo: 3 criterios altos y 2 medios fallan:

  • Puntos obtenidos: (4 × 3) + (4 × 2) + (2 × 1) = 12 + 8 + 2 = 22 puntos.
  • Puntuación = (22 / 35) × 100 = 63.

Puntuación general

Overall Score = (Pattern Score × 0.5) + (Instruction Score × 0.5)

Ambas dimensiones tienen el mismo peso. Si solo hay una dimensión disponible (por ejemplo, no existen instrucciones), la puntuación de esa dimensión se utiliza directamente.

Guía de colores y etiquetas de puntuación

Intervalo de puntuación Label Color
80 y más Excelente Verde
60 a 79 Bueno Amber
40 a 59 Normal Rojo
Menos de 40 Necesita mejora Rojo

Revisar resultados

Tras finalizar la revisión, el panel de revisión muestra los resultados. El panel tiene tres pestañas.

Pestaña Visión general

La pestaña Resumen te ofrece un resumen de alto nivel:

  • Puntuación global: Un calibre circular de color verde, ámbar o rojo.
  • Puntuación de patrón y Puntuación de instrucción lado a lado.
  • Metadatos del agente: Nombre, entorno, idioma, modo de autenticación, configuración de IA.
  • Resumen generado por IA: Una descripción en lenguaje natural de los hallazgos más significativos.
  • Marca de tiempo de revisión y fuente de datos (entorno en vivo o carga de ZIP).

Captura de pantalla de la pestaña Resumen del panel Revisión que muestra la puntuación general, las puntuaciones de patrón e instrucciones, y el resumen de la IA.

Pestaña de patrones

La pestaña Patrones muestra la cuadrícula completa de los 18 patrones evaluados, con estas columnas:

Columna Description
Estado Aprobado o suspenso
Gravedad Notificación Alta, Media o Baja
Categoría Categoría de patrones (Nombre de modelos, arquitectura, etc.)
Nombre del patrón Nombre completo del patrón
Temas afectados Recuento de temas afectados por este patrón
Acciones Botón Detalles para abrir el panel Detalles del patrón

Puedes ordenar la cuadrícula por cualquier columna. Por defecto, los patrones que fallan aparecen primero, ordenados por gravedad (Alta, luego Media, después Baja).

Pestaña Cumplimiento

La pestaña Cumplimiento muestra los 15 criterios de instrucción:

Columna Description
Estado Aprobado o suspenso
Gravedad Notificación Alta, Media o Baja
Categoría Ámbito, Seguridad, Calidad o Experiencia de usuario
Nombre del criterio Nombre completo del criterio
Problemas encontrados Recuento de problemas específicos bajo este criterio
Acciones Botón Detalles para abrir el panel Detalles de cumplimiento

Exploración en profundidad de detalles del patrón

Cuando seleccionas Detalles en cualquier patrón que falle, se abre el panel Detalles del patrón. Muestra lo siguiente:

  • Nombre y descripción del patrón: Qué comprueba este patrón.
  • Por qué importa: El impacto de este antipatrón en la calidad del agente.
  • Tabla de temas afectados: Cada tema con su valor actual y el reemplazo sugerido por la IA.
  • Recomendación: Una acción concreta para solucionar el problema.
  • Más información: Un enlace directo a la documentación relevante de Microsoft Learn.

Captura de pantalla del panel Detalles del patrón que muestra la descripción del patrón, temas afectados, recomendaciones y enlace Aprender más.

Exploración en profundidad de detalles de cumplimiento

Cuando seleccionas Detalles en cualquier criterio de cumplimiento que falle, se abre el panel Detalles de cumplimiento. Muestra lo siguiente:

  • Nombre, categoría y gravedad del criterio
  • Qué verifica el criterio: Una explicación en lenguaje sencillo
  • Problema específico encontrado: El análisis de la IA sobre lo que falta o está mal
  • Recomendación: Lenguaje o patrones exactos para añadir a las instrucciones del agente
  • Ejemplo: Cuando está disponible, un ejemplo de instrucción conforme
  • Más información: Enlace a la guía relevante de Microsoft Learn

Exportar resultados

Puedes exportar los resultados en tres formatos desde el encabezado del panel de revisión.

Informe PDF

Un informe en PDF pulido y legible para humanos, adecuado para compartir con las partes interesadas o adjuntarlo a una auditoría de gobernanza.

Contenido:

  • Resumen ejecutivo con puntuaciones y métricas clave
  • Resultados de evaluación de patrones (estado, gravedad, temas afectados)
  • Hallazgos de cumplimiento (los 15 criterios)
  • Recomendaciones para cada problema encontrado
  • Metadatos del agente (nombre, entorno, fecha de revisión)

Patrón del nombre de archivo: {AgentName}_review_{YYYY-MM-DD}.pdf

El PDF se genera automáticamente al final de cada revisión y se almacena en Dataverse junto con el registro de la revisión. Las descargas posteriores recuperan el archivo almacenado sin volver a ejecutar el análisis.

Exportación de SARIF

SARIF (Static Analysis Results Interchange Format v2.1.0) es un formato JSON diseñado para la integración con herramientas de desarrollo y canalizaciones CI/CD.

Casos de uso:

  • Cargar a GitHub Advanced Security para anotaciones PR basadas en SARIF
  • Importar en comprobaciones de puertas de calidad de Azure DevOps
  • Procesar con herramientas de terceros que consumen SARIF (SonarQube, Visual Studio Code, etc.)

Visión general de la estructura:

{
  "version": "2.1.0",
  "runs": [{
    "tool": {
      "driver": {
        "name": "Copilot Studio Agent Review Tool",
        "version": "1.0"
      }
    },
    "results": [
      {
        "ruleId": "pat-007",
        "level": "error",
        "message": { "text": "Excessive Tools Usage: 28 tools exceed the recommended limit of 25" },
        "properties": {
          "category": "Architecture",
          "recommendation": "Reduce tool count to 25 or fewer"
        }
      }
    ]
  }]
}

Asignación de gravedad de nivel de SARIF:

  • Alto = "error"
  • Medio = "warning"
  • Bajo = "note"

Patrón del nombre de archivo: {AgentName}_review.sarif

Exportar a Excel

Un libro de Excel de varias hojas para análisis de datos, informes y archivo.

Hoja Contenido
Resumen Una fila por agente revisado: nombre, puntuaciones, número de problemas, fecha de revisión
Patrones Los 18 patrones: ID, nombre, categoría, gravedad, estado, temas afectados, recomendación
Cumplimiento Los 15 criterios: identificación, nombre, categoría, gravedad, estado, número de problemas, recomendación

Los encabezados aparecen en negrita con fondos de color de marca. Las celdas de puntuación y gravedad están codificadas por colores verde, ámbar o rojo. Los anchos de las columnas se ajustan automáticamente.

Patrón del nombre de archivo: {AgentName}_review_{YYYY-MM-DD}.xlsx

Análisis en profundidad de revisión de agentes declarativos

Los agentes declarativos de Microsoft 365 son un tipo diferente que los agentes de Copilot Studio. Se definen completamente mediante un archivo de manifiesto JSON y se implementan en el ecosistema de Microsoft 365.

Qué comprueba la revisión del agente declarativo

La revisión primero valida la estructura del manifiesto, comprobando que todos los campos requeridos estén presentes y que el esquema esté bien formado. A continuación, realiza una evaluación de IA con cinco criterios de calidad y genera un informe PDF. La comprobación de cumplimiento de instrucciones de 15 criterios (específica para agentes de Copilot Studio) no se aplica aquí.

Los 5 criterios de evaluación de agentes declarativos

Criterio Peso Lo que se evalúa
Instrucciones 30 % Claridad, especificidad e integridad de la indicación del sistema del agente
Conocimiento 20 % Uso de fuentes de conocimiento conectadas para fundamentación
Capacidades 15 % Uso de las capacidades de CodeInterpreter y OneDriveAndSharePoint
Acciones 15 % Presencia y calidad de las descripciones de acciones de la herramienta
Ideas para iniciar una conversación 10 % Número y calidad (mínimo 3, recomendado 6)
Manejo elegante de errores 10 % Control de entradas desconocidas y estados de error

Comprobación de salud del manifiesto (validación local)

Antes de que la IA se ejecute, una comprobación determinista de salud valida la estructura del manifiesto:

  • Campos requeridos presentes (name, description, instructions)
  • Compatibilidad de versión de esquema
  • Referencias válidas de complementos de acción
  • Recuento de iniciadores de conversación dentro de los límites (3-12)
  • Declaraciones de capacidad correctamente formadas

Cualquier fallo en la comprobación de salud aparece como un problema en los resultados de la revisión del Agente Declarativo, independientemente de la evaluación de la IA.

Enviar un Agente Declarativo para revisión

A través de carga de ZIP (lo más común):

  1. Exporta el Agente Declarativo desde tu herramienta de creación como un paquete ZIP.
  2. Selecciona Cargar ZIP en el encabezado de la página de la Herramienta de revisión de agentes.
  3. Si el ZIP contiene varios agentes, un panel selector te permite elegir cuál revisar.
  4. La revisión se ejecuta automáticamente.

A través del catálogo de Microsoft 365 (requiere configuración de la Graph API):

  1. Seleccione Conectarse a Microsoft 365 en la pestaña Agentes de Microsoft 365.
  2. Completa el asistente de autorización de la Graph API.
  3. Tus Agentes Declarativos implementados aparecen en la cuadrícula de Agentes Declarativos.
  4. Selecciona Revisión en cualquier agente declarativo.

Captura de pantalla del panel Revisión de Agente Declarativo que muestra resultados de la comprobación de salud del manifiesto y la evaluación de IA.

Seguridad y datos de acceso

Esta sección describe cómo la Herramienta de Revisión de Agentes gestiona la seguridad y el acceso a datos.

Almacenamiento de datos

Todos los resultados de las revisiones se almacenan en la tabla de Dataverse cat_agentreviews. Cada disco almacena:

Campo Contenido
cat_agentreviewsid ID único de registro de revisiones
cat_botid Referencia al agente revisado
cat_overallscore Puntuación general de 0-100
cat_patternscore Puntuación de evaluación de patrones
cat_instructionscore Puntuación de cumplimiento de instrucciones
cat_totalissues Recuento total de incidencias
cat_reviewresultjson Resultado completo de la revisión como JSON
cat_reviewpdfreport_name Informe en PDF (columna de archivo de Dataverse)
cat_sourceenvironment URL o zip de entorno de origen
cat_agenttype 1 = Copilot Studio, 2 = agente declarativo

Seguridad de nivel de fila

La tabla cat_agentreviews utiliza el ámbito de lectura de nivel de usuario (Básico) en Dataverse. Los usuarios solo pueden ver las revisiones que han creado. Las opiniones de otro usuario nunca son visibles, ni siquiera en el mismo entorno. Dataverse aplica esta seguridad de forma nativa, no el código de la aplicación.

Entornos de origen

Los usuarios pueden revisar agentes de los entornos a los que tienen acceso, no solo del entorno actual. El panel permite revisiones entre entornos a través del selector de entornos. Las revisiones de otros entornos están etiquetadas con la URL del entorno de origen para que aparezcan correctamente cuando se carga la herramienta.

Las revisiones obtenidas de una carga de ZIP siempre se muestran independientemente del entorno al que esté conectada la herramienta.

Qué datos salen del entorno

  • La configuración del agente (temas, herramientas, instrucciones) se envía a los modelos de IA a través de Dataverse PredictV2. Esto sigue la ruta estándar de invocación del modelo de IA de Dataverse y está sujeto a las mismas directivas de residencia de datos que cualquier operación de IA de Dataverse.
  • No se envían datos a ningún servicio de terceros ni a un punto de conexión de terceros.
  • Los resultados de la revisión (incluido el PDF) se almacenan exclusivamente en Dataverse.

Experiencia de primera ejecución y visita de bienvenida

La primera vez que un usuario abre la Herramienta de Reseñas de Agentes, una visita de bienvenida le guía por las partes clave de la interfaz:

  1. Las tarjetas de estadísticas del panel y lo que representan
  2. Cómo leer la cuadrícula de agentes
  3. Cómo empezar una revisión
  4. Cómo interpretar resultados
  5. Las opciones de exportación

El progreso de la visita persiste en Dataverse, por lo que la ruta no se repite tras completarse. Los usuarios pueden reabrir la visita en cualquier momento desde la sección Ayuda / Enlaces Rápidos en el encabezado de página.

Preguntas más frecuentes

Esta sección responde a preguntas comunes sobre la Herramienta de Revisión de Agentes.

¿Cuánto tiempo tarda una revisión?

Un agente típico con menos de 20 temas termina en menos de 60 segundos. La herramienta tiene un tiempo de espera estricto de 2 minutos. Agentes muy grandes (más de 50 temas, muchas herramientas) pueden acercarse al límite.

¿La herramienta modifica a mi agente?

No. La herramienta es completamente de solo lectura respecto a los datos del agente. Solo lee la configuración del agente. Todas las escrituras pasan a la tabla cat_agentreviews.

¿Puedo volver a revisar un agente después de hacer cambios?

Sí. Cada revisión crea un nuevo registro. La cuadrícula siempre muestra la revisión más reciente. Las revisiones antiguas permanecen en Dataverse y pueden consultarse mediante programación si es necesario.

¿Y si mi agente está en un entorno diferente?

Usa el selector de entornos en el panel para apuntar la herramienta a otro entorno al que tengas acceso. La revisión se ejecuta en ese entorno y el resultado se almacena en el entorno actual.

¿Puedo revisar agentes que no he creado?

Sí. Puedes revisar cualquier agente al que tengas acceso en Dataverse. Sin embargo, solo puedes ver las revisiones que creaste (seguridad de nivel de fila). Las revisiones de otros usuarios no son visibles.

¿Qué es SARIF y lo necesito?

SARIF es un formato estándar para resultados de análisis estático. Solo lo necesitas si integras controles de calidad de agentes en una canalización CI/CD (Acciones de GitHub o Azure DevOps). Para la mayoría de los usuarios, las exportaciones en PDF y Excel son suficientes.

La herramienta dice que mi agente no tiene instrucciones. ¿Es un problema?

Sí. La herramienta solo muestra agentes que tienen IA generativa activada, por lo que se espera que cada agente en la cuadrícula tenga instrucciones. Si la comprobación de cumplimiento no incluye instrucciones, la orquestación generativa del agente está activa pero aún no se han escrito instrucciones del sistema. Se recomienda encarecidamente añadir instrucciones.

¿Por qué "Persona y tono" es de baja gravedad?

La guía de Microsoft señala que un tono profesional y educado ya es el comportamiento predeterminado para los agentes de Copilot Studio. Las instrucciones para el tono solo son necesarias si quieres un tono no predeterminado. Este criterio es bajo porque fallarlo rara vez causa problemas de atención al usuario.

¿Hacer una revisión consume créditos de Copilot?

Sí. Cada revisión invoca modelos de IA tres veces: para evaluación de patrones, cumplimiento de instrucciones y generación de PDF. Cada invocación consume créditos de Copilot de tu inquilino. Reevaluar al mismo agente también consume créditos, así que haz los cambios primero y luego vuelve a revisar.

¿Puedo exportar todas las revisiones de una vez?

Sí. Utiliza el botón Exportar todo en la barra de herramientas de la cuadrícula de agentes para generar un libro de Excel que cubra todos los agentes revisados en la vista actual.