Configurar pruebas en Copilot Agent Kit

Las pruebas son esenciales para asegurar que tus agentes personalizados en Copilot Agent Kit respondan y se comporten como se espera. Este artículo explica cómo crear, gestionar y validar diferentes tipos de pruebas, incluyendo escenarios de varios turnos. También puedes realizar operaciones masivas con Excel y duplicar conjuntos de pruebas.

Tipos de pruebas

Crea varios tipos de pruebas para validar a tus agentes.

Tipo de prueba Description
Coincidencia de respuesta Este es el tipo de prueba más sencillo. Compara la respuesta del agente con la respuesta esperada utilizando el operador de comparación seleccionado.
De forma predeterminada, se utiliza la coincidencia exacta ("es igual a"). Otros operadores de comparación disponibles son "No es igual a", "Contiene", "No contiene", "Empieza con", "No empieza con", "Finaliza con" y "No finaliza con".
Datos adjuntos (como tarjetas adaptables) Compara la respuesta JSON de datos adjuntos del agente con el JSON de datos adjuntos esperado (matriz completa de datos adjuntos).
De forma predeterminada, se utiliza coincidencia exacta ("es igual a"). Otros operadores de comparación disponibles son "No es igual", "Contiene" y "No contiene". Un operador especial de comparación llamado "Validación IA" utiliza modelos de lenguaje para validar el adjunto según las instrucciones de validación proporcionadas por el creador, similar a las respuestas generativas.
Coincidencia de tema Solo está disponible cuando se configura el enriquecimiento de Dataverse (enriquecer con transcripciones de conversación).
Cuando finaliza el paso de enriquecimiento de Dataverse, esta prueba compara el nombre del tema esperado con el nombre del tema activado. Las pruebas de coincidencia de tema también admiten coincidencia de varios temas con agentes personalizados que tienen habilitada la orquestación generativa. En la coincidencia multitema, los temas están separados por comas; por ejemplo: "Tema1,Tema2".
Respuestas generativas Solo está disponible si se configura el enriquecimiento de AI Builder (Analizar respuestas generadas).
Utiliza un modelo de lenguaje avanzado para determinar si la respuesta generada por IA se acerca a una respuesta de muestra o cumple las instrucciones de validación.
Cuando Enrich With Aplicación de Azure Insights está configurado, también se pueden ejecutar pruebas negativas, como moderación o ausencia de resultados de búsqueda. Más información en Uso de rúbricas en pruebas.
Multiturno Consiste en uno o más casos de prueba de otros tipos, como coincidencia de respuestas, adjuntos, coincidencia de temas y respuestas generativas. Todas las pruebas secundarias de una prueba de varios turnos se ejecutan en el mismo contexto de conversación en el orden especificado. Usa pruebas multiturno para probar un escenario de un extremo a otro, y para probar agentes personalizados con orquestación generativa. Más información en pruebas multiturno.
Plan de validación Permite al creador validar que el plan dinámico del agente personalizado incluye las herramientas esperadas. Este tipo de prueba está destinado a agentes personalizados de Copilot Studio con la orquestación generativa habilitada. Obtén más información en Pruebas de Validación de Plan.

Crear un nuevo conjunto de pruebas

Utiliza conjuntos de pruebas para agrupar varias pruebas. Cuando ejecutes pruebas, selecciona un conjunto de pruebas para ejecutar todas las pruebas de ese conjunto.

  1. Accede a la aplicación Copilot Agent Kit.
  2. Ve a Conjuntos de pruebas.
  3. Cree un nuevo registro del conjunto de pruebas para el agente.
  4. Escriba un Nombre.
  5. Seleccione Guardar.

Crear una prueba nueva

Después de crear un conjunto de pruebas, agréguele pruebas. Desde la subcuadrícula Pruebas, selecciona + Nueva prueba de agente.

Captura de pantalla de la interfaz Crear prueba del agente en Copilot Agent Kit con el botón Nueva prueba del agente resaltado.

La siguiente tabla describe los campos.

Nombre de columna Obligatorio Descripción
Nombre Nombre de la prueba. Este nombre puede ser un ID de referencia interno, como TST-001.
Conjunto de pruebas del agente Conjunto de pruebas principal para la prueba.
Tipo de prueba Uno de los tipos de prueba disponibles.
Enviar evento startConversation No Si está habilitado, el agente recibe el evento startConversation para que inicie la conversación de manera proactiva, y el enunciado de prueba se envía después. Esta configuración normalmente se requiere cuando el tema de inicio de conversación incluye lógica que debe ejecutarse antes de responder al usuario o al enunciado de prueba.
Posición esperada del mensaje de respuesta No No asignes un valor si no estás seguro. Esta opción te permite capturar una respuesta específica del agente cuando envía varios mensajes. Por ejemplo, si el agente primero dice "Hola" y luego "¿Cómo puedo ayudarte?", y deseas probar el segundo mensaje, establece el valor en 1. El orden se basa en 0, así que el primer mensaje se indexa como 0, la segunda respuesta como 1, y así sucesivamente.
Enunciado de prueba El mensaje que desea enviar al agente como parte de la prueba.
Respuesta esperada Depende Obligatorio en el tipo de prueba Coincidencia de respuesta. Respuesta esperada del agente Para una prueba de Respuestas Generativas, configura una respuesta de muestra o tus propias instrucciones de validación para el modelo de lenguaje grande.
Variable JSON externas No Registro JSON de cualquier valor externo o contextual que desees pasar al agente como parte de la prueba. Por ejemplo: { "Language": "fr" }
Segundos antes de obtener la respuesta No Cantidad de segundos que se deben esperar antes de evaluar la respuesta del bot. En la mayoría de los casos, puedes dejar este valor vacío, pero es útil en situaciones en las que el agente llama a una API y la respuesta puede tardar más de lo habitual.
Resultado esperado de respuestas generativas Depende Obligatorio para el tipo de prueba de Respuestas Generativas. Debe ser Respondido o No Respondido. Cuando el enriquecimiento de Aplicación de Azure Insights está habilitado, puedes elegir Moderado o Sin resultados de búsqueda.
Nombre del tema esperado Depende Obligatorio para el tipo de prueba Coincidencia de tema. Nombre del tema que esperas que se active. La coincidencia de varios temas se admite con agentes personalizados que tienen habilitada la orquestación generativa. Para coincidencia de múltiples temas, utiliza una lista separada por comas; por ejemplo: "Topic1,Topic2". No agregues espacio en blanco extra. La coincidencia multitema asegura que los temas esperados estén entre los temas del plan.
JSON de los adjuntos esperados Depende Obligatorio para el tipo de prueba de datos adjuntos (tarjetas adaptables, etc.). Array JSON completo de adjuntos que se espera de la respuesta del agente.
Herramientas esperadas Depende Obligatorio para el tipo de prueba Validación del plan. Lista separada por comas de herramientas esperadas (herramientas, acciones y agentes conectados). No agregues espacio en blanco extra. El orden no es relevante. Ejemplo: "Clima,Cambio climático"
% del umbral de paso Depende Obligatorio para el tipo de prueba Validación del plan. El porcentaje de herramientas esperadas que deben estar en el plan dinámico para que la prueba pase. Si el porcentaje es 100, todas las herramientas esperadas deben estar en el plan dinámico para que la prueba pase. Las herramientas adicionales en el plan dinámico no afectan el resultado de la prueba.

Pruebas multiturno

Para el tipo de prueba multiturno, especifique una o varias pruebas secundarias de tipos normales. Cada prueba secundaria tiene un orden y una importancia crítica. El orden define el orden de ejecución dentro del mismo contexto de conversación (dentro del caso de prueba de varios turnos). La criticidad define si el caso de prueba secundario debe pasar para que la ejecución de la prueba multiturno continúe.

Captura de pantalla de la configuración de pruebas multiturno en Copilot Agent Kit.

Si una prueba secundaria requiere evaluación de pruebas posteriores, como Coincidencia de tema o Respuestas generativas, la prueba queda en estado pendiente y la ejecución de la prueba continúa independientemente del estado de gravedad. Si alguna de las pruebas críticas falla, la ejecución de la prueba de varios turnos se detiene y su resultado se considera fallido. Si se superan todos los casos de pruebas secundarias críticas, el resultado del multiturno también es correcto.

Captura de pantalla de la vista de resultados de varios turnos en Copilot Agent Kit.

Utilice casos de prueba secundarios no críticos para "alimentar" a los agentes personalizados con información mediante orquestación generativa. También puedes usar estos casos de prueba cuando la respuesta no importa y quieres prepararte para pruebas críticas.

Pruebas de validación de planes

La validación de planes se centra en la corrección de las herramientas. En lugar de evaluar lo que dice el agente, este tipo de prueba comprueba si las herramientas esperadas se usaron durante el plan.

Al definir una prueba de validación de planes, especifique:

  • Enunciado de prueba
  • Una lista separada por comas de las herramientas esperadas para incluir en el plan dinámico
  • Umbral de paso, que representa la cantidad de desviación que se tolerará en la lista

Esta prueba utiliza transcripciones de conversación y se evalúa después de la ejecución real como una actividad de enriquecimiento.

Tenga en cuenta lo siguiente:

  • Herramientas esperadas: incluya herramientas, acciones y agentes conectados en la lista delimitada por comas. No agregues espacio en blanco extra. El orden no importa.

  • Umbral de aprobación %: El umbral de aprobación especifica el porcentaje requerido de herramientas esperadas que deben estar en el plan dinámico para que la prueba tenga éxito.

La validación de planes es una prueba determinista: calcula la desviación de las herramientas reales respecto a las esperadas y la compara con el umbral de aprobado. Si la desviación está dentro del umbral, la prueba se aprueba; de lo contrario, falla.

Captura de pantalla del tipo de prueba de validación del plan en Copilot Agent Kit.

Obtenga más información en Orquestar el comportamiento del agente con IA generativa.

Agentes de prueba que requieren autorización del conector

Cuando un agente utiliza una fuente de datos externa como SharePoint o Dataverse, la primera conversación suele presentar una tarjeta de autorización "Conectar para continuar". El usuario debe seleccionar Permitir antes de que el agente pueda llamar al conector. Para ejercitar este flujo en una prueba automatizada, modela la indicación y la respuesta del usuario como dos pruebas secundarias dentro de una prueba de varios turnos.

Nota

Esta es una configuración única por conjunto de pruebas. Una vez autorizada la conexión para el usuario de prueba, no necesitas repetir los pasos de autorización en pruebas posteriores.

La prueba de varios turnos contiene dos pruebas secundarias ordenadas:

Ordenar Tipo de prueba Tipo de operación Objetivo
1 Datos adjuntos (tarjetas adaptables, etc.) Operadores de comparación Envía la enunciación que activa el conector y la enuncia en el JSON de tarjeta de autorización.
2 Datos adjuntos (tarjetas adaptables, etc.) Invocar acciones Envía Permitir en la tarjeta de autorización para que el agente pueda completar la llamada.

Para crear una prueba:

  1. En tu conjunto de pruebas, selecciona + Nueva prueba de agente, introduce un nombre, establece Tipo de prueba en Multiturno y selecciona Guardar.

  2. En la cuadrícula secundaria de la prueba de varios turnos, selecciona + Nueva prueba de agente y configura la primera prueba secundaria:

    Campo Valor
    Tipo de prueba Datos adjuntos (tarjetas adaptables, etc.)
    Ordenar 1
    Enunciado de prueba El enunciado que activa el conector, por ejemplo List Fourth Coffee Brands.
    Tipo de operación Operadores de comparación
    Operadores de comparación Igual a
    JSON de los adjuntos esperados [] (marcador — lo reemplazas después de la primera ejecución)

    Seleccione Guardar prueba.

  3. Guarde el conjunto de pruebas y ejecútelo. La primera prueba secundaria falla como se esperaba, porque el JSON provisional no coincide con la tarjeta de autorización.

  4. Abre los resultados de la prueba, selecciona la prueba secundaria multiturno, localiza la sección Datos adjuntos y copia el JSON de datos adjuntos al portapapeles.

  5. Edita la primera prueba hija, pega el JSON copiado en JSON de datos adjuntos esperados y selecciona Guardar prueba.

  6. En la cuadrícula secundaria de la prueba de varios turnos, selecciona + Nueva prueba de agente otra vez y configura la segunda prueba secundaria:

    Campo Valor
    Tipo de prueba Datos adjuntos (tarjetas adaptables, etc.)
    Ordenar 2
    Tipo de operación Invocar acciones
    Carga de tarjeta adaptable {"action": "Allow", "id": "submit", "shouldAwaitUserInput": true}
    Operadores de comparación Contiene datos (o Igual a, dependiendo de la respuesta que quieras enunciar)
    Respuesta esperada Déjalo en blanco, o ponlo en función de los datos que esperas después de permitir la conexión.

    Los valores de la carga provienen del JSON de tarjeta adaptativa que capturaste en el paso 4. Ajusta los campos action y id si tu tarjeta de conector usa identificadores diferentes.

    Seleccione Guardar prueba.

  7. Guarde el conjunto de pruebas y ejecútelo de nuevo. Ambas pruebas secundarias deberían aprobarse ahora.

Cuando esta prueba de varios turnos se ejecuta correctamente una vez, la conexión se autoriza para el usuario de prueba y las pruebas posteriores contra el mismo conector pueden crearse como pruebas regulares de un solo turno.

Use Excel para crear o actualizar pruebas en masa

Después de crear un conjunto de pruebas, puede usar Excel para crear o actualizar pruebas en masa.

  1. Desde el registro de tu conjunto de pruebas, cambia la vista de subcuadrícula de Pruebas a Vista de exportación/importación.
  2. Selecciona Exportar Pruebas de Agente en Excel Online.
  3. Añade y modifica pruebas según sea necesario.
  4. Seleccione Guardar.

Si va a importar pruebas secundarias de varios turnos, primero debe crear o importar la prueba multiturno principal real. A continuación, importe los casos de prueba secundarios.

Obtén más información en Importación y exportación en Excel en aplicaciones basadas en modelo de Power Apps.

Duplicar pruebas y conjuntos de pruebas

Puedes duplicar tanto conjuntos de pruebas como pruebas individuales.

  • Para duplicar un caso de prueba individual, abra el registro de prueba del agente y seleccione Duplicar caso de prueba. Esta acción es útil cuando se crean variantes de un caso de prueba, como cambiar la ubicación, la hora o la cantidad.

  • Para duplicar un conjunto de pruebas completo, abre el registro del conjunto de pruebas y selecciona Duplicar conjunto de pruebas desde la barra de comandos. Esta acción crea una copia del conjunto de pruebas junto con todas sus pruebas secundarias.

Paso siguiente