Analisar agentes usando a Ferramenta de Revisão de Agentes do Kit do agente do Copilot

A Ferramenta de Revisão de Agentes é um sistema automatizado de avaliação de qualidade e de conformidade para agentes do Microsoft Copilot Studio e Agentes Declarativos do Microsoft 365. Ela ajuda criadores, administradores e equipes de governança a identificar problemas, antipadrões e lacunas de conformidade antes que cheguem aos usuários finais.

À medida que as organizações escalam suas implantações do Copilot Studio, revisar manualmente a configuração, as instruções e a estrutura de tópicos de cada agente torna-se impossível. A Ferramenta de Revisão de Agentes automatiza essa análise por meio de análises baseadas em IA, normalmente revelando descobertas acionáveis em menos de 60 segundos.

É para:

  • Criadores: receba comentários acionáveis para melhorar a qualidade dos agentes antes da implantação.
  • Administradores e equipes de CoE: aplique padrões de governança em todos os agentes em um ambiente.
  • Diretores de segurança e conformidade: verifique se os agentes seguem as diretrizes de privacidade, segurança e precisão.

Principais recursos

Recurso Detalhes
Cobertura do agente Agentes do Copilot Studio e Agentes Declarativos do Microsoft 365
Tempo de revisão Normalmente menos de 60 segundos por agente
Padrões verificados 18 padrões (10 determinísticos + 8 da plataforma IA)
Critérios de conformidade 15 critérios de qualidade das instruções
Sistema de pontuação Pontuação geral de 0 a100 (50% padrões, 50% conformidade)
Formatos de exportação PDF, SARIF, Excel
Armazenamento de dados Microsoft Dataverse (segurança aplicada em nível de linha com escopo de usuário)
Mecanismo de IA Prompts de IA do Microsoft Copilot Studio por meio do PredictV2 do Dataverse

Introdução: O painel

Quando você abre a Ferramenta de Avaliação de Agentes, você entra no Painel, o hub central que mostra todos os agentes no seu ambiente e o status de avaliação deles.

Layouts do painel

Captura de tela do painel da Ferramenta de Revisão de Agentes com cartões de estatísticas, grade de agentes e o botão Upload de ZIP.

O painel mostra tudo rapidamente: a barra de abas alternando entre agentes do Copilot Studio e do Microsoft 365, quatro cartões de estatísticas resumindo a integridade do portfólio, uma barra de pesquisa, a grade de agentes paginada e o botão Upload de ZIP para avaliações offline.

Cartões de estatísticas

Os quatro cartões de estatísticas oferecem uma visão instantânea da integridade do seu portfólio de agentes:

Cartão O que ele mostra Como isso é calculado?
Total de agentes Contagem de todos os bots ativos no ambiente. Consulte a tabela bot em que statecode = 0
Revisado Número e porcentagem de agentes avaliados. Contagem de avaliações concluídas dividida pelo total de agentes
Pontuação média Pontuação média geral em todas as avaliações concluídas. Soma das pontuações dividida pela contagem revisada
Total de problemas Problemas acumulados encontrados em todos os agentes avaliados. Soma das falhas de padrão mais falhas de conformidade

Grade de agentes

Coluna Conteúdo
Nome Nome de exibição do agente com ícone.
Pontuação Pontuação geral da avaliação (0 a 100), ou -- se ainda não foi revisada. Codificada por cores.
Saídas Resumo das descobertas de gravidade alta, média e baixa. -- se não foi avaliado.
Última avaliação Tempo relativo (por exemplo, "há 2 horas" ou "há 1 semana"), ou "Não avaliado".
Ações Avaliação para agentes não avaliados; Exibição para agentes com avaliações existentes.

Selecionar um ambiente

Por padrão, a ferramenta mostra agentes do ambiente em que você a instalou. Se precisar revisar um agente de um ambiente diferente, use o seletor de ambiente na barra de ferramentas do painel. A lista suspensa lista todos os ambientes do Power Platform aos quais você tem acesso.

Depois que você seleciona um ambiente diferente, a grade de agentes é atualizada para mostrar os agentes desse ambiente. Você poderá então avaliar qualquer um desses agentes. O resultado da avaliação é armazenado no ambiente atual (inicial), não no que você selecionou.

Captura de tela do seletor de ambiente listando ambientes acessíveis do Power Platform.

Modos de avaliação

A ferramenta oferece suporte a dois modos distintos de avaliação, acessíveis pela barra de guias na parte superior do painel.

Avaliação de agentes do Copilot Studio

Este modo avalia agentes criados no Microsoft Copilot Studio. Ele lê diretamente do Dataverse — não é necessário upload de arquivos.

O que ele analisa:

  • Configurações de tópicos (nomes, descrições, variáveis).
  • Configurações de ferramentas e ações (contagem, descrições, roteamento).
  • Tipos de fonte de conhecimento.
  • Cobertura do caso de teste.
  • Instruções do agente (modo generativo).
  • Metadados do agente (idioma, autenticação, configurações de IA).

Para iniciar uma avaliação:

  1. Encontre seu agente na grade.
  2. Selecione Revisar. O trabalho de análise é iniciado automaticamente.
  3. Um painel de progresso mostra o que está acontecendo em tempo real.
  4. Os resultados são abertos no painel de avaliação após a conclusão.

Você pode avaliar qualquer agente novamente a qualquer momento. Cada avaliação cria um registro no Dataverse. A grade sempre mostra o resultado da avaliação mais recente.

Avaliação de agentes declarativos (Microsoft 365 Copilot)

Este modo avalia os Agentes Declarativos do Microsoft 365, que são definidos por um arquivo JSON de manifesto e implantados no ecossistema do Microsoft 365 Copilot.

Você pode enviar um Agente Declarativo para avaliação de duas maneiras:

método Como Quando usar
Upload de ZIP Selecione Upload de ZIP no cabeçalho da página e selecione o pacote exportado. O agente é de outro locatário ou não está no seu catálogo.
No catálogo do Microsoft 365 Conecte-se ao Microsoft 365 por meio do assistente de instalação da API do Graph e, em seguida, procure os agentes. O agente é implantado no seu locatário do Microsoft 365.

O que ele analisa (5 critérios, não 15):

Critério Peso O que é verificado
Instruções 30% Clareza, integridade e qualidade das instruções para o agente
Conhecimento 20% Fundamentação por meio de fontes de conhecimento conectadas
Capacidades 15% Uso do CodeInterpreter e do OneDriveAndSharePoint
Ações 15% Roteamento de ferramentas e descrições de ações
Iniciadores de Conversa 10% Mínimo 3, recomendado 6 (máximo 12)
Tratamento eficaz de erros 10% Recuperação de erros e comportamentos de fallback

Observação

A verificação de conformidade de instrução com 15 critérios é específica para agentes do Copilot Studio e não se aplica a Agentes Declarativos.

O que acontece durante uma avaliação

Quando você seleciona Avaliar, a ferramenta executa uma análise automatizada que normalmente é concluída em menos de 60 segundos. Um painel de progresso mantém você informado enquanto ele avalia.

Captura de tela do painel de progresso da avaliação mostrando as etapas que são executadas durante uma avaliação de agente.

A análise cobre três pontos em sequência:

  1. Análise da configuração: a ferramenta lê a configuração completa do agente no Dataverse — cada tópico, ferramenta, fonte de conhecimento, caso de teste e instrução. Ela verifica campos ausentes em todos os componentes e mede coisas como contagem de ferramentas e cobertura de testes com base nas melhores práticas documentadas da Microsoft.
  2. Avaliação de padrões baseada em IA: um modelo de IA revisa a mesma configuração para avaliar a qualidade, não só a integridade. Ele analisa se os nomes e descrições dos tópicos são claros o suficiente para que o orquestrador generativo roteie corretamente, se vários tópicos se sobrepõem de formas que causam confusão no roteamento, e se as descrições das ferramentas fornecem à IA orientações suficientes para invocar a ferramenta certa no momento certo.
  3. Verificação de conformidade das instruções: um segundo modelo de IA lê as instruções do sistema do agente e as verifica em relação a 15 critérios de melhores práticas das orientações de modo generativo da Microsoft — abrangendo escopo, segurança, qualidade das respostas e experiência do usuário. Para cada critério que as instruções não atendam, ele revela uma descoberta específica e uma recomendação concreta.

Após a conclusão das três etapas, um relatório em PDF é gerado automaticamente e os resultados são abertos no painel de avaliação.

Importante

Cada avaliação consome créditos do Copilot. As etapas baseadas em IA (avaliação de padrões, verificação de conformidade das instruções e geração de PDF) invocam cada uma um modelo de IA por meio do Dataverse. Planeje de acordo se você estiver avaliando um grande número de agentes.

Padrões detectados

Padrões identificam antipadrões específicos ou melhores práticas ausentes na configuração de um agente. A ferramenta verifica 18 padrões em 7 categorias.

Todos os 18 padrões

ID Nome do padrão Categoria Impacto
pat-001 Nome do modelo ausente Nomeação dos modelos O orquestrador generativo não consegue direcionar para esse tópico de forma confiável.
pat-002 Descrição do modelo ausente Descrição do modelo O tópico pode ser ignorado ou desencadeado incorretamente durante o roteamento.
pat-003 Nome da variável de entrada ausente Variáveis de entrada Os usuários veem variáveis sem nome, causando confusão na conversa.
pat-004 Descrição da variável de entrada ausente Variáveis de entrada A IA não consegue extrair corretamente o valor correto da entrada do usuário.
pat-005 Nome da variável de saída ausente Variáveis de saída Os valores de saída estão sem rótulo e são difíceis de interpretar pelos usuários.
pat-006 Descrição da variável de saída ausente Variáveis de saída A IA não tem contexto para preencher a variável corretamente.
pat-007 Uso excessivo de ferramentas Arquitetura Muitas ferramentas degradam a precisão do roteamento e aumentam a latência.
pat-008 Casos de teste inadequados Avaliação Regressões no comportamento do tópico passam despercebidas antes da implantação.
pat-009 Descrição do agente filho ausente Arquitetura O orquestrador não consegue decidir quando delegar para o agente filho.
pat-010 Expansão da arquitetura do agente filho Arquitetura A delegação excessiva cria complexidade e latência na orquestração.
pat-011 Nome do modelo pouco claro Nomeação dos modelos Nomes vagos fazem o orquestrador rotear para o tópico errado.
pat-012 Descrição do modelo pouco clara Descrição do modelo Descrições ruins levam a gatilhos de tópicos ausentes ou incorretos.
pat-013 Nome da variável de entrada pouco claro Variáveis de entrada Nomes ambíguos dificultam para a IA preencher corretamente a variável.
pat-014 Descrição da variável de entrada pouco clara Variáveis de entrada A IA extrai o valor incorreto ou faz perguntas de esclarecimento desnecessárias.
pat-015 Nome da variável de saída pouco claro Variáveis de saída Tópicos ou fluxos downstream que consomem essa variável podem interpretá-la de forma incorreta.
pat-016 Descrição da variável de saída pouco clara Variáveis de saída A IA não consegue produzir de forma confiável o formato ou valor de saída esperado.
pat-017 Descrições de tópicos sobrepostas Descrição do modelo Vários tópicos competem pelos mesmos enunciados do usuário, causando roteamento imprevisível.
pat-018 Lacuna no roteamento de ferramentas Arquitetura A IA não consegue decidir qual ferramenta chamar, o que leva a invocações incorretas ou nenhuma ação.

Para cada padrão com falha, a ferramenta mostra quais tópicos são afetados, o valor atual que desencadeou a descoberta, uma melhoria sugerida e um link para a documentação relevante do Microsoft Learn.

Captura de tela da guia Padrões listando todos os 18 padrões com status, gravidade, categoria e contagens de tópicos afetados.

Categorias de padrões

A grade de resultados agrupa os padrões em sete categorias, classificadas na seguinte ordem:

# Categoria Padrões incluídos
1 Nomeação dos modelos pat-001, pat-011
2 Descrição do modelo pat-002, pat-012, pat-017
3 Variáveis de entrada pat-003, pat-004, pat-013, pat-014
4 Variáveis de saída pat-005, pat-006, pat-015, pat-016
5 Arquitetura pat-007, pat-009, pat-010, pat-018
6 Orquestração Reservado para futuros padrões detectados por IA
7 Avaliação pat-008

Lógica de gravidade

A combinação de correspondência de palavras-chave e contagem de tópicos determina a gravidade do padrão:

Condição Severidade atribuída
O nome do padrão contém "nome do modelo" ou "descrição do modelo" Alto
O nome do padrão contém "variável" Médio (a menos que o número de tópicos seja cinco ou mais)
A contagem de tópicos é cinco ou mais Alto
A contagem de tópicos é dois ou mais Médio
A contagem de tópicos é um Baixo

A gravidade determina o selo visual na grade de resultados e o nível de erro SARIF no relatório exportado.

Critérios de conformidade

Esta parte da avaliação mede a qualidade das instruções do sistema de um agente — o texto em linguagem natural que o criador fornece nas configurações Generativas do Copilot Studio. Essas instruções definem como o agente se comporta em todas as conversas.

Os 15 critérios derivam das orientações de modo generativo da Microsoft e representam as melhores práticas mais impactantes para a qualidade da instrução.

Todos os 15 critérios

# ID Nome do critério Categoria Gravidade O que ela verifica
1 scope-definition Definição de escopo Escopo Alta As instruções do agente definem explicitamente a quais tópicos o agente deve ou não responder.
2 out-of-scope-handling Tratamento de fora do escopo Escopo Medium As instruções especificam o que dizer quando um usuário pergunta sobre algo fora do escopo do agente.
3 persona-and-tone Persona e tom UX Baixo As instruções definem o tom para cenários não padrão. (Profissional/educado já é o padrão — ignore se não for necessário.)
4 privacy-and-sensitive-data Privacidade e dados confidenciais Segurança Alta As instruções contêm orientações explícitas sobre não armazenar, exibir ou repetir dados pessoais.
5 fallback-when-uncertain Fallback em caso do incerteza Qualidade Alta As instruções especificam o que fazer quando o agente não tem as informações necessárias para responder.
6 citations-and-sources Citações e fontes Qualidade Medium As instruções exigem que o agente cite nomes e seções de documentos ao fazer referência a fontes de conhecimento.
7 formatting-guidelines Diretrizes de formatação UX Baixo As instruções especificam o formato da resposta (tópicos, tabelas, etapas numeradas) para uma saída estruturada.
8 clarifying-questions Perguntas de esclarecimento UX Medium As instruções abordam como lidar com consultas ambíguas fazendo perguntas de acompanhamento para esclarecimento.
9 prompt-injection-resilience Proteção contra injeção de prompts Segurança Alta As instruções incluem proteções explícitas contra tentativas de desbloqueio por jailbreak ou injeção de prompts.
10 link-safety Segurança do link Segurança Medium As instruções garantem que somente links verificados e seguros sejam compartilhados com os usuários.
11 advice-disclaimers Avisos de isenção de responsabilidade de conselhos Segurança Alta As instruções incluem avisos de isenção de responsabilidade para áreas de aconselhamento sensíveis (finanças, saúde, legal).
12 accuracy-quality Precisão e qualidade Qualidade Alta As instruções fundamentam explicitamente o agente em suas fontes de conhecimento e proíbem a fabricação ou suposição.
13 tool-routing-hints Dicas de roteamento de ferramentas Qualidade Medium As instruções fornecem orientações sobre quais ferramentas ou fontes de conhecimento usar quando o roteamento é ambíguo.
14 escalation-guidance Orientações de escalonamento UX Alta As instruções definem o que fazer quando o agente não pode ajudar: transferir para um humano, sugerir uma alternativa ou sair normalmente.
15 deterministic-language Linguagem determinística Qualidade Medium As instruções usam diretrizes absolutas (sempre, nunca, somente, deve) em vez de modificadores vagos (pode, geralmente, tentar, às vezes).

Captura de tela da guia Conformidade mostrando os 15 critérios de qualidade das instruções com status e gravidade.

Detalhamento das categorias

Categoria Contagem de critérios Foco
Escopo 2 Define o que o agente faz e o que não responde
Segurança 4 Protege os usuários contra desinformação, vazamento de dados e manipulação
Qualidade 5 Garante respostas precisas, fundamentadas e bem estruturadas
UX 4 Molda a experiência de conversa e os caminhos de escalonamento

Como as pontuações são calculadas

Todas as pontuações estão na escala de 0 a 100 e são determinísticas. As mesmos entradas sempre produzem a mesma pontuação.

Pontuação do padrão

Pattern Score = (Passed Patterns / Total Patterns) × 100
  • Padrões totais = 10 determinísticos + quantos padrões detectados pela IA forem retornados (até 8).
  • Padrões aprovados = contagem em que o status do padrão é pass.
  • O resultado é arredondado para o inteiro mais próximo.

Exemplo: 15 padrões no total, 12 aprovados = Pontuação do Padrão de 80.

Pontuação da instrução

A pontuação da instrução usa um sistema de pontos ponderados com base na gravidade inerente de cada critério:

Gravidade inerente Pontos se aprovados Contagem de critérios Pontos máximos
Alta 3 7 21
Medium 2 6 12
Baixo 1 2 2
Total 15 35
Instruction Score = (Earned Points / 35) × 100
  • Para cada um dos 15 critérios, se não for encontrado nenhum problema para esse critério, seus pontos de severidade inerentes serão adicionados.
  • Se forem detectadas "instruções ausentes", haverá falha em todos os critérios e a pontuação será 0.
  • O resultado é limitado a 100 e arredondado para o inteiro mais próximo.

Exemplo: 3 critérios Alto e 2 Médio têm falha:

  • Pontos ganhos: (4 × 3) + (4 × 2) + (2 × 1) = 12 + 8 + 2 = 22 pontos.
  • Pontuação = (22 / 35) × 100 = 63.

Pontuação geral

Overall Score = (Pattern Score × 0.5) + (Instruction Score × 0.5)

Ambas as dimensões têm peso igual. Se somente uma dimensão estiver disponível (por exemplo, não existirem instruções), a pontuação dessa dimensão será usada diretamente.

Guia de cores e rótulos da pontuação

Intervalo de pontuação Rótulo Cor
80 e acima Excelente Verde
60 a 79 Bom Amber
40 a 59 Razoável Vermelho
Abaixo de 40 Precisa de melhoria Vermelho

Analisar resultados

Após o término da avaliação, o painel de avaliação exibe os resultados. O painel tem três guias.

Guia Visão geral

A guia Visão Geral oferece um resumo de alto nível:

  • Pontuação geral: um medidor circular colorido em verde, amarelo ou vermelho.
  • Pontuação do padrão e Pontuação da instrução lado a lado.
  • Metadados do agente: nome, ambiente, idioma, modo de autenticação, configurações de IA.
  • Resumo gerado por IA: uma descrição em linguagem natural das descobertas mais significativas.
  • Carimbo de data/hora da avaliação e a fonte dos dados (ambiente ativo ou upload do ZIP).

Captura de tela da guia Visão Geral do painel de Avaliação mostrando o medidor da pontuação geral, pontuações de padrões e de instruções e resumo de IA.

Guia Padrões

A guia Padrões mostra a grade completa de todos os 18 padrões avaliados, com estas colunas:

Coluna descrição
Status Aprovação ou reprovação
Gravidade Selo Alta, Média ou Baixa
Categoria Categoria de padrões (Nomeação do modelo, Arquitetura etc.)
Nome do padrão Nome completo do padrão
Tópicos afetados Contagem de tópicos afetados por esse padrão
Ações Botão Detalhes para abrir o painel Detalhes do Padrão

Você pode classificar a grade por qualquer coluna. Por padrão, padrões com falha aparecem primeiro, classificados por gravidade (Alta, Média e Baixa).

Guia Conformidade

A guia Conformidade mostra todos os 15 critérios de instrução:

Coluna descrição
Status Aprovação ou reprovação
Gravidade Selo Alta, Média ou Baixa
Categoria Escopo, Segurança, Qualidade ou UX
Nome do critério Nome completo do critério
Problemas encontrados Contagem de problemas específicos sob esse critério
Ações Botão Detalhes para abrir o painel Detalhes da Conformidade

Detalhamento do padrão

Quando você seleciona Detalhes de qualquer padrão com falha, o painel Detalhes do Padrão é aberto. Ela mostra:

  • Nome e descrição do padrão: o que esse padrão verifica.
  • Por que isso importa: o impacto desse antipadrão na qualidade do agente.
  • Tabela de tópicos afetados: cada tópico com seu valor atual e a substituição sugerida pela IA.
  • Recomendação: uma ação concreta para resolver o problema.
  • Saiba mais: um link direto para a documentação relevante do Microsoft Learn.

Captura de tela do painel Detalhes do Padrão mostrando a descrição do padrão, os tópicos afetados, a recomendação e o link Saiba mais.

Detalhamento da conformidade

Quando você seleciona Detalhes em qualquer critério de conformidade com falha, o painel Detalhes da Conformidade é aberto. Ela mostra:

  • Nome do critério, categoria e gravidade
  • O que o critério verifica: uma explicação em linguagem simples
  • Problema específico encontrado: a análise da IA sobre o que está ausente ou incorreto
  • Recomendação: linguagem ou padrões exatos para adicionar às instruções do agente
  • Exemplo: quando disponível, um exemplo de instrução em conformidade
  • Saiba mais: link para as orientações relevantes do Microsoft Learn

Exportar resultados

Você pode exportar resultados em três formatos a partir do cabeçalho do painel de avaliação.

Relatório em PDF

Um relatório em PDF bem elaborado, legível por humanos, adequado para compartilhamento com stakeholders ou anexado a uma auditoria de governança.

Conteúdo:

  • Resumo executivo com pontuações e principais métricas
  • Resultados da avaliação de padrões (status, gravidade, tópicos afetados)
  • Descobertas de conformidade (todos os 15 critérios)
  • Recomendações para cada problema encontrado
  • Metadados do agente (nome, ambiente, data da avaliação)

Padrão do nome do arquivo: {AgentName}_review_{YYYY-MM-DD}.pdf

O PDF é gerado automaticamente ao final de cada avaliação e armazenado no Dataverse junto com o registro da avaliação. Downloads subsequentes recuperam o arquivo armazenado sem executar novamente a análise.

Exportação de SARIF

SARIF (Static Analysis Results Interchange Format v2.1.0) é um formato JSON projetado para integração com ferramentas para desenvolvedores e pipelines de CI/CD.

Casos de uso:

  • Upload para o GitHub Advanced Security para anotações de PR baseadas em SARIF
  • Importar para verificações de portão de qualidade do Azure DevOps
  • Processar com ferramentas de terceiros que consomem SARIF (SonarQube, Visual Studio Code, entre outras)

Visão geral da estrutura:

{
  "version": "2.1.0",
  "runs": [{
    "tool": {
      "driver": {
        "name": "Copilot Studio Agent Review Tool",
        "version": "1.0"
      }
    },
    "results": [
      {
        "ruleId": "pat-007",
        "level": "error",
        "message": { "text": "Excessive Tools Usage: 28 tools exceed the recommended limit of 25" },
        "properties": {
          "category": "Architecture",
          "recommendation": "Reduce tool count to 25 or fewer"
        }
      }
    ]
  }]
}

Mapeamento do nível de gravidade para SARIF:

  • Alta = "error"
  • Média = "warning"
  • Baixa = "note"

Padrão do nome do arquivo: {AgentName}_review.sarif

Exportação do Excel

Uma pasta de trabalho do Excel com várias planilhas para análise de dados, relatórios e arquivamento.

Planilha Conteúdo
Resumo Uma linha por agente avaliado — nome, pontuações, contagem de problemas, data da avaliação
Padrões Todos os 18 padrões — ID, nome, categoria, gravidade, status, tópicos afetados, recomendação
Conformidade Todos os 15 critérios — ID, nome, categoria, gravidade, status, contagem de problemas, recomendação

Os cabeçalhos são em negrito com planos de fundo com as cores da marca. As células de pontuação e gravidade são codificadas por cores verde, amarelo ou vermelho. As larguras das colunas se ajustam automaticamente.

Padrão do nome do arquivo: {AgentName}_review_{YYYY-MM-DD}.xlsx

Aprofundamento sobre a avaliação de agente declarativo

Os Agentes Declarativos do Microsoft 365 são um tipo diferente de agente dos agentes do Copilot Studio. Eles são definidos inteiramente por um arquivo de manifesto JSON e implantados no ecossistema do Microsoft 365.

O que a avaliação do Agente Declarativo verifica

A avaliação primeiro valida a estrutura do manifesto, verificando que todos os campos exigidos estejam presentes e que o esquema esteja bem formado. Em seguida, executa uma avaliação de IA em relação aos cinco critérios de qualidade e gera um relatório em PDF. A verificação de conformidade das instruções com 15 critérios (específica para agentes do Copilot Studio) não se aplica aqui.

Os cinco critérios de avaliação do Agente Declarativo

Critério Peso O que é avaliado
Instruções 30% Clareza, especificidade e integridade do prompt do sistema do agente
Conhecimento 20% Uso de fontes de conhecimento conectadas para fundamentação
Capacidades 15% Uso dos recursos do CodeInterpreter e OneDriveAndSharePoint
Ações 15% Presença e qualidade das descrições de ações da ferramenta
Iniciadores de Conversa 10% Contagem e qualidade (mínimo 3, recomendado 6)
Tratamento eficaz de erros 10% Tratamento de entradas desconhecidas e estados de erro

Verificação da integridade do manifesto (validação local)

Antes da execução da IA, um exame determinístico de integridade valida a estrutura do manifesto:

  • Campos obrigatórios presentes (name, description, instructions)
  • Compatibilidade de versão do esquema
  • Referências de plug-ins de ação válidas
  • Contagem de iniciadores de conversa dentro dos limites (3 a 12)
  • Declarações de capacidades corretamente formadas

Qualquer falha na verificação de integridade aparece como problemas nos resultados da avaliação do Agente Declarativo, independentemente da avaliação da IA.

Enviar um Agente Declarativo para avaliação

Via upload de ZIP (mais comum):

  1. Exporte o Agente Declarativo da sua ferramenta de criação como um pacote ZIP.
  2. Selecione Upload de ZIP no cabeçalho da página Ferramenta de Avaliação de Agentes.
  3. Se o ZIP contiver vários agentes, um painel seletor permitirá que você escolha qual deles deve avaliar.
  4. A avaliação é feita automaticamente.

Por meio do catálogo do Microsoft 365 (requer configuração da API do Graph):

  1. Selecione Conectar-se ao Microsoft 365 na guia Agentes do Microsoft 365.
  2. Conclua o assistente de autorização da API do Graph.
  3. Seus Agentes Declarativos implantados aparecem na grade de Agentes Declarativos.
  4. Selecione Avaliar em qualquer Agente Declarativo.

Captura de tela do painel Avaliação de Agente Declarativo mostrando resultados da verificação de integridade do manifesto e a avaliação de IA.

Segurança e acesso a dados

Esta seção descreve como a Ferramenta de Revisão de Agentes lida com a segurança e o acesso a dados.

Armazenamento de dados

Todos os resultados da avaliação são armazenados na tabela cat_agentreviews do Dataverse. Cada registro armazena:

Campo Conteúdo
cat_agentreviewsid ID exclusiva de registro de avaliação
cat_botid Referência ao agente avaliado
cat_overallscore Pontuação geral de 0 a 100
cat_patternscore Pontuação da avaliação de padrões
cat_instructionscore Pontuação da conformidade das instruções
cat_totalissues Contagem total de problemas
cat_reviewresultjson Resultado completo da avaliação como JSON
cat_reviewpdfreport_name Relatório em PDF (coluna de arquivo do Dataverse)
cat_sourceenvironment URL do ambiente de origem ou zip
cat_agenttype 1 = Copilot Studio, 2 = Agente Declarativo

Segurança no nível da linha

A tabela cat_agentreviews usa o escopo de leitura em nível de usuário (Básico) no Dataverse. Os usuários podem ver somente as avaliações que criaram. As avaliações de outro usuário nunca ficam visíveis, mesmo no mesmo ambiente. O Dataverse aplica essa segurança nativamente, não o código do aplicativo.

Ambientes de origem

Os usuários podem avaliar agentes de ambientes aos quais têm acesso, não apenas do ambiente atual. O painel oferece suporte a revisões entre ambientes por meio do seletor de ambiente. Avaliações de outros ambientes são marcadas com a URL do ambiente de origem para que apareçam corretamente quando a ferramenta é carregada.

Avaliações obtidas a partir de um upload de ZIP sempre são exibidas, independentemente do ambiente ao qual a ferramenta está conectada.

Quais dados deixam o ambiente

  • A configuração do agente (tópicos, ferramentas, instruções) é enviada aos modelos de IA por meio do PredictV2 do Dataverse. Isso segue o caminho padrão de invocação do modelo de IA do Dataverse e está sujeito às mesmas políticas de residência de dados que qualquer operação de IA do Dataverse.
  • Nenhum dado é enviado para nenhum serviço de terceiros ou ponto de extremidade externo.
  • Os resultados da revisão (incluindo o PDF) são armazenados exclusivamente no Dataverse.

Experiência de primeira execução e tour de boas-vindas

Na primeira vez que um usuário abre a Ferramenta de Avaliação de Agentes, um tour de boas-vindas o guia pelas partes principais da interface:

  1. Os cartões de estatísticas do painel e o que eles representam
  2. Como ler a grade de agentes
  3. Como iniciar uma avaliação
  4. Como interpretar os resultados
  5. As opções de exportação

O progresso do tour persiste no Dataverse para que o tour não se repita após o término. Os usuários podem reabrir o tour a qualquer momento na seção Ajuda/Links Rápidos no cabeçalho da página.

Perguntas frequentes

Esta seção responde a perguntas comuns sobre a Ferramenta de Avaliação de Agentes.

Quanto tempo leva uma avaliação?

Um agente típico com menos de 20 tópicos termina em menos de 60 segundos. A ferramenta tem um tempo limite de dois minutos. Agentes muito grandes (mais de 50 tópicos, muitas ferramentas) podem chegar perto do limite.

A ferramenta modifica meu agente?

Não. A ferramenta é totalmente somente leitura em relação aos dados do agente. Ele só lê a configuração do agente. Todas as gravações vão para a tabela cat_agentreviews.

Posso reavaliar um agente após fazer alterações?

Sim. Cada avaliação cria um registro. A grade sempre mostra a avaliação mais recente. Avaliações antigas permanecem no Dataverse e podem ser acessadas de forma programática se necessário.

E se meu agente estiver em um ambiente diferente?

Use o seletor de ambiente no painel para apontar a ferramenta para outro ambiente ao qual você tenha acesso. A avaliação é executada em relação a esse ambiente e o resultado é armazenado no ambiente atual.

Posso avaliar agentes que não criei?

Sim. Você pode avaliar qualquer agente ao qual tiver acesso no Dataverse. No entanto, você pode ver somente as avaliações que criou (segurança em nível de linha). Avaliações de outros usuários não ficam visíveis.

O que é SARIF e eu preciso dele?

SARIF é um formato padrão para resultados de análise estática. Você só precisa disso se estiver integrando verificações de qualidade de agentes em um pipeline de CI/CD (GitHub Actions ou Azure DevOps). Para a maioria dos usuários, exportações em PDF e Excel são suficientes.

A ferramenta diz que meu agente não tem instruções. Isso é um problema?

Sim. A ferramenta só mostra agentes que tenham IA generativa ativada, então todo agente na grade deve ter instruções. Se a verificação de conformidade não reportar instruções, a orquestração generativa do agente está ativa, mas nenhuma instrução do sistema foi gravada ainda. Adicionar instruções é altamente recomendável.

Por que "Persona e Tom" é de baixa gravidade?

A orientação da Microsoft observa que um tom profissional e educado já é o comportamento padrão para os agentes do Copilot Studio. Instruções para o tom só são necessárias se você quiser um tom que não seja padrão. Esse critério é Baixo porque falha nele raramente causa problemas para o usuário.

Fazer uma avaliação consome créditos do Copilot?

Sim. Cada avaliação invoca modelos de IA três vezes — para avaliação de padrões, conformidade das instruções e geração de PDFs. Cada invocação consome créditos do Copilot do seu locatário. Reavaliar o mesmo agente também consome créditos, portanto, faça suas alterações primeiro e depois reavalie.

Posso exportar todas as avaliações de uma vez?

Sim. Use o botão Exportar Tudo na barra de ferramentas da grade de agentes para gerar uma pasta de trabalho do Excel abrangendo todos os agentes avaliados na exibição atual.