Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
A Ferramenta de Revisão de Agentes é um sistema automatizado de avaliação de qualidade e de conformidade para agentes do Microsoft Copilot Studio e Agentes Declarativos do Microsoft 365. Ela ajuda criadores, administradores e equipes de governança a identificar problemas, antipadrões e lacunas de conformidade antes que cheguem aos usuários finais.
À medida que as organizações escalam suas implantações do Copilot Studio, revisar manualmente a configuração, as instruções e a estrutura de tópicos de cada agente torna-se impossível. A Ferramenta de Revisão de Agentes automatiza essa análise por meio de análises baseadas em IA, normalmente revelando descobertas acionáveis em menos de 60 segundos.
É para:
- Criadores: receba comentários acionáveis para melhorar a qualidade dos agentes antes da implantação.
- Administradores e equipes de CoE: aplique padrões de governança em todos os agentes em um ambiente.
- Diretores de segurança e conformidade: verifique se os agentes seguem as diretrizes de privacidade, segurança e precisão.
Principais recursos
| Recurso | Detalhes |
|---|---|
| Cobertura do agente | Agentes do Copilot Studio e Agentes Declarativos do Microsoft 365 |
| Tempo de revisão | Normalmente menos de 60 segundos por agente |
| Padrões verificados | 18 padrões (10 determinísticos + 8 da plataforma IA) |
| Critérios de conformidade | 15 critérios de qualidade das instruções |
| Sistema de pontuação | Pontuação geral de 0 a100 (50% padrões, 50% conformidade) |
| Formatos de exportação | PDF, SARIF, Excel |
| Armazenamento de dados | Microsoft Dataverse (segurança aplicada em nível de linha com escopo de usuário) |
| Mecanismo de IA | Prompts de IA do Microsoft Copilot Studio por meio do PredictV2 do Dataverse |
Introdução: O painel
Quando você abre a Ferramenta de Avaliação de Agentes, você entra no Painel, o hub central que mostra todos os agentes no seu ambiente e o status de avaliação deles.
Layouts do painel
O painel mostra tudo rapidamente: a barra de abas alternando entre agentes do Copilot Studio e do Microsoft 365, quatro cartões de estatísticas resumindo a integridade do portfólio, uma barra de pesquisa, a grade de agentes paginada e o botão Upload de ZIP para avaliações offline.
Cartões de estatísticas
Os quatro cartões de estatísticas oferecem uma visão instantânea da integridade do seu portfólio de agentes:
| Cartão | O que ele mostra | Como isso é calculado? |
|---|---|---|
| Total de agentes | Contagem de todos os bots ativos no ambiente. | Consulte a tabela bot em que statecode = 0 |
| Revisado | Número e porcentagem de agentes avaliados. | Contagem de avaliações concluídas dividida pelo total de agentes |
| Pontuação média | Pontuação média geral em todas as avaliações concluídas. | Soma das pontuações dividida pela contagem revisada |
| Total de problemas | Problemas acumulados encontrados em todos os agentes avaliados. | Soma das falhas de padrão mais falhas de conformidade |
Grade de agentes
| Coluna | Conteúdo |
|---|---|
| Nome | Nome de exibição do agente com ícone. |
| Pontuação | Pontuação geral da avaliação (0 a 100), ou -- se ainda não foi revisada. Codificada por cores. |
| Saídas | Resumo das descobertas de gravidade alta, média e baixa.
-- se não foi avaliado. |
| Última avaliação | Tempo relativo (por exemplo, "há 2 horas" ou "há 1 semana"), ou "Não avaliado". |
| Ações | Avaliação para agentes não avaliados; Exibição para agentes com avaliações existentes. |
Selecionar um ambiente
Por padrão, a ferramenta mostra agentes do ambiente em que você a instalou. Se precisar revisar um agente de um ambiente diferente, use o seletor de ambiente na barra de ferramentas do painel. A lista suspensa lista todos os ambientes do Power Platform aos quais você tem acesso.
Depois que você seleciona um ambiente diferente, a grade de agentes é atualizada para mostrar os agentes desse ambiente. Você poderá então avaliar qualquer um desses agentes. O resultado da avaliação é armazenado no ambiente atual (inicial), não no que você selecionou.
Modos de avaliação
A ferramenta oferece suporte a dois modos distintos de avaliação, acessíveis pela barra de guias na parte superior do painel.
Avaliação de agentes do Copilot Studio
Este modo avalia agentes criados no Microsoft Copilot Studio. Ele lê diretamente do Dataverse — não é necessário upload de arquivos.
O que ele analisa:
- Configurações de tópicos (nomes, descrições, variáveis).
- Configurações de ferramentas e ações (contagem, descrições, roteamento).
- Tipos de fonte de conhecimento.
- Cobertura do caso de teste.
- Instruções do agente (modo generativo).
- Metadados do agente (idioma, autenticação, configurações de IA).
Para iniciar uma avaliação:
- Encontre seu agente na grade.
- Selecione Revisar. O trabalho de análise é iniciado automaticamente.
- Um painel de progresso mostra o que está acontecendo em tempo real.
- Os resultados são abertos no painel de avaliação após a conclusão.
Você pode avaliar qualquer agente novamente a qualquer momento. Cada avaliação cria um registro no Dataverse. A grade sempre mostra o resultado da avaliação mais recente.
Avaliação de agentes declarativos (Microsoft 365 Copilot)
Este modo avalia os Agentes Declarativos do Microsoft 365, que são definidos por um arquivo JSON de manifesto e implantados no ecossistema do Microsoft 365 Copilot.
Você pode enviar um Agente Declarativo para avaliação de duas maneiras:
| método | Como | Quando usar |
|---|---|---|
| Upload de ZIP | Selecione Upload de ZIP no cabeçalho da página e selecione o pacote exportado. | O agente é de outro locatário ou não está no seu catálogo. |
| No catálogo do Microsoft 365 | Conecte-se ao Microsoft 365 por meio do assistente de instalação da API do Graph e, em seguida, procure os agentes. | O agente é implantado no seu locatário do Microsoft 365. |
O que ele analisa (5 critérios, não 15):
| Critério | Peso | O que é verificado |
|---|---|---|
| Instruções | 30% | Clareza, integridade e qualidade das instruções para o agente |
| Conhecimento | 20% | Fundamentação por meio de fontes de conhecimento conectadas |
| Capacidades | 15% | Uso do CodeInterpreter e do OneDriveAndSharePoint |
| Ações | 15% | Roteamento de ferramentas e descrições de ações |
| Iniciadores de Conversa | 10% | Mínimo 3, recomendado 6 (máximo 12) |
| Tratamento eficaz de erros | 10% | Recuperação de erros e comportamentos de fallback |
Observação
A verificação de conformidade de instrução com 15 critérios é específica para agentes do Copilot Studio e não se aplica a Agentes Declarativos.
O que acontece durante uma avaliação
Quando você seleciona Avaliar, a ferramenta executa uma análise automatizada que normalmente é concluída em menos de 60 segundos. Um painel de progresso mantém você informado enquanto ele avalia.
A análise cobre três pontos em sequência:
- Análise da configuração: a ferramenta lê a configuração completa do agente no Dataverse — cada tópico, ferramenta, fonte de conhecimento, caso de teste e instrução. Ela verifica campos ausentes em todos os componentes e mede coisas como contagem de ferramentas e cobertura de testes com base nas melhores práticas documentadas da Microsoft.
- Avaliação de padrões baseada em IA: um modelo de IA revisa a mesma configuração para avaliar a qualidade, não só a integridade. Ele analisa se os nomes e descrições dos tópicos são claros o suficiente para que o orquestrador generativo roteie corretamente, se vários tópicos se sobrepõem de formas que causam confusão no roteamento, e se as descrições das ferramentas fornecem à IA orientações suficientes para invocar a ferramenta certa no momento certo.
- Verificação de conformidade das instruções: um segundo modelo de IA lê as instruções do sistema do agente e as verifica em relação a 15 critérios de melhores práticas das orientações de modo generativo da Microsoft — abrangendo escopo, segurança, qualidade das respostas e experiência do usuário. Para cada critério que as instruções não atendam, ele revela uma descoberta específica e uma recomendação concreta.
Após a conclusão das três etapas, um relatório em PDF é gerado automaticamente e os resultados são abertos no painel de avaliação.
Importante
Cada avaliação consome créditos do Copilot. As etapas baseadas em IA (avaliação de padrões, verificação de conformidade das instruções e geração de PDF) invocam cada uma um modelo de IA por meio do Dataverse. Planeje de acordo se você estiver avaliando um grande número de agentes.
Padrões detectados
Padrões identificam antipadrões específicos ou melhores práticas ausentes na configuração de um agente. A ferramenta verifica 18 padrões em 7 categorias.
Todos os 18 padrões
| ID | Nome do padrão | Categoria | Impacto |
|---|---|---|---|
pat-001 |
Nome do modelo ausente | Nomeação dos modelos | O orquestrador generativo não consegue direcionar para esse tópico de forma confiável. |
pat-002 |
Descrição do modelo ausente | Descrição do modelo | O tópico pode ser ignorado ou desencadeado incorretamente durante o roteamento. |
pat-003 |
Nome da variável de entrada ausente | Variáveis de entrada | Os usuários veem variáveis sem nome, causando confusão na conversa. |
pat-004 |
Descrição da variável de entrada ausente | Variáveis de entrada | A IA não consegue extrair corretamente o valor correto da entrada do usuário. |
pat-005 |
Nome da variável de saída ausente | Variáveis de saída | Os valores de saída estão sem rótulo e são difíceis de interpretar pelos usuários. |
pat-006 |
Descrição da variável de saída ausente | Variáveis de saída | A IA não tem contexto para preencher a variável corretamente. |
pat-007 |
Uso excessivo de ferramentas | Arquitetura | Muitas ferramentas degradam a precisão do roteamento e aumentam a latência. |
pat-008 |
Casos de teste inadequados | Avaliação | Regressões no comportamento do tópico passam despercebidas antes da implantação. |
pat-009 |
Descrição do agente filho ausente | Arquitetura | O orquestrador não consegue decidir quando delegar para o agente filho. |
pat-010 |
Expansão da arquitetura do agente filho | Arquitetura | A delegação excessiva cria complexidade e latência na orquestração. |
pat-011 |
Nome do modelo pouco claro | Nomeação dos modelos | Nomes vagos fazem o orquestrador rotear para o tópico errado. |
pat-012 |
Descrição do modelo pouco clara | Descrição do modelo | Descrições ruins levam a gatilhos de tópicos ausentes ou incorretos. |
pat-013 |
Nome da variável de entrada pouco claro | Variáveis de entrada | Nomes ambíguos dificultam para a IA preencher corretamente a variável. |
pat-014 |
Descrição da variável de entrada pouco clara | Variáveis de entrada | A IA extrai o valor incorreto ou faz perguntas de esclarecimento desnecessárias. |
pat-015 |
Nome da variável de saída pouco claro | Variáveis de saída | Tópicos ou fluxos downstream que consomem essa variável podem interpretá-la de forma incorreta. |
pat-016 |
Descrição da variável de saída pouco clara | Variáveis de saída | A IA não consegue produzir de forma confiável o formato ou valor de saída esperado. |
pat-017 |
Descrições de tópicos sobrepostas | Descrição do modelo | Vários tópicos competem pelos mesmos enunciados do usuário, causando roteamento imprevisível. |
pat-018 |
Lacuna no roteamento de ferramentas | Arquitetura | A IA não consegue decidir qual ferramenta chamar, o que leva a invocações incorretas ou nenhuma ação. |
Para cada padrão com falha, a ferramenta mostra quais tópicos são afetados, o valor atual que desencadeou a descoberta, uma melhoria sugerida e um link para a documentação relevante do Microsoft Learn.
Categorias de padrões
A grade de resultados agrupa os padrões em sete categorias, classificadas na seguinte ordem:
| # | Categoria | Padrões incluídos |
|---|---|---|
| 1 | Nomeação dos modelos |
pat-001, pat-011 |
| 2 | Descrição do modelo |
pat-002, pat-012, pat-017 |
| 3 | Variáveis de entrada |
pat-003, pat-004, pat-013, pat-014 |
| 4 | Variáveis de saída |
pat-005, pat-006, pat-015, pat-016 |
| 5 | Arquitetura |
pat-007, pat-009, pat-010, pat-018 |
| 6 | Orquestração | Reservado para futuros padrões detectados por IA |
| 7 | Avaliação | pat-008 |
Lógica de gravidade
A combinação de correspondência de palavras-chave e contagem de tópicos determina a gravidade do padrão:
| Condição | Severidade atribuída |
|---|---|
| O nome do padrão contém "nome do modelo" ou "descrição do modelo" | Alto |
| O nome do padrão contém "variável" | Médio (a menos que o número de tópicos seja cinco ou mais) |
| A contagem de tópicos é cinco ou mais | Alto |
| A contagem de tópicos é dois ou mais | Médio |
| A contagem de tópicos é um | Baixo |
A gravidade determina o selo visual na grade de resultados e o nível de erro SARIF no relatório exportado.
Critérios de conformidade
Esta parte da avaliação mede a qualidade das instruções do sistema de um agente — o texto em linguagem natural que o criador fornece nas configurações Generativas do Copilot Studio. Essas instruções definem como o agente se comporta em todas as conversas.
Os 15 critérios derivam das orientações de modo generativo da Microsoft e representam as melhores práticas mais impactantes para a qualidade da instrução.
Todos os 15 critérios
| # | ID | Nome do critério | Categoria | Gravidade | O que ela verifica |
|---|---|---|---|---|---|
| 1 | scope-definition |
Definição de escopo | Escopo | Alta | As instruções do agente definem explicitamente a quais tópicos o agente deve ou não responder. |
| 2 | out-of-scope-handling |
Tratamento de fora do escopo | Escopo | Medium | As instruções especificam o que dizer quando um usuário pergunta sobre algo fora do escopo do agente. |
| 3 | persona-and-tone |
Persona e tom | UX | Baixo | As instruções definem o tom para cenários não padrão. (Profissional/educado já é o padrão — ignore se não for necessário.) |
| 4 | privacy-and-sensitive-data |
Privacidade e dados confidenciais | Segurança | Alta | As instruções contêm orientações explícitas sobre não armazenar, exibir ou repetir dados pessoais. |
| 5 | fallback-when-uncertain |
Fallback em caso do incerteza | Qualidade | Alta | As instruções especificam o que fazer quando o agente não tem as informações necessárias para responder. |
| 6 | citations-and-sources |
Citações e fontes | Qualidade | Medium | As instruções exigem que o agente cite nomes e seções de documentos ao fazer referência a fontes de conhecimento. |
| 7 | formatting-guidelines |
Diretrizes de formatação | UX | Baixo | As instruções especificam o formato da resposta (tópicos, tabelas, etapas numeradas) para uma saída estruturada. |
| 8 | clarifying-questions |
Perguntas de esclarecimento | UX | Medium | As instruções abordam como lidar com consultas ambíguas fazendo perguntas de acompanhamento para esclarecimento. |
| 9 | prompt-injection-resilience |
Proteção contra injeção de prompts | Segurança | Alta | As instruções incluem proteções explícitas contra tentativas de desbloqueio por jailbreak ou injeção de prompts. |
| 10 | link-safety |
Segurança do link | Segurança | Medium | As instruções garantem que somente links verificados e seguros sejam compartilhados com os usuários. |
| 11 | advice-disclaimers |
Avisos de isenção de responsabilidade de conselhos | Segurança | Alta | As instruções incluem avisos de isenção de responsabilidade para áreas de aconselhamento sensíveis (finanças, saúde, legal). |
| 12 | accuracy-quality |
Precisão e qualidade | Qualidade | Alta | As instruções fundamentam explicitamente o agente em suas fontes de conhecimento e proíbem a fabricação ou suposição. |
| 13 | tool-routing-hints |
Dicas de roteamento de ferramentas | Qualidade | Medium | As instruções fornecem orientações sobre quais ferramentas ou fontes de conhecimento usar quando o roteamento é ambíguo. |
| 14 | escalation-guidance |
Orientações de escalonamento | UX | Alta | As instruções definem o que fazer quando o agente não pode ajudar: transferir para um humano, sugerir uma alternativa ou sair normalmente. |
| 15 | deterministic-language |
Linguagem determinística | Qualidade | Medium | As instruções usam diretrizes absolutas (sempre, nunca, somente, deve) em vez de modificadores vagos (pode, geralmente, tentar, às vezes). |
Detalhamento das categorias
| Categoria | Contagem de critérios | Foco |
|---|---|---|
| Escopo | 2 | Define o que o agente faz e o que não responde |
| Segurança | 4 | Protege os usuários contra desinformação, vazamento de dados e manipulação |
| Qualidade | 5 | Garante respostas precisas, fundamentadas e bem estruturadas |
| UX | 4 | Molda a experiência de conversa e os caminhos de escalonamento |
Como as pontuações são calculadas
Todas as pontuações estão na escala de 0 a 100 e são determinísticas. As mesmos entradas sempre produzem a mesma pontuação.
Pontuação do padrão
Pattern Score = (Passed Patterns / Total Patterns) × 100
- Padrões totais = 10 determinísticos + quantos padrões detectados pela IA forem retornados (até 8).
-
Padrões aprovados = contagem em que o status do padrão é
pass. - O resultado é arredondado para o inteiro mais próximo.
Exemplo: 15 padrões no total, 12 aprovados = Pontuação do Padrão de 80.
Pontuação da instrução
A pontuação da instrução usa um sistema de pontos ponderados com base na gravidade inerente de cada critério:
| Gravidade inerente | Pontos se aprovados | Contagem de critérios | Pontos máximos |
|---|---|---|---|
| Alta | 3 | 7 | 21 |
| Medium | 2 | 6 | 12 |
| Baixo | 1 | 2 | 2 |
| Total | 15 | 35 |
Instruction Score = (Earned Points / 35) × 100
- Para cada um dos 15 critérios, se não for encontrado nenhum problema para esse critério, seus pontos de severidade inerentes serão adicionados.
- Se forem detectadas "instruções ausentes", haverá falha em todos os critérios e a pontuação será 0.
- O resultado é limitado a 100 e arredondado para o inteiro mais próximo.
Exemplo: 3 critérios Alto e 2 Médio têm falha:
- Pontos ganhos: (4 × 3) + (4 × 2) + (2 × 1) = 12 + 8 + 2 = 22 pontos.
- Pontuação = (22 / 35) × 100 = 63.
Pontuação geral
Overall Score = (Pattern Score × 0.5) + (Instruction Score × 0.5)
Ambas as dimensões têm peso igual. Se somente uma dimensão estiver disponível (por exemplo, não existirem instruções), a pontuação dessa dimensão será usada diretamente.
Guia de cores e rótulos da pontuação
| Intervalo de pontuação | Rótulo | Cor |
|---|---|---|
| 80 e acima | Excelente | Verde |
| 60 a 79 | Bom | Amber |
| 40 a 59 | Razoável | Vermelho |
| Abaixo de 40 | Precisa de melhoria | Vermelho |
Analisar resultados
Após o término da avaliação, o painel de avaliação exibe os resultados. O painel tem três guias.
Guia Visão geral
A guia Visão Geral oferece um resumo de alto nível:
- Pontuação geral: um medidor circular colorido em verde, amarelo ou vermelho.
- Pontuação do padrão e Pontuação da instrução lado a lado.
- Metadados do agente: nome, ambiente, idioma, modo de autenticação, configurações de IA.
- Resumo gerado por IA: uma descrição em linguagem natural das descobertas mais significativas.
- Carimbo de data/hora da avaliação e a fonte dos dados (ambiente ativo ou upload do ZIP).
Guia Padrões
A guia Padrões mostra a grade completa de todos os 18 padrões avaliados, com estas colunas:
| Coluna | descrição |
|---|---|
| Status | Aprovação ou reprovação |
| Gravidade | Selo Alta, Média ou Baixa |
| Categoria | Categoria de padrões (Nomeação do modelo, Arquitetura etc.) |
| Nome do padrão | Nome completo do padrão |
| Tópicos afetados | Contagem de tópicos afetados por esse padrão |
| Ações | Botão Detalhes para abrir o painel Detalhes do Padrão |
Você pode classificar a grade por qualquer coluna. Por padrão, padrões com falha aparecem primeiro, classificados por gravidade (Alta, Média e Baixa).
Guia Conformidade
A guia Conformidade mostra todos os 15 critérios de instrução:
| Coluna | descrição |
|---|---|
| Status | Aprovação ou reprovação |
| Gravidade | Selo Alta, Média ou Baixa |
| Categoria | Escopo, Segurança, Qualidade ou UX |
| Nome do critério | Nome completo do critério |
| Problemas encontrados | Contagem de problemas específicos sob esse critério |
| Ações | Botão Detalhes para abrir o painel Detalhes da Conformidade |
Detalhamento do padrão
Quando você seleciona Detalhes de qualquer padrão com falha, o painel Detalhes do Padrão é aberto. Ela mostra:
- Nome e descrição do padrão: o que esse padrão verifica.
- Por que isso importa: o impacto desse antipadrão na qualidade do agente.
- Tabela de tópicos afetados: cada tópico com seu valor atual e a substituição sugerida pela IA.
- Recomendação: uma ação concreta para resolver o problema.
- Saiba mais: um link direto para a documentação relevante do Microsoft Learn.
Detalhamento da conformidade
Quando você seleciona Detalhes em qualquer critério de conformidade com falha, o painel Detalhes da Conformidade é aberto. Ela mostra:
- Nome do critério, categoria e gravidade
- O que o critério verifica: uma explicação em linguagem simples
- Problema específico encontrado: a análise da IA sobre o que está ausente ou incorreto
- Recomendação: linguagem ou padrões exatos para adicionar às instruções do agente
- Exemplo: quando disponível, um exemplo de instrução em conformidade
- Saiba mais: link para as orientações relevantes do Microsoft Learn
Exportar resultados
Você pode exportar resultados em três formatos a partir do cabeçalho do painel de avaliação.
Relatório em PDF
Um relatório em PDF bem elaborado, legível por humanos, adequado para compartilhamento com stakeholders ou anexado a uma auditoria de governança.
Conteúdo:
- Resumo executivo com pontuações e principais métricas
- Resultados da avaliação de padrões (status, gravidade, tópicos afetados)
- Descobertas de conformidade (todos os 15 critérios)
- Recomendações para cada problema encontrado
- Metadados do agente (nome, ambiente, data da avaliação)
Padrão do nome do arquivo: {AgentName}_review_{YYYY-MM-DD}.pdf
O PDF é gerado automaticamente ao final de cada avaliação e armazenado no Dataverse junto com o registro da avaliação. Downloads subsequentes recuperam o arquivo armazenado sem executar novamente a análise.
Exportação de SARIF
SARIF (Static Analysis Results Interchange Format v2.1.0) é um formato JSON projetado para integração com ferramentas para desenvolvedores e pipelines de CI/CD.
Casos de uso:
- Upload para o GitHub Advanced Security para anotações de PR baseadas em SARIF
- Importar para verificações de portão de qualidade do Azure DevOps
- Processar com ferramentas de terceiros que consomem SARIF (SonarQube, Visual Studio Code, entre outras)
Visão geral da estrutura:
{
"version": "2.1.0",
"runs": [{
"tool": {
"driver": {
"name": "Copilot Studio Agent Review Tool",
"version": "1.0"
}
},
"results": [
{
"ruleId": "pat-007",
"level": "error",
"message": { "text": "Excessive Tools Usage: 28 tools exceed the recommended limit of 25" },
"properties": {
"category": "Architecture",
"recommendation": "Reduce tool count to 25 or fewer"
}
}
]
}]
}
Mapeamento do nível de gravidade para SARIF:
- Alta =
"error" - Média =
"warning" - Baixa =
"note"
Padrão do nome do arquivo: {AgentName}_review.sarif
Exportação do Excel
Uma pasta de trabalho do Excel com várias planilhas para análise de dados, relatórios e arquivamento.
| Planilha | Conteúdo |
|---|---|
| Resumo | Uma linha por agente avaliado — nome, pontuações, contagem de problemas, data da avaliação |
| Padrões | Todos os 18 padrões — ID, nome, categoria, gravidade, status, tópicos afetados, recomendação |
| Conformidade | Todos os 15 critérios — ID, nome, categoria, gravidade, status, contagem de problemas, recomendação |
Os cabeçalhos são em negrito com planos de fundo com as cores da marca. As células de pontuação e gravidade são codificadas por cores verde, amarelo ou vermelho. As larguras das colunas se ajustam automaticamente.
Padrão do nome do arquivo: {AgentName}_review_{YYYY-MM-DD}.xlsx
Aprofundamento sobre a avaliação de agente declarativo
Os Agentes Declarativos do Microsoft 365 são um tipo diferente de agente dos agentes do Copilot Studio. Eles são definidos inteiramente por um arquivo de manifesto JSON e implantados no ecossistema do Microsoft 365.
O que a avaliação do Agente Declarativo verifica
A avaliação primeiro valida a estrutura do manifesto, verificando que todos os campos exigidos estejam presentes e que o esquema esteja bem formado. Em seguida, executa uma avaliação de IA em relação aos cinco critérios de qualidade e gera um relatório em PDF. A verificação de conformidade das instruções com 15 critérios (específica para agentes do Copilot Studio) não se aplica aqui.
Os cinco critérios de avaliação do Agente Declarativo
| Critério | Peso | O que é avaliado |
|---|---|---|
| Instruções | 30% | Clareza, especificidade e integridade do prompt do sistema do agente |
| Conhecimento | 20% | Uso de fontes de conhecimento conectadas para fundamentação |
| Capacidades | 15% | Uso dos recursos do CodeInterpreter e OneDriveAndSharePoint |
| Ações | 15% | Presença e qualidade das descrições de ações da ferramenta |
| Iniciadores de Conversa | 10% | Contagem e qualidade (mínimo 3, recomendado 6) |
| Tratamento eficaz de erros | 10% | Tratamento de entradas desconhecidas e estados de erro |
Verificação da integridade do manifesto (validação local)
Antes da execução da IA, um exame determinístico de integridade valida a estrutura do manifesto:
- Campos obrigatórios presentes (
name,description,instructions) - Compatibilidade de versão do esquema
- Referências de plug-ins de ação válidas
- Contagem de iniciadores de conversa dentro dos limites (3 a 12)
- Declarações de capacidades corretamente formadas
Qualquer falha na verificação de integridade aparece como problemas nos resultados da avaliação do Agente Declarativo, independentemente da avaliação da IA.
Enviar um Agente Declarativo para avaliação
Via upload de ZIP (mais comum):
- Exporte o Agente Declarativo da sua ferramenta de criação como um pacote ZIP.
- Selecione Upload de ZIP no cabeçalho da página Ferramenta de Avaliação de Agentes.
- Se o ZIP contiver vários agentes, um painel seletor permitirá que você escolha qual deles deve avaliar.
- A avaliação é feita automaticamente.
Por meio do catálogo do Microsoft 365 (requer configuração da API do Graph):
- Selecione Conectar-se ao Microsoft 365 na guia Agentes do Microsoft 365.
- Conclua o assistente de autorização da API do Graph.
- Seus Agentes Declarativos implantados aparecem na grade de Agentes Declarativos.
- Selecione Avaliar em qualquer Agente Declarativo.
Segurança e acesso a dados
Esta seção descreve como a Ferramenta de Revisão de Agentes lida com a segurança e o acesso a dados.
Armazenamento de dados
Todos os resultados da avaliação são armazenados na tabela cat_agentreviews do Dataverse. Cada registro armazena:
| Campo | Conteúdo |
|---|---|
cat_agentreviewsid |
ID exclusiva de registro de avaliação |
cat_botid |
Referência ao agente avaliado |
cat_overallscore |
Pontuação geral de 0 a 100 |
cat_patternscore |
Pontuação da avaliação de padrões |
cat_instructionscore |
Pontuação da conformidade das instruções |
cat_totalissues |
Contagem total de problemas |
cat_reviewresultjson |
Resultado completo da avaliação como JSON |
cat_reviewpdfreport_name |
Relatório em PDF (coluna de arquivo do Dataverse) |
cat_sourceenvironment |
URL do ambiente de origem ou zip |
cat_agenttype |
1 = Copilot Studio, 2 = Agente Declarativo |
Segurança no nível da linha
A tabela cat_agentreviews usa o escopo de leitura em nível de usuário (Básico) no Dataverse. Os usuários podem ver somente as avaliações que criaram. As avaliações de outro usuário nunca ficam visíveis, mesmo no mesmo ambiente. O Dataverse aplica essa segurança nativamente, não o código do aplicativo.
Ambientes de origem
Os usuários podem avaliar agentes de ambientes aos quais têm acesso, não apenas do ambiente atual. O painel oferece suporte a revisões entre ambientes por meio do seletor de ambiente. Avaliações de outros ambientes são marcadas com a URL do ambiente de origem para que apareçam corretamente quando a ferramenta é carregada.
Avaliações obtidas a partir de um upload de ZIP sempre são exibidas, independentemente do ambiente ao qual a ferramenta está conectada.
Quais dados deixam o ambiente
- A configuração do agente (tópicos, ferramentas, instruções) é enviada aos modelos de IA por meio do PredictV2 do Dataverse. Isso segue o caminho padrão de invocação do modelo de IA do Dataverse e está sujeito às mesmas políticas de residência de dados que qualquer operação de IA do Dataverse.
- Nenhum dado é enviado para nenhum serviço de terceiros ou ponto de extremidade externo.
- Os resultados da revisão (incluindo o PDF) são armazenados exclusivamente no Dataverse.
Experiência de primeira execução e tour de boas-vindas
Na primeira vez que um usuário abre a Ferramenta de Avaliação de Agentes, um tour de boas-vindas o guia pelas partes principais da interface:
- Os cartões de estatísticas do painel e o que eles representam
- Como ler a grade de agentes
- Como iniciar uma avaliação
- Como interpretar os resultados
- As opções de exportação
O progresso do tour persiste no Dataverse para que o tour não se repita após o término. Os usuários podem reabrir o tour a qualquer momento na seção Ajuda/Links Rápidos no cabeçalho da página.
Perguntas frequentes
Esta seção responde a perguntas comuns sobre a Ferramenta de Avaliação de Agentes.
Quanto tempo leva uma avaliação?
Um agente típico com menos de 20 tópicos termina em menos de 60 segundos. A ferramenta tem um tempo limite de dois minutos. Agentes muito grandes (mais de 50 tópicos, muitas ferramentas) podem chegar perto do limite.
A ferramenta modifica meu agente?
Não. A ferramenta é totalmente somente leitura em relação aos dados do agente. Ele só lê a configuração do agente. Todas as gravações vão para a tabela cat_agentreviews.
Posso reavaliar um agente após fazer alterações?
Sim. Cada avaliação cria um registro. A grade sempre mostra a avaliação mais recente. Avaliações antigas permanecem no Dataverse e podem ser acessadas de forma programática se necessário.
E se meu agente estiver em um ambiente diferente?
Use o seletor de ambiente no painel para apontar a ferramenta para outro ambiente ao qual você tenha acesso. A avaliação é executada em relação a esse ambiente e o resultado é armazenado no ambiente atual.
Posso avaliar agentes que não criei?
Sim. Você pode avaliar qualquer agente ao qual tiver acesso no Dataverse. No entanto, você pode ver somente as avaliações que criou (segurança em nível de linha). Avaliações de outros usuários não ficam visíveis.
O que é SARIF e eu preciso dele?
SARIF é um formato padrão para resultados de análise estática. Você só precisa disso se estiver integrando verificações de qualidade de agentes em um pipeline de CI/CD (GitHub Actions ou Azure DevOps). Para a maioria dos usuários, exportações em PDF e Excel são suficientes.
A ferramenta diz que meu agente não tem instruções. Isso é um problema?
Sim. A ferramenta só mostra agentes que tenham IA generativa ativada, então todo agente na grade deve ter instruções. Se a verificação de conformidade não reportar instruções, a orquestração generativa do agente está ativa, mas nenhuma instrução do sistema foi gravada ainda. Adicionar instruções é altamente recomendável.
Por que "Persona e Tom" é de baixa gravidade?
A orientação da Microsoft observa que um tom profissional e educado já é o comportamento padrão para os agentes do Copilot Studio. Instruções para o tom só são necessárias se você quiser um tom que não seja padrão. Esse critério é Baixo porque falha nele raramente causa problemas para o usuário.
Fazer uma avaliação consome créditos do Copilot?
Sim. Cada avaliação invoca modelos de IA três vezes — para avaliação de padrões, conformidade das instruções e geração de PDFs. Cada invocação consome créditos do Copilot do seu locatário. Reavaliar o mesmo agente também consome créditos, portanto, faça suas alterações primeiro e depois reavalie.
Posso exportar todas as avaliações de uma vez?
Sim. Use o botão Exportar Tudo na barra de ferramentas da grade de agentes para gerar uma pasta de trabalho do Excel abrangendo todos os agentes avaliados na exibição atual.