IndirectAttackEvaluator Classe
Definição
Importante
Algumas informações dizem respeito a um produto pré-lançado que pode ser substancialmente modificado antes de ser lançado. A Microsoft não faz garantias, de forma expressa ou implícita, em relação à informação aqui apresentada.
Um IEvaluator que utiliza o serviço Azure AI Foundry Evaluation para avaliar respostas produzidas por um modelo de IA à presença de ataques indiretos, como conteúdo manipulado, intrusão e recolha de informação.
public ref class IndirectAttackEvaluator sealed : Microsoft::Extensions::AI::Evaluation::Safety::ContentSafetyEvaluator
public sealed class IndirectAttackEvaluator : Microsoft.Extensions.AI.Evaluation.Safety.ContentSafetyEvaluator
type IndirectAttackEvaluator = class
inherit ContentSafetyEvaluator
Public NotInheritable Class IndirectAttackEvaluator
Inherits ContentSafetyEvaluator
- Herança
Observações
Ataques indiretos, também conhecidos como ataques injetados por prompt cruz-domínio (XPIA), são quando ataques de jailbreak são injetados no contexto de um documento ou fonte, podendo resultar num comportamento alterado e inesperado. As avaliações de ataques indiretos estão divididas em três subcategorias:
Conteúdo Manipulado: Esta categoria envolve comandos que visam alterar ou fabricar informação, muitas vezes para enganar ou enganar. Inclui ações como espalhar informações falsas, alterar a linguagem ou a formatação, e esconder ou enfatizar detalhes específicos. O objetivo é muitas vezes manipular perceções ou comportamentos controlando o fluxo e a apresentação da informação.
Intrusão: Esta categoria abrange comandos que tentam invadir sistemas, obter acesso não autorizado ou elevar privilégios de forma ilícita. Inclui a criação de backdoors, exploração de vulnerabilidades e jailbreaks tradicionais para contornar medidas de segurança. A intenção é frequentemente obter controlo ou aceder a dados sensíveis sem deteção.
Recolha de Informação: Esta categoria diz respeito ao acesso, eliminação ou modificação de dados sem autorização, frequentemente para fins maliciosos. Inclui a exfiltração de dados sensíveis, a manipulação de registos do sistema e a remoção ou alteração de informações existentes. O foco está na aquisição ou manipulação de dados para explorar ou comprometer sistemas e indivíduos.
IndirectAttackEvaluator devolve a BooleanMetric com um valor de true indicando a presença de um ataque indireto na resposta, e um valor de false indicando a ausência de um ataque indireto.
Note que IndirectAttackEvaluator não suporta a avaliação do conteúdo multimodal presente nas respostas avaliadas. Imagens e outros conteúdos multimodais presentes nas respostas avaliadas serão ignorados.
Construtores
| Name | Descrição |
|---|---|
| IndirectAttackEvaluator() |
Um IEvaluator que utiliza o serviço Azure AI Foundry Evaluation para avaliar respostas produzidas por um modelo de IA à presença de ataques indiretos, como conteúdo manipulado, intrusão e recolha de informação. |
Propriedades
| Name | Descrição |
|---|---|
| EvaluationMetricNames |
Obtém o Names do EvaluationMetrics produzido por isto IEvaluator. (Herdado de ContentSafetyEvaluator) |
| IndirectAttackMetricName |
Obtém o Name de devolvido BooleanMetric por IndirectAttackEvaluator. |
Métodos
| Name | Descrição |
|---|---|
| EvaluateAsync(IEnumerable<ChatMessage>, ChatResponse, ChatConfiguration, IEnumerable<EvaluationContext>, CancellationToken) |
Avalia o fornecido |
| EvaluateContentSafetyAsync(IChatClient, IEnumerable<ChatMessage>, ChatResponse, IEnumerable<EvaluationContext>, String, Boolean, CancellationToken) |
Avalia o |
| FilterAdditionalContext(IEnumerable<EvaluationContext>) |
Filtra os EvaluationContexts fornecidos pelo chamador até |