IndirectAttackEvaluator Classe
Definição
Importante
Algumas informações se referem a produtos de pré-lançamento que podem ser substancialmente modificados antes do lançamento. A Microsoft não oferece garantias, expressas ou implícitas, das informações aqui fornecidas.
Um IEvaluator que utiliza o serviço de Avaliação de Fábrica de IA do Azure para avaliar as respostas produzidas por um modelo de IA para a presença de ataques indiretos, como conteúdo manipulado, intrusão e coleta de informações.
public ref class IndirectAttackEvaluator sealed : Microsoft::Extensions::AI::Evaluation::Safety::ContentSafetyEvaluator
public sealed class IndirectAttackEvaluator : Microsoft.Extensions.AI.Evaluation.Safety.ContentSafetyEvaluator
type IndirectAttackEvaluator = class
inherit ContentSafetyEvaluator
Public NotInheritable Class IndirectAttackEvaluator
Inherits ContentSafetyEvaluator
- Herança
Comentários
Ataques indiretos, também conhecidos como ataques injetados por prompt entre domínios (XPIA), são quando ataques de jailbreak são injetados no contexto de um documento ou fonte que pode resultar em um comportamento alterado e inesperado. As avaliações de ataques indiretos são divididas em três subcategorias:
Conteúdo Manipulado: essa categoria envolve comandos que visam alterar ou fabricar informações, muitas vezes para enganar ou enganar. Ele inclui ações como espalhar informações falsas, alterar idioma ou formatação e ocultar ou enfatizar detalhes específicos. O objetivo geralmente é manipular percepções ou comportamentos controlando o fluxo e a apresentação de informações.
Intrusão: essa categoria abrange comandos que tentam violar sistemas, obter acesso não autorizado ou elevar privilégios ilicitamente. Ele inclui a criação de backdoors, a exploração de vulnerabilidades e os jailbreaks tradicionais para ignorar as medidas de segurança. A intenção geralmente é obter controle ou acessar dados confidenciais sem detecção.
Coleta de informações: essa categoria se refere ao acesso, exclusão ou modificação de dados sem autorização, geralmente para fins mal-intencionados. Ele inclui exfiltração de dados confidenciais, adulteração de registros do sistema e remoção ou alteração de informações existentes. O foco é adquirir ou manipular dados para explorar ou comprometer sistemas e indivíduos.
IndirectAttackEvaluator retorna um BooleanMetric com um valor de true indicar a presença de um ataque indireto na resposta e um valor de false indicar a ausência de um ataque indireto.
Observe que IndirectAttackEvaluator não dá suporte à avaliação de conteúdo multimodal presente nas respostas avaliadas. As imagens e outros conteúdos multimodal presentes nas respostas avaliadas serão ignorados.
Construtores
| Nome | Description |
|---|---|
| IndirectAttackEvaluator() |
Um IEvaluator que utiliza o serviço de Avaliação de Fábrica de IA do Azure para avaliar as respostas produzidas por um modelo de IA para a presença de ataques indiretos, como conteúdo manipulado, intrusão e coleta de informações. |
Propriedades
| Nome | Description |
|---|---|
| EvaluationMetricNames |
Obtém os Names dos EvaluationMetrics produzidos por este IEvaluator. (Herdado de ContentSafetyEvaluator) |
| IndirectAttackMetricName |
Obtém o Name do BooleanMetric retornado por IndirectAttackEvaluator. |
Métodos
| Nome | Description |
|---|---|
| EvaluateAsync(IEnumerable<ChatMessage>, ChatResponse, ChatConfiguration, IEnumerable<EvaluationContext>, CancellationToken) |
Avalia o fornecido |
| EvaluateContentSafetyAsync(IChatClient, IEnumerable<ChatMessage>, ChatResponse, IEnumerable<EvaluationContext>, String, Boolean, CancellationToken) |
Avalia o |
| FilterAdditionalContext(IEnumerable<EvaluationContext>) |
Filtra os EvaluationContexts fornecidos pelo chamador por meio |