Filtri di contenuto
I filtri di contenuto di intelligenza artificiale sono sistemi progettati per rilevare e impedire che il contenuto dannoso o non appropriato venga generato o elaborato dai sistemi di intelligenza artificiale. Funzionano valutando sia i prompt di input che i completamenti di output, usando i modelli di classificazione per identificare categorie specifiche di contenuto problematico. I filtri di contenuto sono una delle difese front-line più importanti in qualsiasi distribuzione di intelligenza artificiale.
Funzionamento dei filtri del contenuto
I filtri di contenuto operano in due punti nella pipeline di interazione di intelligenza artificiale:
- Filtro di input: analizza le richieste degli utenti prima di raggiungere il modello. I filtri di input rilevano tentativi di inserimento di prompt, istruzioni di jailbreak e richieste di contenuto dannoso prima che il modello li elabori.
- Filtro di output: analizza la risposta del modello prima che venga recapitata all'utente. I filtri di output rilevano contenuto dannoso, inappropriato o violazione dei criteri che il modello potrebbe generare nonostante i controlli a livello di input.
La maggior parte dei sistemi di filtro del contenuto usa una combinazione di criteri basati su regole, modelli di classificazione sottoposti a training e soglie di gravità configurabili. Gli amministratori possono in genere modificare la sensibilità dei filtri per le diverse categorie di contenuto in base ai requisiti dell'applicativo.
Funzionalità di filtro del contenuto di base
Quando si valuta o implementa una soluzione di filtro del contenuto per un sistema di intelligenza artificiale, cercare queste funzionalità:
- Moderazione del testo: rileva e filtra contenuti dannosi nel testo, ad esempio il parlato di odio, la violenza, il contenuto autolesionismo o la lingua inappropriata, prima di raggiungere gli utenti.
- Moderazione delle immagini: analizza le immagini per identificare e bloccare il contenuto che potrebbe non essere sicuro o offensivo, inclusi materiale esplicito e immagini violente.
- Analisi unicode: valuta il contenuto in più formati, ovvero testo, immagini e combinazioni, per garantire una copertura completa. Ciò è particolarmente importante per i modelli che accettano e generano più tipi di contenuto.
- Verifica di base effettiva: convalida che le risposte generate dall'IA siano basate sui materiali di origine forniti, rilevando e contrassegnando attestazioni non supportate dai dati a cui si fa riferimento. Questa funzionalità consente di ridurre le istanze in cui l'intelligenza artificiale genera contenuti effettivamente imprecisi.
- Rilevamento degli attacchi di input: analizza le richieste in ingresso per rilevare e bloccare attacchi di prompt injection, tentativi di jailbreak e istruzioni dannose incorporate nei documenti a cui si fa riferimento. Si tratta di una difesa critica contro gli attacchi basati su prompt descritti nel modulo precedente.
- Protezione del copyright: analizza gli output del modello per i contenuti che potrebbero potenzialmente violare il copyright associando materiali protetti noti, ad esempio testo pubblicato, testi o articoli di notizie.
- Supervisione delle azioni dell'agente: monitora l'uso dello strumento agente di intelligenza artificiale per rilevare quando le azioni di un agente non sono allineate, impreviste o premature nel contesto di un'interazione dell'utente, assicurando che l'agente esegua solo azioni autorizzate dall'utente.
- Monitoraggio e analisi dell'utilizzo: tiene traccia dell'attività di moderazione, contrassegna le tendenze nei tentativi di contenuto dannoso e fornisce dashboard per aiutare i team di sicurezza a identificare i rischi emergenti.
Configurazione efficace dei filtri di contenuto
I filtri di contenuto devono essere ottimizzati per il contesto specifico di ogni applicazione:
- Impostare soglie di gravità appropriate: un chatbot per bambini richiede un filtro più rigoroso rispetto a uno strumento di ricerca interno. Configurare le soglie in base al gruppo di destinatari e al caso d'uso.
- Bilanciare sicurezza e usabilità: il filtro eccessivamente aggressivo può bloccare contenuti legittimi e frustrare gli utenti. Monitorare i tassi falsi positivi e regolare le impostazioni per mantenere l'usabilità.
- Filtri di livello con altri controlli: i filtri contenuto sono più efficaci come parte di un approccio di difesa approfondita. Combinarli con i prompt di sistema (metaprompt), la convalida dell'input e il monitoraggio dell'output.
- Rivedere e aggiornare regolarmente: le nuove tecniche di attacco emergono frequentemente. Aggiornare le regole di filtro e ripetere il training dei modelli di classificazione per mantenere il passo con le minacce in continua evoluzione.
La maggior parte delle principali piattaforme di intelligenza artificiale offre funzionalità di filtro dei contenuti predefinite. Ad esempio, Sicurezza dei contenuti di Azure AI implementa molte di queste funzionalità tramite funzionalità come Prompt Shields, Groundedness Detection e Protected Material Detection. Altre piattaforme offrono funzionalità simili: la chiave consiste nel valutare le funzionalità in base ai requisiti specifici indipendentemente dalla piattaforma scelta.