SafeCap: Migliorare la Sicurezza degli LVLM tramite Apprendimento per Rinforzo nella Didascalia delle Immagini
Uno studio recente presenta SafeCap, un framework di apprendimento per rinforzo volto a migliorare la sicurezza dei grandi modelli visione-linguaggio (LVLM) contro le minacce di jailbreak. Questo framework addestra un modello di policy per generare inizialmente una didascalia dell'immagine focalizzata sulla sicurezza, che viene poi utilizzata per derivare una risposta finale, garantendo che la didascalia aiuti un LLM congelato a raggiungere una conclusione orientata alla sicurezza. Questo metodo spinge il modello a evidenziare indicatori visivi pertinenti alla generazione di risposte sicure invece di affidarsi esclusivamente a istruzioni dirette di rifiuto. SafeCap mostra miglioramenti significativi nelle prestazioni complessive di sicurezza sotto il suo protocollo DirectCap su cinque benchmark di sicurezza multimodale e sei benchmark di utilità visiva, ottenendo miglioramenti medi di sicurezza di 3,7-19,0 punti su quattro configurazioni di modello, mantenendo un'utilità simile o migliore. L'articolo è disponibile su arXiv con identificativo 2608.10513.
Fatti principali
- SafeCap è un framework di apprendimento per rinforzo per LVLM.
- Addestra un modello di policy per generare una didascalia dell'immagine rilevante per la sicurezza prima di produrre una risposta finale.
- La didascalia è ottimizzata per consentire a un LLM congelato di raggiungere una decisione allineata alla sicurezza.
- SafeCap migliora le prestazioni di sicurezza di 3,7-19,0 punti su quattro impostazioni di modello.
- Il framework è stato valutato su cinque benchmark di sicurezza multimodale e sei benchmark di utilità visiva.
- L'articolo è disponibile su arXiv con identificativo 2608.10513.
- L'approccio si concentra sull'esporre segnali visivi rilevanti per la generazione di risposte sicure.
- SafeCap mantiene un'utilità comparabile o migliorata mentre migliora la sicurezza.
Entità
Istituzioni
- arXiv