L'ottimizzazione dello stile avversario potenzia i jailbreak degli MLLM tramite trigger stilistici
I ricercatori hanno proposto l'Adversarial Style Optimization (ASO), un modulo plug-and-play che migliora gli attacchi di jailbreak visivi esistenti contro i Modelli Linguistici Multimodali di Grandi Dimensioni (MLLM). Il metodo sfrutta un'incoerenza stilistica negli MLLM: mentre comprendono robustamente il contenuto attraverso stili visivi, le loro difese di sicurezza sono vulnerabili a specifici trigger stilistici. ASO ottimizza un modello di editing delle immagini utilizzando l'ottimizzazione delle politiche relative di gruppo (GRPO) per sovrapporre modifiche stilistiche ottimizzate alle immagini avversarie. L'approccio è dettagliato in un preprint su arXiv (2607.21619).
Fatti principali
- ASO è un modulo di potenziamento plug-and-play per jailbreak visivi.
- Gli MLLM mostrano un'incoerenza stilistica tra comprensione e sicurezza.
- ASO utilizza GRPO per ottimizzare i trigger stilistici.
- Il metodo ottimizza un modello di editing delle immagini.
- Preprint disponibile su arXiv con ID 2607.21619.
Entità
Istituzioni
- arXiv