ARTFEED — Contemporary Art Intelligence

L'ottimizzazione dello stile avversario potenzia i jailbreak degli MLLM tramite trigger stilistici

ai-technology · 2026-07-27

I ricercatori hanno proposto l'Adversarial Style Optimization (ASO), un modulo plug-and-play che migliora gli attacchi di jailbreak visivi esistenti contro i Modelli Linguistici Multimodali di Grandi Dimensioni (MLLM). Il metodo sfrutta un'incoerenza stilistica negli MLLM: mentre comprendono robustamente il contenuto attraverso stili visivi, le loro difese di sicurezza sono vulnerabili a specifici trigger stilistici. ASO ottimizza un modello di editing delle immagini utilizzando l'ottimizzazione delle politiche relative di gruppo (GRPO) per sovrapporre modifiche stilistiche ottimizzate alle immagini avversarie. L'approccio è dettagliato in un preprint su arXiv (2607.21619).

Fatti principali

  • ASO è un modulo di potenziamento plug-and-play per jailbreak visivi.
  • Gli MLLM mostrano un'incoerenza stilistica tra comprensione e sicurezza.
  • ASO utilizza GRPO per ottimizzare i trigger stilistici.
  • Il metodo ottimizza un modello di editing delle immagini.
  • Preprint disponibile su arXiv con ID 2607.21619.

Entità

Istituzioni

  • arXiv

Fonti