ARTFEED — Contemporary Art Intelligence

Amplificazione di difesa guard-agnostica contro jailbreak VLM codificati

other · 2026-07-30

Un recente studio pubblicato su arXiv (2607.26574) introduce un amplificatore recover-and-decode guard-agnostico volto a proteggere i modelli visione-linguaggio (VLM) da attacchi jailbreak codificati. La prevalente difesa black-box, nota come classificatori di sicurezza o guard, è inefficace quando le richieste dannose vengono riformulate utilizzando teoria degli insiemi, logica formale, linguaggi oscuri, codice o immagini di testo—una debolezza identificata come decode gap. Questo amplificatore converte il contenuto delle immagini e riformula il testo codificato in linguaggio semplice prima di raggiungere il guard, consentendo a qualsiasi classificatore standard di valutare la richiesta effettiva. Gli autori testano l'amplificatore contro un insieme di undici attacchi, considerando un comportamento violato se un qualsiasi attacco ha successo (best-of-suite, seguendo AutoAttack), cosa raramente documentata per le difese jailbreak, ottenendo circa 3,5 volte la media per attacco. Il risultato chiave indica un limite empirico di sicurezza-utilità per le difese di recupero non iterative su cinque modelli guard. L'articolo rientra in categorie cross-abstract ed è stato pubblicato su arXiv.

Fatti principali

  • L'articolo arXiv 2607.26574 propone un amplificatore recover-and-decode guard-agnostico per VLM.
  • I classificatori di sicurezza falliscono quando le richieste dannose sono codificate come teoria degli insiemi, logica formale, lingue rare, codice o immagini di testo.
  • Il decode gap è la vulnerabilità per cui i guard giudicano la forma superficiale anziché il significato.
  • L'amplificatore trascrive il contenuto delle immagini e riformula il testo codificato in payload semplice prima del guard.
  • La valutazione utilizza un insieme di undici attacchi con punteggio best-of-suite (AutoAttack).
  • Il punteggio best-of-suite è circa 3,5 volte la media per attacco.
  • Risultato centrale: un limite empirico di sicurezza-utilità per le difese di recupero non iterative.
  • Sono stati valutati cinque modelli guard.

Entità

Istituzioni

  • arXiv

Fonti