ARTFEED — Contemporary Art Intelligence

Difesa SAGE contro jailbreak violata da codifica di codice e ricerca Best-of-N

ai-technology · 2026-07-30

Un recente studio rivela che SAGE, una protezione contro i jailbreak per grandi modelli linguistici che vanta un tasso di successo del 99% nella difesa, può essere aggirata combinando due attacchi apparentemente innocui: una codifica di completamento del codice e una ricerca Best-of-N. Individualmente, questi attacchi ottengono tassi di successo inferiori al 4,7%. Tuttavia, quando combinati con un budget di ricerca applicato alla codifica, raggiungono tassi di successo del 67%, 22% e 15% su tre target aperti, con effetti osservati su un modello con 70 miliardi di parametri. I risultati indicano che SAGE si basa sul modello target per la sua efficacia, poiché non rileva gli attacchi ma piuttosto induce il modello a valutare le richieste, con rifiuti espliciti tra il 32% e il 97% delle volte. Lo studio evidenzia anche quale attacco resiste alla combinazione, gettando luce sulle debolezze dei sistemi di autoverifica.

Fatti principali

  • SAGE riporta un tasso di successo di difesa del 99%
  • La codifica di completamento del codice da sola ha successo <4,7%
  • La ricerca Best-of-N da sola ha successo <4,7%
  • Gli attacchi combinati raggiungono il 67/22/15% su tre target aperti
  • L'effetto persiste su un target da 70B
  • La difesa di autoverifica prende forza dal modello target
  • I target rifiutano dal 32% al 97% delle volte
  • L'articolo spiega la composizione anziché limitarsi a riportare

Entità

Fonti