Difesa SAGE contro jailbreak violata da codifica di codice e ricerca Best-of-N
Un recente studio rivela che SAGE, una protezione contro i jailbreak per grandi modelli linguistici che vanta un tasso di successo del 99% nella difesa, può essere aggirata combinando due attacchi apparentemente innocui: una codifica di completamento del codice e una ricerca Best-of-N. Individualmente, questi attacchi ottengono tassi di successo inferiori al 4,7%. Tuttavia, quando combinati con un budget di ricerca applicato alla codifica, raggiungono tassi di successo del 67%, 22% e 15% su tre target aperti, con effetti osservati su un modello con 70 miliardi di parametri. I risultati indicano che SAGE si basa sul modello target per la sua efficacia, poiché non rileva gli attacchi ma piuttosto induce il modello a valutare le richieste, con rifiuti espliciti tra il 32% e il 97% delle volte. Lo studio evidenzia anche quale attacco resiste alla combinazione, gettando luce sulle debolezze dei sistemi di autoverifica.
Fatti principali
- SAGE riporta un tasso di successo di difesa del 99%
- La codifica di completamento del codice da sola ha successo <4,7%
- La ricerca Best-of-N da sola ha successo <4,7%
- Gli attacchi combinati raggiungono il 67/22/15% su tre target aperti
- L'effetto persiste su un target da 70B
- La difesa di autoverifica prende forza dal modello target
- I target rifiutano dal 32% al 97% delle volte
- L'articolo spiega la composizione anziché limitarsi a riportare
Entità
—