Sfruttamenti della Sicurezza Meccanistica nei LLM a Diffusione Rivelati
Un nuovo studio su arXiv (2608.07430) evidenzia gravi difetti nei modelli linguistici di grandi dimensioni basati su diffusione (DLLM). A differenza dei modelli tradizionali che prevedono il token successivo, i DLLM utilizzano un metodo di denoising parallelo. La ricerca mostra che le caratteristiche di sicurezza in questi modelli non sono molto robuste e possono essere condivise tra varie architetture. I DLLM che partono da modelli autoregressivi ereditano problemi di sicurezza simili, rendendoli vulnerabili ad attacchi di trasferimento attraverso tecniche come la mappatura e il potatura dei neuroni di sicurezza. Ad esempio, l'auto-potatura aumenta drasticamente i tassi di successo degli attacchi su modelli come LLaDA e Dream. Gli autori suggeriscono un nuovo framework chiamato SN-Guided Diffusion per sfruttare queste vulnerabilità, sottolineando la necessità di migliorare la sicurezza nei futuri progetti di DLLM.
Fatti principali
- I DLLM sostituiscono la previsione autoregressiva del token successivo con il denoising parallelo iterativo.
- L'allineamento della sicurezza nei DLLM è sparso e trasferibile tra architetture.
- I DLLM inizializzati da predecessori autoregressivi ereditano la stessa impronta meccanicistica di sicurezza.
- Sono possibili attacchi di trasferimento tramite mappatura diretta e potatura dei neuroni di sicurezza.
- L'auto-potatura aumenta l'ASR dal 2,6% al 73,8% su LLaDA.
- L'auto-potatura aumenta l'ASR dal 1,9% al 86,6% su Dream.
- La potatura di trasferimento da Qwen2.5 aumenta l'ASR dal 1,9% al 73,2% su Dream.
- La potatura di trasferimento da Qwen2.5 aumenta l'ASR dal 7,0% al 86,3% su Fast-dLLM.
- SN-Guided Diffusion è un framework di jailbreak completamente offline e black-box.
Entità
Istituzioni
- arXiv
- LLaDA
- Dream
- Qwen2.5
- Fast-dLLM