ARTFEED — Contemporary Art Intelligence

Sfruttamenti della Sicurezza Meccanistica nei LLM a Diffusione Rivelati

ai-technology · 2026-08-10

Un nuovo studio su arXiv (2608.07430) evidenzia gravi difetti nei modelli linguistici di grandi dimensioni basati su diffusione (DLLM). A differenza dei modelli tradizionali che prevedono il token successivo, i DLLM utilizzano un metodo di denoising parallelo. La ricerca mostra che le caratteristiche di sicurezza in questi modelli non sono molto robuste e possono essere condivise tra varie architetture. I DLLM che partono da modelli autoregressivi ereditano problemi di sicurezza simili, rendendoli vulnerabili ad attacchi di trasferimento attraverso tecniche come la mappatura e il potatura dei neuroni di sicurezza. Ad esempio, l'auto-potatura aumenta drasticamente i tassi di successo degli attacchi su modelli come LLaDA e Dream. Gli autori suggeriscono un nuovo framework chiamato SN-Guided Diffusion per sfruttare queste vulnerabilità, sottolineando la necessità di migliorare la sicurezza nei futuri progetti di DLLM.

Fatti principali

  • I DLLM sostituiscono la previsione autoregressiva del token successivo con il denoising parallelo iterativo.
  • L'allineamento della sicurezza nei DLLM è sparso e trasferibile tra architetture.
  • I DLLM inizializzati da predecessori autoregressivi ereditano la stessa impronta meccanicistica di sicurezza.
  • Sono possibili attacchi di trasferimento tramite mappatura diretta e potatura dei neuroni di sicurezza.
  • L'auto-potatura aumenta l'ASR dal 2,6% al 73,8% su LLaDA.
  • L'auto-potatura aumenta l'ASR dal 1,9% al 86,6% su Dream.
  • La potatura di trasferimento da Qwen2.5 aumenta l'ASR dal 1,9% al 73,2% su Dream.
  • La potatura di trasferimento da Qwen2.5 aumenta l'ASR dal 7,0% al 86,3% su Fast-dLLM.
  • SN-Guided Diffusion è un framework di jailbreak completamente offline e black-box.

Entità

Istituzioni

  • arXiv
  • LLaDA
  • Dream
  • Qwen2.5
  • Fast-dLLM

Fonti