ARTFEED — Contemporary Art Intelligence

I Livelli MLP e i Blocchi Centrali della Rete Codificano il Comportamento di Rifiuto nei LLM

ai-technology · 2026-08-13

Un nuovo studio su arXiv (2608.11583) indaga dove il comportamento di rifiuto allineato alla sicurezza è codificato nei grandi modelli linguistici (LLM). La ricerca, che utilizza due coppie di modelli a pesi aperti e quattro benchmark di sicurezza, rivela che il trasferimento del rifiuto è dominato dai pesi MLP (percettrone multistrato) piuttosto che dai pesi di attenzione. Sostituire i parametri MLP recupera sostanzialmente più rifiuti per prompt malevoli, con guadagni di almeno 2,7 volte su tutti i benchmark. Lo studio trova anche una concentrazione coerente dei parametri rilevanti per il rifiuto nei blocchi centrali della rete all'interno dello stack MLP. Questo lavoro mette in discussione l'assunto che l'allineamento alla sicurezza sia distribuito sull'intera rete, suggerendo che sia concentrato in livelli specifici. I risultati hanno implicazioni per migliorare la sicurezza dei LLM e comprendere gli internals del modello.

Fatti principali

  • Studio su arXiv: 2608.11583
  • Utilizza due coppie di modelli a pesi aperti e quattro benchmark di sicurezza
  • Il trasferimento del rifiuto è dominato dai pesi MLP
  • La sostituzione dei parametri MLP recupera almeno 2,7 volte più rifiuti rispetto all'attenzione
  • I parametri rilevanti per il rifiuto sono concentrati nei blocchi centrali della rete
  • Mette in discussione l'assunto di un allineamento alla sicurezza distribuito
  • Implicazioni per la sicurezza e l'interpretabilità dei LLM

Entità

Istituzioni

  • arXiv

Fonti