Allineamento di Sicurezza Distribuito Contro Attacchi White-Box su Modelli Open-Weight
Un recente articolo pubblicato su arXiv (2608.01414) presenta un nuovo approccio chiamato allineamento di sicurezza distribuito (DSA) volto ad affrontare attacchi white-box a livello di neuroni su grandi modelli foundation con pesi aperti. I ricercatori sostengono che le attuali strategie di allineamento si concentrano su un insieme limitato di neuroni legati alla sicurezza, portando a un vulnerabile punto singolo di guasto. DSA, d'altra parte, distribuisce le funzioni di sicurezza su numerosi neuroni computazionali, consentendo al modello di mantenere i propri standard di sicurezza anche se i neuroni chiave vengono compromessi. Questa tecnica concentra gli interventi sugli input dei layer di down-proiezione all'interno delle reti feed-forward lato linguaggio, trattando ogni coordinata di feature come un neurone separato. DSA integra le attivazioni dei neuroni con i gradienti di perdita per derivare un punteggio di Taylor di primo ordine sensibile alla direzione per un migliore allineamento della sicurezza. L'articolo è classificato come un nuovo annuncio e può essere accessibile tramite il link fornito.
Fatti principali
- Articolo: arXiv:2608.01414
- Propone l'allineamento di sicurezza distribuito (DSA)
- Affronta attacchi white-box a livello di neuroni
- Si rivolge a grandi modelli foundation con pesi aperti
- Codifica la sicurezza attraverso più neuroni
- Localizza l'intervento ai layer di down-proiezione
- Usa un punteggio di Taylor di primo ordine sensibile alla direzione
- Pubblicato come nuovo annuncio su arXiv
Entità
Istituzioni
- arXiv