ARTFEED — Contemporary Art Intelligence

Allineamento di Sicurezza Distribuito Contro Attacchi White-Box su Modelli Open-Weight

ai-technology · 2026-08-04

Un recente articolo pubblicato su arXiv (2608.01414) presenta un nuovo approccio chiamato allineamento di sicurezza distribuito (DSA) volto ad affrontare attacchi white-box a livello di neuroni su grandi modelli foundation con pesi aperti. I ricercatori sostengono che le attuali strategie di allineamento si concentrano su un insieme limitato di neuroni legati alla sicurezza, portando a un vulnerabile punto singolo di guasto. DSA, d'altra parte, distribuisce le funzioni di sicurezza su numerosi neuroni computazionali, consentendo al modello di mantenere i propri standard di sicurezza anche se i neuroni chiave vengono compromessi. Questa tecnica concentra gli interventi sugli input dei layer di down-proiezione all'interno delle reti feed-forward lato linguaggio, trattando ogni coordinata di feature come un neurone separato. DSA integra le attivazioni dei neuroni con i gradienti di perdita per derivare un punteggio di Taylor di primo ordine sensibile alla direzione per un migliore allineamento della sicurezza. L'articolo è classificato come un nuovo annuncio e può essere accessibile tramite il link fornito.

Fatti principali

  • Articolo: arXiv:2608.01414
  • Propone l'allineamento di sicurezza distribuito (DSA)
  • Affronta attacchi white-box a livello di neuroni
  • Si rivolge a grandi modelli foundation con pesi aperti
  • Codifica la sicurezza attraverso più neuroni
  • Localizza l'intervento ai layer di down-proiezione
  • Usa un punteggio di Taylor di primo ordine sensibile alla direzione
  • Pubblicato come nuovo annuncio su arXiv

Entità

Istituzioni

  • arXiv

Fonti