Tripwire: Difesa senza addestramento contro i jailbreak dei LLM tramite neuroni di sicurezza
Un nuovo articolo di ricerca su arXiv (2608.14392) introduce Tripwire, un meccanismo di difesa senza addestramento per i modelli linguistici di grandi dimensioni (LLM) contro gli attacchi di jailbreak. Il metodo identifica neuroni specifici per la sicurezza attraverso test di ipotesi per neurone, con l'obiettivo di attivare un rifiuto allineato senza compromettere l'utilità del modello. A differenza degli interventi esistenti a livello di neurone e di percorso che spesso degradano le prestazioni o rimangono sempre attivi, Tripwire si attiva selettivamente solo quando viene rilevato un attacco. L'articolo affronta i limiti degli approcci precedenti, come la soppressione dei neuroni tossici (che richiede grandi interventi) e l'uso di classificatori esterni (che possono compromettere l'utilità). Tripwire è presentato come un approccio statisticamente certificato, che offre una via a grana fine per difendere i LLM preservando l'elaborazione delle richieste benigne.
Fatti principali
- 1. ID dell'articolo: arXiv:2608.14392
- 2. Titolo: Tripwire: Triggering Aligned Refusal via Statistically Certified Safety Neurons
- 3. Tipo: Nuovo annuncio
- 4. Abstract: Gli interventi a livello di neurone e di percorso offrono la difesa più granulare contro i jailbreak ma spesso compromettono l'utilità.
- 5. Metodi esistenti: sopprimere i neuroni tossici e usare classificatori esterni hanno limiti.
- 6. Tripwire è senza addestramento e identifica neuroni specifici per la sicurezza tramite test di ipotesi per neurone.
- 7. Tripwire mira a attivare un rifiuto allineato senza perturbazione sempre attiva.
- 8. Fonte: arXiv (https://arxiv.org/abs/2608.14392)
Entità
Istituzioni
- arXiv