JailbreakSkill: un framework incentrato sulle competenze per il red-teaming automatizzato su larga scala
I ricercatori hanno introdotto un nuovo sistema chiamato JailbreakSkill volto a migliorare l'efficienza del red-teaming automatizzato per i grandi modelli linguistici (LLM). Questo nuovo metodo categorizza le tecniche di attacco in competenze che possono essere riutilizzate e adattate. Trasformando le strategie attuali in competenze modulari, JailbreakSkill consente un'applicazione versatile su diversi compiti e modelli. Una caratteristica chiave è la sua capacità di collegare le azioni di attacco con l'apprendimento: le intuizioni ottenute dagli attacchi aiutano a sviluppare e perfezionare nuove competenze, contribuendo a una libreria di competenze in crescita. Questo perfezionamento continuo ha portato a impressionanti aumenti nei tassi di successo degli attacchi, come un aumento medio di 17,5 punti su AdvBench e 13,4 punti su HarmBench, con un notevole guadagno di 48,6 punti contro GPT-5.4 su AdvBench. Il framework affronta efficacemente la frammentazione esistente nei metodi di attacco, promuovendo una migliore integrazione e miglioramento. La ricerca completa è disponibile su arXiv, identificatore 2608.16465.
Fatti principali
- JailbreakSkill è un framework incentrato sulle competenze per scalare il red-teaming automatizzato.
- Impacchetta le strategie di attacco in competenze modulari pronte per gli agenti.
- Le competenze possono essere riutilizzate e selezionate in modo adattivo tra compiti e modelli target.
- Il framework chiude il ciclo tra attacco e apprendimento.
- L'esperienza degli attacchi viene utilizzata per diagnosticare, perfezionare, combinare e scoprire nuove competenze.
- Nuove competenze vengono aggiunte a una libreria di competenze in continua crescita.
- Il tasso di successo medio (ASR) è migliorato di 17,5 punti percentuali su AdvBench.
- Il tasso di successo medio (ASR) è migliorato di 13,4 punti su HarmBench.
- È stato osservato un guadagno di 48,6 punti contro GPT-5.4 su AdvBench.
- L'articolo è disponibile su arXiv con identificatore 2608.16465.
Entità
Istituzioni
- arXiv