Fair-ASR: Un nuovo protocollo per la valutazione comparabile degli attacchi jailbreak black-box
Il 26 agosto 2028, è stato pubblicato su arXiv (arXiv:2608.17360v1) un articolo di ricerca che mette in discussione la metrica convenzionale del tasso di successo degli attacchi (ASR) utilizzata per valutare gli attacchi jailbreak sui grandi modelli linguistici (LLM), sostenendo che non tiene conto dell'utilizzo delle risorse. Le valutazioni attuali che considerano il calcolo, come i FLOPs, sono criticate come insufficienti per i modelli black-box. Gli autori propongono un nuovo framework di valutazione chiamato Fair-ASR, che limita tutti gli approcci a un budget comune di chiamate target (B), consentendo confronti equi senza richiedere conoscenze interne del modello. Rivalutando undici strategie di attacco, i ricercatori hanno osservato che le classifiche variavano significativamente in base ai vincoli di budget. Hanno scoperto che semplici perturbazioni stocastiche e modelli creati manualmente erano competitivi, indicando che attacchi intricati potrebbero non essere sempre necessari. I risultati evidenziano l'importanza di tecniche di valutazione che si allineino con i limiti del mondo reale.
Fatti principali
- Articolo pubblicato su arXiv con identificativo 2608.17360v1
- Introduce Fair-ASR, un protocollo di valutazione per attacchi jailbreak black-box
- Utilizza budget comuni di chiamate target B come asse di confronto
- Le chiamate target sono direttamente osservabili e indipendenti dal metodo
- Tiene traccia separatamente delle chiamate dell'attaccante per l'analisi dell'efficienza
- Rivaluta 11 metodi di attacco rappresentativi
- Le classifiche degli attacchi cambiano sostanzialmente tra diversi budget di chiamate target
- Semplici perturbazioni stocastiche e modelli creati manualmente rimangono altamente competitivi
Entità
Istituzioni
- arXiv