LENS: Valutare il Disapprendimento Narrativo nei LLM
Un nuovo quadro di valutazione noto come Level-based Evaluation of Narrative Suppression (LENS) è stato sviluppato per determinare se le tecniche di machine-unlearning possono impedire ai grandi modelli linguistici di generare narrazioni allineate con la disinformazione. LENS valuta la riproduzione delle narrazioni target su quattro livelli: diretto, attribuito, contrastivo e resistenza astratta. La ricerca esamina due narrazioni: una che ritrae l'invasione russa dell'Ucraina come risultato dell'espansione della NATO, e un'altra che descrive gli Stati Uniti come sfruttatori o abbandonatori di Taiwan. Gli esperimenti coinvolgono quattro modelli multilingue di istruzione con quasi 12 miliardi di parametri: Lapa LLM, Gemma-12B, Qwen-14B e TAIDE-Gemma. Inoltre, viene introdotto il punteggio Suppression-Collapse Efficiency (SCE) come metrica per selezionare checkpoint che incoraggino la soppressione della narrazione target scoraggiando output scadenti.
Fatti principali
- LENS valuta la soppressione narrativa su quattro livelli: diretto, attribuito, contrastivo e resistenza astratta.
- Due narrazioni testate: guerra Russia-Ucraina inquadrata come espansione NATO, e USA che sfruttano/abbandonano Taiwan.
- Modelli valutati: Lapa LLM, Gemma-12B, Qwen-14B, TAIDE-Gemma.
- Il punteggio SCE bilancia la soppressione delle narrazioni target con la qualità dell'output.
- Lo studio affronta se gli algoritmi di unlearning possano sopprimere narrazioni allineate con la disinformazione.
- Ricerca pubblicata su arXiv con ID 2607.22657.
- I modelli sono multilingue e hanno quasi 12 miliardi di parametri.
- Le cornici narrative sono spiegazioni plausibili prodotte dai LLM.
Entità
Istituzioni
- arXiv
Luoghi
- Russia
- Ukraine
- United States
- Taiwan