LENS: Evaluating Narrative Unlearning in LLMs
A novel assessment framework known as Level-based Evaluation of Narrative Suppression (LENS) has been developed to determine if machine-unlearning techniques can stop large language models from generating narratives aligned with disinformation. LENS evaluates the reproduction of target narratives on four levels: direct, attributed, contrastive, and abstract resistance. The research examines two narratives: one portraying Russia's invasion of Ukraine as a result of NATO's expansion, and another depicting the United States as either exploiting or neglecting Taiwan. The experiments involve four multilingual instruction models nearing 12 billion parameters: Lapa LLM, Gemma-12B, Qwen-14B, and TAIDE-Gemma. Additionally, the Suppression-Collapse Efficiency (SCE) score is introduced to serve as a metric for selecting checkpoints that encourage target-narrative suppression while discouraging poor outputs.
Key facts
- LENS evaluates narrative suppression across four levels: direct, attributed, contrastive, and abstract resistance.
- Two narratives tested: Russia-Ukraine war framed as NATO expansion, and US exploiting/abandoning Taiwan.
- Models evaluated: Lapa LLM, Gemma-12B, Qwen-14B, TAIDE-Gemma.
- SCE score balances suppression of target narratives against output quality.
- Study addresses whether unlearning algorithms can suppress disinformation-aligned narratives.
- Research published on arXiv with ID 2607.22657.
- Models are multilingual and near-12B parameters.
- Narrative frames are plausible explanations produced by LLMs.
Entities
Institutions
- arXiv
Locations
- Russia
- Ukraine
- United States
- Taiwan