TokenMem: Un sistema di memoria leggero per l'iniezione fedele di conoscenza in LLM congelati
TokenMem è un'architettura di memoria innovativa che consente l'integrazione di conoscenze esterne in modelli linguistici di grandi dimensioni (LLM) statici senza generare conflitti di conoscenza. A differenza della generazione aumentata da recupero (RAG), che utilizza un percorso comune di self-attention che può produrre risultati erratici quando i dati recuperati contraddicono la conoscenza esistente, TokenMem impiega un canale separato di cross-attention. Questo metodo evita di competere con la memoria parametrica all'interno del flusso residuo. Il sistema addestra un adattatore di gating leggero, composto da circa 3-7 milioni di parametri, attraverso un curriculum in due fasi: inizialmente focalizzato sull'applicazione della conoscenza generale, seguito dal miglioramento dell'aderenza alle informazioni controfattuali. Nei test che coinvolgono cinque modelli di tre famiglie (Qwen3-4B/8B/14B, LLaMA-3.1-8B, OLMo-3-7B), TokenMem ha dimostrato una Conformità della Conoscenza (KC) del 69-70% su benchmark controfattuali, superando significativamente il RAG vanilla con il 20-52%, con una differenza fino a 49 punti percentuali. Il documento di ricerca è disponibile su arXiv.
Fatti principali
- TokenMem è un sistema di memoria leggero per LLM congelati
- Utilizza un canale dedicato di cross-attention per iniettare conoscenza
- Addestra un adattatore di gating sottile di circa 3-7 milioni di parametri
- Curriculum in due fasi: utilizzo della conoscenza generale poi conformità fedele
- Testato su Qwen3-4B/8B/14B, LLaMA-3.1-8B, OLMo-3-7B
- Raggiunge il 69-70% di Conformità della Conoscenza su benchmark controfattuali
- Il RAG vanilla raggiunge il 20-52% sugli stessi benchmark
- Differenza di prestazioni fino a 49 punti percentuali
Entità
Istituzioni
- arXiv