MoNe: La memoria neurale modulare riduce i costi di inferenza a contesto lungo dell'80% a 128K token
MoNe si presenta come una memoria neurale modulare leggera per Transformer pre-addestrati, che consente l'inferenza a contesto lungo senza alcun riaddestramento. Elaborando l'input in blocchi fissi attraverso reti a pesi veloci apprese al momento del test, il sistema evita di rileggere il contesto durante l'inferenza derivando chiavi e valori esclusivamente dai token di query. Di conseguenza, i requisiti computazionali diventano indipendenti dalla lunghezza della sequenza: la pre-elaborazione scala linearmente con N, mentre ogni query costa tempo costante e il picco di memoria GPU rimane stabile. A 128K token, MoNe riduce il carico computazionale e di memoria di circa l'80% rispetto all'apprendimento in contesto standard, aggiungendo solo il 6,4% di parametri. Gestisce inoltre finestre di contesto ben oltre il limite del modello di base, eccellendo nei compiti di ago nel pagliaio e di estrazione di parole da RULER, dove l'ICL convenzionale fallisce nettamente.
Fatti principali
- MoNe è una memoria neurale modulare leggera per modelli Transformer.
- Si aggancia a qualsiasi Transformer pre-addestrato e congelato senza riaddestramento.
- Elabora il contesto in segmenti di dimensione fissa utilizzando l'apprendimento al momento del test di reti a pesi veloci.
- Durante l'inferenza, genera chiavi e valori esclusivamente dai token di query, evitando riletture del contesto.
- Raggiunge una pre-elaborazione O(N) e un costo di query O(1).
- Il picco di memoria GPU non cresce con la lunghezza del contesto N.
- A 128K token, riduce il carico computazionale e il picco di memoria GPU di circa l'80% rispetto all'apprendimento in contesto, con solo il 6,4% di parametri aggiuntivi.
- Generalizza oltre la finestra nativa del modello di base, ottenendo ottime prestazioni sui benchmark RULER dove l'ICL degrada nettamente.
Entità
Istituzioni
- arXiv
- arXivLabs
- Semantic Scholar
- RULER