Raven: Un Nuovo Modello Sequenziale a Tempo Lineare con Routing di Memoria Sparso
I ricercatori presentano Raven, un modello sequenziale a tempo lineare che migliora il richiamo di contesti lunghi mantenendo un insieme fisso di slot di memoria e aggiornando solo un sottoinsieme selezionato tramite routing appreso e dipendente dall'input. Questo approccio mitiga l'interferenza degli aggiornamenti densi di stato nei modelli a spazio di stato (SSM) e nei Transformer lineari, evitando al contempo l'evizione forzata dell'attenzione a finestra scorrevole (SWA). Raven raggiunge un alto richiamo preservando contenuti a lungo raggio senza il costo computazionale dell'attenzione completa. Il modello è descritto in un preprint su arXiv (2607.25357).
Fatti principali
- Raven è un modello sequenziale a tempo lineare.
- Utilizza un insieme fisso di slot di memoria.
- Aggiorna solo un sottoinsieme selezionato tramite routing appreso e dipendente dall'input.
- Mitiga l'interferenza degli aggiornamenti densi di stato negli SSM.
- Evita l'evizione forzata dell'attenzione a finestra scorrevole.
- Preserva contenuti a lungo raggio.
- Descritto nel preprint arXiv 2607.25357.
- Tipo di annuncio: cross.
Entità
Istituzioni
- arXiv