Attenzione 2-simpliciale linearizzata raggiunge costo lineare con portata globale
Un recente articolo di ricerca presenta una variante linearizzata dell'attenzione 2-simpliciale, che migliora i meccanismi di attenzione convenzionali per gestire interazioni di ordine superiore. Gli autori riformulano il punteggio trilineare come un prodotto interno che coinvolge una query composita e una chiave, consentendo alla sommatoria lungo un asse dei token di rispecchiare la struttura dell'attenzione softmax standard. Utilizzano caratteristiche casuali positive per approssimare questa sommatoria, preservando l'intera storia in uno stato di dimensione fissa mentre mantengono esplicitamente il secondo asse su una breve finestra di token recenti. Questo approccio raggiunge una complessità lineare rispetto alla lunghezza della sequenza offrendo una prospettiva globale assente nell'attenzione 2-simpliciale a finestra. Implementato con kernel Triton personalizzati e integrato con l'attenzione delta di Kimi, questo modello opera senza attenzione softmax. Quando confrontato a parità di calcolo, dimostra la più alta accuratezza media downstream rispetto ad altre architetture. Con una lunghezza di contesto di 16k, migliora l'accuratezza media rispetto a un ibrido KDA e riduce la perplessità LAMBADA da 715.6 a 602.6. L'articolo è accessibile su arXiv con l'identificatore 2608.09307 nella sezione Informatica > Intelligenza Artificiale.
Fatti principali
- L'articolo presenta una forma linearizzata dell'attenzione 2-simpliciale.
- Il punteggio trilineare viene riscritto come prodotto interno tra una query composita e una chiave.
- La somma lungo un asse dei token assume la stessa forma dell'attenzione softmax ordinaria.
- Caratteristiche casuali positive approssimano la somma, memorizzando l'intero passato in uno stato di dimensione fissa.
- Il secondo asse rimane esplicito su una breve finestra di token recenti.
- Il metodo raggiunge un costo lineare nella lunghezza della sequenza con portata globale.
- Vengono utilizzati kernel Triton personalizzati per l'implementazione.
- Il modello si combina con l'attenzione delta di Kimi e non ha attenzione softmax.
- A parità di calcolo, raggiunge la più alta accuratezza media downstream tra le architetture confrontate.
- Con un contesto di 16k, migliora l'accuratezza media rispetto a un ibrido KDA e riduce la perplessità LAMBADA da 715.6 a 602.6.
Entità
Istituzioni
- arXiv