Ge²mS-T: Trasformatore Spiking Ultra-Efficiente tramite Raggruppamento Multi-Dimensionale
Una nuova architettura per i Trasformatori Visivi Spiking (S-ViT) mira a migliorare significativamente l'efficienza energetica affrontando al contempo le sfide di addestramento e inferenza. Il modello proposto, Ge²mS-T, incorpora il calcolo raggruppato attraverso le dimensioni temporale, spaziale e della struttura di rete. Utilizza il modello IF basato su codifica esponenziale raggruppata (ExpG-IF), che consente una conversione senza perdite con un overhead di addestramento costante e una gestione accurata dei pattern di spike, insieme all'Autoattenzione Spiking per Gruppi (GW-SSA) per ridurre la complessità computazionale attraverso il raggruppamento di token multi-scala. Questa ricerca affronta i limiti dei metodi attuali come la Conversione ANN-SNN e la Retropropagazione Spazio-Temporale (STBP), che ostacolano l'ottimizzazione simultanea di memoria, accuratezza ed energia. L'articolo è disponibile su arXiv con identificativo 2604.08894, dettagliando la metodologia. Questo lavoro è significativo per il calcolo neuromorfico e l'IA a basso consumo energetico, con potenziali implicazioni per il calcolo periferico e le applicazioni in tempo reale.
Fatti principali
- Ge²mS-T è una nuova architettura per i Trasformatori Visivi Spiking (S-ViT).
- Implementa il calcolo raggruppato attraverso le dimensioni temporale, spaziale e della struttura di rete.
- Introduce il modello IF basato su codifica esponenziale raggruppata (ExpG-IF) per una conversione senza perdite.
- Sviluppa l'Autoattenzione Spiking per Gruppi (GW-SSA) per ridurre la complessità computazionale.
- Affronta i limiti della Conversione ANN-SNN e della Retropropagazione Spazio-Temporale (STBP).
- Punta all'ottimizzazione simultanea di memoria, accuratezza e consumo energetico.
- Articolo disponibile su arXiv con identificativo 2604.08894.
- Obiettivo: efficienza energetica ultra-elevata nei trasformatori spiking.
Entità
Istituzioni
- arXiv