SAGE: Gradienti Surrogati Adattivi per Trasformatori Spiking
Un nuovo approccio chiamato SAGE è stato sviluppato da ricercatori per addestrare reti neurali spiking (SNN), migliorando l'accuratezza adattando i gradienti surrogati durante il processo di addestramento. Questa tecnica innovativa, descritta in un articolo disponibile su arXiv (2608.13702), affronta le difficoltà di ottimizzazione associate alle SNN, note per la loro efficienza energetica ma che incontrano difficoltà a causa della natura non differenziabile della funzione spike. SAGE sfrutta l'incertezza a livello di blocco derivata dall'entropia di self-attention normalizzata per modificare la pendenza del gradiente surrogato durante l'addestramento, mantenendo invariato il modello di inferenza. I test condotti su CIFAR-10/100 dimostrano che SAGE supera i benchmark a gradiente surrogato fisso, mantenendo l'architettura originale e i costi di implementazione, offrendo al contempo una maggiore flessibilità di ottimizzazione.
Fatti principali
- SAGE è un meccanismo di gradiente surrogato modulato dall'incertezza per SNN basate su Transformer.
- Stima l'incertezza a livello di blocco dall'entropia di self-attention normalizzata.
- Il metodo adatta la pendenza del gradiente surrogato solo durante l'addestramento.
- Il modello di inferenza rimane invariato, preservando il costo di implementazione.
- Gli esperimenti su CIFAR-10/100 mostrano una maggiore accuratezza rispetto ai baseline a gradiente surrogato fisso.
- L'articolo è disponibile su arXiv con ID 2608.13702.
- Le SNN offrono un'alternativa energeticamente efficiente alle reti neurali profonde convenzionali.
- L'addestramento delle SNN è impegnativo a causa della funzione spike non differenziabile.
Entità
Istituzioni
- arXiv