SAPER: Potatura Morbida Guidata dall'Interpretabilità delle Teste di Attenzione nei Vision Transformer
Un nuovo articolo su arXiv (2608.00264) introduce SAPER (Soft Attention PrunER), un framework di potatura differenziabile end-to-end per i Vision Transformer (ViT) che sfrutta le intuizioni dell'interpretabilità per ridurre i costi computazionali mantenendo l'accuratezza. Gli autori propongono una tecnica di analisi spettrale e visualizzazione basata sugli autovettori di Laplaciano delle mappe di attenzione per comprendere le singole teste di attenzione. Raggruppano semanticamente le teste per identificare ridondanze funzionali, quindi applicano l'approccio LapSum Soft Top-K per la potatura morbida. Gli esperimenti su ImageNet-1K mostrano che SAPER raggiunge un favorevole compromesso accuratezza-efficienza, superando il baseline RAPTOR nella riduzione dei FLOPs. Il lavoro affronta le esigenze computazionali di grandi modelli foundation visivi come DINOv2, offrendo una soluzione più efficiente e interpretabile.
Fatti principali
- L'articolo arXiv:2608.00264 introduce SAPER (Soft Attention PrunER).
- SAPER è un framework di potatura differenziabile end-to-end per i Vision Transformer.
- Il metodo utilizza l'analisi spettrale e gli autovettori di Laplaciano delle mappe di attenzione.
- Le teste di attenzione vengono raggruppate semanticamente per identificare ridondanze funzionali.
- L'approccio LapSum Soft Top-K viene utilizzato per la potatura morbida.
- Gli esperimenti su ImageNet-1K dimostrano un favorevole compromesso accuratezza-efficienza.
- SAPER supera il baseline RAPTOR nella riduzione dei FLOPs.
- Il lavoro affronta le esigenze computazionali di modelli foundation visivi come DINOv2.
Entità
Istituzioni
- arXiv