LoSA: Attenzione Sparsa Quasi Senza Perdite per l'Accelerazione della Diffusione Video Senza Addestramento
Un nuovo metodo chiamato LoSA, o Attenzione Sparsa Quasi Senza Perdite, è stato sviluppato per migliorare il funzionamento dei transformer di diffusione video, e non richiede alcun riaddestramento. Questa tecnica affronta il problema degli alti costi associati all'auto-attenzione in lunghe sequenze di token 3D, che possono diventare più problematici con risoluzioni più elevate e durate più lunghe. A differenza dei metodi di attenzione sparsa esistenti che si concentrano su una sparsità estrema, LoSA mantiene una soglia del 99% della massa di attenzione, garantendo una fedeltà quasi perfetta. Si basa su due idee principali: circa il 40% delle interazioni tra blocchi può essere eliminato senza perdere massa di attenzione, e il supporto ad alta massa rimane stabile durante la denoising. Puoi consultare la ricerca su arXiv con ID 2608.12032.
Fatti principali
- LoSA è un metodo di attenzione sparsa senza addestramento per i transformer di diffusione video.
- Fissa una soglia di massa mantenuta al 99% invece di un rapporto di sparsità.
- Circa il 40% delle interazioni tra blocchi può essere rimosso mantenendo il 99% della massa di attenzione.
- Il supporto ad alta massa rimane stabile attraverso i passi di denoising.
- LoSA misura le masse di attenzione esatte dei blocchi in un primo passo denso.
- Il metodo mira al costo quadratico dell'auto-attenzione su lunghe sequenze di token 3D.
- L'articolo è disponibile su arXiv con ID 2608.12032.
- Il tipo di annuncio è cross.
Entità
Istituzioni
- arXiv