ARTFEED — Contemporary Art Intelligence

Stem: Un Nuovo Modulo di Sparsità per un'Attenzione Causale Efficiente nei LLM

ai-technology · 2026-08-03

Uno studio recente pubblicato su arXiv (2603.06274) presenta Stem, una soluzione modulare di sparsità volta a mitigare le richieste computazionali quadratiche dell'auto-attenzione nei Grandi Modelli Linguistici (LLM) durante la fase di pre-riempimento. I ricercatori sostengono che le attuali tecniche sparse, che generalmente implementano una selezione top-k uniforme su tutte le posizioni dei token in un livello, trascurano le dipendenze cumulative delle informazioni dei token presenti nelle architetture causali. Per affrontare questo problema, Stem introduce una strategia di Decadimento della Posizione dei Token, che impiega selezioni top-k specifiche per posizione all'interno di ogni livello per mantenere i token iniziali per le dipendenze ricorsive, insieme a un metodo per trattenere i token ricchi di informazioni. L'articolo completo è disponibile all'indirizzo https://arxiv.org/abs/2603.06274.

Fatti principali

  • L'articolo arXiv:2603.06274 introduce Stem, un modulo di sparsità per l'attenzione causale.
  • Stem affronta la complessità computazionale quadratica dell'auto-attenzione nei LLM.
  • I metodi sparsi esistenti usano una selezione top-k uniforme, ignorando la dipendenza cumulativa.
  • Stem impiega una strategia di Decadimento della Posizione dei Token per un top-k dipendente dalla posizione.
  • Stem è plug-and-play e allineato con il flusso di informazioni.
  • L'articolo si concentra sulla fase di pre-riempimento dei LLM.
  • Stem mira a preservare i token ricchi di informazioni.
  • L'articolo è disponibile su arXiv.

Entità

Istituzioni

  • arXiv

Fonti