Wiola: Un'architettura di attenzione a spirale gated per modelli linguistici piccoli ed efficienti
Una recente pubblicazione su arXiv (2608.14604) presenta Wiola, un modello linguistico focalizzato sui decoder, ottimizzato per un numero di parametri compreso tra 10 e 100 milioni, destinato all'inferenza su dispositivo e alla ricerca scientifica controllata. Questa architettura incorpora tre componenti innovativi in ogni strato: la codifica posizionale rotativa a spirale, che migliora la discriminazione a lungo raggio modificando le frequenze rotative standard con un fattore per dimensione gradualmente crescente, mantenendo al contempo il numero di parametri; l'attenzione a spirale gated, che implementa un gate scalare adattivo al contenuto per una selezione implicita delle teste soft basata su una statistica cumulativa causale del flusso di query; e un blocco feed-forward a farfalla che sostituisce il tradizionale strato di espansione con un design moltiplicativo. Gli autori di questo studio sottolineano la necessità di modelli linguistici su piccola scala che si adattino oltre i blocchi transformer standard.
Fatti principali
- Il documento arXiv:2608.14604 introduce Wiola, un modello linguistico solo decoder.
- Si rivolge a modelli linguistici piccoli nell'intervallo di parametri 10-100 milioni.
- Punta all'inferenza su dispositivo, alla sperimentazione rapida e allo studio scientifico controllato.
- La novità risiede in tre componenti sostituibili per strato.
- La codifica posizionale rotativa a spirale perturba le frequenze rotative con un fattore per dimensione che cresce lentamente.
- L'attenzione a spirale gated introduce un gate scalare adattivo al contenuto per testa, basato su una statistica cumulativa causale del flusso di query.
- Il blocco feed-forward a farfalla sostituisce il convenzionale strato di espansione con una struttura moltiplicativa.
- Il documento è pubblicato su arXiv con tipo di annuncio 'cross'.
Entità
Istituzioni
- arXiv