Mini Transformer Mostrano Protoragionamento nel Chain of Thought
Un nuovo articolo su arXiv (2608.04980) dimostra che modelli transformer molto piccoli, con circa 1 milione di parametri, possono utilizzare efficacemente una forma semplificata di ragionamento Chain of Thought (CoT), chiamata 'protoragionamento'. Questo approccio consente ai ricercatori di studiare il ragionamento passo-passo su una scala molto più piccola rispetto ai tipici modelli linguistici di grandi dimensioni (LLM), permettendo esperimenti e analisi più dettagliati. Lo studio affronta la questione se gli LLM apprendano algoritmi generali o semplicemente 'sacchi di euristiche' utilizzando compiti basati su linguaggi Dyck, che consistono in parentesi correttamente annidate. I risultati mostrano che le tracce di protoragionamento migliorano significativamente la generalizzazione fuori distribuzione, e le ablazioni confermano che il contenuto della traccia, non solo la sua esistenza, è cruciale. Questo lavoro apre opportunità per un'indagine più granulare sui meccanismi del ragionamento nei sistemi di intelligenza artificiale.
Fatti principali
- Articolo su arXiv: 2608.04980
- Mini transformer con ~1 milione di parametri usano il protoragionamento
- Il protoragionamento è una forma semplice di Chain of Thought
- Lo studio usa linguaggi Dyck (parentesi correttamente annidate)
- Le tracce di protoragionamento colmano il divario di generalizzazione fuori distribuzione
- Le ablazioni confermano che il contenuto della traccia è importante
- Permette esperimenti dettagliati su piccola scala
- Affronta la generalità del ragionamento negli LLM
Entità
Istituzioni
- arXiv