ARTFEED — Contemporary Art Intelligence

Mini Transformer Mostrano Protoragionamento nel Chain of Thought

ai-technology · 2026-08-06

Un nuovo articolo su arXiv (2608.04980) dimostra che modelli transformer molto piccoli, con circa 1 milione di parametri, possono utilizzare efficacemente una forma semplificata di ragionamento Chain of Thought (CoT), chiamata 'protoragionamento'. Questo approccio consente ai ricercatori di studiare il ragionamento passo-passo su una scala molto più piccola rispetto ai tipici modelli linguistici di grandi dimensioni (LLM), permettendo esperimenti e analisi più dettagliati. Lo studio affronta la questione se gli LLM apprendano algoritmi generali o semplicemente 'sacchi di euristiche' utilizzando compiti basati su linguaggi Dyck, che consistono in parentesi correttamente annidate. I risultati mostrano che le tracce di protoragionamento migliorano significativamente la generalizzazione fuori distribuzione, e le ablazioni confermano che il contenuto della traccia, non solo la sua esistenza, è cruciale. Questo lavoro apre opportunità per un'indagine più granulare sui meccanismi del ragionamento nei sistemi di intelligenza artificiale.

Fatti principali

  • Articolo su arXiv: 2608.04980
  • Mini transformer con ~1 milione di parametri usano il protoragionamento
  • Il protoragionamento è una forma semplice di Chain of Thought
  • Lo studio usa linguaggi Dyck (parentesi correttamente annidate)
  • Le tracce di protoragionamento colmano il divario di generalizzazione fuori distribuzione
  • Le ablazioni confermano che il contenuto della traccia è importante
  • Permette esperimenti dettagliati su piccola scala
  • Affronta la generalità del ragionamento negli LLM

Entità

Istituzioni

  • arXiv

Fonti