ARTFEED — Contemporary Art Intelligence

CogTest: un benchmark per valutare le abitudini cognitive nei modelli di ragionamento su larga scala

ai-technology · 2026-07-29

È stato lanciato un nuovo strumento di valutazione chiamato CogTest per valutare le abitudini cognitive nei Large Reasoning Models (LRM). Questo benchmark trae ispirazione dal modo in cui gli LRM riflettono schemi cognitivi simili a quelli umani, come la frase di auto-verifica 'Aspetta, mi sono perso qualcosa?'. CogTest si basa sul framework Habits of Mind, che delinea le abitudini cognitive legate a un'efficace risoluzione dei problemi umana. Comprende 16 abitudini cognitive, ciascuna rappresentata da 25 compiti vari, utilizzando un approccio di estrazione basato sull'evidenza per un rilevamento accurato delle abitudini. Il benchmark ha valutato 16 LLM di spicco, composti da 13 LRM e 3 modelli non di ragionamento. I risultati indicano che gli LRM mostrano abitudini cognitive simili a quelle umane, a differenza dei LLM tradizionali. La ricerca è documentata nell'articolo 'Towards Understanding the Cognitive Habits of Large Reasoning Models', accessibile su arXiv con identificatore 2506.21571.

Fatti principali

  • CogTest è un benchmark per valutare le abitudini cognitive negli LRM.
  • Include 16 abitudini cognitive, ciascuna con 25 compiti.
  • Il benchmark utilizza un metodo di estrazione basato sull'evidenza.
  • Sono stati valutati 16 LLM: 13 LRM e 3 modelli non di ragionamento.
  • Gli LRM mostrano abitudini cognitive simili a quelle umane, a differenza dei LLM convenzionali.
  • L'articolo è su arXiv con identificatore 2506.21571.
  • Le abitudini cognitive si basano sul framework Habits of Mind.
  • Frasi come 'Aspetta, mi sono perso qualcosa?' sono osservate negli LRM.

Entità

Istituzioni

  • arXiv

Fonti