ARTFEED — Contemporary Art Intelligence

I modelli visione-linguaggio all'avanguardia mostrano una teoria della mente frammentata tra i compiti

ai-technology · 2026-08-04

Uno studio recente pubblicato su arXiv (2608.00261) esamina nove modelli avanzati visione-linguaggio (VLM) utilizzando due benchmark derivati dalla psicologia per valutare le loro capacità di Teoria della Mente (ToM). I benchmark includono il Keysar Director Task, che misura la presa di prospettiva visiva in mezzo all'interferenza egocentrica, e i triangoli animati di Frith-Happé, valutati con la rubrica di Castelli, concentrandosi sull'attribuzione di intenzioni basata sul movimento. I risultati indicano che, in assenza di ragionamento a catena di pensiero, i modelli commettono errori egocentrici nel 78% delle prove, assomigliando alla prestazione dei bambini piuttosto che a quella degli adulti, con notevoli differenze tra i modelli. Il ragionamento migliora i risultati per alcuni modelli. Nel compito dei triangoli, l'attribuzione di intenzioni è sottorappresentata, con profili ToM più vicini alla media degli adulti autistici ad alto funzionamento (HF-ASD) che alla media degli adulti con sviluppo tipico (TD), mentre le condizioni Goal-Directed e Random sono vicine alla TD. Questo studio rivela una dissociazione nelle abilità ToM tra i VLM, indicando una cognizione sociale frammentata tra diversi compiti.

Fatti principali

  • Sono stati valutati nove modelli visione-linguaggio all'avanguardia.
  • Due benchmark utilizzati: Keysar Director Task e triangoli animati di Frith-Happé.
  • Senza catena di pensiero, i modelli commettono errori egocentrici nel 78% delle prove.
  • Il ragionamento salva diversi modelli nel Director Task.
  • Nei triangoli, i modelli sottostimano l'attribuzione di intenzioni.
  • Il profilo ToM è più di tre volte più vicino alla media HF-ASD che alla media TD.
  • Le condizioni Goal-Directed e Random rimangono vicine alla TD.
  • Lo studio mostra una dissociazione tra i compiti nella ToM dei VLM.

Entità

Istituzioni

  • arXiv

Fonti