I modelli visione-linguaggio all'avanguardia mostrano una teoria della mente frammentata tra i compiti
Uno studio recente pubblicato su arXiv (2608.00261) esamina nove modelli avanzati visione-linguaggio (VLM) utilizzando due benchmark derivati dalla psicologia per valutare le loro capacità di Teoria della Mente (ToM). I benchmark includono il Keysar Director Task, che misura la presa di prospettiva visiva in mezzo all'interferenza egocentrica, e i triangoli animati di Frith-Happé, valutati con la rubrica di Castelli, concentrandosi sull'attribuzione di intenzioni basata sul movimento. I risultati indicano che, in assenza di ragionamento a catena di pensiero, i modelli commettono errori egocentrici nel 78% delle prove, assomigliando alla prestazione dei bambini piuttosto che a quella degli adulti, con notevoli differenze tra i modelli. Il ragionamento migliora i risultati per alcuni modelli. Nel compito dei triangoli, l'attribuzione di intenzioni è sottorappresentata, con profili ToM più vicini alla media degli adulti autistici ad alto funzionamento (HF-ASD) che alla media degli adulti con sviluppo tipico (TD), mentre le condizioni Goal-Directed e Random sono vicine alla TD. Questo studio rivela una dissociazione nelle abilità ToM tra i VLM, indicando una cognizione sociale frammentata tra diversi compiti.
Fatti principali
- Sono stati valutati nove modelli visione-linguaggio all'avanguardia.
- Due benchmark utilizzati: Keysar Director Task e triangoli animati di Frith-Happé.
- Senza catena di pensiero, i modelli commettono errori egocentrici nel 78% delle prove.
- Il ragionamento salva diversi modelli nel Director Task.
- Nei triangoli, i modelli sottostimano l'attribuzione di intenzioni.
- Il profilo ToM è più di tre volte più vicino alla media HF-ASD che alla media TD.
- Le condizioni Goal-Directed e Random rimangono vicine alla TD.
- Lo studio mostra una dissociazione tra i compiti nella ToM dei VLM.
Entità
Istituzioni
- arXiv