ARTFEED — Contemporary Art Intelligence

See2Think Framework verifica se l'IA multimodale utilizza realmente il ragionamento visivo

ai-technology · 2026-07-30

Uno studio recente ha presentato See2Think, un quadro di valutazione completo volto a determinare se i grandi modelli linguistici multimodali utilizzano realmente stati visivi intermedi – come schizzi, annotazioni e immagini renderizzate – durante il ragionamento, o se si limitano a simulare la comprensione visiva. Questo framework è composto da due elementi chiave: See2ThinkBench, che include 1.200 sfide aperte e visivamente dipendenti in 12 categorie di compiti, tra cui ragionamento 2D strutturato, 3D di scena e del mondo reale; e Visual Action-of-Thought (VAoT), che cattura pensieri testuali, azioni visive, stati renderizzati e ragionamenti successivi in quattro scenari di inferenza controllati. La ricerca esamina vari modelli multimodali proprietari e open-source, rivelando che il ragionamento visivo è spesso superficiale. I risultati sono disponibili su arXiv con l'identificatore 2607.26769.

Fatti principali

  • See2Think è un quadro di valutazione unificato per LLM multimodali.
  • See2ThinkBench contiene 1.200 problemi aperti in 12 categorie di compiti.
  • Le categorie coprono il ragionamento 2D strutturato, 3D di scena e del mondo reale.
  • VAoT registra pensieri testuali, azioni visive, stati renderizzati e ragionamenti.
  • In VAoT vengono utilizzate quattro impostazioni di inferenza controllate.
  • Sono stati valutati modelli multimodali proprietari e open-source.
  • I risultati indicano che il ragionamento visivo è spesso superficiale.
  • Articolo pubblicato su arXiv con ID 2607.26769.

Entità

Istituzioni

  • arXiv

Fonti