See2Think Framework verifica se l'IA multimodale utilizza realmente il ragionamento visivo
Uno studio recente ha presentato See2Think, un quadro di valutazione completo volto a determinare se i grandi modelli linguistici multimodali utilizzano realmente stati visivi intermedi – come schizzi, annotazioni e immagini renderizzate – durante il ragionamento, o se si limitano a simulare la comprensione visiva. Questo framework è composto da due elementi chiave: See2ThinkBench, che include 1.200 sfide aperte e visivamente dipendenti in 12 categorie di compiti, tra cui ragionamento 2D strutturato, 3D di scena e del mondo reale; e Visual Action-of-Thought (VAoT), che cattura pensieri testuali, azioni visive, stati renderizzati e ragionamenti successivi in quattro scenari di inferenza controllati. La ricerca esamina vari modelli multimodali proprietari e open-source, rivelando che il ragionamento visivo è spesso superficiale. I risultati sono disponibili su arXiv con l'identificatore 2607.26769.
Fatti principali
- See2Think è un quadro di valutazione unificato per LLM multimodali.
- See2ThinkBench contiene 1.200 problemi aperti in 12 categorie di compiti.
- Le categorie coprono il ragionamento 2D strutturato, 3D di scena e del mondo reale.
- VAoT registra pensieri testuali, azioni visive, stati renderizzati e ragionamenti.
- In VAoT vengono utilizzate quattro impostazioni di inferenza controllate.
- Sono stati valutati modelli multimodali proprietari e open-source.
- I risultati indicano che il ragionamento visivo è spesso superficiale.
- Articolo pubblicato su arXiv con ID 2607.26769.
Entità
Istituzioni
- arXiv