Studio Rivela l'Inerzia delle Risposte nel Ragionamento dei Modelli Visione-Linguaggio
Un recente articolo su arXiv (2604.14888) esplora l'integrazione di dati visivi e testuali nei modelli visione-linguaggio (VLM) durante i processi di ragionamento. La ricerca esamina 18 VLM, categorizzati in tipi addestrati con istruzioni e tipi addestrati al ragionamento. Il team ha valutato i livelli di confidenza durante il ragionamento Chain-of-Thought (CoT), analizzato l'impatto delle correzioni di ragionamento e considerato il ruolo dei passaggi intermedi. I risultati indicano che i modelli mostrano 'inerzia delle risposte', dove le previsioni iniziali tendono a essere rafforzate piuttosto che modificate. Sebbene i modelli addestrati al ragionamento mostrino capacità di correzione migliorate, la loro efficacia varia in base alle condizioni di modalità, che vanno da ambienti prevalentemente testuali a ambienti esclusivamente visivi. Esperimenti con suggerimenti testuali fuorvianti hanno mostrato che i modelli sono persistentemente influenzati da questi segnali, anche quando le informazioni visive sono adeguate. Questo articolo, contrassegnato come replace-cross su arXiv, sottolinea le sfide nel monitorare la dipendenza dalla modalità nei VLM, sollevando preoccupazioni sull'affidabilità e la sicurezza dell'IA.
Fatti principali
- L'articolo è disponibile su arXiv con ID 2604.14888.
- Lo studio analizza le dinamiche di ragionamento in 18 modelli visione-linguaggio.
- Sono stati esaminati modelli di due diverse famiglie, inclusi varianti addestrate con istruzioni e addestrate al ragionamento.
- I ricercatori hanno monitorato la confidenza durante il ragionamento Chain-of-Thought (CoT).
- Lo studio ha rilevato che i modelli mostrano 'inerzia delle risposte', rafforzando le previsioni iniziali piuttosto che rivedendole.
- I modelli addestrati al ragionamento mostrano un comportamento correttivo più forte, ma i guadagni dipendono dalle condizioni di modalità.
- Interventi controllati con segnali testuali fuorvianti hanno mostrato che i modelli sono costantemente influenzati da questi segnali anche quando l'evidenza visiva è sufficiente.
- L'articolo è stato annunciato come replace-cross su arXiv, indicando una revisione.
Entità
Istituzioni
- arXiv