LaViT: Allineare i Pensieri Visivi Latenti per un Ragionamento Multimodale Potenziato
Un nuovo framework chiamato LaViT, acronimo di Latent Visual Thoughts (Pensieri Visivi Latenti), mira a migliorare il modo in cui i sistemi di intelligenza artificiale gestiscono il ragionamento multimodale allineando i concetti visivi anziché utilizzare embedding fissi. Secondo uno studio condiviso nell'articolo arXiv 2601.10129, esiste un 'Perception Gap' nella distillazione della conoscenza, in cui i modelli studenti imitano il testo di un insegnante ma si concentrano su aspetti visivi diversi a causa di pregiudizi linguistici invece che sulla percezione fondata. LaViT affronta questo problema facendo sì che il modello studente ricostruisca il significato visivo e i percorsi di attenzione dell'insegnante prima di generare testo. I suoi esperimenti mostrano progressi significativi nel grounding visivo, con un aumento fino al 16,9% in compiti di ragionamento complessi, e un modello compatto da 3B supera alternative più grandi. Questa ricerca segna un passo significativo nell'IA e nell'apprendimento automatico.
Fatti principali
- LaViT allinea i pensieri visivi latenti anziché embedding statici.
- Identifica un Perception Gap nella distillazione in cui gli studenti imitano l'output testuale ma prestano attenzione a diverse regioni visive.
- Utilizza un meccanismo di gating sensoriale curriculare per prevenire l'apprendimento tramite scorciatoie.
- Raggiunge guadagni fino a +16,9% su compiti di ragionamento complessi.
- Un modello compatto da 3B supera varianti open-source più grandi.
- Articolo disponibile su arXiv con ID 2601.10129.
- Tipo di annuncio: replace-cross.
- Si concentra sul ragionamento latente multimodale senza supervisione esterna.
Entità
Istituzioni
- arXiv