Collasso in-contesto nei modelli visione-linguaggio: una nuova modalità di fallimento e mitigazione
Un articolo su arXiv (2608.02830) ha scoperto una modalità di fallimento inaspettata nei modelli visione-linguaggio (VLM). All'aumentare della quantità di dimostrazioni nell'apprendimento in-contesto multi-esempio (ICL), alcuni VLM subiscono un calo significativo e talvolta disastroso dell'accuratezza, definito 'collasso in-contesto'. Questo problema è evidente in classificazione sintetica, classificazione di immagini naturali e benchmark VQA, con alcuni modelli che ottengono prestazioni peggiori del caso pur producendo output coerenti. La ricerca valuta un pannello di VLM open con parametri che vanno da 0,5B a 11B e include il modello avanzato Claude Sonnet 4.5, rivelando un collasso graduale. Lo studio distingue due abilità: la resilienza all'aumento delle dimostrazioni e l'apprendimento di nuove regole in contesto, portando a tre regimi riproducibili. Attraverso esperimenti di lesione-e-ripristino con parametri abbinati, gli autori identificano il percorso di integrazione visione-linguaggio, in particolare un adattatore sul connettore, come fonte del collasso. Le strategie di mitigazione proposte mirano a risolvere questo problema, sfidando la convinzione diffusa che dimostrazioni aggiuntive migliorino sempre le prestazioni ICL nei VLM ed esponendo una vulnerabilità significativa nei modelli esistenti.
Fatti principali
- L'apprendimento in-contesto multi-esempio (ICL) nei modelli visione-linguaggio (VLM) può portare a un netto calo dell'accuratezza man mano che le dimostrazioni si accumulano.
- Questo fenomeno, chiamato 'collasso in-contesto', si verifica in un sottoinsieme di VLM.
- Il collasso è osservato in classificazione sintetica, classificazione di immagini naturali e benchmark VQA.
- Alcuni modelli scendono al di sotto dell'accuratezza casuale mentre gli output rimangono ben formati.
- Lo studio include un pannello di VLM open (parametri 0,5B–11B) e Claude Sonnet 4.5.
- Due capacità sono dissociabili: la robustezza all'accumulo di dimostrazioni e l'apprendimento di una nuova regola in contesto.
- Il collasso è causalmente localizzato al percorso di integrazione visione-linguaggio tramite un adattatore sul connettore.
- L'articolo propone strategie di mitigazione.
- L'articolo è disponibile su arXiv con ID 2608.02830.
Entità
Istituzioni
- arXiv
- Claude Sonnet 4.5