ARTFEED — Contemporary Art Intelligence

Collasso in-contesto nei modelli visione-linguaggio: una nuova modalità di fallimento e mitigazione

ai-technology · 2026-08-06

Un articolo su arXiv (2608.02830) ha scoperto una modalità di fallimento inaspettata nei modelli visione-linguaggio (VLM). All'aumentare della quantità di dimostrazioni nell'apprendimento in-contesto multi-esempio (ICL), alcuni VLM subiscono un calo significativo e talvolta disastroso dell'accuratezza, definito 'collasso in-contesto'. Questo problema è evidente in classificazione sintetica, classificazione di immagini naturali e benchmark VQA, con alcuni modelli che ottengono prestazioni peggiori del caso pur producendo output coerenti. La ricerca valuta un pannello di VLM open con parametri che vanno da 0,5B a 11B e include il modello avanzato Claude Sonnet 4.5, rivelando un collasso graduale. Lo studio distingue due abilità: la resilienza all'aumento delle dimostrazioni e l'apprendimento di nuove regole in contesto, portando a tre regimi riproducibili. Attraverso esperimenti di lesione-e-ripristino con parametri abbinati, gli autori identificano il percorso di integrazione visione-linguaggio, in particolare un adattatore sul connettore, come fonte del collasso. Le strategie di mitigazione proposte mirano a risolvere questo problema, sfidando la convinzione diffusa che dimostrazioni aggiuntive migliorino sempre le prestazioni ICL nei VLM ed esponendo una vulnerabilità significativa nei modelli esistenti.

Fatti principali

  • L'apprendimento in-contesto multi-esempio (ICL) nei modelli visione-linguaggio (VLM) può portare a un netto calo dell'accuratezza man mano che le dimostrazioni si accumulano.
  • Questo fenomeno, chiamato 'collasso in-contesto', si verifica in un sottoinsieme di VLM.
  • Il collasso è osservato in classificazione sintetica, classificazione di immagini naturali e benchmark VQA.
  • Alcuni modelli scendono al di sotto dell'accuratezza casuale mentre gli output rimangono ben formati.
  • Lo studio include un pannello di VLM open (parametri 0,5B–11B) e Claude Sonnet 4.5.
  • Due capacità sono dissociabili: la robustezza all'accumulo di dimostrazioni e l'apprendimento di una nuova regola in contesto.
  • Il collasso è causalmente localizzato al percorso di integrazione visione-linguaggio tramite un adattatore sul connettore.
  • L'articolo propone strategie di mitigazione.
  • L'articolo è disponibile su arXiv con ID 2608.02830.

Entità

Istituzioni

  • arXiv
  • Claude Sonnet 4.5

Fonti