Studio: Il Grounding Visivo nei VLM a Lungo Orizzonte Prevede la Generalizzazione Fuori Distribuzione
Uno studio recente pubblicato su arXiv (2603.06828) indica che i modelli visione-linguaggio (VLM) a lungo orizzonte con credenze temporalmente ancorate mostrano una migliore generalizzazione ai dati fuori distribuzione (OOD). I ricercatori definiscono la 'fedeltà comportamentale' come una caratteristica misurabile che valuta la coerenza del ragionamento intermedio di un modello con il contesto visivo in cambiamento. Analizzando otto modelli su tre benchmark a lungo orizzonte, dimostrano che il Tasso di Ancoraggio per Passo (SGR) correla con la ritenzione OOD a r = 0.83 (test di permutazione p = 0.003). Questa correlazione persiste tra modelli di capacità simile e non è attribuibile alla scala o all'accuratezza nella distribuzione. Gli autori sostengono che i benchmark tradizionali che si concentrano solo sull'accuratezza della risposta finale possono trascurare l'uso delle informazioni visive da parte del modello, evidenziando l'importanza dell'ancoraggio temporale come metrica chiave per migliorare i VLM nelle applicazioni a lungo orizzonte.
Fatti principali
- Articolo su arXiv:2603.06828
- Introduce il Tasso di Ancoraggio per Passo (SGR)
- SGR prevede la ritenzione OOD con r = 0.83
- Test di permutazione p = 0.003
- Valutato su otto modelli e tre benchmark
- La relazione vale anche tra modelli di capacità simile
- Non può essere spiegato dalla scala o dall'accuratezza nella distribuzione
- I benchmark standard misurano solo l'accuratezza della risposta finale
Entità
Istituzioni
- arXiv