OPD-V: Auto-Distillazione Visiva On-Policy per LLM Multimodali
Un nuovo articolo di ricerca introduce OPD-V, un paradigma di auto-distillazione visiva on-policy progettato per affrontare lo squilibrio di modalità nei modelli linguistici di grandi dimensioni multimodali (MLLM). L'articolo, disponibile su arXiv (2608.05131), sostiene che i metodi esistenti di auto-distillazione on-policy (OPSD) trascurano lo squilibrio di modalità, dove l'informazione testuale domina la generazione, impedendo al modello di integrare completamente l'input multimodale. Per studiare questo, gli autori costruiscono un Insegnante Positivo con un'Immagine Zoom-In e un Insegnante Negativo con un'Immagine Maschera, che mostrano diversi gradi di squilibrio di modalità. I loro esperimenti rivelano che l'equilibrio di modalità stesso può servire come informazione privilegiata. Motivato da ciò, OPD-V implementa un approccio OPSD visivo che sfrutta questa intuizione per migliorare il ragionamento visivo nei MLLM. L'articolo è un annuncio di tipo cross, indicando che è stato sottoposto a una conferenza o a una rivista. La ricerca contribuisce al campo dell'IA e dell'apprendimento automatico, in particolare nel migliorare le capacità di ragionamento multimodale.
Fatti principali
- L'articolo introduce OPD-V, un paradigma di auto-distillazione visiva on-policy.
- Affronta lo squilibrio di modalità nei modelli linguistici di grandi dimensioni multimodali (MLLM).
- I metodi OPSD esistenti trascurano lo squilibrio di modalità.
- L'Insegnante Positivo utilizza un'Immagine Zoom-In; l'Insegnante Negativo utilizza un'Immagine Maschera.
- Gli esperimenti mostrano che l'equilibrio di modalità può servire come informazione privilegiata.
- OPD-V implementa OPSD visivo per migliorare il ragionamento visivo.
- L'articolo è disponibile su arXiv con ID 2608.05131.
- Il tipo di annuncio è cross.
Entità
Istituzioni
- arXiv