VSSD: La distillazione del saliency visivo migliora il ragionamento CoT multimodale
I ricercatori propongono VSSD (Visual Saliency Steering Distillation), un metodo per migliorare il ragionamento a catena di pensiero multimodale in modelli di piccole dimensioni. VSSD utilizza mappe di attenzione di modelli linguistici multimodali di grandi dimensioni per generare immagini perturbate che catturano direzioni di feature sensibili al compito, quindi applica la decomposizione ai valori singolari per estrarre vettori di guida per la distillazione tra strati. Esperimenti su ScienceQA e M³CoT mostrano un miglioramento nella generazione di ragionamenti e nell'inferenza delle risposte. Il codice è disponibile pubblicamente.
Fatti principali
- VSSD sfrutta le mappe di attenzione dei modelli linguistici multimodali di grandi dimensioni.
- Genera immagini perturbate per catturare direzioni di feature sensibili al compito.
- La decomposizione ai valori singolari estrae i vettori di guida dominanti.
- I vettori di guida orientano la distillazione tra strati.
- Esperimenti condotti sui dataset ScienceQA e M³CoT.
- VSSD migliora la generazione di ragionamenti e l'inferenza delle risposte.
- Il metodo affronta i limiti di budget dei token nei modelli piccoli.
- Il codice è disponibile all'URL fornito.
Entità
—