Motion-as-Prompt: Migliorare il Ragionamento sul Movimento nei Modelli Multimodali di Grandi Dimensioni tramite Prompt Visivi Cross-Frame
Il nuovo framework introdotto, Motion-as-Prompt (MaP), mira a migliorare il ragionamento video incentrato sul movimento nei modelli linguistici multimodali di grandi dimensioni (MLLM). I MLLM convenzionali utilizzano un campionamento uniforme sparso per l'analisi video, che può trascurare transizioni essenziali tra i fotogrammi, ostacolando così la comprensione dei movimenti degli oggetti, delle collisioni e delle relazioni causali. MaP affronta questo problema recuperando traiettorie puntuali dense, selezionando fotogrammi che trasmettono informazioni sul movimento e sovrapponendo le traiettorie accumulate tra fotogrammi campionati consecutivi sugli input visivi. Questo approccio rende visibili spostamenti nascosti, cambi di direzione e interazioni ai MLLM statici. I test su CLEVRER e Something-Something-v2 dimostrano che MaP aumenta significativamente l'accuratezza media del ragionamento sul movimento. Questa ricerca è disponibile su arXiv con l'identificatore 2608.11655.
Fatti principali
- MaP è un framework di prompting visivo cross-frame guidato da traiettorie.
- Recupera traiettorie puntuali dense e seleziona fotogrammi informativi sul movimento.
- Segna le traiettorie tra fotogrammi campionati consecutivi sugli input visivi.
- Rende osservabili spostamenti nascosti, cambi di direzione e interazioni ai MLLM congelati.
- Gli esperimenti su CLEVRER e Something-Something-v2 mostrano un miglioramento costante nell'accuratezza del ragionamento sul movimento.
- L'articolo è disponibile su arXiv con ID 2608.11655.
- La ricerca affronta i limiti del campionamento uniforme sparso nei MLLM.
- Il ragionamento video incentrato sul movimento è fondamentale per la manipolazione robotica e la navigazione autonoma.
Entità
Istituzioni
- arXiv