ARTFEED — Contemporary Art Intelligence

Motion-as-Prompt: Migliorare il Ragionamento sul Movimento nei Modelli Multimodali di Grandi Dimensioni tramite Prompt Visivi Cross-Frame

ai-technology · 2026-08-13

Il nuovo framework introdotto, Motion-as-Prompt (MaP), mira a migliorare il ragionamento video incentrato sul movimento nei modelli linguistici multimodali di grandi dimensioni (MLLM). I MLLM convenzionali utilizzano un campionamento uniforme sparso per l'analisi video, che può trascurare transizioni essenziali tra i fotogrammi, ostacolando così la comprensione dei movimenti degli oggetti, delle collisioni e delle relazioni causali. MaP affronta questo problema recuperando traiettorie puntuali dense, selezionando fotogrammi che trasmettono informazioni sul movimento e sovrapponendo le traiettorie accumulate tra fotogrammi campionati consecutivi sugli input visivi. Questo approccio rende visibili spostamenti nascosti, cambi di direzione e interazioni ai MLLM statici. I test su CLEVRER e Something-Something-v2 dimostrano che MaP aumenta significativamente l'accuratezza media del ragionamento sul movimento. Questa ricerca è disponibile su arXiv con l'identificatore 2608.11655.

Fatti principali

  • MaP è un framework di prompting visivo cross-frame guidato da traiettorie.
  • Recupera traiettorie puntuali dense e seleziona fotogrammi informativi sul movimento.
  • Segna le traiettorie tra fotogrammi campionati consecutivi sugli input visivi.
  • Rende osservabili spostamenti nascosti, cambi di direzione e interazioni ai MLLM congelati.
  • Gli esperimenti su CLEVRER e Something-Something-v2 mostrano un miglioramento costante nell'accuratezza del ragionamento sul movimento.
  • L'articolo è disponibile su arXiv con ID 2608.11655.
  • La ricerca affronta i limiti del campionamento uniforme sparso nei MLLM.
  • Il ragionamento video incentrato sul movimento è fondamentale per la manipolazione robotica e la navigazione autonoma.

Entità

Istituzioni

  • arXiv

Fonti