ARTFEED — Contemporary Art Intelligence

ReMem: Comprensione di Video Lunghi Senza Addestramento tramite Selezione Adattiva di Keyframe basata sulla Granularità Temporale

ai-technology · 2026-07-29

È stato introdotto un nuovo framework chiamato ReMem (Reasoning with Memory) per la comprensione di video lunghi senza necessità di addestramento. Questo framework affronta le sfide poste dai Modelli Linguistici Multimodali di Grandi Dimensioni (MLLM), che hanno finestre di contesto limitate che restringono la loro capacità di analizzare video lunghi. ReMem presenta un adattamento potenziato dalla memoria a due livelli: a livello di query, il Parsing delle Domande Guidato dalla Memoria utilizza la memoria a lungo termine degli LLM per interpretare la granularità temporale delle domande e identificare entità semantiche; a livello video, l'Allineamento dei Frame a Doppia Semantica Sinergico sfrutta la memoria strutturale intrinseca per sincronizzare i frame con la semantica della query, facilitando il Routing Dinamico dei Frame Consapevole della Struttura per il clustering dei frame. Progettato per il Question Answering su Video Lunghi (LongVideoQA), adatta la selezione dei keyframe in base alla granularità temporale della query, superando gli svantaggi del campionamento uniforme o della selezione statica guidata dalla query. Il paper è disponibile su arXiv con ID 2607.24794.

Fatti principali

  • 1. ReMem è un framework di selezione adattiva dei keyframe basato sulla granularità temporale per LongVideoQA senza addestramento.
  • 2. Affronta le finestre di contesto limitate negli MLLM per la comprensione di video lunghi.
  • 3. Il framework utilizza un adattamento potenziato dalla memoria a due livelli: a livello di query e a livello video.
  • 4. Il Parsing delle Domande Guidato dalla Memoria utilizza la memoria a lungo termine degli LLM per decodificare la granularità temporale delle domande.
  • 5. L'Allineamento dei Frame a Doppia Semantica Sinergico allinea i frame con la semantica della query utilizzando la memoria strutturale intrinseca.
  • 6. Il Routing Dinamico dei Frame Consapevole della Struttura raggruppa i frame in base all'allineamento.
  • 7. Il paper è pubblicato su arXiv con ID 2607.24794.
  • 8. Il framework è senza addestramento, il che significa che non richiede ulteriore fine-tuning.

Entità

Istituzioni

  • arXiv

Fonti