EcoFrame: Programmazione Adattiva delle Evidenze Visive per una Comprensione Efficiente di Video Lunghi
È stato introdotto un nuovo framework, EcoFrame, per migliorare l'efficienza della comprensione di video lunghi nei modelli visione-linguaggio (VLM). Questo metodo, descritto in un articolo su arXiv (2608.03918), affronta la difficoltà di selezionare evidenze visive sparse da video lunghi. Le tecniche attuali impiegano una selezione statica one-shot con limiti di frame predeterminati o dipendono da scheduler basati su agenti che richiedono costosi ragionamenti multi-round. EcoFrame presenta un sistema di scheduling adattivo alla query che utilizza il feedback dell'inferenza del VLM per decidere quando aumentare il budget di frame e identificare ulteriori evidenze candidate. Incorpora uno scheduling del budget con soglia di entropia, che si ferma presto se le evidenze esistenti sono sufficienti o espande il budget progressivamente in caso contrario. Inoltre, le proposte di candidati guidate dall'attenzione trasformano l'attenzione a livello di frame in una priorità temporale, facilitando ricerche locali dense nelle aree chiave. Il framework è intenzionalmente a basso overhead e non richiede addestramento. L'articolo è stato pubblicato come sottomissione cross-type su arXiv.
Fatti principali
- EcoFrame è un framework senza addestramento per la comprensione efficiente di video lunghi.
- Utilizza uno scheduling del budget con soglia di entropia per adattare dinamicamente i budget di frame.
- La proposta di candidati guidata dall'attenzione converte l'attenzione a livello di frame in una priorità temporale.
- Il metodo sfrutta il feedback dell'inferenza del VLM per uno scheduling adattivo alla query.
- Punta a ridurre l'overhead rispetto agli scheduler basati su agenti.
- L'articolo è disponibile su arXiv con ID 2608.03918.
- Il tipo di annuncio è 'cross'.
- Il framework è destinato ai modelli visione-linguaggio (VLM).
Entità
Istituzioni
- arXiv