CSES: Selettore Semantico di Keyframe Senza Addestramento per una Comprensione Video Efficiente
I ricercatori hanno introdotto CSES, un selettore semantico di keyframe senza addestramento progettato per ridurre il carico computazionale nei grandi modelli visione-linguaggio (LVLM) per la comprensione di video lunghi. Il metodo determina in modo adattivo il numero di frame da valutare e i keyframe da selezionare in base alla prominenza del profilo di rilevanza frame-query, affrontando i limiti dei metodi esistenti che valutano centinaia o migliaia di frame. CSES formula la selezione dei keyframe come un problema di copertura, tenendo conto congiuntamente di rilevanza semantica, ridondanza temporale e ridondanza visiva. L'approccio è dettagliato in un articolo annunciato su arXiv (arXiv:2608.00714) come annuncio di tipo cross. Il lavoro mira a migliorare l'efficienza nelle attività di analisi video, potenzialmente a beneficio di applicazioni nella documentazione artistica e nell'elaborazione di archivi video.
Fatti principali
- CSES è un selettore semantico di keyframe senza addestramento per LVLM.
- Determina in modo adattivo il numero di frame da valutare e i keyframe da selezionare.
- Stima la prominenza del profilo di rilevanza frame-query per guidare l'acquisizione attiva.
- La selezione dei keyframe è formulata come un problema di copertura.
- Il metodo tiene conto di rilevanza semantica, ridondanza temporale e ridondanza visiva.
- L'articolo è disponibile su arXiv con ID 2608.00714.
- Il tipo di annuncio è cross.
- L'approccio riduce il carico computazionale nella comprensione di video lunghi.
Entità
Istituzioni
- arXiv