Aggregatore Video Compresso per Raccomandazione Efficiente di Micro-Video
Un team di ricercatori ha presentato un nuovo strumento chiamato Aggregatore Video Compresso (CVA), che si concentra sul miglioramento delle raccomandazioni di micro-video mantenendo il contenuto video separato dall'apprendimento delle preferenze. Questo modulo utilizza una tecnica chiamata masked mean pooling per trasformare gli embedding statici dei frame VFM in un anchor di consenso semantico, che viene poi convertito in uno spazio latente più piccolo. Subisce ulteriori affinamenti attraverso strati di self-attention residua e feedforward, producendo un unico embedding video per le raccomandazioni. Per ridurre la ridondanza, i titoli aiutano a selezionare i frame importanti utilizzando CLIP. I test sui dataset MicroLens e Short-Video mostrano notevoli miglioramenti, insieme a significative riduzioni del tempo di addestramento e della memoria GPU, migliorando al contempo le prestazioni di tutti i metodi, incluso CVA.
Fatti principali
- CVA separa le informazioni video dall'apprendimento delle preferenze.
- Utilizza masked mean pooling per riassumere gli embedding dei frame VFM congelati.
- I frame chiave vengono riselezionati in base a CLIP utilizzando i titoli.
- Gli esperimenti sui dataset MicroLens e Short-Video mostrano guadagni.
- Il tempo di addestramento e la memoria GPU sono ridotti di ordini di grandezza.
- I frame riselezionati migliorano tutti i metodi, incluso CVA.
- L'articolo discute scenari di titoli errati.
- CVA produce un unico embedding video per il raccomandatore.
Entità
—