CachedSearch: Ricerca senza addestramento per la ricerca video durante il test nei modelli di diffusione
Un approccio innovativo noto come CachedSearch riduce significativamente i costi computazionali delle ricerche durante il test nei modelli di diffusione video, utilizzando una cache che non richiede addestramento. Mentre le ricerche durante il test consentono a modelli più piccoli di competere con quelli più grandi, di solito richiedono da 2 a 10 volte più risorse computazionali poiché tutti i candidati vengono sottoposti a una denoising completo, anche se la maggior parte viene infine scartata. L'implementazione di una cache senza addestramento accelera ogni rollout di 2-3 volte mantenendo una qualità quasi senza perdite. La ricerca condotta su Wan2.1-T2V-1.3B, utilizzando un wrapper di cache adattivo, rivela che i rollout in cache con seed corrispondente e i rollout completi mostrano una correlazione di rango di Spearman mediana di 0,905 e un accordo top-1 del 72% sulla suite VBench. VBench-2.0 conferma questi risultati su una suite più impegnativa. La rivalutazione del vincitore in cache con calcolo completo preserva il 90-94% dei guadagni delle ricerche complete, con errori che si verificano principalmente tra candidati con punteggi simili, limitando così la corruzione. CachedSearch valuta efficacemente tutti i candidati attraverso tecniche di cache robuste.
Fatti principali
- CachedSearch è un metodo di caching senza addestramento per la ricerca durante il test nella diffusione video.
- La ricerca durante il test costa 2-10 volte più calcolo perché tutti i candidati vengono denoizzati completamente.
- Il caching senza addestramento rende ogni rollout 2-3 volte più veloce con qualità quasi senza perdite.
- Lo studio utilizza Wan2.1-T2V-1.3B con un wrapper di cache adattivo (~2x di accelerazione per candidato).
- La correlazione di rango di Spearman mediana per prompt è 0,905 tra rollout in cache e rollout completi.
- Accordo top-1 del 72% sulla suite VBench.
- VBench-2.0 replica i risultati su una suite più difficile.
- Ricalcolare il vincitore in cache con calcolo completo conserva il 90-94% del guadagno della ricerca completa.
- Gli errori si raggruppano tra candidati con punteggi simili, rendendo la corruzione autolimitante.
Entità
Istituzioni
- arXiv
- Wan2.1-T2V-1.3B
- ImageReward
- VBench
- VBench-2.0