ForgeWM: Addestramento Causale Progressivo per Modelli del Mondo Video Azione-Condizionati a Pochi Passi
È stato introdotto un nuovo framework chiamato ForgeWM per aiutare a costruire modelli del mondo video efficienti che richiedono solo pochi passi di azione. Trasforma un generatore video bidirezionale azione-condizionato in modelli semplificati utilizzando metodi come l'adattamento del dominio e l'addestramento causale forzato dall'insegnante. I modelli operano efficacemente con budget di denoising di 1, 2 e 4 passi. Inoltre, ForgeWM include un sistema di implementazione a doppio percorso che gestisce sia interazioni sensibili alla latenza che rollout opzionali. Questa ricerca affronta la sfida di allineare la distillazione causale con i modelli del mondo interattivi, garantendo che gli stati della tastiera e i movimenti del mouse siano sincronizzati con i chunk latenti compressi durante l'addestramento e il rollout. Puoi trovare l'articolo su arXiv con l'identificatore 2608.14022.
Fatti principali
- ForgeWM è un framework progressivo per modelli del mondo video azione-condizionati a pochi passi.
- Utilizza adattamento del dominio, addestramento causale forzato dall'insegnante, distillazione di coerenza causale e corrispondenza di distribuzione on-policy.
- Gli studenti operano con budget di denoising di 1, 2 e 4 passi.
- Supporta un protocollo di implementazione a doppio percorso.
- L'articolo è su arXiv con ID 2608.14022.
- Affronta sfide con stati discreti della tastiera e movimento continuo del mouse.
- Estende la distillazione causale ai modelli del mondo interattivi.
- Il framework trasforma un generatore bidirezionale in modelli del mondo a pochi passi.
Entità
Istituzioni
- arXiv