ARTFEED — Contemporary Art Intelligence

ForgeWM: Addestramento Causale Progressivo per Modelli del Mondo Video Azione-Condizionati a Pochi Passi

ai-technology · 2026-08-17

È stato introdotto un nuovo framework chiamato ForgeWM per aiutare a costruire modelli del mondo video efficienti che richiedono solo pochi passi di azione. Trasforma un generatore video bidirezionale azione-condizionato in modelli semplificati utilizzando metodi come l'adattamento del dominio e l'addestramento causale forzato dall'insegnante. I modelli operano efficacemente con budget di denoising di 1, 2 e 4 passi. Inoltre, ForgeWM include un sistema di implementazione a doppio percorso che gestisce sia interazioni sensibili alla latenza che rollout opzionali. Questa ricerca affronta la sfida di allineare la distillazione causale con i modelli del mondo interattivi, garantendo che gli stati della tastiera e i movimenti del mouse siano sincronizzati con i chunk latenti compressi durante l'addestramento e il rollout. Puoi trovare l'articolo su arXiv con l'identificatore 2608.14022.

Fatti principali

  • ForgeWM è un framework progressivo per modelli del mondo video azione-condizionati a pochi passi.
  • Utilizza adattamento del dominio, addestramento causale forzato dall'insegnante, distillazione di coerenza causale e corrispondenza di distribuzione on-policy.
  • Gli studenti operano con budget di denoising di 1, 2 e 4 passi.
  • Supporta un protocollo di implementazione a doppio percorso.
  • L'articolo è su arXiv con ID 2608.14022.
  • Affronta sfide con stati discreti della tastiera e movimento continuo del mouse.
  • Estende la distillazione causale ai modelli del mondo interattivi.
  • Il framework trasforma un generatore bidirezionale in modelli del mondo a pochi passi.

Entità

Istituzioni

  • arXiv

Fonti