Faster-WAM: Teste Azioni Leggere per Modelli Azione Mondiale
Una recente pubblicazione su arXiv presenta Faster-WAM, una tecnica volta a minimizzare le richieste computazionali nei Modelli Azione Mondiale (WAM) separando la profondità del modulo di azione dal backbone video. Gli autori introducono il concetto di Dock of Transformer (DoT), che utilizza un trasformatore video preaddestrato come hub di rappresentazione, collegando teste di output leggere tramite interfacce di docking. Faster-WAM integra una testa di azione a singolo strato con un backbone video a 30 strati, impiegando un'interfaccia di docking che fonde chiavi e valori da tutti gli strati video e implementa il riallineamento RoPE. Questo metodo elimina la necessità di ulteriore preaddestramento embodied, riducendo la latenza di inferenza mantenendo le prestazioni. Il documento può essere trovato su arXiv con identificatore 2608.02365.
Fatti principali
- Articolo intitolato 'Faster-WAM: Do World Action Models Need Deep Action Modules?'
- Pubblicato su arXiv con identificatore 2608.02365
- Introduce il principio di progettazione Dock of Transformer (DoT)
- Faster-WAM aggancia una testa di azione a singolo strato su un backbone video a 30 strati
- L'interfaccia di docking fonde chiavi e valori da tutti gli strati video
- Applica il riallineamento RoPE
- Nessun preaddestramento embodied aggiuntivo richiesto
- Riduce il sovraccarico computazionale e la latenza di inferenza
Entità
Istituzioni
- arXiv