LiLa-WAM: Un Modello Leggero di Azione-Mondo per la Manipolazione Robotica
Uno studio recente presenta LiLa-WAM, un efficiente modello di azione-mondo volto alla manipolazione robotica. Questo modello analizza le scene future in uno spazio latente ridotto e può essere addestrato in modo end-to-end su una singola GPU da 24GB, riducendo efficacemente i costi computazionali associati agli attuali modelli di azione-mondo. Il suo design fondamentale presenta uno spazio di ragionamento latente compatto che è influenzato in modo collaborativo dalla generazione di azioni e dalla previsione dello stato futuro, garantendo che il modello rimanga leggero mantenendo l'allineamento del controllo. La ricerca è disponibile su arXiv con l'identificatore 2608.03701.
Fatti principali
- LiLa-WAM è un modello leggero di azione-mondo per la manipolazione robotica.
- Ragiona sul futuro in uno spazio latente compatto.
- Può essere addestrato end-to-end su una singola GPU da 24GB.
- Il design principale è uno spazio di ragionamento latente compatto modellato dalla previsione dello stato futuro e dalla generazione di azioni.
- Gli attuali modelli di azione-mondo spesso comportano un notevole sovraccarico computazionale.
- I metodi basati sullo spazio dei pixel allocano capacità ai dettagli visivi non direttamente rilevanti per il controllo.
- Alcuni metodi basati sullo spazio latente richiedono un addestramento multi-fase per costruire lo spazio di ragionamento.
- L'articolo è disponibile su arXiv con l'identificatore 2608.03701.
Entità
Istituzioni
- arXiv