RIFT: Immaginazione Senza Rollout tramite Token Futuri per Modelli di Azione nel Mondo
Uno studio recente pubblicato su arXiv (2608.11521) esamina se i modelli di azione nel mondo (WAM) necessitano dell'intera traiettoria di rollout video iterativa per la generazione di azioni robotiche o se una rappresentazione statica del futuro sia sufficiente. Analizzando quattro WAM su tutti i 40 compiti LIBERO, la ricerca indica che, sebbene la generazione di azioni sia influenzata dai valori della cache futura e dalle loro posizioni, modelli specifici (Joint e Cosmos-2) possono utilizzare efficacemente una cache chiave/valore (K/V) finale-pulita fissa con solo un lieve degrado delle prestazioni, raggiungendo tassi di successo tra il 97,9% e il 98,2% e un errore medio di spostamento dell'end-effector da 1,7 a 1,9 cm. Questa scoperta differenzia il consumo della cache dalla produzione, portando gli autori a introdurre RIFT (Immaginazione Senza Rollout tramite Token Futuri), che sfrutta l'anticipazione appresa per creare token futuri senza rollout iterativo, potenzialmente minimizzando la latenza di implementazione. L'articolo è una sottomissione cross-type del team di ricerca su arXiv.
Fatti principali
- L'articolo è intitolato 'Keep the Future, Drop the Rollout: RIFT for World Action Models'.
- È disponibile su arXiv con ID 2608.11521.
- Lo studio ha testato quattro WAM su tutti i 40 compiti LIBERO.
- Mascherare o riassegnare i valori della cache futura cambia l'esecuzione e riduce il successo.
- I modelli Joint e Cosmos-2 possono riutilizzare una cache K/V finale-pulita fissa con un successo dal 97,9% al 98,2%.
- L'errore medio di spostamento dell'end-effector è di 1,7-1,9 cm.
- Il metodo proposto si chiama RIFT (Immaginazione Senza Rollout tramite Token Futuri).
- RIFT utilizza l'anticipazione appresa per evitare il rollout iterativo.
Entità
Istituzioni
- arXiv