ARTFEED — Contemporary Art Intelligence

RIFT: Immaginazione Senza Rollout tramite Token Futuri per Modelli di Azione nel Mondo

ai-technology · 2026-08-13

Uno studio recente pubblicato su arXiv (2608.11521) esamina se i modelli di azione nel mondo (WAM) necessitano dell'intera traiettoria di rollout video iterativa per la generazione di azioni robotiche o se una rappresentazione statica del futuro sia sufficiente. Analizzando quattro WAM su tutti i 40 compiti LIBERO, la ricerca indica che, sebbene la generazione di azioni sia influenzata dai valori della cache futura e dalle loro posizioni, modelli specifici (Joint e Cosmos-2) possono utilizzare efficacemente una cache chiave/valore (K/V) finale-pulita fissa con solo un lieve degrado delle prestazioni, raggiungendo tassi di successo tra il 97,9% e il 98,2% e un errore medio di spostamento dell'end-effector da 1,7 a 1,9 cm. Questa scoperta differenzia il consumo della cache dalla produzione, portando gli autori a introdurre RIFT (Immaginazione Senza Rollout tramite Token Futuri), che sfrutta l'anticipazione appresa per creare token futuri senza rollout iterativo, potenzialmente minimizzando la latenza di implementazione. L'articolo è una sottomissione cross-type del team di ricerca su arXiv.

Fatti principali

  • L'articolo è intitolato 'Keep the Future, Drop the Rollout: RIFT for World Action Models'.
  • È disponibile su arXiv con ID 2608.11521.
  • Lo studio ha testato quattro WAM su tutti i 40 compiti LIBERO.
  • Mascherare o riassegnare i valori della cache futura cambia l'esecuzione e riduce il successo.
  • I modelli Joint e Cosmos-2 possono riutilizzare una cache K/V finale-pulita fissa con un successo dal 97,9% al 98,2%.
  • L'errore medio di spostamento dell'end-effector è di 1,7-1,9 cm.
  • Il metodo proposto si chiama RIFT (Immaginazione Senza Rollout tramite Token Futuri).
  • RIFT utilizza l'anticipazione appresa per evitare il rollout iterativo.

Entità

Istituzioni

  • arXiv

Fonti