SALT: Tokenizzatore Semanticamente Allineato Migliora i Modelli Visione-Linguaggio-Azione
Un recente articolo su arXiv presenta SALT, o Tokenizzatore di Azione Semanticamente Allineato, che migliora i modelli visione-linguaggio-azione (VLA) sincronizzando le rappresentazioni delle azioni con il linguaggio. La ricerca, identificata come arXiv:2608.10484, affronta la sfida che i verbi d'azione non trasmettono solo risultati fisici ma anche stili di esecuzione. I VLA tradizionali, che ottimizzano per la ricostruzione utilizzando perdite L1/L2, trascurano differenze linguistiche significative. Gli autori rivelano sul benchmark BridgeV2 che le traiettorie d'azione contengono informazioni di ancoraggio verbale che vanno oltre le alterazioni dello stato visivo, e che affidarsi esclusivamente alla ricostruzione diminuisce queste informazioni. SALT migliora un tokenizzatore in stile VQ-VAE con un obiettivo ausiliario, consentendo a un modello visione-linguaggio congelato di recuperare le istruzioni dell'episodio dai latenti di azione quantizzati. Le politiche che utilizzano SALT raggiungono un tasso di successo medio del 71,9% in SimplerEnv, superando il 42,7% di un tokenizzatore VQ-VAE solo per ricostruzione e il 31,2% di una baseline. Questa ricerca, significativa per l'IA embodied e la robotica, mira a collegare il controllo delle azioni di basso livello con la comprensione del linguaggio di alto livello, migliorando potenzialmente la capacità dei robot di seguire comandi in linguaggio naturale.
Fatti principali
- SALT è un tokenizzatore di azione semanticamente allineato per modelli visione-linguaggio-azione.
- Affronta il disallineamento tra rappresentazioni delle azioni e linguaggio nei VLA.
- Lo studio utilizza il benchmark BridgeV2 per mostrare che le traiettorie d'azione contengono informazioni di ancoraggio verbale.
- La tokenizzazione discreta basata solo sulla ricostruzione erode le informazioni di ancoraggio verbale.
- SALT potenzia un tokenizzatore in stile VQ-VAE con un obiettivo ausiliario.
- L'obiettivo ausiliario richiede che un modello visione-linguaggio congelato recuperi l'istruzione dell'episodio dai latenti di azione quantizzati.
- Le politiche addestrate con SALT raggiungono un successo medio del 71,9% in SimplerEnv.
- Rispetto al 42,7% per il solo VQ-VAE di ricostruzione e al 31,2% per una baseline.
- L'articolo è disponibile su arXiv con ID 2608.10484.
Entità
Istituzioni
- arXiv