La memoria linguistica esplicita migliora la pianificazione a lungo orizzonte nei modelli VLA
Uno studio recente disponibile su arXiv (2608.04765) introduce un framework gerarchico per i modelli visione-linguaggio-azione (VLA), caratterizzato da un modulo di memoria linguistica dedicato per affrontare i problemi nei compiti robotici a lungo orizzonte. La ricerca evidenzia quattro carenze chiave degli attuali modelli VLA: le dimostrazioni esperte sparse impediscono la generalizzazione compositiva tra compiti; le caratteristiche non markoviane dei compiti a lungo orizzonte ostacolano le politiche che si basano solo sulle osservazioni presenti dal mantenere la coerenza temporale; la correzione degli errori in anello chiuso insufficiente porta all'accumulo di errori di esecuzione; e la messa a punto end-to-end delle azioni può degradare le rappresentazioni semantiche di alto livello dei backbone dei modelli visione-linguaggio (VLM). Il metodo proposto trasforma le osservazioni temporali discrete in una sequenza testuale coesa con logica temporale, separando il sistema in componenti di alto livello VLM e di basso livello per le azioni. Questa strategia cerca di migliorare la coerenza temporale e la correzione degli errori utilizzando la memoria linguistica esplicita. L'articolo è classificato come cross submission e può essere accessibile tramite l'URL fornito.
Fatti principali
- ID del paper: arXiv:2608.04765
- Tipo di annuncio: cross
- Propone un'architettura VLA gerarchica a lungo orizzonte con modulo di memoria linguistica esplicita
- Affronta quattro sfide: dimostrazioni sparse, compiti non markoviani, correzione degli errori limitata, rappresentazioni VLM indebolite
- Idea centrale: convertire le osservazioni temporali discrete in una sequenza testuale coerente con logica temporale
- Il sistema è disaccoppiato in VLM di alto livello e modulo di azione di basso livello
- Pubblicato su arXiv
- URL della fonte: https://arxiv.org/abs/2608.04765
Entità
Istituzioni
- arXiv