XCoT-VLA: Catena di Pensiero Eseguibile per la Guida Visione-Linguaggio-Azione
Uno studio recente pubblicato su arXiv (2608.10976) presenta XCoT-VLA, un modello volto a migliorare i sistemi Visione-Linguaggio-Azione (VLA) per veicoli a guida autonoma. I ricercatori sostengono che il ragionamento convenzionale a Catena di Pensiero (CoT) in linguaggio naturale verboso non sia adatto al controllo in tempo reale a causa della sua natura aperta, degli elevati costi di decodifica e delle sfide di ottimizzazione. XCoT-VLA sostituisce le lunghe spiegazioni con concisi token CoT eseguibili derivati da una supervisione Reason-Action generata automaticamente. Le evidenze delle azioni sono tratte da traiettorie registrate, mentre il contesto della scena fornisce semantica causale. La sequenza XCoT è contestualmente rilevante e condiziona query di traiettoria fisse tramite attenzione multimodale condivisa. Il routing deterministico token-funzione impiega la Reason FFN per i token XCoT e la Control FFN per le query di traiettoria per facilitare la generazione di traiettorie con flow-matching. Inoltre, l'articolo presenta l'XCoT Policy Optimization (XCPO) come miglioramento opzionale. Questa ricerca affronta un problema significativo nella guida autonoma: raggiungere un equilibrio tra ragionamento semantico ed efficienza di controllo in tempo reale.
Fatti principali
- L'articolo arXiv:2608.10976 introduce XCoT-VLA, un modello per la guida Visione-Linguaggio-Azione.
- XCoT-VLA sostituisce la verbosa Catena di Pensiero in linguaggio naturale con compatti token CoT eseguibili.
- I token vengono appresi da una supervisione Reason-Action costruita automaticamente.
- Le traiettorie registrate forniscono evidenze delle azioni; il contesto della scena fornisce semantica causale.
- La sequenza XCoT prevista condiziona query di traiettoria fisse tramite attenzione multimodale condivisa.
- Il routing deterministico token-funzione applica la Reason FFN ai token XCoT e la Control FFN alle query di traiettoria.
- Per il controllo viene utilizzata la generazione di traiettorie con flow-matching.
- L'XCoT Policy Optimization (XCPO) viene introdotto come perfezionamento opzionale.
- Il modello mira a migliorare l'efficienza del controllo in tempo reale nella guida autonoma.
- L'articolo è pubblicato su arXiv con ID 2608.10976.
Entità
Istituzioni
- arXiv