BCP: Esecuzione con Orizzonte Adattivo per Modelli Visione-Linguaggio-Azione
È stato introdotto un nuovo framework chiamato Bernoulli-Continuation Policy (BCP) per superare le sfide affrontate dai modelli Visione-Linguaggio-Azione (VLA) basati su chunk, che generalmente eseguono un numero predeterminato di azioni prima di avviare una ri pianificazione. Questo orizzonte di esecuzione predeterminato è uniforme e periodico, non tenendo conto dell'avanzamento del compito, il che può portare a fasi cruciali di manipolazione eseguite sulla base di chunk obsoleti se non avviene una ri pianificazione in anticipo. BCP funge da framework leggero e adattabile che consente orizzonti di esecuzione dinamici mantenendo la stabilità del VLA di base. La sua testa di continuazione suddivide la selezione degli orizzonti di esecuzione in una serie di decisioni su se continuare o ri pianificare, applicando un bias induttivo ordinale e di condivisione del prefisso. L'addestramento della testa utilizza l'apprendimento per rinforzo poiché l'orizzonte ideale per ogni chunk non è direttamente osservabile. La ricerca, volta a migliorare le prestazioni dei modelli VLA nella manipolazione robotica, è disponibile su arXiv con l'identificatore 2608.03483v1 ed è stata annunciata come una sottomissione di tipo cross.
Fatti principali
- BCP è un framework per l'esecuzione con orizzonte adattivo nei modelli VLA.
- Affronta la limitazione dell'orizzonte di esecuzione fisso nei modelli VLA basati su chunk.
- BCP è leggero e plug-and-play, mantenendo il VLA di base congelato.
- Utilizza una testa di continuazione per prendere decisioni di continuare o ri pianificare.
- La testa impone un bias induttivo ordinale e di condivisione del prefisso.
- L'addestramento utilizza l'apprendimento per rinforzo perché gli orizzonti ottimali non sono osservabili.
- L'articolo è su arXiv con ID 2608.03483v1.
- Il tipo di annuncio è cross.
Entità
Istituzioni
- arXiv