EXPO-FT: Fine-tuning RL efficiente in termini di campioni per modelli Vision-Language-Action
EXPO-FT è un sistema innovativo progettato per il fine-tuning stabile ed efficiente in termini di campioni dell'apprendimento per rinforzo (RL) di policy vision-language-action (VLA) pre-addestrate. Affronta i problemi di affidabilità che ostacolano l'implementazione di policy robotiche pre-addestrate in scenari del mondo reale. A differenza degli approcci attuali che partono da zero o effettuano un fine-tuning con un'efficienza dei campioni inadeguata, EXPO-FT utilizza la conoscenza pre-addestrata per garantire sia stabilità che alti tassi di successo. Questo sistema è stato testato su compiti di manipolazione complessi, tra cui l'instradamento di lucine e la loro connessione, il mettere in buca una palla da biliardo e il mettere un fiore in una bottiglia di vino. La ricerca, disponibile su arXiv con numero 2605.25477 e un annuncio replace-cross, sostiene che il fine-tuning RL sia un metodo praticabile per acquisire in modo efficiente nuovi compiti, colmando il divario tra i modelli VLA pre-addestrati e le loro applicazioni pratiche.
Fatti principali
- EXPO-FT è un sistema per il fine-tuning RL stabile ed efficiente in termini di campioni di policy VLA pre-addestrate.
- I modelli VLA mostrano una forte generalizzazione in diversi compiti di manipolazione.
- Le policy pre-addestrate non raggiungono l'affidabilità richiesta per l'implementazione nel mondo reale.
- Gli approcci esistenti di fine-tuning RL o addestrano da zero o effettuano il fine-tuning senza un'efficienza dei campioni sufficiente.
- EXPO-FT colma il divario tra i VLA pre-addestrati e l'implementazione pratica.
- Il sistema risolve l'instradamento di lucine e l'inserimento della spina per accenderle.
- Risolve il compito di colpire una palla da biliardo per metterla in buca.
- Risolve l'inserimento di un fiore in una bottiglia di vino.
Entità
Istituzioni
- arXiv