Le dimostrazioni SMPC consentono RL sparso per la loco-manipolazione
Un nuovo articolo di ricerca su arXiv (2608.12063) introduce un metodo per addestrare robot in compiti combinati di locomozione e manipolazione utilizzando ricompense sparse, evitando la necessità di modellare ricompense dense. L'approccio sfrutta il Controllo Predittivo basato su Modelli e Campioni (SMPC) interamente in simulazione per generare enormi dataset offline, risolvendo il problema dell'esplorazione. Un agente RL off-policy viene poi addestrato con ricompense di compito puramente sparse, riducendo il tempo di apprendimento ed eliminando la regolazione manuale. L'agente di alto livello è integrato con un controllore di stabilità dinamica di basso livello, producendo comportamenti ottimali allineati con gli obiettivi del compito, e le politiche apprese possono superare l'insegnante SMPC originale. La robustezza del framework è validata tramite il trasferimento sim-to-real, anche se l'abstract è tagliato a metà frase.
Fatti principali
- ID dell'articolo: arXiv:2608.12063
- Tipo di annuncio: cross
- Il metodo usa SMPC in simulazione per generare dataset offline
- Addestra RL off-policy con ricompense sparse
- Integra agente di alto livello con controllore di stabilità di basso livello
- Le politiche apprese possono superare l'insegnante di controllo ottimale
- Valida la robustezza sim-to-real
- Mira a scalare RL per compiti complessi di loco-manipolazione
Entità
Istituzioni
- arXiv