ARTFEED — Contemporary Art Intelligence

Le dimostrazioni SMPC consentono RL sparso per la loco-manipolazione

ai-technology · 2026-08-13

Un nuovo articolo di ricerca su arXiv (2608.12063) introduce un metodo per addestrare robot in compiti combinati di locomozione e manipolazione utilizzando ricompense sparse, evitando la necessità di modellare ricompense dense. L'approccio sfrutta il Controllo Predittivo basato su Modelli e Campioni (SMPC) interamente in simulazione per generare enormi dataset offline, risolvendo il problema dell'esplorazione. Un agente RL off-policy viene poi addestrato con ricompense di compito puramente sparse, riducendo il tempo di apprendimento ed eliminando la regolazione manuale. L'agente di alto livello è integrato con un controllore di stabilità dinamica di basso livello, producendo comportamenti ottimali allineati con gli obiettivi del compito, e le politiche apprese possono superare l'insegnante SMPC originale. La robustezza del framework è validata tramite il trasferimento sim-to-real, anche se l'abstract è tagliato a metà frase.

Fatti principali

  • ID dell'articolo: arXiv:2608.12063
  • Tipo di annuncio: cross
  • Il metodo usa SMPC in simulazione per generare dataset offline
  • Addestra RL off-policy con ricompense sparse
  • Integra agente di alto livello con controllore di stabilità di basso livello
  • Le politiche apprese possono superare l'insegnante di controllo ottimale
  • Valida la robustezza sim-to-real
  • Mira a scalare RL per compiti complessi di loco-manipolazione

Entità

Istituzioni

  • arXiv

Fonti