TMRL: Pre-addestramento Modulato sul Timestep di Diffusione per un Fine-tuning Efficiente delle Politiche Robot
Il quadro appena introdotto, denominato Timestep-Modulated Reinforcement Learning (TMRL), mira a migliorare l'efficienza del fine-tuning delle politiche robot pre-addestrate attraverso l'apprendimento per rinforzo (RL). Un problema diffuso è che il pre-addestramento tramite clonazione comportamentale (BC) spesso porta a distribuzioni di azioni limitate, ostacolando l'esplorazione durante il successivo fine-tuning RL. Per affrontare questo problema, il metodo noto come Context-Smoothed Pre-training (CSP) aggiunge rumore di diffusione in avanti agli input delle politiche, facilitando uno spettro tra imitazione accurata e ampia diversità di azioni. TMRL poi affina queste politiche pre-addestrate regolando il timestep di diffusione, consentendo un migliore controllo dell'esplorazione. Questo quadro funziona bene con vari input di politica, inclusi stati e nuvole di punti 3D. La ricerca, identificata come arXiv:2605.12236 e categorizzata come 'replace-cross', dovrebbe attirare l'interesse dei ricercatori nel campo della robotica e dell'RL.
Fatti principali
- TMRL sta per Timestep-Modulated Reinforcement Learning.
- Il quadro collega il pre-addestramento tramite clonazione comportamentale (BC) e il fine-tuning tramite apprendimento per rinforzo (RL).
- Il Context-Smoothed Pre-training (CSP) inietta rumore di diffusione in avanti negli input delle politiche.
- TMRL modula il timestep di diffusione durante il fine-tuning per controllare l'esplorazione.
- Il metodo si integra con input di politica arbitrari, inclusi stati e nuvole di punti 3D.
- L'articolo è disponibile su arXiv con ID 2605.12236.
- Il tipo di annuncio è 'replace-cross'.
- La ricerca mira a consentire un fine-tuning efficiente delle politiche robot.
Entità
Istituzioni
- arXiv