ARTFEED — Contemporary Art Intelligence

TMRL: Pre-addestramento Modulato sul Timestep di Diffusione per un Fine-tuning Efficiente delle Politiche Robot

ai-technology · 2026-08-13

Il quadro appena introdotto, denominato Timestep-Modulated Reinforcement Learning (TMRL), mira a migliorare l'efficienza del fine-tuning delle politiche robot pre-addestrate attraverso l'apprendimento per rinforzo (RL). Un problema diffuso è che il pre-addestramento tramite clonazione comportamentale (BC) spesso porta a distribuzioni di azioni limitate, ostacolando l'esplorazione durante il successivo fine-tuning RL. Per affrontare questo problema, il metodo noto come Context-Smoothed Pre-training (CSP) aggiunge rumore di diffusione in avanti agli input delle politiche, facilitando uno spettro tra imitazione accurata e ampia diversità di azioni. TMRL poi affina queste politiche pre-addestrate regolando il timestep di diffusione, consentendo un migliore controllo dell'esplorazione. Questo quadro funziona bene con vari input di politica, inclusi stati e nuvole di punti 3D. La ricerca, identificata come arXiv:2605.12236 e categorizzata come 'replace-cross', dovrebbe attirare l'interesse dei ricercatori nel campo della robotica e dell'RL.

Fatti principali

  • TMRL sta per Timestep-Modulated Reinforcement Learning.
  • Il quadro collega il pre-addestramento tramite clonazione comportamentale (BC) e il fine-tuning tramite apprendimento per rinforzo (RL).
  • Il Context-Smoothed Pre-training (CSP) inietta rumore di diffusione in avanti negli input delle politiche.
  • TMRL modula il timestep di diffusione durante il fine-tuning per controllare l'esplorazione.
  • Il metodo si integra con input di politica arbitrari, inclusi stati e nuvole di punti 3D.
  • L'articolo è disponibile su arXiv con ID 2605.12236.
  • Il tipo di annuncio è 'replace-cross'.
  • La ricerca mira a consentire un fine-tuning efficiente delle politiche robot.

Entità

Istituzioni

  • arXiv

Fonti