Dual-Force: Nuovo Algoritmo RL Offline Migliora la Massimizzazione della Diversità
Un algoritmo innovativo chiamato Dual-Force è in procinto di essere rilasciato, con l'obiettivo di migliorare la massimizzazione della diversità offline rispettando i vincoli di imitazione. Questo metodo innovativo, descritto in un recente articolo arXiv (arXiv:2501.04426v2), affronta le sfide di stabilità affrontate dagli attuali approcci offline che si basano su informazione mutua e discriminazione delle abilità. Utilizzando uno stimatore off-policy incentrato su un obiettivo di forza di Van der Waals collegato a caratteristiche successive, elimina la necessità di un discriminatore di abilità. Il Dual-Force migliora anche la coerenza dell'addestramento in mezzo a ricompense intrinseche mutevoli sfruttando una codifica funzionale della ricompensa pre-addestrata, che facilita il richiamo delle abilità a zero colpi. L'annuncio è stato fatto il 26 gennaio 2025.
Fatti principali
- Dual-Force è un algoritmo offline per la massimizzazione della diversità sotto vincoli di imitazione.
- Utilizza uno stimatore off-policy di un obiettivo di forza di Van der Waals (VdW) calcolato da caratteristiche successive.
- Elimina la necessità di un discriminatore di abilità.
- Stabilizza l'addestramento condizionando su una codifica funzionale della ricompensa (FRE) pre-addestrata.
- Il codice FRE consente il richiamo a zero colpi delle abilità incontrate.
- Il metodo mira a migliorare la robustezza allo spostamento di distribuzione senza ulteriore interazione con l'ambiente.
- L'articolo è disponibile su arXiv con ID 2501.04426v2.
- Il tipo di annuncio è replace-cross.
Entità
Istituzioni
- arXiv