CPR Previene il Collasso della Politica nel RL Continuo
Un nuovo ottimizzatore chiamato Calibrated Partial Resets (CPR) previene il collasso della politica nell'apprendimento per rinforzo continuo. Le reti neurali soffrono di neuroni dormienti e perdita di espressività in ambienti non stazionari. I reset completi sacrificano le prestazioni e destabilizzano l'addestramento. CPR riporta periodicamente i neuroni a bassa utilità verso l'inizializzazione, con una forza di ripristino scalata in base all'utilità. A differenza dei reset binari o del decadimento uniforme, CPR evita la fragilità e concentra gli aggiustamenti dove necessario. In SlipperyAnt, solo CPR evita il collasso per oltre 400 milioni di passi di addestramento.
Fatti principali
- CPR sta per Calibrated Partial Resets
- CPR è un ottimizzatore per l'apprendimento per rinforzo continuo
- Le reti neurali accumulano neuroni dormienti in ambienti non stazionari
- La reinizializzazione completa delle unità può causare il collasso della politica
- CPR riporta i neuroni a bassa utilità verso l'inizializzazione
- La forza di ripristino è scalata in base all'utilità di ciascun neurone
- Solo CPR evita il collasso della politica per oltre 400 milioni di passi di addestramento in SlipperyAnt
- CPR supera i metodi confrontati
Entità
—