ARTFEED — Contemporary Art Intelligence

CPR Previene il Collasso della Politica nel RL Continuo

other · 2026-07-29

Un nuovo ottimizzatore chiamato Calibrated Partial Resets (CPR) previene il collasso della politica nell'apprendimento per rinforzo continuo. Le reti neurali soffrono di neuroni dormienti e perdita di espressività in ambienti non stazionari. I reset completi sacrificano le prestazioni e destabilizzano l'addestramento. CPR riporta periodicamente i neuroni a bassa utilità verso l'inizializzazione, con una forza di ripristino scalata in base all'utilità. A differenza dei reset binari o del decadimento uniforme, CPR evita la fragilità e concentra gli aggiustamenti dove necessario. In SlipperyAnt, solo CPR evita il collasso per oltre 400 milioni di passi di addestramento.

Fatti principali

  • CPR sta per Calibrated Partial Resets
  • CPR è un ottimizzatore per l'apprendimento per rinforzo continuo
  • Le reti neurali accumulano neuroni dormienti in ambienti non stazionari
  • La reinizializzazione completa delle unità può causare il collasso della politica
  • CPR riporta i neuroni a bassa utilità verso l'inizializzazione
  • La forza di ripristino è scalata in base all'utilità di ciascun neurone
  • Solo CPR evita il collasso della politica per oltre 400 milioni di passi di addestramento in SlipperyAnt
  • CPR supera i metodi confrontati

Entità

Fonti