ARTFEED — Contemporary Art Intelligence

Errore TD Gaussiano Generalizzato per RL Consapevole dell'Incertezza

other · 2026-07-27

Una nuova tecnica di reinforcement learning sostituisce il tradizionale modello gaussiano a media zero per gli errori di differenza temporale (TD) con una Distribuzione Gaussiana Generalizzata (GGD), migliorando la modellazione dei residui a coda pesante ed eteroschedastici derivanti dal bootstrapping e dall'esplorazione. Questo metodo incorpora una testa di forma condizionata allo stato che utilizza GGD e una perdita GGD numericamente aggiustata come proxy online per i residui TD non stazionari. Distingue tra la verosimiglianza GGD precisa (normalizzata per ogni β>0) e il suo kernel di densità esponenziale (definito positivo per β∈(0,2]). Viene formulata una semplice euristica di ponderazione monotona basata sulla forma appresa, insieme alla regolarizzazione Batch Inverse Error Variance (BIEV) che utilizza varianza e curtosi eccessiva campionaria degli errori TD dell'insieme. I risultati di benchmark su compiti di controllo sia continui che discreti indicano che le varianti consapevoli della forma superano gli approcci basati su Gaussiana.

Fatti principali

  • 1. L'apprendimento TD convenzionale assume errori gaussiani a media zero.
  • 2. Residui a coda pesante ed eteroschedastici derivano da bootstrapping ed esplorazione.
  • 3. Il metodo proposto utilizza la Distribuzione Gaussiana Generalizzata (GGD) per la testa di forma.
  • 4. La verosimiglianza GGD è normalizzata per ogni β>0.
  • 5. Il kernel di densità esponenziale è definito positivo per β∈(0,2].
  • 6. La forma appresa consente un'euristica di ponderazione monotona.
  • 7. La regolarizzazione Batch Inverse Error Variance (BIEV) utilizza varianza e curtosi eccessiva campionaria.
  • 8. Le varianti consapevoli della forma superano i metodi basati su Gaussiana nei benchmark di controllo.

Entità

Fonti