CNN Casuali Congelate Sviluppano Rappresentazioni Sparse nel Deep RL
Un nuovo studio su arXiv rivela che quando gli agenti di deep reinforcement learning utilizzano estrattori di caratteristiche CNN casuali e congelati, tendono a sviluppare rappresentazioni fully-connected estremamente sparse senza alcuna attenzione alla promozione della sparsità. Nel primo strato fully-connected (FC1, da 3.136 a 64), questi agenti utilizzano solo 1-3 neuroni per Pong prevedibile e 5-11 per Pong imprevedibile. Al contrario, le CNN addestrabili attivano tipicamente 55-64 neuroni in scenari simili. I risultati evidenziano che la sparsità di FC1 varia con la difficoltà del compito: 1-11 per Pong, 19-26 per Breakout e quasi 42 per Space Invaders. È interessante notare che tre seed identici in Pong producono 5, 7 e 11 neuroni attivi, portando a risultati di performance differenti, suggerendo che le caratteristiche casuali possono catturare efficacemente le informazioni essenziali del compito attraverso la sparsità naturale.
Fatti principali
- Gli agenti di deep RL con CNN casuali congelate sviluppano rappresentazioni FC1 sparse senza obiettivi di sparsità.
- La sparsità di FC1 varia da 1-3 neuroni per Pong deterministico a 5-11 per Pong stocastico.
- Le CNN addestrabili attivano 55-64 neuroni in condizioni corrispondenti.
- La sparsità di FC1 scala con la complessità del compito: 1-11 per Pong, 19-26 per Breakout, ~42 per Space Invaders.
- Lo scaling della larghezza conferma che la sparsità riflette la struttura del compito, non una frazione fissa di capacità.
- Tre seed identici in Pong producono 5, 7 e 11 neuroni attivi.
- Il seed con 5 neuroni si stabilizza a +14 di ricompensa, mentre gli altri raggiungono +18,4 di performance esperta.
- Studio pubblicato su arXiv con ID 2607.26059.
Entità
Istituzioni
- arXiv