Aftab: Benchmarking degli Encoder CNN e Funzioni di Valore Avanzate in Q-Network Parallelizzati
Un recente preprint disponibile su arXiv (2608.07335) introduce Aftab, un benchmark dettagliato incentrato sugli encoder delle Reti Neurali Convoluzionali (CNN) e sulle funzioni di valore sofisticate all'interno del framework Parallelized Q-Network (PQN). Questa ricerca esamina a fondo lo spazio di progettazione architetturale, valutando otto architetture CNN uniche per la loro efficienza campionaria, rispettando al contempo rigorosi limiti di parametri. Inoltre, incorpora il metodo di codifica Hadamax insieme a tecniche avanzate di Q-learning, come le teste distribuzionali, ensemble e dueling. Gli esperimenti utilizzano il benchmark Atari-57. Questo studio evidenzia la capacità rappresentativa e l'efficienza dei parametri degli encoder visivi, spesso trascurate, in ambienti senza buffer, con l'obiettivo di migliorare lo sviluppo di encoder efficaci per PQN e algoritmi correlati.
Fatti principali
- L'articolo è un preprint su arXiv con identificativo 2608.07335.
- Si concentra sull'algoritmo Parallelized Q-Network (PQN).
- PQN raggiunge un apprendimento off-policy stabile senza buffer di replay o reti target.
- Sono state progettate e valutate otto diverse topologie CNN.
- Lo studio ottimizza l'efficienza campionaria sotto severi vincoli di parametri.
- Il paradigma di codifica Hadamax è integrato.
- Le estensioni avanzate del Q-learning includono teste distribuzionali, ensemble e dueling.
- Gli esperimenti sono condotti sul benchmark Atari-57.
Entità
Istituzioni
- arXiv