Novelty and Surprise Prioritized Experience Replay: un nuovo metodo per l'apprendimento per rinforzo basato su immagini efficiente in termini di campioni
Il preprint arXiv 2608.17373 introduce NSPER (Novelty and Surprise Prioritized Experience Replay), un metodo per migliorare l'efficienza dei campioni nell'apprendimento per rinforzo basato su immagini. L'approccio combina la novità, che identifica gli stati sottorappresentati, con la sorpresa, che rivela le lacune nella comprensione dell'ambiente da parte dell'agente. Si basa sul Prioritized Experience Replay (PER), che riutilizza transizioni ad alto valore, e sulle ricompense intrinseche, che incoraggiano l'esplorazione. Le strategie di campionamento convenzionali selezionano le esperienze in modo imprevedibile, causando aggiornamenti ridondanti e un apprendimento più lento. Gli autori propongono NSPER per affrontare questo problema e presentano anche NSPER+R, un'ulteriore estensione che integra questi segnali. Il lavoro mira a dare priorità alle esperienze informative e a migliorare la velocità di apprendimento nei domini visivi.
Fatti principali
- L'efficienza dei campioni è una sfida centrale nell'apprendimento per rinforzo, soprattutto nei domini basati su immagini.
- Il campionamento tradizionale si basa spesso su una selezione casuale o subottimale delle esperienze, portando ad aggiornamenti ridondanti e a un apprendimento lento.
- Il Prioritized Experience Replay (PER) riutilizza transizioni ad alto valore.
- Le ricompense intrinseche promuovono l'esplorazione di stati nuovi o incerti.
- L'integrazione di PER e ricompense intrinseche non è stata studiata in modo approfondito.
- L'articolo introduce il Novelty and Surprise Prioritized Experience Replay (NSPER).
- NSPER usa la novità per catturare gli stati sottorappresentati e la sorpresa per esporre le lacune nella comprensione dell'agente.
- L'articolo introduce NSPER+R, che integra questi segnali.
Entità
—