SOOPER: Apprendimento per Rinforzo Sicuro tramite Priorità Politiche Conservative
È stato sviluppato un nuovo algoritmo di apprendimento per rinforzo (RL), SOOPER (Safe Optimistic Exploration using Policy Priors), per affrontare il problema dell'esplorazione sicura per gli agenti RL. Questo approccio utilizza politiche conservative, sebbene subottimali, che possono essere ottenute da dataset offline o simulazioni come priorità. Impiegando modelli dinamici probabilistici, SOOPER facilita un'esplorazione ottimistica garantendo al contempo che una politica conservativa funga da ripiego quando necessario. I ricercatori hanno dimostrato teoricamente che SOOPER mantiene la sicurezza durante la fase di apprendimento e assicura la convergenza a una politica ottimale limitando il rimpianto cumulativo. Test completi su significativi benchmark di RL sicuro e hardware reale confermano la scalabilità e la superiorità di SOOPER rispetto ai metodi leader, confermando le sue affermazioni teoriche. Questo articolo rientra in Informatica > Apprendimento Automatico ed è disponibile su arXiv con l'identificatore 2601.19612, evidenziando la sua importanza per i sistemi RL che devono funzionare in modo sicuro in scenari del mondo reale per prevenire effetti avversi derivanti da un'esplorazione incontrollata.
Fatti principali
- SOOPER è un nuovo algoritmo RL per l'esplorazione sicura.
- Utilizza politiche subottimali ma conservative come priorità.
- I modelli dinamici probabilistici consentono un'esplorazione ottimistica.
- Il ripiego pessimistico alla politica conservativa garantisce la sicurezza.
- Le garanzie teoriche includono la sicurezza e la convergenza a una politica ottimale.
- Il rimpianto cumulativo è limitato.
- Gli esperimenti su benchmark RL sicuri e hardware reale mostrano scalabilità e prestazioni superiori.
- L'articolo è stato inviato ad arXiv con ID 2601.19612.
Entità
Istituzioni
- arXiv