Algoritmo RL Bilevel Senza Hessiana Raggiunge una Migliore Complessità di Campionamento
È stato sviluppato un nuovo algoritmo di apprendimento per rinforzo bilevel che utilizza ipergradienti, mostrando una notevole complessità di campionamento di O(ε⁻²) e una complessità di iterazione di O(ε⁻¹) in condizioni di regolarità rilassate. Questo metodo, descritto nell'articolo arXiv 2607.28849, non richiede il calcolo della Hessiana, il che aiuta ad affrontare i problemi di scalabilità che i precedenti metodi basati su ipergradienti incontravano. Sfruttando l'ottimalità della politica di Boltzmann per l'obiettivo di RL scontato regolarizzato con entropia, risolve efficacemente problemi bilevel come il meta-apprendimento, la scomposizione gerarchica dei compiti e l'apprendimento per rinforzo dal feedback umano (RLHF). In particolare, l'analisi di convergenza elimina la necessità della condizione di Polyak-Lojasiewicz (PL), affrontando una limitazione comune nelle ricerche precedenti e rappresentando un importante passo avanti nell'IA e nell'apprendimento automatico.
Fatti principali
- L'algoritmo proposto è senza Hessiana.
- Raggiunge una complessità di iterazione di O(ε⁻¹).
- Raggiunge una complessità di campionamento di O(ε⁻²).
- Elimina l'assunzione della condizione di Polyak-Lojasiewicz (PL).
- Utilizza l'ottimalità della politica di Boltzmann per RL scontato regolarizzato con entropia.
- Affronta problemi RL bilevel tra cui meta-apprendimento, decomposizione gerarchica dei compiti e RLHF.
- L'articolo è disponibile su arXiv con ID 2607.28849.
- Il tipo di annuncio è cross.
Entità
Istituzioni
- arXiv