ARTFEED — Contemporary Art Intelligence

Algoritmo RL Bilevel Senza Hessiana Raggiunge una Migliore Complessità di Campionamento

ai-technology · 2026-08-03

È stato sviluppato un nuovo algoritmo di apprendimento per rinforzo bilevel che utilizza ipergradienti, mostrando una notevole complessità di campionamento di O(ε⁻²) e una complessità di iterazione di O(ε⁻¹) in condizioni di regolarità rilassate. Questo metodo, descritto nell'articolo arXiv 2607.28849, non richiede il calcolo della Hessiana, il che aiuta ad affrontare i problemi di scalabilità che i precedenti metodi basati su ipergradienti incontravano. Sfruttando l'ottimalità della politica di Boltzmann per l'obiettivo di RL scontato regolarizzato con entropia, risolve efficacemente problemi bilevel come il meta-apprendimento, la scomposizione gerarchica dei compiti e l'apprendimento per rinforzo dal feedback umano (RLHF). In particolare, l'analisi di convergenza elimina la necessità della condizione di Polyak-Lojasiewicz (PL), affrontando una limitazione comune nelle ricerche precedenti e rappresentando un importante passo avanti nell'IA e nell'apprendimento automatico.

Fatti principali

  • L'algoritmo proposto è senza Hessiana.
  • Raggiunge una complessità di iterazione di O(ε⁻¹).
  • Raggiunge una complessità di campionamento di O(ε⁻²).
  • Elimina l'assunzione della condizione di Polyak-Lojasiewicz (PL).
  • Utilizza l'ottimalità della politica di Boltzmann per RL scontato regolarizzato con entropia.
  • Affronta problemi RL bilevel tra cui meta-apprendimento, decomposizione gerarchica dei compiti e RLHF.
  • L'articolo è disponibile su arXiv con ID 2607.28849.
  • Il tipo di annuncio è cross.

Entità

Istituzioni

  • arXiv

Fonti