LEMUR: Apprendimento per Rinforzo Multi-Obiettivo da Feedback di Preferenza
Un nuovo preprint arXiv (2607.29559) introduce LEMUR (Learning to Align with Multi-Objective Reinforcement Learning with Preference feedback), un metodo che combina l'apprendimento per rinforzo multi-obiettivo (MORL) con l'apprendimento per rinforzo basato su preferenze (PbRL). L'RL tradizionale si basa su un'unica ricompensa scalare, ma i compiti del mondo reale spesso implicano obiettivi concorrenti come prestazioni vs. efficienza, dove specificare le funzioni di ricompensa è difficile. Il MORL affronta i compromessi con ricompense vettoriali ma presuppone ancora funzioni di ricompensa ben specificate. Il PbRL apprende le ricompense dal feedback umano, evitando ricompense predefinite, ma è stato limitato a contesti a obiettivo singolo. LEMUR colma questa lacuna consentendo agli agenti RL di apprendere dal feedback di preferenza in scenari multi-obiettivo, migliorando potenzialmente l'allineamento con i valori umani in compiti decisionali complessi. L'articolo è annunciato come nuova sottomissione ed è disponibile su arXiv.
Fatti principali
- arXiv:2607.29559
- Tipo di annuncio: nuovo
- LEMUR sta per Learning to Align with Multi-Objective Reinforcement Learning with Preference feedback
- Combina l'apprendimento per rinforzo multi-obiettivo (MORL) e l'apprendimento per rinforzo basato su preferenze (PbRL)
- Affronta le sfide della specificazione delle funzioni di ricompensa in compiti multi-obiettivo
- I compiti del mondo reale spesso implicano obiettivi concorrenti come prestazioni vs. efficienza
- Gli approcci MORL esistenti presuppongono funzioni di ricompensa ben specificate
- Il PbRL apprende le ricompense dal feedback umano ma è stato studiato in contesti a obiettivo singolo
Entità
Istituzioni
- arXiv