ARTFEED — Contemporary Art Intelligence

LEMUR: Apprendimento per Rinforzo Multi-Obiettivo da Feedback di Preferenza

ai-technology · 2026-08-03

Un nuovo preprint arXiv (2607.29559) introduce LEMUR (Learning to Align with Multi-Objective Reinforcement Learning with Preference feedback), un metodo che combina l'apprendimento per rinforzo multi-obiettivo (MORL) con l'apprendimento per rinforzo basato su preferenze (PbRL). L'RL tradizionale si basa su un'unica ricompensa scalare, ma i compiti del mondo reale spesso implicano obiettivi concorrenti come prestazioni vs. efficienza, dove specificare le funzioni di ricompensa è difficile. Il MORL affronta i compromessi con ricompense vettoriali ma presuppone ancora funzioni di ricompensa ben specificate. Il PbRL apprende le ricompense dal feedback umano, evitando ricompense predefinite, ma è stato limitato a contesti a obiettivo singolo. LEMUR colma questa lacuna consentendo agli agenti RL di apprendere dal feedback di preferenza in scenari multi-obiettivo, migliorando potenzialmente l'allineamento con i valori umani in compiti decisionali complessi. L'articolo è annunciato come nuova sottomissione ed è disponibile su arXiv.

Fatti principali

  • arXiv:2607.29559
  • Tipo di annuncio: nuovo
  • LEMUR sta per Learning to Align with Multi-Objective Reinforcement Learning with Preference feedback
  • Combina l'apprendimento per rinforzo multi-obiettivo (MORL) e l'apprendimento per rinforzo basato su preferenze (PbRL)
  • Affronta le sfide della specificazione delle funzioni di ricompensa in compiti multi-obiettivo
  • I compiti del mondo reale spesso implicano obiettivi concorrenti come prestazioni vs. efficienza
  • Gli approcci MORL esistenti presuppongono funzioni di ricompensa ben specificate
  • Il PbRL apprende le ricompense dal feedback umano ma è stato studiato in contesti a obiettivo singolo

Entità

Istituzioni

  • arXiv

Fonti