TrustRoboReward: Modifica del punteggio isotonico ordinata per preferenza per modelli di ricompensa robotica multi-paradigma
Un nuovo articolo su arXiv (2608.08491) introduce TrustRoboReward, un framework di modellazione delle ricompense multi-paradigma progettato per affrontare le incongruenze nei modelli di ricompensa per l'apprendimento per rinforzo nell'IA embodied. Il framework è dotato di Preference-Ordered Isotonic Score Editing (POISE), che armonizza le preferenze a coppie e i punteggi puntuali. Gli autori costruiscono un dataset unificato a quattro paradigmi che include il punteggio del progresso della traiettoria, annotazioni video-QA e altri segnali di supervisione. Questo approccio mira a migliorare la manipolazione robotica a lungo orizzonte fornendo un feedback visivo scalabile oltre alle ricompense artigianali o alle annotazioni specifiche del compito. L'articolo evidenzia i limiti dei giudici di ricompensa VLM open-source esistenti come RoboReward, che utilizzano un semplice punteggio del progresso della traiettoria da 1 a 5 e mancano di preferenze a coppie per i framework RLHF, DPO e Bradley-Terry. Il metodo proposto affronta anche i problemi dei metodi di aggregazione come TrustJudge, che non possono risolvere le incongruenze tra preferenze a coppie e punteggi puntuali. Il lavoro è rilevante per i campi dell'IA, della robotica e dell'apprendimento per rinforzo, ed è pubblicato come preprint su arXiv.
Fatti principali
- L'articolo arXiv:2608.08491 introduce TrustRoboReward, un framework di modellazione delle ricompense multi-paradigma.
- TrustRoboReward utilizza Preference-Ordered Isotonic Score Editing (POISE) per armonizzare le preferenze a coppie e i punteggi puntuali.
- Il framework costruisce un dataset unificato a quattro paradigmi che include il punteggio del progresso della traiettoria e annotazioni video-QA.
- I giudici di ricompensa VLM open-source esistenti come RoboReward utilizzano un semplice punteggio del progresso della traiettoria da 1 a 5 e mancano di preferenze a coppie.
- L'articolo affronta i limiti dei metodi di aggregazione come TrustJudge.
- Il lavoro mira alla manipolazione robotica a lungo orizzonte nell'IA embodied.
- L'articolo è un preprint su arXiv con tipo di annuncio nuovo.
- L'approccio mira a fornire un feedback visivo scalabile oltre alle ricompense artigianali.
Entità
Istituzioni
- arXiv