ARTFEED — Contemporary Art Intelligence

TrustRoboReward: Modifica del punteggio isotonico ordinata per preferenza per modelli di ricompensa robotica multi-paradigma

ai-technology · 2026-08-11

Un nuovo articolo su arXiv (2608.08491) introduce TrustRoboReward, un framework di modellazione delle ricompense multi-paradigma progettato per affrontare le incongruenze nei modelli di ricompensa per l'apprendimento per rinforzo nell'IA embodied. Il framework è dotato di Preference-Ordered Isotonic Score Editing (POISE), che armonizza le preferenze a coppie e i punteggi puntuali. Gli autori costruiscono un dataset unificato a quattro paradigmi che include il punteggio del progresso della traiettoria, annotazioni video-QA e altri segnali di supervisione. Questo approccio mira a migliorare la manipolazione robotica a lungo orizzonte fornendo un feedback visivo scalabile oltre alle ricompense artigianali o alle annotazioni specifiche del compito. L'articolo evidenzia i limiti dei giudici di ricompensa VLM open-source esistenti come RoboReward, che utilizzano un semplice punteggio del progresso della traiettoria da 1 a 5 e mancano di preferenze a coppie per i framework RLHF, DPO e Bradley-Terry. Il metodo proposto affronta anche i problemi dei metodi di aggregazione come TrustJudge, che non possono risolvere le incongruenze tra preferenze a coppie e punteggi puntuali. Il lavoro è rilevante per i campi dell'IA, della robotica e dell'apprendimento per rinforzo, ed è pubblicato come preprint su arXiv.

Fatti principali

  • L'articolo arXiv:2608.08491 introduce TrustRoboReward, un framework di modellazione delle ricompense multi-paradigma.
  • TrustRoboReward utilizza Preference-Ordered Isotonic Score Editing (POISE) per armonizzare le preferenze a coppie e i punteggi puntuali.
  • Il framework costruisce un dataset unificato a quattro paradigmi che include il punteggio del progresso della traiettoria e annotazioni video-QA.
  • I giudici di ricompensa VLM open-source esistenti come RoboReward utilizzano un semplice punteggio del progresso della traiettoria da 1 a 5 e mancano di preferenze a coppie.
  • L'articolo affronta i limiti dei metodi di aggregazione come TrustJudge.
  • Il lavoro mira alla manipolazione robotica a lungo orizzonte nell'IA embodied.
  • L'articolo è un preprint su arXiv con tipo di annuncio nuovo.
  • L'approccio mira a fornire un feedback visivo scalabile oltre alle ricompense artigianali.

Entità

Istituzioni

  • arXiv

Fonti