ARTFEED — Contemporary Art Intelligence

OSReward: Nuovo Benchmark per la Valutazione dei Giudici VLM negli Agenti di Uso del Computer

ai-technology · 2026-08-07

I ricercatori hanno introdotto OSReward, un benchmark progettato per valutare l'affidabilità dei modelli visione-linguaggio (VLM) utilizzati come giudici per gli agenti di uso del computer (CUA). Il benchmark affronta una lacuna critica: mentre i VLM sono sempre più impiegati per verificare se i CUA hanno completato i compiti, la loro affidabilità non è stata studiata sistematicamente. OSReward comprende traiettorie provenienti da diversi backbone di agenti che eseguono istruzioni verificate da umani su più piattaforme, etichettate con verdetti di verità di base attraverso annotazione umana a più fasi. Il team ha anche derivato OSReward-Hard, un sottoinsieme impegnativo. Il lavoro è dettagliato in un articolo su arXiv (ID: 2607.28609), annunciato come sostituto. Lo studio sottolinea l'importanza di una valutazione standardizzata per i modelli di ricompensa cross-platform per l'uso del computer, con l'obiettivo di migliorare la valutazione dei CUA, la cura dei dati e l'apprendimento per rinforzo.

Fatti principali

  • OSReward è un benchmark per valutare i giudici VLM sulle traiettorie dei CUA.
  • Le traiettorie provengono da diversi backbone di agenti che eseguono istruzioni verificate da umani su più piattaforme.
  • I verdetti di verità di base sono etichettati attraverso annotazione umana a più fasi.
  • OSReward-Hard è un set di sfide derivato da OSReward.
  • L'articolo è disponibile su arXiv con ID 2607.28609.
  • Il tipo di annuncio è 'replace'.
  • Lo studio affronta l'affidabilità dei giudici VLM nella valutazione dei CUA.
  • Il lavoro mira a migliorare la valutazione dei CUA, la cura dei dati e l'apprendimento per rinforzo.

Entità

Istituzioni

  • arXiv

Fonti