ARTFEED — Contemporary Art Intelligence

MobileJudgeBench: Benchmark per i Giudici LLM nella Valutazione degli Agenti Mobili

ai-technology · 2026-08-13

È stato lanciato un nuovo benchmark chiamato MobileJudgeBench per valutare l'efficacia dei giudici basati su LLM nella valutazione delle traiettorie degli agenti mobili. Questo benchmark include 931 traiettorie annotate da umani, coprendo 6 benchmark di agenti mobili, 4 modelli di agenti e 68 applicazioni. La ricerca esamina 6 tecniche di giudizio, con cinque modificate da SPA-Bench, A3 con due configurazioni, AndroidArena e AgentRewardBench, insieme a una semplice baseline, attraverso vari backend LLM. In particolare, i risultati indicano che il giudice baseline di base che utilizza screenshot campionati è alla pari, e spesso supera, i metodi specializzati, suggerendo che sistemi di giudizio più complessi non migliorano necessariamente la qualità. Il backbone LLM emerge come il fattore chiave tra i metodi competitivi. Lo studio discute anche la qualità del benchmark, con l'abstract troncato. L'articolo è disponibile su arXiv con identificativo 2608.11434.

Fatti principali

  • MobileJudgeBench è un nuovo benchmark per valutare i metodi LLM-as-judge sulle traiettorie degli agenti mobili.
  • Comprende 931 traiettorie annotate da umani.
  • Le traiettorie coprono 6 benchmark di agenti mobili, 4 modelli di agenti e 68 app.
  • Vengono valutati 6 metodi di giudizio, inclusi cinque adattati da SPA-Bench, A3 con due modalità, AndroidArena e AgentRewardBench, più una semplice baseline.
  • Un semplice giudice baseline con screenshot campionati è competitivo con, e spesso supera, i metodi appositamente costruiti.
  • Pipeline di giudizio più elaborate non migliorano costantemente la qualità del giudizio.
  • Tra i metodi competitivi, il backbone LLM è il principale motore della qualità del giudizio.
  • L'articolo è disponibile su arXiv con identificativo 2608.11434.

Entità

Istituzioni

  • arXiv

Fonti