ARTFEED — Contemporary Art Intelligence

SeekJudge: Un Nuovo Sistema di Ricompensa per Agenti che Usano il Computer

ai-technology · 2026-07-29

È stato pubblicato un nuovo articolo di ricerca che presenta SeekJudge, un sistema di ricompensa innovativo progettato per l'apprendimento per rinforzo in agenti AI. Questo sistema affronta la sfida di valutare se un percorso è allineato con le istruzioni in attività GUI a lungo termine. I metodi tradizionali basati su regole spesso non colgono l'intenzione umana e possono diventare obsoleti con gli aggiornamenti delle app. Gli attuali giudici basati su modelli non hanno ancora raggiunto l'efficacia di quelli basati su regole. SeekJudge impiega quattro agenti specializzati—Condense, Ground, Seek e Analyze—che lavorano insieme in un ciclo Seek-Analyze per valutare i risultati. Un processo di distillazione appositamente calibrato addestra un modello combinato da 9B per fungere da base per questi agenti. Notevolmente, SeekJudge è il primo sistema di ricompensa basato su modello a eguagliare o superare le valutazioni basate su regole in base ai tassi di successo downstream. Puoi trovare l'articolo su arXiv con l'ID 2607.23263.

Fatti principali

  • SeekJudge è un sistema di ricompensa per l'apprendimento per rinforzo in agenti che usano il computer.
  • Utilizza quattro agenti specializzati per ruolo: Condense, Ground, Seek e Analyze.
  • Gli agenti raggiungono un verdetto attraverso un ciclo Seek-Analyze sulla traiettoria.
  • Un processo di distillazione calibrato con seed addestra un singolo modello da 9B come backbone condiviso.
  • SeekJudge eguaglia o supera la valutazione basata su regole su obiettivi di test RL esclusi.
  • È il primo giudice pratico basato su modello a raggiungere questo risultato.
  • La valutazione basata su regole fatica ad allinearsi con l'intenzione umana e diventa obsoleta.
  • I giudici basati su modello esistenti sono ancora in ritardo rispetto alla valutazione basata su regole.

Entità

Istituzioni

  • arXiv

Fonti