RubricForge: Evoluzione di Rubriche di Valutazione Senza Ricompensa per Ridurre il Sovra-Credito nella Valutazione degli Agenti
Un nuovo articolo arXiv (2608.13564) introduce RubricForge, un metodo per generare automaticamente rubriche di valutazione per la valutazione di agenti basati su modelli linguistici. L'approccio affronta il problema del sovra-credito nella valutazione degli agenti, dove i giudici esistenti (come G-Eval o modelli fine-tuned) tendono a dare credito a traiettorie fluenti ma non riuscite come successi. RubricForge evolve una rubrica di giudizio utilizzando l'evoluzione riflessiva su un piccolo insieme di traiettorie etichettate con verità di base, massimizzando l'accordo con la ricompensa dell'ambiente. La rubrica ottimizzata viene congelata e applicata a traiettorie non viste in una singola chiamata al modello senza accesso all'ambiente. L'artefatto risultante è testo leggibile dall'uomo, garantendo trasparenza nei verdetti. Questo lavoro è rilevante per il campo della valutazione dell'IA, offrendo un'alternativa più affidabile ed economica alle rubriche scritte a mano o ai giudici fine-tuned.
Fatti principali
- L'articolo arXiv:2608.13564 introduce RubricForge.
- RubricForge evolve una rubrica di giudizio utilizzando l'evoluzione riflessiva su traiettorie etichettate.
- Il metodo massimizza l'accordo con la ricompensa dell'ambiente.
- La rubrica ottimizzata viene congelata e applicata a traiettorie non viste in una singola chiamata al modello.
- Non è richiesto accesso all'ambiente durante l'applicazione.
- L'artefatto è testo leggibile dall'uomo.
- I giudici esistenti come G-Eval scrivono rubriche di punteggio a mano o ottimizzano i pesi del giudice.
- L'approccio mira a ridurre il sovra-credito di traiettorie fluenti ma non riuscite.
Entità
Istituzioni
- arXiv