Rubriche Strutturate a Grafo Migliorano l'Accuratezza della Valutazione LLM
Uno studio recente pubblicato su arXiv (2608.12097) presenta le Rubriche Strutturate a Grafo (GSR), una tecnica innovativa per organizzare le rubriche di valutazione in grafi strutturati per le valutazioni dei modelli linguistici di grandi dimensioni (LLM). Questo metodo supera una limitazione degli attuali valutatori basati su rubriche, che spesso considerano le rubriche come criteri semplicistici senza una composizione chiara. GSR crea un grafo indipendente dalle risposte prima della valutazione, in cui i nodi criterio facilitano i giudizi e utilizzano operatori di trasformazione, riduzione e gating tramite porte designate. Una specifica mappatura di output, chiamata Readout, trasforma il sink unico in un punteggio o preferenza. La fase di compilazione scarta i grafi malformati o incompatibili. Per le valutazioni pointwise, le dimensioni della rubrica vengono valutate singolarmente prima dell'integrazione nel grafo, mentre le valutazioni pairwise applicano il grafo con un giudizio per criterio per ciascun candidato. Con GPT-OSS-120B, GSR migliora l'accordo esatto sui punteggi di 0,62-6,75 punti percentuali rispetto al punteggio stile Prometheus su quattro dataset pointwise. Questa ricerca è stata condotta da un team di ricercatori e annunciata come nuova sottomissione su arXiv.
Fatti principali
- Il paper arXiv:2608.12097 introduce le Rubriche Strutturate a Grafo (GSR).
- GSR compila le rubriche in grafi di valutazione tipizzati prima di osservare le risposte.
- I nodi criterio sollecitano giudizi; gli operatori di trasformazione, riduzione e gating li compongono.
- Readout mappa il sink unico a un punteggio o preferenza.
- La compilazione rifiuta grafi malformati o tipicamente incompatibili.
- La valutazione pointwise giudica le dimensioni separatamente prima dell'aggregazione.
- La valutazione pairwise riutilizza il grafo con un giudizio per candidato.
- Con GPT-OSS-120B, GSR migliora l'accordo esatto sui punteggi di 0,62-6,75 punti percentuali rispetto al punteggio stile Prometheus su quattro dataset pointwise.
Entità
Istituzioni
- arXiv