CalibratedRubric: Banche di Rubriche Adattive per la Valutazione di LLM
Un nuovo framework chiamato CalibratedRubric è stato sviluppato da ricercatori per migliorare la coerenza delle valutazioni LLM a risposta aperta attraverso la selezione di rubriche efficaci. Questo approccio innovativo integra punteggi specifici per tipo, filtraggio bayesiano per la misurabilità delle rubriche e l'assemblaggio di banche basate sulla teoria della risposta all'item (IRT). Valuta la misurabilità di ciascuna rubrica utilizzando un posteriore di accordo Beta-Bernoulli e utilizza un obiettivo di copertura informativa submodulare per creare banche di rubriche efficienti. Il filtraggio della misurabilità ha portato a un aumento dell'accordo umano-oro su JudgmentBench da κ=0.604 a 0.743 in vari benchmark nei settori finanziario, sanitario, generale e legale. Inoltre, la selezione greedy basata su IRT ha superato la selezione casuale nella fedeltà del rango cross-fitted. La ricerca è disponibile su arXiv con l'identificatore 2607.29252.
Fatti principali
- CalibratedRubric è un framework adattivo al compito per la valutazione di LLM.
- Combina punteggi specifici per tipo, filtraggio bayesiano della misurabilità delle rubriche e assemblaggio di banche basate su IRT.
- Il filtraggio della misurabilità ha migliorato l'accordo umano-oro su JudgmentBench da κ=0.604 a 0.743.
- La selezione greedy basata su IRT ha migliorato la fedeltà del rango cross-fitted rispetto alla selezione casuale.
- Il framework è stato testato su benchmark finanziari, sanitari, generali e legali.
- L'articolo è disponibile su arXiv con ID 2607.29252.
- L'approccio affronta il costo e la scalabilità della cura esperta delle rubriche.
- Distingue le rubriche misurabili da quelle informative.
Entità
Istituzioni
- arXiv