ARTFEED — Contemporary Art Intelligence

CalibratedRubric: Banche di Rubriche Adattive per la Valutazione di LLM

ai-technology · 2026-08-03

Un nuovo framework chiamato CalibratedRubric è stato sviluppato da ricercatori per migliorare la coerenza delle valutazioni LLM a risposta aperta attraverso la selezione di rubriche efficaci. Questo approccio innovativo integra punteggi specifici per tipo, filtraggio bayesiano per la misurabilità delle rubriche e l'assemblaggio di banche basate sulla teoria della risposta all'item (IRT). Valuta la misurabilità di ciascuna rubrica utilizzando un posteriore di accordo Beta-Bernoulli e utilizza un obiettivo di copertura informativa submodulare per creare banche di rubriche efficienti. Il filtraggio della misurabilità ha portato a un aumento dell'accordo umano-oro su JudgmentBench da κ=0.604 a 0.743 in vari benchmark nei settori finanziario, sanitario, generale e legale. Inoltre, la selezione greedy basata su IRT ha superato la selezione casuale nella fedeltà del rango cross-fitted. La ricerca è disponibile su arXiv con l'identificatore 2607.29252.

Fatti principali

  • CalibratedRubric è un framework adattivo al compito per la valutazione di LLM.
  • Combina punteggi specifici per tipo, filtraggio bayesiano della misurabilità delle rubriche e assemblaggio di banche basate su IRT.
  • Il filtraggio della misurabilità ha migliorato l'accordo umano-oro su JudgmentBench da κ=0.604 a 0.743.
  • La selezione greedy basata su IRT ha migliorato la fedeltà del rango cross-fitted rispetto alla selezione casuale.
  • Il framework è stato testato su benchmark finanziari, sanitari, generali e legali.
  • L'articolo è disponibile su arXiv con ID 2607.29252.
  • L'approccio affronta il costo e la scalabilità della cura esperta delle rubriche.
  • Distingue le rubriche misurabili da quelle informative.

Entità

Istituzioni

  • arXiv

Fonti