Principle-Bench: un benchmark di affidabilità a quattro assi per LLM-as-Judge nella regolamentazione basata su principi
Un nuovo benchmark chiamato Principle-Bench è stato introdotto dai ricercatori per valutare l'affidabilità dei sistemi LLM-as-judge nell'ambito della regolamentazione basata su principi. Questo benchmark include 168 scenari relativi alle promozioni finanziarie di cripto-attività, allineati con due principi della Financial Conduct Authority (FCA) del Regno Unito. Presenta variazioni come parafrasi, manipolazione avversaria delle parole chiave e casi limite creati seguendo un quadro pre-registrato. Gli autori sottolineano che la valutazione di qualsiasi giudice LLM dovrebbe coinvolgere quattro criteri: accuratezza, robustezza rispetto alla parafrasi, resilienza avversaria e calibrazione. Presentano anche Ceca (Calibrated Exemplar-Cluster Assessment), uno strumento verificabile che offre attribuzioni controfattuali precise. Un confronto di vari metodi rivela che nessun singolo approccio eccelle in tutte le aree. La ricerca è accessibile su arXiv con l'identificatore 2608.14329.
Fatti principali
- Principle-Bench include 168 scenari di promozione finanziaria di cripto-attività.
- Gli scenari sono mappati su due principi della FCA del Regno Unito.
- Le perturbazioni includono parafrasi, keyword-stuffing avversario e casi limite.
- Il benchmark copre quattro assi: accuratezza, robustezza alla parafrasi, robustezza avversaria e calibrazione.
- Ceca (Calibrated Exemplar-Cluster Assessment) è introdotto come valutatore calibrato e verificabile.
- Ceca emette attribuzioni controfattuali esatte per ogni esempio.
- Metodi confrontati: conteggio delle parole chiave, tre embedder sentence-transformer, un giudice LLM open-weight e una cascata calibrata.
- Nessun metodo domina su tutti gli assi.
- L'articolo è disponibile su arXiv (2608.14329).
Entità
Istituzioni
- UK Financial Conduct Authority (FCA)
- arXiv