Studio dimostra che le prestazioni del giudice LLM dipendono dalla regola decisionale, non solo dall'accuratezza
Un nuovo articolo arXiv (2608.07813) indaga l'efficacia dei giudici LLM nei pipeline di ragionamento, sostenendo che il costo della decisione di un giudice dipende più dalla regola decisionale in cui opera che dalla sua accuratezza grezza. Lo studio, che utilizza pool di candidati congelati da quattro politiche GRPO, rileva che un giudice scalare non vincolato DeepSeek-R1-7B fornisce un miglioramento minimo rispetto al voto di maggioranza a livello di risposta: +1,0 punti percentuali su 500 domande GSM8K e +0,34 di corrispondenza esatta su 300 domande HotpotQA. Su una suddivisione di conferma di 30 domande con regola congelata, il giudice è 10 punti peggiore della maggioranza, dimostrando che un giudice sicuro può effettivamente distruggere l'accuratezza. Gli autori introducono quindi Evidence-Locked Derive-Gate-Repair (EL-DGR), una regola decisionale non compensativa adattiva al compito. Sotto EL-DGR, una preferenza del giudice può sovrascrivere il consenso supportato da prove solo se accompagnata da un certificato di prova estrattiva, e una riparazione è consentita solo quando nessuna delle alternative è certificata e la riparazione stessa è certificata. L'articolo riporta che senza alcuna modifica al modello del giudice, EL-DGR migliora le prestazioni, suggerendo che la regola decisionale è un fattore critico nell'implementazione dei giudici LLM. I risultati hanno implicazioni per i sistemi di intelligenza artificiale che utilizzano giudici LLM per selezionare risposte in compiti di ragionamento, evidenziando l'importanza di progettare regole decisionali che impediscano ai giudici di prendere decisioni dannose.
Fatti principali
- Articolo arXiv:2608.07813
- Il giudice LLM nel pipeline di ragionamento decide quale risposta viene inviata
- Giudice scalare non vincolato DeepSeek-R1-7B: +1,0 pp su 500 domande GSM8K
- Giudice: +0,34 EM su 300 domande HotpotQA
- Su una suddivisione di conferma di 30 domande con regola congelata, il giudice è 10 punti peggiore della maggioranza
- EL-DGR: Evidence-Locked Derive-Gate-Repair
- EL-DGR richiede un certificato di prova estrattiva per l'override del giudice
- EL-DGR migliora le prestazioni senza alcuna modifica al modello del giudice
Entità
Istituzioni
- arXiv