Nuovo metodo per ridurre il bias di punteggio nei valutatori LLM-as-a-Judge
Un articolo di ricerca su arXiv (2608.05726) propone un nuovo metodo per mitigare il bias di punteggio nei Large Language Models (LLM) utilizzati come valutatori della qualità del testo, una pratica nota come LLM-as-a-Judge. Il metodo prevede di istruire l'LLM a generare casualmente token numerici, quindi misurare la deviazione della distribuzione osservata da una distribuzione uniforme per identificare il bias numerico latente. Il bias specifico del compito viene misurato aggiungendo una definizione del compito a valle ai prompt di generazione casuale di numeri. Durante la valutazione, le probabilità di generazione dei token vengono rettificate per tenere conto di questo bias. Sono stati condotti esperimenti su quattro compiti, anche se i dettagli non sono forniti nell'abstract. L'articolo è stato annunciato come una sottomissione cross-type su arXiv.
Fatti principali
- L'articolo arXiv:2608.05726 propone un metodo per mitigare il bias di punteggio in LLM-as-a-Judge.
- LLM-as-a-Judge utilizza LLM per valutare la qualità del testo, superando le metriche convenzionali.
- Il bias di punteggio è la tendenza dei valutatori LLM a generare punteggi particolari indipendentemente dal contesto.
- Il metodo istruisce l'LLM a generare casualmente token numerici per identificare il bias numerico latente.
- La deviazione dalla distribuzione uniforme viene utilizzata per misurare il bias.
- Il bias specifico del compito viene misurato aggiungendo la definizione del compito ai prompt di generazione casuale di numeri.
- Le probabilità di generazione dei token vengono rettificate considerando il bias numerico latente dell'LLM.
- Sono stati condotti esperimenti su quattro compiti.
Entità
Istituzioni
- arXiv