Le classifiche degli LLM cambiano con i budget di token: lo studio trova accuratezza non monotona e complementarità dei modelli
Una recente indagine contesta la convinzione che le classifiche dei grandi modelli linguistici (LLM) siano coerenti in diverse condizioni di inferenza. Questo studio, disponibile su arXiv (2608.12150), modifica sistematicamente il budget di generazione dei token—da 64 a 4.096 token—attraverso sette livelli. Quattro modelli sono stati valutati utilizzando tre benchmark di ragionamento, per un totale di 56.476 inferenze. I risultati indicano che il 3-19% degli elementi mostra un comportamento non monotono, con un'accuratezza che diminuisce all'aumentare del budget, nonostante il controllo per il troncamento. Questo comportamento è specifico dei singoli modelli, con una sovrapposizione tra modelli dal 6% al 14%. Le classifiche cambiano tra i budget su tutti i benchmark, raggiungendo una significatività statistica (p < 0,01, McNemar). Un'analisi oracle rivela una complementarità dei modelli fino a +27,8 punti percentuali, in particolare a budget inferiori. Un router consapevole del budget affronta il 14,1% del divario oracle tra i domini, mentre le caratteristiche di budget migliorano le prestazioni all'interno del dominio (+1,6 a +5,7 punti percentuali) ma influenzano negativamente il trasferimento (-1,2 punti percentuali). Questi risultati sostengono protocolli di valutazione che tengano conto dei budget e suggeriscono che i budget di inferenza dovrebbero essere un fattore nella selezione dei modelli. Questa ricerca è stata condotta da un team di ricercatori ed è stata recentemente pubblicata su arXiv.
Fatti principali
- Lo studio pubblicato su arXiv (2608.12150) mette in discussione le classifiche stabili degli LLM.
- Varia il budget di generazione dei token su sette livelli (64-4.096).
- Valuta quattro modelli su tre benchmark di ragionamento (56.476 inferenze).
- Il 3-19% degli elementi mostra un'accuratezza non monotona (diminuisce con più budget).
- Il comportamento non monotono è specifico del modello (sovrapposizione tra modelli 6-14%).
- Le classifiche dei modelli si invertono tra i budget su tutti i benchmark (p < 0,01, McNemar).
- L'analisi oracle mostra una complementarità dei modelli fino a +27,8 punti percentuali.
- Un router consapevole del budget cattura il 14,1% del divario oracle tra i domini.
- Le caratteristiche di budget aiutano all'interno del dominio (+1,6 a +5,7 pp) ma danneggiano il trasferimento (-1,2 pp).
Entità
Istituzioni
- arXiv