Raggiungibilità vs. Realizzazione: Audit dei Guadagni nei Benchmark degli LLM
Un nuovo articolo arXiv (2608.03219) mette in discussione l'assunto che i guadagni nei benchmark riflettano reali miglioramenti delle capacità degli LLM. Gli autori sostengono che i punteggi aggregati oscurano se i modelli raggiungono nuove risposte o semplicemente producono risposte che erano già a portata di mano. Propongono un audit a livello di domanda con budget, temperature e formati di risposta fissi, distinguendo tra domande 'realizzate' (corrette in condizioni di implementazione predefinite) e domande 'raggiungibili' (corrette tramite una sonda specifica entro un budget). Testando il routing a livello di layer durante l'inferenza su 43 impostazioni di modelli e compiti, hanno scoperto che i percorsi casuali eguagliano o superano la ricerca strutturata con budget corrispondenti, e che le procedure cieche alla risposta non mantengono quasi nessun guadagno, indicando la necessità di accesso alla risposta corretta. Lo studio copre sei casi con modelli da 0,5B a 31B parametri, indagando perché le risposte raggiungibili a volte non compaiono. Questo lavoro ha implicazioni significative per la valutazione dei sistemi di IA, suggerendo che i punteggi dei benchmark potrebbero sopravvalutare i progressi e che è necessario un audit più granulare.
Fatti principali
- Articolo arXiv 2608.03219
- Audit a livello di domanda dei benchmark degli LLM
- Distingue tra domande 'realizzate' e 'raggiungibili'
- I percorsi casuali eguagliano o superano la ricerca strutturata in 43 impostazioni
- Le procedure cieche alla risposta non mantengono quasi nessun guadagno
- Richiede accesso alla risposta corretta per ottenere guadagni
- Copre sei casi con modelli da 0,5B a 31B parametri
- Mette in discussione i punteggi aggregati dei benchmark come prova di capacità
Entità
Istituzioni
- arXiv