Studio Scopre che un Ragionamento Più Breve Può Mantenere l'Accuratezza nei LLM
Una recente indagine pubblicata su arXiv (2608.03401) esamina l'impatto della riduzione della durata del ragionamento nei modelli linguistici di grandi dimensioni (LLM) sulla loro accuratezza. I ricercatori hanno condotto test accoppiati sulle stesse domande a intervalli di ragionamento equivalenti, utilizzando 198 query GPQA Diamond e 500 query MMLU-Pro. Hanno implementato un prompt numerico/conciso che imposta un limite di token per Qwen3-14B e le configurazioni addestrate di gpt-oss-20b e -120b. Il prompt Qwen ha portato a una riduzione del 12-17% delle tracce di ragionamento, con variazioni di accuratezza minime e miste agli stessi limiti di token. In particolare, un'istruzione concisa/risposta anticipata ha migliorato l'accuratezza MMLU-Pro di 3,8 punti percentuali a 512 token. Lo studio indica che un ragionamento più breve può migliorare l'accuratezza, sfidando la nozione che un ragionamento più lungo sia sempre superiore.
Fatti principali
- Lo studio valuta le interfacce di ragionamento per i LLM
- Utilizza 198 domande GPQA Diamond e 500 domande MMLU-Pro
- Testa il prompt numerico/conciso su Qwen3-14B
- Testa le impostazioni di sforzo addestrate di gpt-oss-20b e -120b
- Il prompt Qwen riduce le tracce di ragionamento del 12-17%
- Le variazioni di accuratezza a limiti di token corrispondenti sono piccole e miste
- L'istruzione concisa/risposta anticipata aumenta l'accuratezza MMLU-Pro di 3,8 punti a 512 token
- Le risposte a sforzo basso/medio di gpt-oss sono più accurate di 14,5-26,3 punti rispetto a quelle ad alto sforzo
Entità
Istituzioni
- arXiv