ARTFEED — Contemporary Art Intelligence

Studio Scopre che un Ragionamento Più Breve Può Mantenere l'Accuratezza nei LLM

ai-technology · 2026-08-06

Una recente indagine pubblicata su arXiv (2608.03401) esamina l'impatto della riduzione della durata del ragionamento nei modelli linguistici di grandi dimensioni (LLM) sulla loro accuratezza. I ricercatori hanno condotto test accoppiati sulle stesse domande a intervalli di ragionamento equivalenti, utilizzando 198 query GPQA Diamond e 500 query MMLU-Pro. Hanno implementato un prompt numerico/conciso che imposta un limite di token per Qwen3-14B e le configurazioni addestrate di gpt-oss-20b e -120b. Il prompt Qwen ha portato a una riduzione del 12-17% delle tracce di ragionamento, con variazioni di accuratezza minime e miste agli stessi limiti di token. In particolare, un'istruzione concisa/risposta anticipata ha migliorato l'accuratezza MMLU-Pro di 3,8 punti percentuali a 512 token. Lo studio indica che un ragionamento più breve può migliorare l'accuratezza, sfidando la nozione che un ragionamento più lungo sia sempre superiore.

Fatti principali

  • Lo studio valuta le interfacce di ragionamento per i LLM
  • Utilizza 198 domande GPQA Diamond e 500 domande MMLU-Pro
  • Testa il prompt numerico/conciso su Qwen3-14B
  • Testa le impostazioni di sforzo addestrate di gpt-oss-20b e -120b
  • Il prompt Qwen riduce le tracce di ragionamento del 12-17%
  • Le variazioni di accuratezza a limiti di token corrispondenti sono piccole e miste
  • L'istruzione concisa/risposta anticipata aumenta l'accuratezza MMLU-Pro di 3,8 punti a 512 token
  • Le risposte a sforzo basso/medio di gpt-oss sono più accurate di 14,5-26,3 punti rispetto a quelle ad alto sforzo

Entità

Istituzioni

  • arXiv

Fonti