ARTFEED — Contemporary Art Intelligence

I modelli di ragionamento non riescono ad allocare il calcolo a tempo di test tra le domande

ai-technology · 2026-08-11

Un nuovo articolo arXiv (2608.07968) introduce un framework di valutazione in stile esame per studiare come i modelli linguistici di ragionamento distribuiscono un budget di token condiviso tra più domande con diversi livelli di difficoltà e punteggi. Lo studio rileva che i modelli, inclusi diversi modelli di ragionamento open e all'avanguardia, non riescono a distribuire strategicamente il calcolo, comportandosi invece come risolutori sequenziali greedy che danno priorità all'ordine di presentazione e concentrano gli sforzi sulle prime domande, rimanendo insensibili al valore. Queste tendenze diventano più pronunciate all'aumentare del numero di domande. La ricerca evidenzia una limitazione significativa nella capacità dei modelli di ragionamento attuali di gestire vincoli di costo o latenza end-to-end quando risolvono più problemi.

Fatti principali

  • L'articolo arXiv:2608.07968 introduce un framework di valutazione in stile esame.
  • I modelli devono distribuire un budget di token condiviso tra domande con diversi livelli di difficoltà e punteggi.
  • Sono stati valutati diversi modelli di ragionamento open e all'avanguardia.
  • I modelli non riescono ad allocare strategicamente un budget condiviso.
  • I modelli si comportano come risolutori sequenziali greedy, dando priorità all'ordine di presentazione.
  • I modelli concentrano gli sforzi sulle prime domande e sono insensibili al valore.
  • Le tendenze diventano più pronunciate all'aumentare del numero di domande.
  • Lo studio affronta l'allocazione del calcolo a tempo di test tra domande, non solo una alla volta.

Entità

Istituzioni

  • arXiv

Fonti