Scaling al Test-Time nei LLM di Ragionamento: Regimi di Inferenza, Valutazione e Riproducibilità
Un recente articolo su arXiv (2608.04001) affronta le difficoltà di valutare il ragionamento nei modelli linguistici di grandi dimensioni (LLM) che utilizzano diversi livelli di calcolo al momento dell'inferenza. Gli autori sostengono che lo 'scaling al test-time' attualmente include una varietà di metodi di inferenza, come la deliberazione sequenziale su un singolo percorso, il campionamento di più candidati con successiva votazione o verifica, e l'esplorazione di stati parziali. Questi metodi presentano variazioni nella struttura statistica, nel calcolo computazionale e nelle potenziali modalità di fallimento. Trattarli come intercambiabili sotto un unico 'budget' scalare o presentare l'accuratezza senza chiarire il metodo di inferenza ostacola i confronti tra studi. L'articolo introduce un quadro strutturato che si concentra su tre aree: formalizzare lo scaling al test-time come inferenza con budget sull'albero dei prefissi implicito di un modello autoregressivo, differenziare tre regimi strutturali (scaling sequenziale a traiettoria singola, scaling a livello di foglia con terminazione e scaling basato su ricerca) e migliorare la valutazione e la riproducibilità. L'obiettivo è promuovere una visione coesa per migliorare la comparabilità e la riproducibilità nella ricerca sul ragionamento nei LLM.
Fatti principali
- Articolo arXiv:2608.04001
- Titolo: 'Scaling al Test-Time nei LLM di Ragionamento: Regimi di Inferenza, Valutazione e Riproducibilità'
- Tipo di annuncio: cross
- Si concentra sul calcolo al momento dell'inferenza nei LLM di ragionamento
- Identifica diversi algoritmi di inferenza sotto 'scaling al test-time'
- Gli algoritmi differiscono per struttura statistica, calcolo computazionale e modalità di fallimento
- Propone tre regimi strutturali: sequenziale a traiettoria singola, a livello di foglia con terminazione e basato su ricerca
- Richiede di riportare il protocollo di inferenza per migliorare la comparabilità
Entità
Istituzioni
- arXiv