Framework di Auto-Correzione Senza Verificatore Potenzia il Ragionamento degli LLM
Uno studio recente pubblicato su arXiv (2608.05643) introduce un framework di raffinamento ampiezza-profondità che elimina la necessità di verificatori per migliorare il ragionamento nei modelli linguistici di grandi dimensioni (LLM) durante il test. Questo metodo innovativo affronta il problema dei rendimenti decrescenti associati al campionamento più ampio, dove rollout aggiuntivi tendono a replicare schemi di risposta esistenti. Piuttosto che dipendere da modelli di ricompensa esterni per la validazione, questo framework utilizza risorse computazionali al momento del test per esplorare e migliorare le soluzioni candidate. Genera più rollout di ragionamento indipendenti, li raffina attraverso auto-critica e auto-correzione iterativa, e combina le risposte raffinate usando il voto di maggioranza. Questa tecnica mantiene diversi tentativi iniziali (ampiezza) mentre corregge i difetti di ragionamento locali prima dell'aggregazione (profondità). Il framework supera costantemente la decodifica greedy, il voto di maggioranza e la selezione best-of-N basata su verificatore su vari benchmark, tra cui AIME24, AIME25, AMC, OlympiadBench e MATH500. Gli autori dell'articolo, annunciato su arXiv, evidenziano il suo potenziale per migliorare il ragionamento dell'IA fornendo un'alternativa più efficiente ai metodi dipendenti da verificatore che si basano sulla calibrazione del modello di ricompensa.
Fatti principali
- Propone un framework di raffinamento ampiezza-profondità senza verificatore per il ragionamento degli LLM.
- Utilizza il calcolo al momento del test per esplorare e migliorare le soluzioni candidate.
- Campiona più rollout di ragionamento indipendenti.
- Raffina ogni rollout attraverso auto-critica e auto-correzione iterativa.
- Aggrega le risposte raffinate tramite voto di maggioranza.
- Supera la decodifica greedy, il voto di maggioranza e la selezione best-of-N basata su verificatore.
- Valutato su AIME24, AIME25, AMC, OlympiadBench e MATH500.
- Articolo disponibile su arXiv con ID 2608.05643.
Entità
Istituzioni
- arXiv