Il ragionamento divergente-convergente migliora l'accuratezza degli LLM con meno calcolo
Un nuovo articolo su arXiv (2608.15303) introduce il ragionamento divergente-convergente (DCR), un metodo in due fasi per migliorare il ragionamento dei modelli linguistici di grandi dimensioni (LLM). L'approccio genera prima più soluzioni candidate (fase divergente) e poi le riconcilia (fase convergente). Gli autori riportano tre risultati principali: un singolo passaggio di riconciliazione può amplificare le risposte corrette di minoranza, superando il voto di maggioranza nei casi in cui le risposte corrette sono rare; il DCR ricorsivo, che analizza iterativamente i disaccordi e alloca il calcolo, raggiunge una maggiore accuratezza rispetto ai baselines a calcolo fisso; e sui benchmark AIME 2024 e AIME 2025, il DCR ricorsivo raggiunge rispettivamente il 93,3% e il 92,0% di accuratezza, utilizzando circa il 27% in meno di calcolo. L'articolo è disponibile su arXiv ed è stato annunciato come nuova sottomissione.
Fatti principali
- L'articolo arXiv:2608.15303 introduce il ragionamento divergente-convergente (DCR).
- Il DCR consiste in una fase di esplorazione che genera più soluzioni e una fase di riconciliazione.
- Un singolo passaggio di riconciliazione può amplificare le risposte corrette di minoranza.
- Il DCR spesso recupera le risposte corrette quando le risposte corrette sono in minoranza, dove il voto di maggioranza fallisce.
- Il DCR ricorsivo analizza iterativamente i disaccordi e alloca il calcolo a tempo di test.
- Il DCR ricorsivo raggiunge il 93,3% su AIME 2024 e il 92,0% su AIME 2025.
- Il DCR ricorsivo utilizza circa il 27% in meno di calcolo rispetto ai baselines a calcolo fisso.
- L'articolo è annunciato come nuova sottomissione su arXiv.
Entità
Istituzioni
- arXiv