CoBa: Il Routing Bilanciato sul Calcolo Migliora l'Efficienza dello Scaling al Test-Time
Un nuovo preprint su arXiv (2608.07424) introduce CoBa, una politica di routing volta a ottimizzare l'uso del calcolo durante i compiti di ragionamento dell'IA. Gli autori considerano il ragionamento al test-time come una sfida di allocazione delle risorse, decidendo se concentrarsi sulla generazione di output, sulla verifica dei risultati o sulla terminazione dei processi. CoBa genera un piccolo insieme di candidati, esegue una verifica ampia e a basso costo, e invia i candidati incerti o di valore a una verifica più approfondita. Nei test che coinvolgono 3.129 compiti di generazione di esempi come MATH-500 e AMC 2023, CoBa-Routed-Strong ha raggiunto un'accuratezza macro dell'85,13%, quasi eguagliando un metodo di autovalutazione all'85,20% utilizzando il 49,1% in meno di token. Ha anche eguagliato le prestazioni di un metodo di voto di maggioranza di alto livello, mostrando un approccio più efficiente al ragionamento entro limiti di inferenza fissi.
Fatti principali
- 1. CoBa è una politica di routing bilanciata sul calcolo per lo scaling al test-time.
- 2. Formula il ragionamento al test-time come un problema di allocazione del calcolo.
- 3. CoBa ottiene prima un piccolo insieme di candidati, applica una verifica economica su larga scala e instrada i candidati incerti o di alto valore verso una verifica più forte.
- 4. Valutato su 3.129 valutazioni di generazione di esempi che coprono MATH-500, AIME 2024/2025, AMC 2023 e ragionamento simbolico procedurale.
- 5. CoBa-Routed-Strong raggiunge un'accuratezza macro dell'85,13%.
- 6. Eguaglia statisticamente un proxy di voto ponderato basato su autovalutazione all'85,20%.
- 7. Utilizza il 49,1% in meno di token pesati per parametro.
- 8. Eguaglia le prestazioni del voto di maggioranza best-of-16.
- 9. Il paper è disponibile su arXiv con ID 2608.07424.
Entità
Istituzioni
- arXiv