Imbuto di Pensieri: Scaling Efficiente al Test-Time tramite Voto Anticipato e Potatura dei Rollout
Un nuovo articolo arXiv (2608.15065) introduce il metodo Funnel of Thoughts (FoT), un approccio al test-time per i Large Reasoning Models (LRM) che riduce i costi computazionali mantenendo l'accuratezza. Il metodo affronta l'elevato costo dell'inferenza multi-campione, necessaria per un'implementazione affidabile a causa delle risposte incoerenti tra query ripetute. Il voto di maggioranza su k rollout è l'approccio standard ma costoso. FoT mantiene l'accuratezza del voto completo su 32 traiettorie, dimezzando i FLOPs di attenzione e ottenendo una riduzione del 28,8% del costo di inferenza del modello completo. Il metodo sfrutta un segnale lessicale senza training: le traiettorie improduttive spesso contengono marcatori di esitazione come "Aspetta", "In realtà" e "forse". Queste traiettorie hanno meno probabilità di raggiungere risposte corrette e consumano una quantità sproporzionata di FLOPs di attenzione, talvolta degenerando in loop senza risposta. L'articolo analizza 115.000 traiettorie di ragionamento provenienti da sei LRM. FoT utilizza il voto anticipato e la potatura dei rollout per migliorare l'efficienza. L'articolo è disponibile su arXiv con tipo di annuncio "nuovo". Gli autori non sono nominati nel contenuto fornito. Il metodo è significativo per rendere gli LRM più pratici per applicazioni reali, riducendo i costi di inferenza.
Fatti principali
- Il metodo Funnel of Thoughts (FoT) è introdotto come metodo al test-time.
- FoT preserva l'accuratezza del voto completo su 32 traiettorie.
- FoT dimezza i FLOPs di attenzione e riduce il costo di inferenza del modello completo del 28,8%.
- Il metodo è senza training e utilizza segnali lessicali.
- Marcatori di esitazione come 'Aspetta', 'In realtà' e 'forse' indicano traiettorie improduttive.
- L'analisi include 115.000 traiettorie di ragionamento provenienti da sei LRM.
- L'articolo è disponibile su arXiv con ID 2608.15065.
- Il metodo affronta l'alto costo dell'inferenza multi-campione per gli LRM.
Entità
Istituzioni
- arXiv