VIGOR: Allocazione Efficiente dei Rollout per l'Apprendimento per Rinforzo
L'introduzione di una tecnica innovativa denominata Variance Guided Online Rollout Allocation (VIGOR) migliora l'efficacia dell'apprendimento per rinforzo con ricompense verificabili (RLVR) specificamente per i modelli linguistici di grandi dimensioni. VIGOR affronta gli elevati costi computazionali e le incongruenze associate a GRPO, che spesso produce numerosi rollout di catena di pensiero non informativi. Invece di assegnare un budget di rollout predeterminato per ogni esempio, VIGOR inizia con un numero limitato di rollout su tutti gli esempi in un batch e distribuisce progressivamente rollout aggiuntivi in base a valutazioni della varianza. Questo metodo non solo riduce la durata dell'addestramento, ma aumenta anche la stabilità, il tutto senza la necessità di un pool di rollout ampliato o di filtraggio storico.
Fatti principali
- VIGOR è un metodo per l'allocazione efficiente dei rollout in RLVR.
- Affronta i costi computazionali e l'instabilità di GRPO.
- VIGOR inizia con un piccolo numero di rollout per esempio.
- Alloca iterativamente rollout aggiuntivi in base alla varianza.
- Il metodo riduce il tempo di addestramento e migliora la stabilità.
- VIGOR non richiede un pool più ampio di rollout o filtraggio storico.
- La ricerca è pubblicata su arXiv con ID 2607.22002.
- GRPO si basa sulla generazione ripetuta di lunghi rollout di catena di pensiero.
Entità
Istituzioni
- arXiv