Ottimizzazione dei Premi di Processo Auto-Guidata per il Ragionamento dei LLM
È stato proposto un nuovo framework chiamato Self-Guided Process Reward Optimization (SPRO) per migliorare le capacità di ragionamento dei Large Language Models (LLM) attraverso l'apprendimento per rinforzo di processo. SPRO elimina la necessità di modelli di ricompensa di processo aggiuntivi, derivando le ricompense di processo intrinsecamente dal modello politico stesso. Introduce due innovazioni chiave: Cumulative Process Rewards (CPR) e Masked Step Advantage (MSA), che consentono una rigorosa stima del vantaggio delle azioni a livello di passo all'interno di gruppi di campionamento con prompt condivisi. L'approccio affronta la mancanza di un quadro teorico unificato per la stima del vantaggio a livello di processo e riduce il carico computazionale. I risultati sperimentali dimostrano la sua efficacia nel migliorare il ragionamento dei LLM.
Fatti principali
- SPRO è un framework per l'apprendimento per rinforzo di processo nei LLM.
- Deriva le ricompense di processo dal modello politico stesso, evitando modelli di ricompensa aggiuntivi.
- Introduce Cumulative Process Rewards (CPR) e Masked Step Advantage (MSA).
- CPR e MSA consentono la stima del vantaggio delle azioni a livello di passo all'interno di gruppi di campionamento con prompt condivisi.
- Il framework riduce il carico computazionale rispetto all'uso di modelli di ricompensa di processo separati.
- Fornisce un quadro teorico unificato per la stima del vantaggio a livello di processo.
- I risultati sperimentali mostrano che SPRO migliora le capacità di ragionamento dei LLM.
- L'articolo è disponibile su arXiv con ID 2507.01551.
Entità
Istituzioni
- arXiv