PNPO: Un nuovo metodo per ridurre il costo computazionale nell'apprendimento per rinforzo dei LLM
Uno studio recente pubblicato su arXiv (2608.01418) presenta la Prefix-Normalized Policy Optimization (PNPO), una tecnica volta a minimizzare il carico computazionale associato all'apprendimento per rinforzo nei modelli linguistici di grandi dimensioni (LLM). Questa ricerca affronta le spese significative legate alla generazione autoregressiva dei rollout, consentendo il riutilizzo dei batch di rollout in più aggiornamenti del learner. Tuttavia, questo approccio comporta aggiornamenti off-policy poiché il learner si discosta dalla policy di comportamento. La PNPO sostituisce il rapporto di importanza cumulativo con la media geometrica dei rapporti di verosimiglianza per ogni prefisso causale, mantenendo la dipendenza dal prefisso causale e riducendo la scala del log-peso. Il metodo è stato testato in esperimenti controllati che coinvolgono il ragionamento matematico a contesto lungo, stabilendo due regimi off-policy attraverso una o quattro epoche di aggiornamento della policy per batch di rollout.
Fatti principali
- Il paper arXiv:2608.01418 introduce la Prefix-Normalized Policy Optimization (PNPO).
- La PNPO mira a ridurre il costo computazionale nell'apprendimento per rinforzo per i modelli linguistici di grandi dimensioni.
- Il metodo riutilizza i batch di rollout per ulteriori aggiornamenti del learner.
- La PNPO utilizza la media geometrica dei rapporti di verosimiglianza lungo i prefissi causali.
- Gli esperimenti sono stati condotti in compiti di ragionamento matematico a contesto lungo.
- Sono stati indotti due regimi off-policy: una e quattro epoche di aggiornamento della policy per rollout.
- Il paper è disponibile su arXiv, un server di prestampa.
- La ricerca affronta la correzione off-policy nell'apprendimento per rinforzo dei LLM.
Entità
Istituzioni
- arXiv