GCPO: Un Nuovo Metodo per Stabilizzare il RL di Rollout per LLM
Un nuovo articolo di ricerca su arXiv (2608.11674) introduce GCPO (Geometrically Constrained Policy Optimization), un metodo progettato per affrontare le instabilità di addestramento nell'apprendimento per rinforzo (RL) di rollout on-policy per grandi modelli linguistici (LLM). L'articolo, intitolato 'GCPO: Diagnosing and Constraining Subspace Geometry in Rollout RL for LLMs', identifica problemi come il degrado delle capacità cross-task e l'inflazione della lunghezza delle risposte che comunemente affliggono metodi come GRPO. Gli autori propongono una misura corretta per dimensione chiamata Principal-Subspace Overlap per analizzare la variazione passo-passo della geometria degli aggiornamenti rispetto ai sottospazi singolari dominanti dei pesi pre-addestrati. Osservano che picchi transitori di overlap spesso precedono il degrado delle prestazioni. GCPO applica proiezioni ortogonali bilaterali rigide per vincolare gli aggiornamenti a sottospazi complementari, prevenendo tali escursioni per costruzione. Il metodo è valutato su compiti di ragionamento matematico, generazione di codice e uso di strumenti. L'articolo è disponibile su https://arxiv.org/abs/2608.11674.
Fatti principali
- L'articolo arXiv:2608.11674 introduce GCPO (Geometrically Constrained Policy Optimization).
- GCPO affronta le instabilità di addestramento nel RL di rollout on-policy per LLM.
- I problemi comuni includono il degrado delle capacità cross-task e l'inflazione della lunghezza delle risposte.
- Principal-Subspace Overlap è una nuova misura corretta per dimensione.
- Picchi transitori di overlap spesso precedono il degrado delle prestazioni.
- GCPO utilizza proiezioni ortogonali bilaterali rigide per vincolare gli aggiornamenti.
- Valutato su compiti di ragionamento matematico, generazione di codice e uso di strumenti.
- L'articolo è disponibile su https://arxiv.org/abs/2608.11674.
Entità
Istituzioni
- arXiv