LC-GRPO: La correzione di Langevin colma il divario tra addestramento e inferenza nel GRPO basato su flusso
Un nuovo framework, LC-GRPO, affronta il divario tra addestramento e inferenza nei modelli generativi basati su flusso addestrati con apprendimento per rinforzo online. Il metodo, introdotto nell'articolo arXiv 2608.05600, corregge la discrepanza tra i rollout stocastici utilizzati durante l'addestramento e il campionamento ODE deterministico all'inferenza. Applicando una correzione di Langevin dopo ogni passo di Eulero ODE, LC-GRPO allinea i campioni di addestramento con la generazione a test-time, migliorando l'ottimizzazione della politica. Il lavoro mira alla sfocatura causata dal rumore di esplorazione nei rollout SDE, garantendo coerenza nelle discretizzazioni a passi finiti.
Fatti principali
- LC-GRPO è un framework GRPO basato su flusso con correzione di Langevin.
- Affronta il divario tra addestramento e inferenza nei modelli generativi basati su flusso.
- L'apprendimento per rinforzo online richiede rollout stocastici, mentre l'inferenza utilizza il campionamento ODE deterministico.
- I metodi GRPO esistenti sostituiscono l'ODE con SDE durante l'addestramento, causando una discrepanza nei campioni.
- I rollout SDE diventano sfocati all'aumentare del rumore di esplorazione.
- LC-GRPO esegue un passo di Eulero ODE allineato all'inferenza seguito da una correzione stocastica di Langevin.
- Il metodo mira alla distribuzione marginale per allineare i campioni di addestramento e test-time.
- L'articolo è disponibile su arXiv con ID 2608.05600.
Entità
—