OM-GRPO: Un Nuovo Framework RLVR Senza Etichette per Prevenire il Collasso delle Risposte
Uno studio recente pubblicato su arXiv (2608.03119) presenta OM-GRPO, un framework progettato per l'apprendimento per rinforzo senza etichette con ricompense verificabili (RLVR) che affronta la sfida del collasso delle risposte. Il RLVR convenzionale dipende da risposte accurate, il che ostacola la scalabilità. Mentre gli approcci senza etichette basati sul voto sostituiscono la supervisione gold-standard con il consenso dei campioni del modello, rischiano di rinforzare i token di risposta invece di migliorare il ragionamento. OM-GRPO separa la stima della ricompensa dall'ottimizzazione della politica mascherando i gradienti sull'intervallo di risposta, mantenendo comunque le ricompense a livello di risposta attraverso un segnale di consenso soft. Inoltre, introduce la Ricompensa Aumentata da Contrasto, che migliora la stima della ricompensa tramite confronti a coppie economici delle traiettorie esistenti senza richiedere rollout aggiuntivi. L'articolo indica miglioramenti su vari benchmark di ragionamento, sebbene i risultati specifici non siano forniti nell'abstract.
Fatti principali
- L'articolo arXiv:2608.03119 propone OM-GRPO, un framework RLVR senza etichette.
- OM-GRPO maschera i gradienti sull'intervallo di risposta per prevenire il collasso delle risposte.
- Mantiene le ricompense a livello di risposta attraverso un segnale di consenso soft.
- La Ricompensa Aumentata da Contrasto affina la stima della ricompensa tramite confronti a coppie.
- Il metodo evita rollout aggiuntivi per il perfezionamento della ricompensa.
- Affronta i limiti dei metodi RLVR senza etichette basati sul voto.
- L'articolo è annunciato su arXiv con tipo 'new'.
- Il framework è valutato su diversi benchmark di ragionamento.
Entità
Istituzioni
- arXiv