MARS: Quadro di Augmentazione Dati Adattivo per la Modellazione delle Ricompense in RLHF
I ricercatori hanno introdotto un nuovo quadro chiamato MARS, che sta per Margin and Semantic-Aware Data Augmentation for Reward Modeling, volto a potenziare la modellazione delle ricompense in scenari con dati limitati. La modellazione delle ricompense è cruciale in tecniche come l'apprendimento per rinforzo dal feedback umano (RLHF) e il feedback dell'IA (RLAIF), ma spesso soffre di dati di preferenza umana insufficienti e incoerenti. MARS affronta questo problema enfatizzando l'aumento per coppie di preferenza a basso margine e migliorando le distinzioni semantiche per separare efficacemente le risposte accettate da quelle rifiutate prima di generare campioni di preferenza sintetici. Valutato su tre set di dati e due quadri di modellazione delle ricompense, MARS ha mostrato prestazioni migliori in RewardBench e nei tassi di vittoria di allineamento rispetto ai metodi tradizionali. I dettagli completi sono disponibili su arXiv con l'identificatore 2602.17658 nella sezione Machine Learning.
Fatti principali
- 1. MARS sta per Margin and Semantic-Aware Data Augmentation for Reward Modeling.
- 2. È un quadro di augmentazione adattivo per la modellazione delle ricompense a basse risorse controllate.
- 3. MARS assegna più augmentazione alle coppie di preferenza a basso margine.
- 4. Utilizza un perfezionamento basato sulla distanza semantica per migliorare il contrasto scelto-rifiutato.
- 5. Valutato su tre set di dati di preferenza e due backbone di modelli di ricompensa.
- 6. Migliora le prestazioni medie di RewardBench e i tassi di vittoria di allineamento.
- 7. Confrontato con augmentazione uniforme, WoN e baseline stile AdaBoost.
- 8. I guadagni non sono spiegati esclusivamente dal perfezionamento semantico o dall'accoppiamento del giudice GPT-4.1.
Entità
Istituzioni
- arXiv