REOPD: Estrapolazione Adattiva della Ricompensa per la Distillazione On-Policy
È stato introdotto un nuovo framework noto come REOPD (Reliability-Adaptive Reward Extrapolation for On-Policy Distillation) per affrontare i problemi di reward hacking e instabilità dell'addestramento nella distillazione on-policy (OPD). In OPD, un modello studente viene addestrato utilizzando le proprie traiettorie, beneficiando di una supervisione densa a livello di token da parte di un insegnante. Le attuali tecniche di estrapolazione della ricompensa, come ExOPD, migliorano il rapporto di verosimiglianza logaritmica di riferimento dell'insegnante per trascendere la semplice imitazione; tuttavia, utilizzano un unico coefficiente globale lambda per tutti i token, portando potenzialmente lo studente a conformarsi a picchi estremi nelle ricompense implicite, con conseguente instabilità e reward hacking. Inoltre, il lambda ottimale varia a seconda del dominio, richiedendo una costosa ottimizzazione degli iperparametri. REOPD presenta un peso di compatibilità a livello di token insieme a un budget adattivo a livello di batch, risultando in un coefficiente token-wise lambda_{b,t} = 1 + gamma_b q_t. Questo metodo mantiene l'allineamento con l'insegnante mentre estrapola selettivamente in direzioni affidabili. In particolare, REOPD non richiede un verificatore, un modello di ricompensa, un modello di valore o rollout aggiuntivi oltre alla OPD standard. L'articolo di ricerca è disponibile su arXiv con identificativo 2608.11698 ed è stato rilasciato come sottomissione cross-type.
Fatti principali
- REOPD è un framework di estrapolazione della ricompensa adattivo all'affidabilità per la distillazione on-policy (OPD).
- Affronta il reward hacking e l'addestramento instabile nella OPD.
- I metodi esistenti come ExOPD utilizzano un unico coefficiente globale lambda per tutti i token.
- REOPD utilizza un peso di compatibilità a livello di token e un budget adattivo a livello di batch.
- Il coefficiente token-wise è lambda_{b,t} = 1 + gamma_b q_t.
- REOPD non richiede verificatore, modello di ricompensa, modello di valore o rollout aggiuntivi.
- L'articolo è disponibile su arXiv con identificativo 2608.11698.
- Il tipo di annuncio è cross.
Entità
Istituzioni
- arXiv