Relay-OPD: Un Nuovo Metodo per Risolvere il Fallimento del Prefisso nella Distillazione On-Policy
Un nuovo articolo su arXiv (2607.26057) introduce Relay On-Policy Distillation (Relay-OPD), un metodo per affrontare il fallimento del prefisso nella distillazione on-policy (OPD). Nell'OPD, un modello studente apprende da un modello insegnante utilizzando la propria traiettoria di generazione, ma se lo studente commette un errore precoce, i token successivi si basano su quell'errore, portando a una supervisione inaffidabile. Gli autori identificano un'asimmetria di continuazione insegnante-studente sui prefissi falliti: l'insegnante tende a reindirizzare, mentre lo studente continua lungo il percorso sbagliato. Relay-OPD utilizza questa asimmetria come trigger senza etichetta per far sì che l'insegnante subentri brevemente in posizioni critiche iniziali, producendo una gamba dell'insegnante, dopo di che lo studente riprende. Un budget di relay limitato concentra l'intervento sui punti chiave riducendo al minimo la deviazione dalla politica. Il metodo viene valutato su compiti di ragionamento matematico, mostrando prestazioni migliori rispetto all'OPD standard.
Fatti principali
- L'articolo arXiv:2607.26057 introduce Relay-OPD
- La distillazione on-policy soffre di fallimento del prefisso
- Viene identificata un'asimmetria di continuazione insegnante-studente sui prefissi falliti
- Relay-OPD utilizza un trigger di passaggio senza etichetta
- L'insegnante subentra brevemente nei punti di trigger rilevati
- Un budget di relay limitato concentra l'intervento sulle posizioni iniziali
- Il metodo viene valutato su compiti di ragionamento matematico
- Relay-OPD migliora rispetto all'OPD standard
Entità
Istituzioni
- arXiv