SimpleOPD: Distillazione On-Policy Indipendente dal Tokenizer per il Ragionamento a Contesto Lungo
I ricercatori hanno introdotto SimpleOPD, una tecnica di distillazione on-policy (OPD) volta a trasferire le capacità di ragionamento da modelli insegnante a contesto lungo a modelli studente a contesto breve. Questo affronta problemi come la mancata corrispondenza del tokenizer, le discrepanze di distribuzione, l'inflazione della lunghezza delle risposte e l'instabilità dell'addestramento. Il metodo dimostra il trasferimento delle capacità di ragionamento dimostrativo dal modello a contesto lungo SU-01 a studenti a contesto breve. Per risolvere le differenze del tokenizer, l'OPD viene eseguita in uno spazio testuale condiviso, allineando i token che occupano gli stessi intervalli di testo in entrambi i tokenizer. Inoltre, viene implementata una perdita KL di riferimento per lo studente per gestire la generazione eccessivamente lunga e la frequente troncatura, mascherando i vantaggi dei token di terminazione speciali (ad esempio, <|im_end|>) per evitare che lo studente si allontani troppo dalla sua distribuzione originale. L'articolo è disponibile su arXiv con identificativo 2608.14277.
Fatti principali
- SimpleOPD è un metodo di distillazione on-policy indipendente dal tokenizer.
- Trasferisce il ragionamento da modelli insegnante a contesto lungo a modelli studente a contesto breve.
- Il metodo affronta la mancata corrispondenza del tokenizer, la discrepanza di distribuzione, l'esplosione della lunghezza delle risposte e l'instabilità dell'addestramento.
- Le capacità di ragionamento dimostrativo vengono trasferite da SU-01 a studenti a contesto breve.
- L'OPD viene eseguita in uno spazio testuale condiviso, allineando i token con intervalli di testo identici.
- Viene introdotta una perdita KL di riferimento per lo studente per mitigare la generazione eccessivamente lunga.
- I vantaggi dei token di terminazione speciali vengono mascherati.
- L'articolo è disponibile su arXiv (2608.14277).
Entità
Istituzioni
- arXiv