SMOPD: Stabilizzazione della Auto-Distillazione Multi-Turn tramite Mascheramento dell'Entropia dei Token
È stata sviluppata una nuova tecnica chiamata SMOPD (Selective Masking for On-Policy Distillation) per affrontare i problemi di instabilità nell'auto-distillazione on-policy multi-turn (OPSD) per i modelli linguistici. Questa instabilità deriva dai rollout 'dirty-history', in cui risposte intermedie errate influenzano i turni successivi, e la distillazione uniforme può allocare erroneamente la perdita a token che forniscono un feedback correttivo minimo. SMOPD funziona come metodo di stabilizzazione basato solo sulla perdita, dando priorità alle posizioni dei token in base all'entropia dello studente per ogni risposta intermedia, scartando il 20% dei token con entropia più bassa dalla perdita di distillazione di Jensen-Shannon generalizzata e ritagliata, mantenendo le perdite di risposta finale e di piena preservazione. Questa tecnica si concentra sull'incertezza a livello di token, non introduce parametri aggiuntivi e non comporta overhead al momento dell'inferenza. È stata valutata rispetto a una variante di scaling della correttezza che migliora un comune proxy di affidabilità staccato basato sull'accuratezza della risposta finale. Sul benchmark LiC utilizzando modelli Qwen3, SMOPD migliora SHA (la metrica è troncata nell'abstract). La ricerca è accessibile su arXiv con l'identificatore 2608.14647, categorizzata come 'cross'.
Fatti principali
- SMOPD è un metodo di stabilizzazione basato solo sulla perdita per l'auto-distillazione on-policy multi-turn.
- Rimuove il 20% dei token con entropia più bassa dalla perdita di distillazione di Jensen-Shannon generalizzata e ritagliata.
- Le perdite di risposta finale e di piena preservazione rimangono invariate.
- Il metodo non aggiunge parametri e ha zero overhead al momento dell'inferenza.
- È stato confrontato con una variante di scaling della correttezza che utilizza la correttezza della risposta finale come proxy di affidabilità.
- Gli esperimenti sono stati condotti sul benchmark LiC con modelli Qwen3.
- L'articolo è disponibile su arXiv con ID 2608.14647.
- Il tipo di annuncio è 'cross'.
Entità
Istituzioni
- arXiv