Distillazione On-Policy Top-k Consapevole della Coda Migliora l'Addestramento dei Modelli Linguistici
Un nuovo approccio chiamato Distillazione On-Policy Top-k Consapevole della Coda (TA-OPD) è stato sviluppato dai ricercatori per migliorare l'addestramento dei modelli linguistici, affrontando specificamente le carenze degli attuali metodi di distillazione on-policy. La distillazione on-policy tradizionale (OPD) consente a un modello studente di replicare la distribuzione del token successivo di un modello insegnante. Tuttavia, molte tecniche esistenti si concentrano esclusivamente sulla minimizzazione della divergenza di Kullback-Leibler (KL) inversa rispetto ai top-k token dell'insegnante, trascurando le informazioni sulla probabilità della coda. Questa negligenza porta a un aumento della probabilità della coda e dell'entropia nel modello studente, con conseguente riduzione dell'accuratezza nei compiti a valle. TA-OPD corregge questo problema minimizzando la divergenza KL inversa sui top-k token, incorporando al contempo le informazioni sulla coda. I dettagli di questo metodo sono disponibili in un articolo su arXiv (arXiv:2608.14728), con l'obiettivo di migliorare l'efficienza della distillazione della conoscenza nei grandi modelli linguistici.
Fatti principali
- TA-OPD è un nuovo metodo di distillazione per modelli linguistici.
- Affronta il problema della probabilità della coda scartata nella distillazione on-policy top-k.
- Il metodo minimizza la divergenza KL inversa sui top-k token ripristinando il segnale della probabilità della coda.
- I metodi esistenti che ignorano la probabilità della coda possono aumentare la probabilità della coda e l'entropia dello studente, degradando l'accuratezza.
- L'articolo è disponibile su arXiv con identificativo 2608.14728.
- Il lavoro è rilevante per la ricerca e lo sviluppo dell'IA.
- TA-OPD mira a migliorare l'accuratezza a valle senza costi computazionali aggiuntivi.
Entità
Istituzioni
- arXiv