Distillazione Efficiente della Conoscenza per LLM: Logit Top-K Offline e Perdita KL a Chunk Fusa
Uno studio recente pubblicato su arXiv (2608.03796) esplora come migliorare l'efficienza dell'addestramento della distillazione della conoscenza (KD) per modelli linguistici più piccoli. I ricercatori forniscono due contributi chiave. In primo luogo, mostrano che la KD offline, che prevede la memorizzazione nella cache dei logit top-K dell'insegnante per addestrare lo studente, raggiunge una perdita di addestramento paragonabile alla distillazione online, essendo più rapida e più efficiente in termini di memoria. Funziona circa il 29% più velocemente per iterazione e può fornire fino al 41% in più di throughput su una singola GPU H200, eliminando la necessità di mantenere l'insegnante in memoria. In secondo luogo, presentano una perdita KL a chunk fusa che evita la necessità di creare un tensore di logit di dimensioni pari al vocabolario, con un utilizzo di memoria di picco che scala linearmente con la lunghezza della sequenza. Questo metodo affronta i costi significativi associati alla distillazione, che spesso influiscono sulla qualità dei modelli compressi. L'articolo è classificato come annuncio di tipo incrociato e può essere consultato all'indirizzo https://arxiv.org/abs/2608.03796.
Fatti principali
- L'articolo arXiv:2608.03796 presenta una distillazione efficiente della conoscenza per LLM.
- La KD offline memorizza nella cache i logit top-K dell'insegnante una volta e addestra lo studente contro la cache.
- La KD offline eguaglia la distillazione online in termini di perdita di addestramento.
- La KD offline è circa il 29% più veloce per iterazione.
- La KD offline raggiunge fino al 41% in più di throughput su una singola GPU H200.
- La KD offline rimuove l'insegnante dalla memoria.
- La perdita KL a chunk fusa evita di materializzare un tensore di logit di dimensioni pari al vocabolario.
- La memoria di picco diventa lineare nella lunghezza della sequenza.
Entità
Istituzioni
- arXiv