Multiverse Computing Riduce i Costi della Distillazione della Conoscenza con la Perdita KL a Chunk Fuso
Multiverse Computing ha pubblicato un nuovo articolo che descrive una tecnica innovativa volta a migliorare l'efficienza della memoria nel processo di distillazione della conoscenza per i modelli linguistici di grandi dimensioni (LLM). Questa tecnica impiega i top-100 logit memorizzati nella cache per la distillazione offline e utilizza una perdita di divergenza KL a chunk combinata. Di conseguenza, i requisiti massimi di memoria sono crollati da 85,2 GiB a 5,45 GiB per l'elaborazione di 32K token. Inoltre, la distillazione del modello GPT-OSS 20B può ora essere eseguita su un singolo nodo GPU, accelerando significativamente il processo e migliorando la produttività. Il modello passa anche da 8B a 3,2B parametri senza perdere l'accuratezza di benchmark.
Fatti principali
- 1. Multiverse Computing ha pubblicato un articolo sulla distillazione efficiente della conoscenza per gli LLM.
- 2. L'articolo introduce la distillazione offline utilizzando i logit top-K memorizzati nella cache.
- 3. Una perdita KL a chunk fuso evita di materializzare l'intera matrice vocabolario × sequenza.
- 4. La memoria di picco è ridotta da 85,2 GiB a 5,45 GiB a 32K token (riduzione di 15,6 volte).
- 5. La distillazione di GPT-OSS 20B a contesto 32K è passata da quattro nodi GPU a uno.
- 6. Il tempo per passo è sceso da 57,0 a 12,23 secondi (5 volte più veloce).
- 7. Il modello studente (3,2B parametri) mantiene la maggior parte dell'accuratezza dell'insegnante su BoolQ e HellaSwag.
- 8. L'implementazione è open-source su GitHub.
Entità
Istituzioni
- Multiverse Computing
- Nvidia
- Hugging Face