ARTFEED — Contemporary Art Intelligence

Multiverse Computing Riduce i Costi della Distillazione della Conoscenza con la Perdita KL a Chunk Fuso

ai-technology · 2026-08-10

Multiverse Computing ha pubblicato un nuovo articolo che descrive una tecnica innovativa volta a migliorare l'efficienza della memoria nel processo di distillazione della conoscenza per i modelli linguistici di grandi dimensioni (LLM). Questa tecnica impiega i top-100 logit memorizzati nella cache per la distillazione offline e utilizza una perdita di divergenza KL a chunk combinata. Di conseguenza, i requisiti massimi di memoria sono crollati da 85,2 GiB a 5,45 GiB per l'elaborazione di 32K token. Inoltre, la distillazione del modello GPT-OSS 20B può ora essere eseguita su un singolo nodo GPU, accelerando significativamente il processo e migliorando la produttività. Il modello passa anche da 8B a 3,2B parametri senza perdere l'accuratezza di benchmark.

Fatti principali

  • 1. Multiverse Computing ha pubblicato un articolo sulla distillazione efficiente della conoscenza per gli LLM.
  • 2. L'articolo introduce la distillazione offline utilizzando i logit top-K memorizzati nella cache.
  • 3. Una perdita KL a chunk fuso evita di materializzare l'intera matrice vocabolario × sequenza.
  • 4. La memoria di picco è ridotta da 85,2 GiB a 5,45 GiB a 32K token (riduzione di 15,6 volte).
  • 5. La distillazione di GPT-OSS 20B a contesto 32K è passata da quattro nodi GPU a uno.
  • 6. Il tempo per passo è sceso da 57,0 a 12,23 secondi (5 volte più veloce).
  • 7. Il modello studente (3,2B parametri) mantiene la maggior parte dell'accuratezza dell'insegnante su BoolQ e HellaSwag.
  • 8. L'implementazione è open-source su GitHub.

Entità

Istituzioni

  • Multiverse Computing
  • Nvidia
  • Hugging Face

Fonti