SpecPrefetch: Prefetching Efficiente degli Esperti per Modelli MoE
Un recente studio pubblicato su arXiv introduce SpecPrefetch, un framework efficiente progettato per il prefetching dei pesi degli esperti nei modelli foundation sparse Mixture-of-Experts (MoE). Sebbene i modelli MoE aumentino la loro capacità tramite l'attivazione condizionale degli esperti, incontrano problemi di implementazione quando la memoria dell'acceleratore è limitata a causa dello scaricamento degli esperti. Il collo di bottiglia causato dai trasferimenti dipendenti dal routing porta alla serializzazione dei processi di routing, caricamento degli esperti ed esecuzione. SpecPrefetch impiega un adattatore leggero condiviso per anticipare i candidati esperti del livello successivo per trasferimenti asincroni, mentre il router nativo, che rimane invariato, identifica gli esperti da eseguire. Questo approccio minimizza la latenza associata al caricamento degli esperti senza modificare il meccanismo di routing originale.
Fatti principali
- I modelli MoE sparsi utilizzano l'attivazione condizionale degli esperti per espandere la capacità.
- Lo scaricamento degli esperti sposta gli esperti inattivi nella memoria host o nello storage.
- Il collo di bottiglia dei trasferimenti dipendenti dal routing serializza routing, caricamento degli esperti ed esecuzione.
- SpecPrefetch utilizza un adattatore leggero condiviso per la previsione degli esperti del livello successivo.
- Il router nativo congelato determina gli esperti finali da eseguire.
- SpecPrefetch separa la previsione del trasferimento dal routing di esecuzione.
- Riduce la latenza esposta del caricamento degli esperti.
- L'articolo è su arXiv con ID 2607.24787.
Entità
Istituzioni
- arXiv