APEX: Prefetching Adattivo degli Esperti per l'Inferenza MoE sui Dispositivi Edge
Un framework di nuova concezione noto come APEX (Adaptive Expert Prefetching) mira ad affrontare i vincoli di memoria nei modelli Mixture-of-Experts (MoE) utilizzati sui dispositivi edge. Sebbene i modelli MoE siano preferiti per le applicazioni edge grazie alla loro notevole capacità e all'efficienza computazionale, i grandi parametri degli esperti, tipicamente memorizzati in memoria off-chip, possono ostacolare il caricamento degli esperti. APEX funziona come un sistema di gestione predittiva delle risorse che sincronizza il caricamento degli esperti con il calcolo produttivo. Presenta un router di prefetching leggero che anticipa gli esperti candidati prima del blocco di attenzione, recuperando dinamicamente esperti aggiuntivi basandosi su un modello di confidenza appreso. Questo approccio adattivo raggiunge oltre il 99% di accuratezza nell'overlap, superando i tradizionali metodi di prefetching top-k fissi. Il framework, che include due modalità di esecuzione—una che garantisce la correttezza e un'altra che può sacrificare l'accuratezza per la velocità—è discusso in un articolo disponibile su arXiv (2608.11688), sottolineando la sua importanza nell'AI edge e nell'inferenza efficiente.
Fatti principali
- APEX è un framework di gestione predittiva delle risorse per l'inferenza MoE sui dispositivi edge.
- Sovrappone il caricamento degli esperti con il calcolo per nascondere la latenza di memoria.
- Utilizza un router di prefetching leggero con un modello di confidenza appreso.
- Raggiunge oltre il 99% di accuratezza nell'overlap.
- Supera il prefetching top-k fisso.
- Supporta modalità che preservano la correttezza e modalità più veloci.
- Articolo disponibile su arXiv (2608.11688).
- Affronta il collo di bottiglia della memoria nell'inferenza MoE edge.
Entità
Istituzioni
- arXiv