TEMPO: Nuovo bilanciamento del carico per il servizio MoE con parallelismo esperto
Un nuovo articolo di ricerca su arXiv (2608.13057) introduce TEMPO, un metodo di bilanciamento del carico esperto-parallelo consapevole del makespan per il servizio di Mixture-of-Experts (MoE). L'articolo sfida gli approcci esistenti di bilanciamento del carico mostrando che il tempo di esecuzione di un esperto non è lineare solo nel numero di token o nel numero di esperti attivati. Misurazioni su due generazioni di GPU per datacenter rivelano due regimi distinti: al di sotto di circa 156-168 token, domina lo streaming dei pesi HBM, rendendo il costo proporzionale alle repliche attivate; al di sopra di tale soglia, la GEMM raggruppata arrotonda i token a tile M di 128, quindi dividere un esperto aggiunge calcolo con padding. Gli autori propongono un profilo max-affine t = max(a + bG, c + βN) per catturare entrambi i regimi. Formalizzano il dispatch per batch come un problema di makespan a costo fisso, che è NP-hard su due macchine. L'articolo dimostra che i dispatch proxy possono differire di 1.4-1.6× nel tempo di blocco modellato (p95 fino a 1.7×), e il proxy ottimale dipende dal regime. Il lavoro è rilevante per migliorare l'efficienza nei sistemi di servizio AI su larga scala.
Fatti principali
- L'articolo arXiv:2608.13057 introduce TEMPO, un metodo di bilanciamento del carico esperto-parallelo consapevole del makespan.
- Misurazioni su due generazioni di GPU per datacenter mostrano che il tempo di esecuzione di un esperto non è lineare nel numero di token o nel numero di esperti attivati.
- Al di sotto di circa 156-168 token, domina lo streaming dei pesi HBM, e il costo è legato alle repliche attivate.
- Al di sopra di tale soglia, la GEMM raggruppata arrotonda i token a tile M di 128, quindi dividere un esperto aggiunge calcolo con padding.
- Un profilo max-affine t = max(a + bG, c + βN) cattura entrambi i regimi.
- Il dispatch per batch è formalizzato come un problema di makespan a costo fisso, NP-hard su due macchine.
- I dispatch proxy differiscono di 1.4-1.6× nel tempo di blocco modellato (p95 fino a 1.7×).
- Il proxy ottimale cambia a seconda del regime.
Entità
Istituzioni
- arXiv