ARTFEED — Contemporary Art Intelligence

TEMPO: Nuovo bilanciamento del carico per il servizio MoE con parallelismo esperto

ai-technology · 2026-08-15

Un nuovo articolo di ricerca su arXiv (2608.13057) introduce TEMPO, un metodo di bilanciamento del carico esperto-parallelo consapevole del makespan per il servizio di Mixture-of-Experts (MoE). L'articolo sfida gli approcci esistenti di bilanciamento del carico mostrando che il tempo di esecuzione di un esperto non è lineare solo nel numero di token o nel numero di esperti attivati. Misurazioni su due generazioni di GPU per datacenter rivelano due regimi distinti: al di sotto di circa 156-168 token, domina lo streaming dei pesi HBM, rendendo il costo proporzionale alle repliche attivate; al di sopra di tale soglia, la GEMM raggruppata arrotonda i token a tile M di 128, quindi dividere un esperto aggiunge calcolo con padding. Gli autori propongono un profilo max-affine t = max(a + bG, c + βN) per catturare entrambi i regimi. Formalizzano il dispatch per batch come un problema di makespan a costo fisso, che è NP-hard su due macchine. L'articolo dimostra che i dispatch proxy possono differire di 1.4-1.6× nel tempo di blocco modellato (p95 fino a 1.7×), e il proxy ottimale dipende dal regime. Il lavoro è rilevante per migliorare l'efficienza nei sistemi di servizio AI su larga scala.

Fatti principali

  • L'articolo arXiv:2608.13057 introduce TEMPO, un metodo di bilanciamento del carico esperto-parallelo consapevole del makespan.
  • Misurazioni su due generazioni di GPU per datacenter mostrano che il tempo di esecuzione di un esperto non è lineare nel numero di token o nel numero di esperti attivati.
  • Al di sotto di circa 156-168 token, domina lo streaming dei pesi HBM, e il costo è legato alle repliche attivate.
  • Al di sopra di tale soglia, la GEMM raggruppata arrotonda i token a tile M di 128, quindi dividere un esperto aggiunge calcolo con padding.
  • Un profilo max-affine t = max(a + bG, c + βN) cattura entrambi i regimi.
  • Il dispatch per batch è formalizzato come un problema di makespan a costo fisso, NP-hard su due macchine.
  • I dispatch proxy differiscono di 1.4-1.6× nel tempo di blocco modellato (p95 fino a 1.7×).
  • Il proxy ottimale cambia a seconda del regime.

Entità

Istituzioni

  • arXiv

Fonti