Movimento Dati Topology-Aware per Inferenza GPU Disaggregata
Un nuovo articolo su arXiv (2607.28633) presenta un sistema volto a migliorare il movimento dei dati nell'inferenza GPU disaggregata, un problema rilevante quando si lavora con modelli linguistici di grandi dimensioni (LLM). Quando le fasi di prefill e decode utilizzano pool GPU diversi, è necessario trasferire la cache KV, che ammonta a 2,6 GB per richiesta per un modello da 70B e può superare i 100 GB/s in totale a livello di produzione. Le soluzioni esistenti come DistServe, Splitwise e Mooncake si affidano a RDMA uniforme ma ignorano le significative differenze di larghezza di banda basate sulla posizione delle GPU, che variano da 900 GB/s via NVLink a 12,5 GB/s via TCP. Il nuovo orchestratore ottimizza il trasporto dei dati riconoscendo le gerarchie di interconnessione all'avvio e utilizza diverse tecniche per migliorare l'efficienza, riducendo significativamente la latenza. Questa ricerca è vitale per l'infrastruttura AI e affronta una sfida chiave nelle attuali configurazioni di inferenza disaggregata.
Fatti principali
- L'articolo arXiv:2607.28633 propone un movimento dati topology-aware per l'inferenza GPU disaggregata.
- L'inferenza LLM disaggregata richiede il trasferimento della cache KV tra i pool GPU di prefill e decode.
- Per un modello da 70B, il trasferimento della cache KV è di 2,6 GB per richiesta, superando i 100 GB/s aggregati a scala di produzione.
- I sistemi esistenti (DistServe, Splitwise, Mooncake) utilizzano RDMA uniforme, ignorando le variazioni di larghezza di banda.
- La larghezza di banda varia di 72 volte: 900 GB/s via NVLink all'interno di un dominio, 50 GB/s via InfiniBand tra nodi, 12,5 GB/s via TCP tra data center.
- L'orchestratore scopre la gerarchia di interconnessione all'avvio e seleziona il trasporto ottimale per ogni trasferimento.
- Il trasferimento pipeline layer-by-layer nasconde il 60-85% della latenza dietro il calcolo.
- La collocazione basata sul dominio NVLink viene utilizzata per la modalità Mixture-of-Experts.
- L'articolo è un annuncio cross-type su arXiv.
- Il lavoro affronta un problema di rete critico nelle architetture di inferenza disaggregata.
Entità
Istituzioni
- arXiv