ARTFEED — Contemporary Art Intelligence

Movimento Dati Topology-Aware per Inferenza GPU Disaggregata

ai-technology · 2026-08-03

Un nuovo articolo su arXiv (2607.28633) presenta un sistema volto a migliorare il movimento dei dati nell'inferenza GPU disaggregata, un problema rilevante quando si lavora con modelli linguistici di grandi dimensioni (LLM). Quando le fasi di prefill e decode utilizzano pool GPU diversi, è necessario trasferire la cache KV, che ammonta a 2,6 GB per richiesta per un modello da 70B e può superare i 100 GB/s in totale a livello di produzione. Le soluzioni esistenti come DistServe, Splitwise e Mooncake si affidano a RDMA uniforme ma ignorano le significative differenze di larghezza di banda basate sulla posizione delle GPU, che variano da 900 GB/s via NVLink a 12,5 GB/s via TCP. Il nuovo orchestratore ottimizza il trasporto dei dati riconoscendo le gerarchie di interconnessione all'avvio e utilizza diverse tecniche per migliorare l'efficienza, riducendo significativamente la latenza. Questa ricerca è vitale per l'infrastruttura AI e affronta una sfida chiave nelle attuali configurazioni di inferenza disaggregata.

Fatti principali

  • L'articolo arXiv:2607.28633 propone un movimento dati topology-aware per l'inferenza GPU disaggregata.
  • L'inferenza LLM disaggregata richiede il trasferimento della cache KV tra i pool GPU di prefill e decode.
  • Per un modello da 70B, il trasferimento della cache KV è di 2,6 GB per richiesta, superando i 100 GB/s aggregati a scala di produzione.
  • I sistemi esistenti (DistServe, Splitwise, Mooncake) utilizzano RDMA uniforme, ignorando le variazioni di larghezza di banda.
  • La larghezza di banda varia di 72 volte: 900 GB/s via NVLink all'interno di un dominio, 50 GB/s via InfiniBand tra nodi, 12,5 GB/s via TCP tra data center.
  • L'orchestratore scopre la gerarchia di interconnessione all'avvio e seleziona il trasporto ottimale per ogni trasferimento.
  • Il trasferimento pipeline layer-by-layer nasconde il 60-85% della latenza dietro il calcolo.
  • La collocazione basata sul dominio NVLink viene utilizzata per la modalità Mixture-of-Experts.
  • L'articolo è un annuncio cross-type su arXiv.
  • Il lavoro affronta un problema di rete critico nelle architetture di inferenza disaggregata.

Entità

Istituzioni

  • arXiv

Fonti