LGNNIC: Architettura Basata su SmartNIC per Accelerare l'Addestramento di GNN su Larga Scala
Un nuovo studio su arXiv (2608.07733) presenta LGNNIC, un design di sistema all'avanguardia che impiega SmartNIC per ridurre i ritardi di comunicazione durante l'addestramento distribuito di Graph Neural Networks (GNN). Man mano che i grafi diventano più grandi, affidarsi a una singola configurazione CPU-GPU non è più pratico, spingendo verso soluzioni distribuite su nodi di memoria remoti. Tuttavia, l'addestramento può essere rallentato dal traffico di rete tra i nodi. LGNNIC affronta questo problema scaricando attività di pre-elaborazione chiave su SmartNIC vicini ai nodi di memoria, contribuendo a ridurre i dati inviati ai nodi di calcolo e ad alleviare la congestione. Lo studio introduce anche due tecniche che utilizzano SmartNIC per migliorare le prestazioni, affrontando le sfide di scalabilità nelle GNN, rilevanti in vari campi come l'analisi delle reti sociali e la progettazione di chip.
Fatti principali
- LGNNIC è una nuova architettura di sistema inter-nodo per l'addestramento distribuito di GNN.
- Sfrutta SmartNIC co-localizzati con nodi di memoria remoti.
- Gli SmartNIC scaricano attività di pre-elaborazione chiave per ridurre il volume di trasferimento dati.
- L'approccio allevia la congestione di rete inter-nodo durante l'addestramento.
- Due tecniche complementari vengono eseguite sugli SmartNIC durante l'addestramento.
- Le GNN sono utilizzate in scienze naturali, analisi delle reti sociali, progettazione di chip e sistemi di raccomandazione.
- L'articolo è disponibile su arXiv con identificatore 2608.07733.
- L'architettura mira a sistemi moderni con configurazioni SmartNIC esistenti.
Entità
Istituzioni
- arXiv