ARTFEED — Contemporary Art Intelligence

SPDP: Potatura Unificata Statico-Dinamica per un'Inferenza Efficiente degli LLM

ai-technology · 2026-07-27

Un nuovo framework chiamato SPDP combina la potatura statica non strutturata con la potatura dinamica adattiva all'input per migliorare l'efficienza dell'inferenza dei modelli linguistici di grandi dimensioni (LLM) su GPU. Questo approccio affronta i limiti computazionali e di memoria associati alla decodifica autoregressiva, che è principalmente influenzata da kernel limitati dalla larghezza di banda. SPDP presenta un formato Tiled-Column-wise Bitmap Compressed (Tiled-CBC) insieme a due kernel GPU complementari: un kernel spMspV basato su CUDA-core che utilizza Hybrid Activation-aware Dynamic Shared-Memory Bitmap Decoding (HAD-SMBD) per un salto preciso dell'attivazione a runtime, e un kernel SpMM basato su Tensor-Core. La ricerca è disponibile su arXiv con l'identificatore 2607.21985.

Fatti principali

  • SPDP unifica la potatura statica e dinamica per l'inferenza degli LLM.
  • Utilizza un formato Tiled-Column-wise Bitmap Compressed (Tiled-CBC).
  • Sono progettati due kernel GPU: CUDA-core spMspV con HAD-SMBD e Tensor-Core SpMM.
  • Il metodo mira ai colli di bottiglia della decodifica autoregressiva.
  • Articolo disponibile su arXiv: 2607.21985.
  • La potatura dei pesi viene utilizzata per ridurre i costi computazionali e di memoria.
  • La potatura statica rimuove permanentemente i pesi ridondanti.
  • La potatura dinamica si adatta alla sparsità dell'input ma introduce irregolarità.

Entità

Istituzioni

  • arXiv

Fonti