ARTFEED — Contemporary Art Intelligence

CUDA-L2: Kernel HGEMM Ottimizzati con RL Superano cuBLAS

ai-technology · 2026-08-07

Il sistema di recente introduzione, CUDA-L2, descritto nell'articolo arXiv 2512.02551, utilizza modelli di linguaggio di grandi dimensioni (LLM) insieme all'apprendimento per rinforzo (RL) per migliorare automaticamente i kernel CUDA di moltiplicazione di matrici a mezza precisione (HGEMM). Trattando la velocità di esecuzione CUDA come ricompensa nell'RL, CUDA-L2 valuta 1.000 configurazioni per identificare le migliori implementazioni di kernel. Supera costantemente i benchmark leader di moltiplicazione di matrici, come torch.matmul e le librerie proprietarie di Nvidia cuBLAS e cuBLASLt. In modalità offline, dove i kernel vengono eseguiti in sequenza, CUDA-L2 registra un'accelerazione media del +22,0% rispetto a torch.matmul, +19,2% rispetto a cuBLAS disposto in modo ottimale (NN e TN), +16,8% rispetto a cuBLASLt-heuristic e +11,4% rispetto al modello altamente competitivo cuBLASLt-AutoTuning. L'annuncio dell'articolo come replace-cross su arXiv indica una versione rivista. Questo avanzamento è cruciale per il calcolo ad alte prestazioni, mostrando la capacità dell'ottimizzazione guidata dall'IA di superare le librerie ottimizzate manualmente e potenzialmente trasformando l'ottimizzazione del software per l'hardware attraverso vari kernel computazionali.

Fatti principali

  • CUDA-L2 combina LLM e apprendimento per rinforzo per ottimizzare i kernel CUDA HGEMM.
  • Usa la velocità di esecuzione CUDA come ricompensa per l'RL.
  • Ottimizza i kernel attraverso 1.000 configurazioni.
  • Supera torch.matmul del +22,0% in media in modalità offline.
  • Supera cuBLAS del +19,2% utilizzando il layout ottimale (NN e TN).
  • Supera cuBLASLt-heuristic del +16,8%.
  • Supera cuBLASLt-AutoTuning del +11,4%.
  • L'articolo è stato annunciato come replace-cross su arXiv.

Entità

Istituzioni

  • arXiv
  • Nvidia

Fonti