CUDA-L2: Kernel HGEMM Ottimizzati con RL Superano cuBLAS
Il sistema di recente introduzione, CUDA-L2, descritto nell'articolo arXiv 2512.02551, utilizza modelli di linguaggio di grandi dimensioni (LLM) insieme all'apprendimento per rinforzo (RL) per migliorare automaticamente i kernel CUDA di moltiplicazione di matrici a mezza precisione (HGEMM). Trattando la velocità di esecuzione CUDA come ricompensa nell'RL, CUDA-L2 valuta 1.000 configurazioni per identificare le migliori implementazioni di kernel. Supera costantemente i benchmark leader di moltiplicazione di matrici, come torch.matmul e le librerie proprietarie di Nvidia cuBLAS e cuBLASLt. In modalità offline, dove i kernel vengono eseguiti in sequenza, CUDA-L2 registra un'accelerazione media del +22,0% rispetto a torch.matmul, +19,2% rispetto a cuBLAS disposto in modo ottimale (NN e TN), +16,8% rispetto a cuBLASLt-heuristic e +11,4% rispetto al modello altamente competitivo cuBLASLt-AutoTuning. L'annuncio dell'articolo come replace-cross su arXiv indica una versione rivista. Questo avanzamento è cruciale per il calcolo ad alte prestazioni, mostrando la capacità dell'ottimizzazione guidata dall'IA di superare le librerie ottimizzate manualmente e potenzialmente trasformando l'ottimizzazione del software per l'hardware attraverso vari kernel computazionali.
Fatti principali
- CUDA-L2 combina LLM e apprendimento per rinforzo per ottimizzare i kernel CUDA HGEMM.
- Usa la velocità di esecuzione CUDA come ricompensa per l'RL.
- Ottimizza i kernel attraverso 1.000 configurazioni.
- Supera torch.matmul del +22,0% in media in modalità offline.
- Supera cuBLAS del +19,2% utilizzando il layout ottimale (NN e TN).
- Supera cuBLASLt-heuristic del +16,8%.
- Supera cuBLASLt-AutoTuning del +11,4%.
- L'articolo è stato annunciato come replace-cross su arXiv.
Entità
Istituzioni
- arXiv
- Nvidia