Il benchmark PTXBench valuta gli LLM per l'ottimizzazione dei kernel GPU con PTX specifico per architettura
PTXBench, introdotto in un preprint arXiv, valuta i grandi modelli linguistici per l'ottimizzazione dei kernel GPU utilizzando PTX specifico per architettura. Misura la correttezza funzionale, l'esecuzione delle istruzioni a runtime e lo speedup rispetto alle librerie all'avanguardia su carichi di lavoro GEMM e attention utilizzando GPU H100 e B200. I risultati mostrano capacità disomogenee tra i modelli, con prestazioni notevolmente scarse su compiti complessi di backward dell'attention; l'esecuzione delle istruzioni target non garantisce velocità competitive. Nessun modello eguaglia costantemente le librerie all'avanguardia. Gli autori hanno adattato Qwen3.6-27B tramite fine-tuning supervisionato, scoprendo che l'addestramento condizionato alla riparazione migliora alcuni compiti, ma la generalizzazione rimane disomogenea, influenzata dalla copertura dei dati, dall'equilibrio e dalla qualità del teacher di ragionamento. Il benchmark offre un audit per il lavoro futuro.
Fatti principali
- PTXBench è un nuovo benchmark per valutare e adattare gli LLM per l'ottimizzazione dei kernel GPU.
- Si concentra su istruzioni PTX specifiche per architettura.
- La valutazione copre la correttezza funzionale, l'esecuzione runtime delle istruzioni target e lo speedup.
- I carichi di lavoro includono GEMM e attention su GPU H100 e B200.
- I tassi di successo diminuiscono significativamente su carichi di lavoro complessi di backward dell'attention.
- Eseguire le istruzioni target non porta automaticamente a prestazioni competitive.
- Nessun modello valutato supera o eguaglia costantemente le librerie all'avanguardia sull'intera suite.
- L'adattamento ha utilizzato il fine-tuning supervisionato su Qwen3.6-27B, con l'addestramento condizionato alla riparazione che migliora alcuni compiti ma la generalizzazione rimane disomogenea.
Entità
—