Ottimizzazione dei kernel Triton basata su LLM con diagnosi fondata sul compilatore
Un recente studio pubblicato su arXiv (2607.23089) presenta un framework di diagnosi gerarchico fondato sui compilatori, volto a migliorare i kernel Triton attraverso grandi modelli linguistici. Gli attuali metodi di ottimizzazione basati su LLM si affidano a indicatori superficiali come il feedback di compilazione e le metriche di profilazione, che rivelano problemi di prestazioni ma non chiariscono le carenze del compilatore backend, specialmente con nuovi acceleratori come le NPU. Questo metodo innovativo tratta l'ottimizzazione dei kernel come una sfida di diagnosi a strati, collegando i problemi di runtime alla struttura della rappresentazione intermedia (IR) e alle azioni del compilatore prima delle modifiche al codice sorgente. Il sistema progredisce dalla valutazione di pattern di base e profilazione a un'analisi IR più approfondita e valutazioni basate sul compilatore quando necessario, suggerendo infine modifiche a livello di sorgente supportate da evidenze. È stato implementato su Triton per NPU Ascend.
Fatti principali
- Il paper arXiv 2607.23089 propone un framework di diagnosi gerarchico fondato sul compilatore per l'ottimizzazione dei kernel Triton.
- Gli approcci esistenti basati su LLM utilizzano segnali superficiali come feedback di compilazione e metriche di profilazione.
- I segnali superficiali rivelano la lentezza del kernel ma non perché il compilatore backend non riesce a ottimizzare.
- Il framework si rivolge ad acceleratori emergenti come le NPU.
- L'ottimizzazione dei kernel è formulata come un problema progressivo di diagnosi cross-layer.
- Il sistema collega i sintomi di runtime alla struttura IR e al comportamento del compilatore.
- Scala da un triage leggero di pattern a un'analisi più approfondita solo quando necessario.
- L'implementazione è su Triton per NPU Ascend.
Entità
Istituzioni
- arXiv