KernelArc: framework AI multi-agente raggiunge i migliori risultati nell'ottimizzazione dei kernel GPU
L'articolo presenta KernelArc, un framework progettato per l'ottimizzazione autonoma multi-agente dei kernel GPU su vari carichi di lavoro. A differenza dei metodi tradizionali a singolo agente, KernelArc utilizza agenti specializzati che lavorano contemporaneamente e comunicano esclusivamente attraverso conclusioni condivise in memoria. Il framework presenta una guardia di benchmark deterministica e uno stato di sola lettura condiviso tra gli agenti, incorporando una bozza attivata da plateau per migliorare l'esplorazione. I test sono stati eseguiti su GPU NVIDIA H100 e B200 utilizzando carichi di lavoro SOL-ExecBench rappresentativi. Gli output ottimizzati di KernelArc comprendono un'ampia gamma di attività GPU, come GEMM BF16 personalizzato, tabelle di configurazione statiche dell'API Expert cuBLASLt e altro ancora. Il 30 luglio 2026, la classifica pubblica SOL-ExecBench mostrava queste submission in testa nelle attività L1, L2, Quantizzazione e FlashInfer, evidenziando l'efficacia della ricerca multi-agente condivisa nel migliorare i risultati di ottimizzazione. Questa innovazione segna un sostanziale passo avanti nell'ottimizzazione automatica dei kernel GPU, influenzando il calcolo ad alte prestazioni e l'efficienza dell'inferenza AI.
Fatti principali
- KernelArc è un framework multi-agente per l'ottimizzazione autonoma dei kernel GPU.
- Agenti specializzati per strategia operano in parallelo e coordinano tramite memoria condivisa basata solo su conclusioni.
- Il sistema include una guardia di benchmark deterministica e uno stato trasversale agli agenti di sola lettura con bozza attivata da plateau.
- Valutato su GPU NVIDIA H100 e B200.
- Utilizza carichi di lavoro SOL-ExecBench rappresentativi per categoria.
- Le implementazioni generate includono GEMM BF16 personalizzato, configurazioni cuBLASLt Expert-API, backward moe fuso, fusione del livello decoder con shape-gating, attenzione grouped-query NVFP4 nativa e attenzione prefill impaginata.
- Nell'istantanea della classifica SOL-ExecBench del 30 luglio 2026, le submission sono risultate prime nei compiti L1, L2, Quantizzazione e FlashInfer.
- La ricerca multi-agente condivisa amplia l'esplorazione e raggiunge risultati più forti.
Entità
Istituzioni
- arXiv
- NVIDIA
- SOL-ExecBench
- cuBLASLt
- FlashInfer