ARTFEED — Contemporary Art Intelligence

KernelArc: framework AI multi-agente raggiunge i migliori risultati nell'ottimizzazione dei kernel GPU

ai-technology · 2026-08-19

L'articolo presenta KernelArc, un framework progettato per l'ottimizzazione autonoma multi-agente dei kernel GPU su vari carichi di lavoro. A differenza dei metodi tradizionali a singolo agente, KernelArc utilizza agenti specializzati che lavorano contemporaneamente e comunicano esclusivamente attraverso conclusioni condivise in memoria. Il framework presenta una guardia di benchmark deterministica e uno stato di sola lettura condiviso tra gli agenti, incorporando una bozza attivata da plateau per migliorare l'esplorazione. I test sono stati eseguiti su GPU NVIDIA H100 e B200 utilizzando carichi di lavoro SOL-ExecBench rappresentativi. Gli output ottimizzati di KernelArc comprendono un'ampia gamma di attività GPU, come GEMM BF16 personalizzato, tabelle di configurazione statiche dell'API Expert cuBLASLt e altro ancora. Il 30 luglio 2026, la classifica pubblica SOL-ExecBench mostrava queste submission in testa nelle attività L1, L2, Quantizzazione e FlashInfer, evidenziando l'efficacia della ricerca multi-agente condivisa nel migliorare i risultati di ottimizzazione. Questa innovazione segna un sostanziale passo avanti nell'ottimizzazione automatica dei kernel GPU, influenzando il calcolo ad alte prestazioni e l'efficienza dell'inferenza AI.

Fatti principali

  • KernelArc è un framework multi-agente per l'ottimizzazione autonoma dei kernel GPU.
  • Agenti specializzati per strategia operano in parallelo e coordinano tramite memoria condivisa basata solo su conclusioni.
  • Il sistema include una guardia di benchmark deterministica e uno stato trasversale agli agenti di sola lettura con bozza attivata da plateau.
  • Valutato su GPU NVIDIA H100 e B200.
  • Utilizza carichi di lavoro SOL-ExecBench rappresentativi per categoria.
  • Le implementazioni generate includono GEMM BF16 personalizzato, configurazioni cuBLASLt Expert-API, backward moe fuso, fusione del livello decoder con shape-gating, attenzione grouped-query NVFP4 nativa e attenzione prefill impaginata.
  • Nell'istantanea della classifica SOL-ExecBench del 30 luglio 2026, le submission sono risultate prime nei compiti L1, L2, Quantizzazione e FlashInfer.
  • La ricerca multi-agente condivisa amplia l'esplorazione e raggiunge risultati più forti.

Entità

Istituzioni

  • arXiv
  • NVIDIA
  • SOL-ExecBench
  • cuBLASLt
  • FlashInfer

Fonti