ARTFEED — Contemporary Art Intelligence

Previsione della VRAM negli Agenti di Sintesi di Codice: Modelli Analitici vs. Baseline Apprese

ai-technology · 2026-08-18

Un recente articolo su arXiv (2608.15117) indaga l'uso di picco della VRAM durante l'inferenza di LLM per agenti di sintesi di codice. La ricerca suddivide la memoria in componenti di memorizzazione dei pesi, cache KV e attivazioni, influenzate dal numero di passi, dalle invocazioni di strumenti e dall'espansione del contesto. Utilizzando un agente di sintesi di kernel CUDA basato su LangGraph (AgentK), una famiglia di quantizzazione a 4 bit (Q4_K_M) e una singola GPU NVIDIA H100, lo studio analizza quattro backbone LLM su 1.920 traiettorie. In particolare, i modelli analitici a forma chiusa, quando forniti di due costanti empiriche (VRAM dei pesi caricati e overhead fisso della memoria di attivazione), dimostrano una precisione competitiva rispetto alle baseline apprese. Per tre dei quattro backbone, il modello a forma chiusa eguaglia o supera la migliore baseline appresa, raggiungendo un MAPE di test del 2,2-4,4% rispetto al 3,4-6,5% (p=0,76). L'unica eccezione è il backbone più piccolo, dove la baseline appresa eccelle. Questa ricerca sottolinea la promessa dei modelli analitici per prevedere la memoria di picco in compiti agentici, offrendo vantaggi in termini di interpretabilità e ridotti requisiti computazionali rispetto ai metodi appresi. L'articolo è ufficialmente presentato su arXiv come 2608.15117v1.

Fatti principali

  • L'articolo è arXiv:2608.15117v1, annunciato come nuova sottomissione.
  • Lo studio si concentra sul consumo di picco della VRAM nell'inferenza di LLM per agenti di sintesi di codice.
  • La memoria è scomposta in termini di memorizzazione dei pesi, cache KV e attivazioni.
  • La valutazione utilizza l'agente AgentK basato su LangGraph, la quantizzazione a 4 bit Q4_K_M e una singola GPU NVIDIA H100.
  • Quattro backbone LLM sono testati su 1.920 traiettorie.
  • I modelli analitici a forma chiusa raggiungono una precisione competitiva con due costanti empiriche.
  • Su tre dei quattro backbone, il modello a forma chiusa eguaglia o supera le baseline apprese.
  • Il MAPE di test per il modello a forma chiusa è del 2,2-4,4% rispetto al 3,4-6,5% delle baseline apprese (p=0,76).
  • L'eccezione è il backbone più piccolo, dove la baseline appresa performa meglio.

Entità

Istituzioni

  • arXiv
  • LangGraph
  • NVIDIA

Fonti