ARTFEED — Contemporary Art Intelligence

KVDiagnosis: Benchmark per la Compressione della Cache KV in LLM a Contesto Lungo

ai-technology · 2026-08-11

È stato presentato un nuovo standard per diagnosticare la compressione della cache KV nei modelli linguistici a contesto lungo, chiamato KVDiagnosis. Questo benchmark supera i limiti dei punteggi aggregati delle attività identificando quali esecuzioni corrette falliscono e le ragioni di questi fallimenti. Presenta una tassonomia di 25 metodi categorizzati in cinque famiglie di meccanismi, collegati a otto implementazioni verificate e alle relative metriche diagnostiche. Ogni impostazione di metodo viene valutata rispetto a un controllo FullCache per ogni split fisso, con righe FullCache-corrette/compresse-errate (C-to-W) selezionate individualmente, evitando sovrapposizioni nei set di test. Su Qwen3-8B, quattro workload basati su evidenze hanno generato 59.800 esecuzioni compresse su 2.600 fonti e 12.520 righe C-to-W, migliorando la comprensione dei fallimenti di compressione della cache KV, essenziale per ottimizzare l'efficienza della memoria in scenari a contesto lungo.

Fatti principali

  • KVDiagnosis è un dataset diagnostico e un benchmark per la compressione della cache KV.
  • Include una tassonomia di 25 metodi raggruppati in cinque famiglie di meccanismi.
  • Otto implementazioni verificate sono collegate alla tassonomia.
  • La valutazione utilizza un controllo FullCache per fonte e seleziona righe C-to-W separatamente per ogni impostazione di metodo.
  • Un formato di record comune collega output e metadati di esecuzione a misurazioni di cache, verosimiglianza, attenzione e decodifica.
  • Su Qwen3-8B, quattro workload basati su evidenze producono 59.800 esecuzioni compresse supportate su 2.600 fonti.
  • Il benchmark produce 12.520 righe C-to-W.
  • Il lavoro è disponibile su arXiv con ID 2608.09412.

Entità

Istituzioni

  • arXiv

Fonti