KVDiagnosis: Benchmark per la Compressione della Cache KV in LLM a Contesto Lungo
È stato presentato un nuovo standard per diagnosticare la compressione della cache KV nei modelli linguistici a contesto lungo, chiamato KVDiagnosis. Questo benchmark supera i limiti dei punteggi aggregati delle attività identificando quali esecuzioni corrette falliscono e le ragioni di questi fallimenti. Presenta una tassonomia di 25 metodi categorizzati in cinque famiglie di meccanismi, collegati a otto implementazioni verificate e alle relative metriche diagnostiche. Ogni impostazione di metodo viene valutata rispetto a un controllo FullCache per ogni split fisso, con righe FullCache-corrette/compresse-errate (C-to-W) selezionate individualmente, evitando sovrapposizioni nei set di test. Su Qwen3-8B, quattro workload basati su evidenze hanno generato 59.800 esecuzioni compresse su 2.600 fonti e 12.520 righe C-to-W, migliorando la comprensione dei fallimenti di compressione della cache KV, essenziale per ottimizzare l'efficienza della memoria in scenari a contesto lungo.
Fatti principali
- KVDiagnosis è un dataset diagnostico e un benchmark per la compressione della cache KV.
- Include una tassonomia di 25 metodi raggruppati in cinque famiglie di meccanismi.
- Otto implementazioni verificate sono collegate alla tassonomia.
- La valutazione utilizza un controllo FullCache per fonte e seleziona righe C-to-W separatamente per ogni impostazione di metodo.
- Un formato di record comune collega output e metadati di esecuzione a misurazioni di cache, verosimiglianza, attenzione e decodifica.
- Su Qwen3-8B, quattro workload basati su evidenze producono 59.800 esecuzioni compresse supportate su 2.600 fonti.
- Il benchmark produce 12.520 righe C-to-W.
- Il lavoro è disponibile su arXiv con ID 2608.09412.
Entità
Istituzioni
- arXiv