vToken: Virtualizzazione a Livello di Token per Cache KV Recuperabili
Uno studio recente pubblicato su arXiv (2608.13263) presenta vToken, un livello di virtualizzazione a livello di token progettato per mitigare le inefficienze di memoria nel servizio di modelli linguistici di grandi dimensioni (LLM). La cache key-value (KV), che contiene coppie chiave-valore relative all'attenzione, si espande sia con la lunghezza della sequenza che con la dimensione del batch, portando a notevoli vincoli di memoria. Mentre le soluzioni esistenti come PagedAttention utilizzano blocchi di memoria a dimensione fissa per ridurre al minimo la frammentazione a livello di allocatore, le più recenti strategie di evizione KV operano a un livello più granulare di token, causando frammentazione intra-blocco e lasciando una parte sostanziale della memoria KV allocata non recuperabile. vToken separa la vivacità logica dei token dall'allocazione fisica dei blocchi tramite l'indirezione della tabella dei token, consentendo il reimpacchettamento asincrono dei token attivi mantenendo una visione logica coerente dei token. Questo approccio rimane compatibile con i kernel PagedAttention e CUDA Graphs. Gli autori hanno integrato vToken in vLLM e lo hanno valutato utilizzando gli algoritmi di evizione H2O, Random e Scissorhands su più modelli. Rispetto a una baseline Naive-Evict abbinata, vToken ha dimostrato una riduzione dei blocchi KV mantenuti, indicando una maggiore efficienza della memoria. L'articolo è scritto da ricercatori ed è accessibile su arXiv.
Fatti principali
- vToken è un livello di virtualizzazione a livello di token per cache KV nel servizio LLM.
- Affronta la frammentazione intra-blocco causata dagli algoritmi di evizione a granularità di token.
- Disaccoppia la vivacità logica dei token dal posizionamento fisico dei blocchi.
- Utilizza l'indirezione della tabella dei token e il reimpacchettamento asincrono dei token vivi.
- Preserva i kernel PagedAttention e la compatibilità con CUDA Graphs.
- Implementato in vLLM e valutato con H2O, Random e Scissorhands.
- Riduce i blocchi KV mantenuti rispetto alla baseline Naive-Evict.
- Articolo disponibile su arXiv con ID 2608.13263.
Entità
Istituzioni
- arXiv
- vLLM