HiKV: Compressione della Cache KV Accelerata via Hardware per LLM
Un nuovo metodo chiamato HiKV è stato introdotto dai ricercatori per comprimere le cache chiave-valore nei modelli linguistici di grandi dimensioni (LLM) con un focus sull'importanza gerarchica. Il metodo funziona in due fasi: la prima fase rimuove i token meno importanti rispettando un budget prestabilito, e la seconda fase carica selettivamente solo i componenti cruciali di ciascun token rimanente, consentendo rapporti di compressione non possibili con un approccio a granularità singola. Un acceleratore innovativo dotato di un ordinatore di importanza riconfigurabile integra entrambe le fasi in un unico circuito. Testato su LLM standard, HiKV dimostra un aumento di velocità fino a 7,95 volte e una riduzione del 90% del consumo energetico durante i calcoli di attenzione.
Fatti principali
- HiKV è un nuovo co-design algoritmo-hardware per la compressione della cache KV.
- Opera a due granularità: rimozione di token e selezione di elementi.
- Un ordinatore di importanza riconfigurabile passa tra due percorsi di ordinamento.
- Raggiunge fino a 7,95x di accelerazione e una riduzione energetica del 90%.
- Pubblicato su arXiv con ID 2607.22389.
- Mira al collo di bottiglia della memoria nella decodifica di LLM a lungo contesto.
- La Fase I rimuove i token non importanti entro un budget fisso.
- La Fase II carica solo gli elementi significativi di ciascun token mantenuto.
Entità
Istituzioni
- arXiv