OptR: Rotazione Consapevole dell'Output per la Quantizzazione della Cache KV INT2
Una nuova tecnica chiamata OptR, presentata nell'articolo arXiv 2608.02691, affronta i limiti di memoria e larghezza di banda nelle cache key-value (KV) durante l'inferenza di modelli linguistici di grandi dimensioni con contesto lungo. I precedenti metodi di quantizzazione INT2 basati sulla rotazione si concentravano sull'ottimizzazione delle statistiche della cache o degli errori proxy prima della lettura completa dell'attenzione. Tuttavia, questi metodi soffrono ancora di errori propagati attraverso l'attenzione e la proiezione di output W_O. OptR affronta questo problema scomponendo l'errore di output dell'attenzione post-W_O in componenti indotte da chiave e valore, apprendendo correzioni ortogonali per testa attraverso il processo completo di quantizzazione INT2 e attenzione. Inoltre, impiega una riparametrizzazione delle chiavi equivalente all'attenzione, minimizzando i grandi offset per canale preservando la distribuzione softmax. L'approccio è stato valutato su tre modelli e cinque benchmark di ragionamento e codifica, dimostrando miglioramenti rispetto alle tecniche attuali.
Fatti principali
- OptR è un metodo di rotazione consapevole dell'output per la quantizzazione della cache KV INT2.
- Minimizza l'errore di output dell'attenzione post-W_O.
- Scompone l'errore in termini indotti da chiave e valore.
- Apprende correzioni ortogonali per testa attraverso il percorso completo di quantizzazione INT2 e attenzione.
- Applica una riparametrizzazione delle chiavi equivalente all'attenzione per ridurre gli offset per canale.
- Testato su tre modelli e cinque benchmark di ragionamento e codifica.
- Articolo disponibile su arXiv con ID 2608.02691.
Entità
Istituzioni
- arXiv