ARTFEED — Contemporary Art Intelligence

OptR: Rotazione Consapevole dell'Output per la Quantizzazione della Cache KV INT2

ai-technology · 2026-08-06

Una nuova tecnica chiamata OptR, presentata nell'articolo arXiv 2608.02691, affronta i limiti di memoria e larghezza di banda nelle cache key-value (KV) durante l'inferenza di modelli linguistici di grandi dimensioni con contesto lungo. I precedenti metodi di quantizzazione INT2 basati sulla rotazione si concentravano sull'ottimizzazione delle statistiche della cache o degli errori proxy prima della lettura completa dell'attenzione. Tuttavia, questi metodi soffrono ancora di errori propagati attraverso l'attenzione e la proiezione di output W_O. OptR affronta questo problema scomponendo l'errore di output dell'attenzione post-W_O in componenti indotte da chiave e valore, apprendendo correzioni ortogonali per testa attraverso il processo completo di quantizzazione INT2 e attenzione. Inoltre, impiega una riparametrizzazione delle chiavi equivalente all'attenzione, minimizzando i grandi offset per canale preservando la distribuzione softmax. L'approccio è stato valutato su tre modelli e cinque benchmark di ragionamento e codifica, dimostrando miglioramenti rispetto alle tecniche attuali.

Fatti principali

  • OptR è un metodo di rotazione consapevole dell'output per la quantizzazione della cache KV INT2.
  • Minimizza l'errore di output dell'attenzione post-W_O.
  • Scompone l'errore in termini indotti da chiave e valore.
  • Apprende correzioni ortogonali per testa attraverso il percorso completo di quantizzazione INT2 e attenzione.
  • Applica una riparametrizzazione delle chiavi equivalente all'attenzione per ridurre gli offset per canale.
  • Testato su tre modelli e cinque benchmark di ragionamento e codifica.
  • Articolo disponibile su arXiv con ID 2608.02691.

Entità

Istituzioni

  • arXiv

Fonti