MM-ShiftKV: Selezione di Cache KV Consapevole della Decodifica per MLLM
Un nuovo metodo senza training chiamato MM-ShiftKV affronta il collo di bottiglia della memoria della cache key-value (KV) nei modelli linguistici multimodali di grandi dimensioni (MLLM). Il metodo è presentato in un preprint su arXiv (2607.22586v1). La selezione KV standard in fase di prefill assume che le query durante il prefill siano rappresentative delle query in fase di decodifica, ma questa ipotesi fallisce nell'inferenza multimodale a causa della maggiore varianza delle query di decodifica. MM-ShiftKV è un metodo di selezione consapevole della decodifica, strettamente limitato al prefill, che approssima le distribuzioni delle query in fase di decodifica per migliorare la stima dell'importanza KV. Ciò impedisce lo scarto sproporzionato di token visivi semanticamente critici con budget di cache limitati, migliorando le prestazioni di grounding e ragionamento.
Fatti principali
- MM-ShiftKV è un metodo di selezione KV senza training per MLLM.
- È consapevole della decodifica e strettamente limitato al prefill.
- La selezione KV standard in fase di prefill assume che le query di prefill rappresentino le query di decodifica.
- Questa ipotesi viene meno nell'inferenza multimodale a causa della maggiore varianza delle query di decodifica.
- Piccoli errori di ranking possono scartare token visivi critici, degradando le prestazioni.
- MM-ShiftKV approssima le distribuzioni delle query in fase di decodifica.
- Il metodo migliora la stima dell'importanza KV con budget di cache limitati.
- Il preprint è disponibile su arXiv con ID 2607.22586v1.
Entità
Istituzioni
- arXiv