KV-Rescue: Un framework senza training per recuperare l'accuratezza persa nell'evizione della cache KV per lunghe tracce di ragionamento
Un recente articolo su arXiv (2608.15797) presenta KV-Rescue, un framework di inferenza che opera senza training per affrontare la perdita di informazioni derivante dall'evizione della cache KV in modelli linguistici di grandi dimensioni che gestiscono compiti di ragionamento estesi. Gli autori descrivono l'impatto dell'evizione come un divario informativo piuttosto che un divario di capacità, evidenziando che un modello da 7B con evizione e un modello da 1.5B con contesto completo producono errori complementari. Selezionando le migliori risposte da entrambi i modelli, è possibile recuperare il 79% del deficit di accuratezza rispetto al modello da 7B con KV completo. KV-Rescue integra i passaggi di ragionamento di entrambi i modelli in una traiettoria unificata, utilizzando un helper leggero con contesto completo e un rilevatore online per compensare il contesto perso. Questa ricerca è cruciale per gestire le esigenze di memoria delle lunghe tracce di ragionamento in ambienti di produzione, e la sua natura senza training consente un'applicazione immediata ai modelli attuali senza necessità di fine-tuning. I risultati indicano che le perdite dovute all'evizione possono essere significativamente mitigate utilizzando un piccolo modello helper, fornendo un approccio praticabile per implementare grandi modelli di ragionamento entro i limiti di memoria.
Fatti principali
- ID dell'articolo: arXiv:2608.15797v1
- Tipo di annuncio: nuovo
- L'evizione della cache KV limita il costo di memoria ma è lossy
- L'evizione può causare degenerazione incontrollata (token incoerenti o ripetitivi)
- La perdita è caratterizzata come divario informativo, non divario di capacità
- Un modello da 7B con evizione e un modello da 1.5B con contesto completo producono errori complementari
- La scelta oracolare recupera il 79% del divario di accuratezza rispetto al modello da 7B con KV completo
- KV-Rescue è un framework di inferenza senza training
- Il framework intercala i passaggi di ragionamento di due modelli
- Utilizza un helper leggero con contesto completo e un rilevatore online
Entità
Istituzioni
- arXiv