TaskPress: Compressione della Cache KV Agnostica rispetto alle Query tramite Potatura Guidata dai Compiti
È stato presentato un nuovo framework chiamato TaskPress per affrontare il problema dell'inferenza a contesto lungo nei modelli linguistici di grandi dimensioni, che incontra limitazioni a causa dell'espansione lineare della cache key-value (KV) rispetto alla lunghezza della sequenza. A differenza delle tecniche di potatura convenzionali che valutano l'importanza dei token per query specifiche—senza la capacità di generalizzare a nuove query—TaskPress sviluppa una rappresentazione di memoria riutilizzabile basata su una guida di alto livello del compito. Questa guida funge da meta-query durante la fase di prefill, consentendo la filtrazione dei token irrilevanti prima dell'esecuzione delle query successive. Inoltre, TaskPress utilizza i fattori di scala della quantizzazione come indicatore a costo zero per identificare outlier rappresentativi significativi, offrendo così una misura efficace per la rilevanza dei token. Esperimenti su vari compiti a contesto lungo rivelano che TaskPress genera con successo una cache compatta e riutilizzabile. La ricerca è disponibile su arXiv con identificativo 2608.03276v1.
Fatti principali
- TaskPress è un framework per l'evizione della cache KV agnostica rispetto alle query e guidata dai compiti.
- Utilizza una guida di alto livello del compito come meta-query durante il prefill per filtrare i token irrilevanti.
- Sfrutta i fattori di scala della quantizzazione come segnale a costo zero per rilevare outlier rappresentativi influenti.
- Esperimenti su vari compiti con input a contesto lungo dimostrano l'efficienza.
- L'articolo è annunciato su arXiv con identificativo 2608.03276v1.
- L'approccio affronta la crescita lineare della cache KV con la lunghezza della sequenza.
- I metodi di potatura tradizionali sono specifici per query e non riutilizzabili su query non viste.
Entità
Istituzioni
- arXiv