TAM: Compattazione della Cache KV Consapevole del Pensiero per Modelli di Ragionamento
Un approccio innovativo noto come Thought-Aware Attention Matching (TAM) affronta i limiti di memoria nei modelli linguistici di ragionamento sfruttando la natura gerarchica delle sequenze di catena di pensiero (CoT). A differenza delle attuali tecniche di compattazione che considerano i percorsi di ragionamento come sequenze piatte di token con compressione uniforme, TAM scompone la traiettoria in blocchi di ragionamento attraverso la segmentazione del pensiero. Alloca i budget di compressione in modo adattivo, considerando l'importanza e la dimensione di ciascun segmento, salvaguardando al contempo i token cruciali ad alta attenzione. Gli autori dimostrano che la strategia di allocazione è ottimale all'interno di un quadro di errore convesso e che gli errori cumulativi derivanti dalla compattazione sequenziale rimangono limitati. Gli esperimenti sono stati condotti sui dataset AIME 2024 e MATH, sebbene i risultati specifici non siano inclusi nell'abstract. L'articolo è disponibile su arXiv con l'identificatore 2608.12331.
Fatti principali
- TAM è un nuovo metodo di compattazione della cache KV per modelli linguistici di ragionamento.
- Utilizza la segmentazione del pensiero per scomporre le traiettorie CoT in blocchi di ragionamento.
- L'allocazione adattiva del budget assegna il budget di compressione in base all'importanza e alla dimensione del segmento.
- La protezione dei token pivotali preserva gli ancoraggi di ragionamento ad alta attenzione.
- La regola di allocazione è dimostrata ottimale sotto un modello di errore convesso.
- L'errore cumulativo sotto compattazione sequenziale rimane limitato.
- Gli esperimenti sono stati eseguiti sui dataset AIME 2024 e MATH.
- L'articolo è disponibile su arXiv (2608.12331).
Entità
Istituzioni
- arXiv