ARTFEED — Contemporary Art Intelligence

ReCo: Compressione Coordinata dalla Ricompensa per un Ragionamento Efficiente degli LRM

ai-technology · 2026-08-06

Un nuovo articolo di ricerca su arXiv (2608.04771) introduce ReCo (Compressione Coordinata dalla Ricompensa), un framework per ridurre i costi di inferenza nei Modelli di Ragionamento di Grandi Dimensioni (LRM) comprimendo la cache KV. L'articolo osserva che gli stati di ragionamento variano nella tolleranza alla perdita di contesto lungo la traiettoria, e la ricompensa di processo può tracciare questo: eliminare token in passi ad alta ricompensa preserva l'accuratezza meglio della cancellazione casuale. Inoltre, la compressione sul lato della generazione non è gratuita, poiché una cache più piccola porta a più token generati, compensando parzialmente i risparmi. ReCo coordina sia la compressione che la generazione sotto un'unica ricompensa di processo. L'articolo è scritto da ricercatori (i cui nomi non sono forniti nell'abstract) ed è stato annunciato come nuovo su arXiv. Il lavoro affronta il problema dell'eccesso di ragionamento negli LRM, che gonfia i costi di inferenza a causa di lunghe catene di pensiero. Il metodo proposto mira a migliorare l'efficienza senza sacrificare l'accuratezza.

Fatti principali

  • Articolo su arXiv: 2608.04771
  • Introduce ReCo (Compressione Coordinata dalla Ricompensa)
  • Si concentra sulla compressione della cache KV per i Modelli di Ragionamento di Grandi Dimensioni
  • Osservazioni: la tolleranza dello stato di ragionamento varia, la ricompensa di processo la traccia
  • La compressione porta a più token generati, annullando parzialmente i risparmi
  • Coordina compressione e generazione sotto un'unica ricompensa di processo
  • Affronta l'eccesso di ragionamento negli LRM
  • Mira a ridurre i costi di inferenza preservando l'accuratezza

Entità

Istituzioni

  • arXiv

Fonti