ARTFEED — Contemporary Art Intelligence

RMM: Una Politica Senza Addestramento per lo Smoothing a Ritardo Fisso nella Gestione della Memoria degli LLM

other · 2026-07-29

Un recente articolo su arXiv (2607.24667) reinterpreta la sfida della gestione della memoria di lavoro limitata di un modello linguistico come un problema di stima riguardante un segnale nascosto—nello specifico, la probabilità che un elemento venga riutilizzato. Gli approcci attuali, tra cui StreamingLLM, H2O e SnapKV, implementano l'evizione non appena un elemento viene ricevuto (con ritardo di commit H=0), mentre la strategia offline ottimale di Belady richiede una completa preveggenza. Gli autori introducono un nuovo approccio chiamato smoothing a ritardo fisso, che osserva un numero limitato di passi per determinare su quali elementi si concentra una previsione a breve termine corretta prima di effettuare il commit. Questa tecnica trasforma le richieste future non osservabili di Belady in dati accessibili dal modello. Presentano questo come RMM, una politica senza addestramento che generalizza H2O, riconducendosi ad esso quando la misura è uniforme. L'articolo contribuisce teoricamente alla gestione efficiente della memoria negli LLM, fornendo nuove intuizioni sulle tattiche di evizione.

Fatti principali

  • L'articolo arXiv 2607.24667 propone lo smoothing a ritardo fisso per la gestione della memoria degli LLM.
  • I metodi esistenti (StreamingLLM, H2O, SnapKV) effettuano il commit a H=0.
  • L'ottimo offline di Belady richiede la piena conoscenza futura.
  • Lo smoothing a ritardo fisso attende un numero limitato di passi prima di effettuare il commit.
  • Il metodo osserva a quali elementi ha prestato attenzione una previsione corretta a breve termine.
  • RMM è una politica senza addestramento che generalizza H2O.
  • RMM si riduce a H2O quando la misura è uniforme.
  • L'articolo riformula l'evizione come un problema di stima su un segnale nascosto.

Entità

Istituzioni

  • arXiv

Fonti