ARTFEED — Contemporary Art Intelligence

SodaMem: La memoria grafica temporale basata su prove migliora la memoria degli agenti LLM

ai-technology · 2026-08-11

I ricercatori hanno introdotto SodaMem, una nuova architettura di memoria per agenti basati su grandi modelli linguistici (LLM) progettata per gestire contesti conversazionali a lungo termine. Il sistema affronta una limitazione critica degli attuali agenti LLM: la loro tendenza a ricordare ciò che è stato detto piuttosto che ciò che è attualmente vero. I tradizionali diari RAG piatti e i registri Markdown, sebbene efficienti nel recuperare informazioni specifiche, non riescono a catturare l'attualità, la provenienza e il ragionamento temporale ordinato necessari per interazioni sostenute. SodaMem affronta questo problema estraendo FactEvents tipizzati con span di provenienza obbligatori, persistendo il tempo di menzione, il tempo di occorrenza e la validità, e collegandoli tramite archi SUPERSEDES, CONTRADICTS e UPDATES sotto uno schema di indicizzazione ibrido lessicale-denso. L'architettura impiega un ciclo planner-reader che raccoglie prove citabili prima di comporre le risposte finali, garantendo che le risposte siano basate su fatti verificabili. Nelle valutazioni sul benchmark LongMemEval-S, la configurazione store-of-record ha raggiunto un'accuratezza del 92,8% (464 su 500 domande, migliore di N=3) a un costo medio di $0,00161 per domanda (circa 18,3k token; mediana $0,00111, circa 14,6k token) utilizzando il modello deepseek-v4-flash. Questo lavoro, dettagliato nell'articolo arXiv 2608.08055, segna un passo significativo verso assistenti AI più affidabili e sensibili al contesto.

Fatti principali

  • SodaMem è una memoria grafica temporale basata su prove per agenti LLM.
  • Estrae FactEvents tipizzati con span di provenienza obbligatori.
  • Persiste il tempo di menzione, il tempo di occorrenza e la validità con archi SUPERSEDES/CONTRADICTS/UPDATES.
  • Utilizza un'indicizzazione ibrida lessicale-densa.
  • Risponde tramite un ciclo planner-reader che raccoglie prove citabili.
  • Su LongMemEval-S, raggiunge un'accuratezza del 92,8% (464/500, migliore di N=3).
  • Il costo medio per domanda è di $0,00161 (circa 18,3k token).
  • Il modello utilizzato è deepseek-v4-flash.

Entità

Fonti