AgentMemBench: Benchmarking delle Strategie di Memoria a Lungo Termine per l'IA Conversazionale
È stato lanciato un nuovo framework di valutazione chiamato AgentMemBench per valutare le capacità dell'IA conversazionale nel mantenere la memoria a lungo termine durante le interazioni. Questo benchmark affronta i limiti delle finestre di contesto che influenzano il recupero della memoria in conversazioni estese. Valuta cinque strategie di memoria: finestra di contesto, archivi esterni chiave-valore, memoria episodica basata su grafi, riassunto basato su compressione e memoria aumentata dal web. La valutazione utilizza tre dataset pubblici per vari tipi di dialogo. I risultati preliminari suggeriscono che il metodo dell'archivio esterno chiave-valore supera gli altri, sebbene i risultati completi siano in sospeso. L'intero framework è accessibile su arXiv con l'identificatore 2608.00009.
Fatti principali
- AgentMemBench è un benchmark unificato e riproducibile per valutare la gestione della memoria a lungo termine nell'IA conversazionale.
- Confronta cinque strategie di memoria: ICW, EKV, GEM, CBS e WAM.
- La valutazione utilizza tre dataset pubblici: LoCoMo, MultiDoc2Dial e MSC.
- Le metriche includono Recall@k, MRR, nDCG@k, Answer F1, Faithfulness, Memory Footprint e Latency.
- Sono utilizzati 491 turni di domande annotate per la valutazione.
- Qwen2.5-7B-Instruct (4-bit) viene utilizzato per la generazione e il giudizio con decodifica greedy.
- Secondo i risultati preliminari, EKV domina su ogni metrica qualitativa.
- Il benchmark è pubblicato su arXiv con l'identificatore 2608.00009.
Entità
Istituzioni
- arXiv