FinPerMA: Nuovo Benchmark Testa la Memoria Personalizzata degli Agenti LLM in Finanza
L'introduzione di FinPerMA segna un avanzamento significativo nella valutazione delle capacità di memoria personalizzata degli agenti basati su modelli linguistici di grandi dimensioni (LLM) in aree critiche come la consulenza finanziaria. Questo benchmark, descritto in un articolo disponibile su arXiv (arXiv:2608.04095), colma una lacuna nelle attuali valutazioni della memoria personalizzata, che si concentrano principalmente sulla memorizzazione di fatti o dipendono da percorsi generati dal modello in modo vago, trascurando l'adattamento delle preferenze basato su eventi. FinPerMA testa la memoria personalizzata attraverso percorsi di investitore longitudinali fissi, utilizzando una pipeline di generazione che combina regole di impatto deterministiche basate su teorie, narrazione LLM controllata e controlli di qualità automatizzati. Un checkpoint Post-Shock determina se un agente ha incorporato un evento significativo nel suo modello utente persistente. Il benchmark include 2.994 domande provenienti da 276 persone. Il test di sette LLM avanzati con varie configurazioni di memoria rivela che le prestazioni sono ancora lontane dall'essere ottimali, suggerendo ampie opportunità di miglioramento. Questa ricerca è cruciale per l'evoluzione degli assistenti AI in campo finanziario e in altri settori personalizzati, sottolineando la necessità di strategie di memoria e adattamento più robuste.
Fatti principali
- FinPerMA è un benchmark basato su eventi per la memoria personalizzata negli agenti LLM.
- Valuta rispetto a traiettorie di investitore longitudinali congelate.
- La pipeline di generazione utilizza regole di impatto deterministiche basate su teorie, narrazione LLM controllata e screening di qualità automatizzato.
- Un checkpoint Post-Shock isola l'integrazione di eventi materiali nei modelli utente persistenti.
- Il benchmark include 2.994 domande provenienti da 276 persone.
- Sono stati testati sette LLM all'avanguardia e fino a sette configurazioni di memoria.
- I risultati mostrano che le prestazioni sono lungi dall'essere sature.
- L'articolo è disponibile su arXiv con ID 2608.04095.
Entità
Istituzioni
- arXiv