La memoria agente è una dose da calibrare, non una funzione da attivare: IBM Research
Recenti risultati della ricerca IBM, condivisi su Hugging Face, introducono la tecnica ALTK-Evolve, che fornisce agli agenti AI una memoria in modo calibrato, invece che come un semplice attributo binario. Questa innovazione consente agli agenti di imparare dalle proprie esperienze senza bisogno di aggiornamenti dei pesi o input umani. In una revisione di otto modelli, modelli robusti come DeepSeek-V3.2 (671B MoE) hanno visto un aumento del completamento delle attività di +9,5 punti, mentre modelli meno potenti come gpt-oss-120b (117B MoE) hanno ottenuto un miglioramento di +16,1 punti con recupero curato. Tuttavia, modelli saturi come GLM-5 (745B MoE) non hanno mostrato alcun miglioramento. La ricerca ha valutato le configurazioni di memoria su AppWorld, un benchmark composto da 585 attività. Gli sforzi futuri si concentreranno sulla creazione di un selettore appreso e sull'espansione dei benchmark. La libreria ALTK-Evolve e il report sono accessibili per la riproduzione.
Fatti principali
- L'ALTK-Evolve di IBM Research consente agli agenti di apprendere dalle proprie traiettorie passate distillando linee guida riutilizzabili e iniettandole al momento dell'inferenza, senza aggiornamenti dei pesi e senza annotazioni umane.
- Attraverso otto modelli, la memoria agente si comporta come una dose da calibrare, non come una funzione da attivare.
- DeepSeek-V3.2 (671B MoE) ha guadagnato +9,5 punti percentuali in TGC e +16,1 punti in SGC quando ha ricevuto il suo set completo di linee guida auto-estratte.
- gpt-oss-120b (117B MoE) ha guadagnato +16,1 punti TGC con recupero curato a solo +5% di token, mentre il set completo è costato circa il 50% in più di token.
- GLM-5 (745B MoE) non ha mostrato alcun guadagno misurabile, un pattern che gli autori chiamano 'saturo'.
- GPT-5.5 e Opus hanno guadagnato rispettivamente +7,2 e +7,1 punti SGC, dimostrando che la memoria ripaga anche vicino al massimo.
- La valutazione ha utilizzato le 585 attività multi-step di AppWorld su 9 app simulate, con metriche TGC e SGC più rigorose.
- La memorizzazione nella cache dei prompt può mantenere conveniente il set completo di linee guida perché la parte statica è memorizzabile nella cache tra i passaggi dell'agente.
Entità
Istituzioni
- IBM Research
- DeepSeek
- OpenAI
- Anthropic
- Zhipu AI