ALTK-Evolve vs ACE: La memoria agentica calibrata riduce i costi di inferenza
IBM Research introduce ALTK-Evolve, un sistema di memoria agentica che migliora le prestazioni degli agenti LLM in compiti multi-step imparando dalle traiettorie passate senza aggiornamenti dei pesi o etichette umane. Il sistema viene confrontato con ACE (Agentic Context Engineering), e entrambi concordano sul fatto che comprimere le lezioni di un agente in un riassunto ordinato sia controproducente. Invece, contano le lezioni piuttosto che comprimerle. La differenza chiave sta nella consegna: ACE inietta un playbook completo a ogni passo, mentre ALTK-Evolve calibra la consegna in base alla capacità del modello, inviando un piccolo nucleo fisso di linee guida ad alto supporto più una selezione specifica per il compito, o l'insieme completo quando il modello può gestirlo. Sul benchmark AppWorld, ALTK-Evolve raggiunge un'accuratezza uguale o migliore a circa il 40% del costo di inferenza di ACE su un modello forte (DeepSeek-V3.2) e circa un settimo del costo su un modello più debole (gpt-oss-120b), con un pareggio in accuratezza (56.0 vs 54.8). La suddivisione per difficoltà mostra che il recupero selettivo vince sui compiti difficili, mentre i playbook completi aiutano nei compiti facili e medi per il modello più debole. Il sistema utilizza conteggi di supporto, linee guida tipizzate (strategia, recupero, ottimizzazione) e attribuzione causale con provenienza. La libreria e il rapporto tecnico completo sono disponibili. Il confronto è controllato eseguendo ACE internamente sugli stessi modelli di base e split.
Fatti principali
- ALTK-Evolve è un sistema di memoria agentica che impara dalle traiettorie passate di un agente senza aggiornamenti dei pesi o etichette umane.
- ACE (Agentic Context Engineering) è un sistema simile che organizza le lezioni in un playbook completo e in evoluzione.
- Entrambi i sistemi rifiutano di comprimere le lezioni, usando contatori (i contatori per punto di ACE, i conteggi di supporto di ALTK-Evolve) invece.
- ALTK-Evolve raggruppa le lezioni quasi duplicate e le fonde, conservando i conteggi di supporto.
- ALTK-Evolve estrae linee guida tipizzate (strategia, recupero, ottimizzazione) con attribuzione causale e provenienza.
- La consegna differisce: ACE inietta il playbook completo a ogni passo; ALTK-Evolve calibra la consegna per modello e compito.
- Su AppWorld, ALTK-Evolve raggiunge un'accuratezza uguale o migliore a circa il 40% del costo di inferenza di ACE su DeepSeek-V3.2 e circa 1/7 del costo su gpt-oss-120b.
- Su gpt-oss-120b, ALTK-Evolve pareggia con ACE in accuratezza (56.0 vs 54.8) a circa un settimo del costo.
- Analisi per difficoltà: il recupero selettivo vince sui compiti difficili, mentre i playbook completi aiutano nei compiti facili/medi per i modelli più deboli.
- La libreria ALTK-Evolve e il rapporto tecnico completo sono disponibili.
Entità
Istituzioni
- IBM Research
- Hugging Face