Compilatore deterministico di attività su schermo migliora la memoria degli agenti
Un recente articolo su arXiv (2608.05784) presenta un approccio deterministico e senza modelli che trasforma le interazioni sullo schermo registrate passivamente in 'frame di attività' organizzati per agenti di uso del computer. Questo sistema innovativo divide i flussi di acquisizione locali in episodi categorizzati, dettagliando applicazione, sito web, tempi, volume di input e puntatori di evidenza, tutto senza coinvolgere un modello, garantendo così output byte-identici, memorizzabili in cache e soggetti a verifica meccanica. Valutato su un dataset di un singolo utente professionista di 128.756 frame raccolti in 51 giorni, il compilatore condensa i dati grezzi di un giorno in un blocco di contesto 86 volte più piccolo in soli 68 millisecondi. Un agente che analizza questo blocco risponde alle domande quotidiane con una precisione del 98,4% (Wilson 95% CI 91,7-99,7%) rispetto a un oracolo indipendente, superando i riassunti LLM, che producono una precisione del 66-80% in una modalità di fascia media. Gli autori sostengono che la memoria degli agenti attuali si concentra sul parlato dell'utente piuttosto che sulle azioni, con conseguente inferenza non necessaria; questo metodo colma efficacemente questa lacuna attraverso una compilazione deterministica per una maggiore efficienza e affidabilità della memoria.
Fatti principali
- L'articolo arXiv:2608.05784 introduce una pipeline deterministica e senza modelli per compilare l'attività sullo schermo nella memoria degli agenti.
- La pipeline segmenta i flussi di acquisizione locali in frame di attività tipizzati con applicazione, sito, tempi, volume di input e puntatori di evidenza.
- Nessun modello è utilizzato nel processo, garantendo output byte-identici, memorizzabili in cache e verificabili meccanicamente.
- Testato su un corpus di 128.756 frame in 51 giorni attivi di un singolo utente professionista.
- Il compilatore riduce un giorno di acquisizione grezza a un blocco di contesto pronto per il prompt 86 volte più piccolo in 68 ms.
- L'agente che legge il blocco compilato risponde alle domande con una precisione del 98,4% (Wilson 95% CI 91,7-99,7%).
- I riassunti LLM della stessa acquisizione raggiungono una precisione del 66-80% in una modalità di fascia media.
- L'articolo evidenzia che la memoria degli agenti attuali registra le dichiarazioni dell'utente, non le azioni, portando a inferenze ridondanti.
Entità
Istituzioni
- arXiv