ContextWeave: Nuovo Benchmark Testa la Memoria dell'IA nei Flussi di Lavoro Ufficio Reali
Un team di ricercatori ha presentato ContextWeave, un benchmark longitudinale volto a valutare se il richiamo delle esperienze migliora le prestazioni degli agenti in flussi di lavoro d'ufficio realistici. Questo benchmark ricostruisce flussi di lavoro plurimensili protetti dalla privacy di 14 partecipanti in 1.005 attività eseguibili, che includono 568 attività di valutazione principali, complete di istruzioni, ambienti containerizzati, traiettorie e rubriche specifiche per attività. Valuta la qualità dello spazio di lavoro e l'allineamento con le preferenze individuali dei partecipanti, insieme a diagnostiche per pertinenza, continuità, risolvibilità e resilienza contro il richiamo fuorviante. Utilizzando un modello fisso su sei componenti di memoria, la configurazione ottimale aumenta il punteggio dello spazio di lavoro da 68,08 a 78,20 e il punteggio di preferenza da 41,50 a 70,60. Questa ricerca colma una lacuna nelle valutazioni attuali che tipicamente limitano la memoria al recupero o al question answering, evidenziando la sua importanza in flussi di lavoro a lungo termine e stateful. Il benchmark è accessibile su arXiv con l'identificatore 2608.04830.
Fatti principali
- ContextWeave è un benchmark longitudinale per valutare la memoria negli agenti linguistici.
- Ricostruisce flussi di lavoro plurimensili di 14 partecipanti in 1.005 attività eseguibili.
- Il benchmark include 568 attività di valutazione principali.
- Misura la qualità dello spazio di lavoro e l'allineamento con le preferenze specifiche dei partecipanti.
- La configurazione più forte aumenta il punteggio dello spazio di lavoro da 68,08 a 78,20.
- Il punteggio di preferenza migliora da 41,50 a 70,60 con la configurazione più forte.
- Il benchmark include diagnostiche di pertinenza, continuità, risolvibilità e robustezza al richiamo fuorviante.
- Il lavoro è annunciato su arXiv con l'identificatore 2608.04830.
Entità
—