CompressAgent: Benchmarking dell'affidabilità dei contesti di controllo degli agenti compressi nell'uso di strumenti
Uno studio recente introduce CompressAgent, un benchmark progettato per valutare l'affidabilità dei contesti di controllo degli agenti (ACC) compressi nei modelli linguistici che utilizzano strumenti, ora accessibile su arXiv (2608.01056). Questa ricerca colma le lacune esistenti nella valutazione dell'affidabilità operativa riguardo alla compressione dei prompt. CompressAgent valuta nove ACC in tre categorie di compiti distinte, impiegando tre identificatori di modelli API Qwen, sei budget di contesto e un totale di 15.525 esecuzioni. I risultati rivelano una frontiera di affidabilità non lineare; con il 75% del contesto mantenuto, la riscrittura generica e la compressione basata su sezioni raggiungono tassi di successo rispettivamente del 92,7% e del 92,4%, avvicinandosi molto al 93,8% di base per il contesto completo. Il benchmark è verificato nel suo ambiente, sottolineando l'equilibrio tra compressione e affidabilità, che è vitale per gli sviluppatori che utilizzano modelli compressi in scenari pratici.
Fatti principali
- CompressAgent è un benchmark per l'affidabilità della compressione ACC.
- Copre nove ACC, tre famiglie di compiti, tre modelli API Qwen, sei budget e 15.525 esecuzioni.
- Con il 75% del contesto mantenuto, la riscrittura generica raggiunge il 92,7% di successo.
- La compressione basata su sezioni raggiunge il 92,4% di successo con il 75% del contesto mantenuto.
- Il tasso di successo di base per il contesto completo è del 93,8%.
- Tra il 50% e il 35% del contesto mantenuto, i metodi divergono nettamente.
- Con il 35% del contesto mantenuto, le prestazioni diminuiscono significativamente per diversi metodi.
- Il benchmark è verificato nell'ambiente.
- L'articolo è disponibile su arXiv con ID 2608.01056.
Entità
Istituzioni
- arXiv
- Qwen