HANDBOOK.md: Benchmark per il Seguito di Istruzioni Agentiche in Contesti Lunghi
I ricercatori hanno presentato HANDBOOK.md, un benchmark composto da 65 compiti agentici progettati per valutare se gli agenti basati su modelli linguistici seguono documenti politici vincolanti a lungo termine durante l'uso prolungato di strumenti. Ogni compito immerge un agente in un ambiente aziendale simulato, completo di servizi fittizi di email, chat, calendario, tracciamento dei problemi e commercio accessibili tramite il Model Context Protocol. Gli agenti devono svolgere compiti professionali di routine secondo procedure operative standard create da esperti, che variano da 20 a 124 pagine. I compiti coprono cinque aree, tra cui finanza e medicina. Questo benchmark colma una lacuna nelle valutazioni attuali, che generalmente si concentrano sul completamento dei compiti piuttosto che sull'aderenza continua alle linee guida stabilite.
Fatti principali
- HANDBOOK.md consiste in 65 compiti agentici
- I compiti sono modellati su come i dipendenti aziendali seguono i manuali aziendali
- Ogni compito utilizza un ambiente aziendale autonomo con servizi fittizi
- I servizi includono email, chat, calendario, tracciamento dei problemi e commercio
- I servizi sono esposti tramite il Model Context Protocol
- Le procedure operative standard sono lunghe da 20 a 124 pagine
- I compiti coprono cinque domini, tra cui finanza e medicina
- Il benchmark verifica se documenti politici lunghi vincolano il comportamento dell'agente
Entità
—