ARTFEED — Contemporary Art Intelligence

HANDBOOK.md: Benchmark per il Seguito di Istruzioni Agentiche in Contesti Lunghi

ai-technology · 2026-07-29

I ricercatori hanno presentato HANDBOOK.md, un benchmark composto da 65 compiti agentici progettati per valutare se gli agenti basati su modelli linguistici seguono documenti politici vincolanti a lungo termine durante l'uso prolungato di strumenti. Ogni compito immerge un agente in un ambiente aziendale simulato, completo di servizi fittizi di email, chat, calendario, tracciamento dei problemi e commercio accessibili tramite il Model Context Protocol. Gli agenti devono svolgere compiti professionali di routine secondo procedure operative standard create da esperti, che variano da 20 a 124 pagine. I compiti coprono cinque aree, tra cui finanza e medicina. Questo benchmark colma una lacuna nelle valutazioni attuali, che generalmente si concentrano sul completamento dei compiti piuttosto che sull'aderenza continua alle linee guida stabilite.

Fatti principali

  • HANDBOOK.md consiste in 65 compiti agentici
  • I compiti sono modellati su come i dipendenti aziendali seguono i manuali aziendali
  • Ogni compito utilizza un ambiente aziendale autonomo con servizi fittizi
  • I servizi includono email, chat, calendario, tracciamento dei problemi e commercio
  • I servizi sono esposti tramite il Model Context Protocol
  • Le procedure operative standard sono lunghe da 20 a 124 pagine
  • I compiti coprono cinque domini, tra cui finanza e medicina
  • Il benchmark verifica se documenti politici lunghi vincolano il comportamento dell'agente

Entità

Fonti