SteerBench-Work: Benchmarking del Controllo degli Agenti ai Confini delle Azioni
C'è questo nuovo benchmark chiamato SteerBench-Work che riguarda la valutazione di come gli agenti LLM a lungo termine prendono decisioni di controllo in contesti professionali. Si concentra davvero su quelle scelte cruciali pre-impegno ai confini delle azioni, che possono portare a risultati significativi come l'invio di email o la gestione dei pagamenti. Questo benchmark è unico perché è bidirezionale e legato a incidenti specifici, coprendo aree come le operazioni di sviluppo, il servizio clienti, la finanza, il diritto, la sanità, le risorse umane e la sicurezza. L'ultimo aggiornamento, v2026-05, include 106 scenari basati su incidenti pubblici reali, con un approccio equilibrato alle etichette di procedere e trattenere. I primi risultati mostrano che i modelli spesso esitano su azioni approvate, il che potrebbe indicare che sono troppo cauti, limitando potenzialmente la loro efficacia in ruoli autonomi. L'obiettivo principale è aumentare la sicurezza e l'affidabilità del controllo degli agenti.
Fatti principali
- SteerBench-Work è un benchmark per valutare le decisioni di controllo negli agenti LLM.
- Si concentra sulla scelta pre-impegno ai confini delle azioni: procedere o trattenere.
- Il benchmark è ancorato a incidenti ed è bidirezionale.
- Copre operazioni di sviluppo, servizio clienti, finanza, legale, medico, risorse umane e sicurezza.
- La versione v2026-05 contiene 106 scenari ancorati a incidenti pubblici.
- Gli scenari includono specchi con evidenza invertita e controlli di calibrazione.
- Le etichette sono divise quasi equamente tra procedere e trattenere.
- In 30 condizioni di modello, i fallimenti vanno quasi interamente in una direzione: i modelli trattengono erroneamente azioni autorizzate.
Entità
Istituzioni
- arXiv