ARTFEED — Contemporary Art Intelligence

E-Bench: Benchmark sintetico per agenti con uso di strumenti multi-step

ai-technology · 2026-07-29

I ricercatori hanno introdotto un nuovo benchmark chiamato E-Bench per valutare i modelli linguistici di grandi dimensioni (LLM) come agenti in grado di eseguire compiti multi-step in ambienti mutevoli. E-Bench consiste in 323 compiti che creano cambiamenti di stato in tre diverse aree: Honor of Kings, QQ Music e Tencent Meeting. Utilizzando il riempimento del database guidato da grafi, separa efficacemente la creazione degli ambienti dalla generazione dei compiti, consentendo ambienti di prodotto riutilizzabili senza componenti residue. La caratteristica di asimmetria generatore-risolutore presenta sfide che includono sia lacune informative che di strumenti, richiedendo agli agenti di scoprire dati nascosti e effettuare più chiamate a strumenti prima di ottenere un cambiamento di stato. Questa ricerca mira a migliorare i benchmark esistenti che di solito si concentrano su chiamate API isolate o brevi sequenze. Il documento completo è accessibile su arXiv con il riferimento 2607.23722.

Fatti principali

  • E-Bench è un benchmark completamente sintetico per agenti con uso di strumenti multi-step
  • Contiene 323 compiti che cambiano stato in tre domini di prodotto: Honor of Kings, QQ Music, Tencent Meeting
  • Utilizza il riempimento del database guidato da grafi per la sintesi dell'ambiente
  • L'asimmetria generatore-risolutore crea lacune informative e di strumenti
  • I risultati sono valutati in modo deterministico
  • Affronta le limitazioni dei benchmark esistenti che si concentrano su chiamate API isolate o brevi traiettorie
  • Documento disponibile su arXiv: 2607.23722

Entità

Istituzioni

  • arXiv
  • Honor of Kings
  • QQ Music
  • Tencent Meeting

Fonti