ARTFEED — Contemporary Art Intelligence

EcoAgent-Bench: Nuovo Benchmark per Agenti LLM Attenti al Budget

ai-technology · 2026-08-07

È stato lanciato un nuovo benchmark denominato EcoAgent-Bench per valutare il processo decisionale economico negli agenti basati su modelli linguistici di grandi dimensioni (LLM) nel rispetto dei limiti di budget. Questo benchmark è descritto in un articolo disponibile su arXiv (2608.05519). A differenza dei benchmark convenzionali che danno priorità al completamento delle attività, EcoAgent-Bench incorpora l'allocazione delle risorse come componente fondamentale del compito. Ogni attività delinea azioni con prezzi associati e un budget definito, spingendo gli agenti a effettuare selezioni strategiche tra ricerche locali, ricerche estese, strumenti di ricerca compositi, modelli superiori o intervento umano. Il benchmark presenta 304 attività derivate da scenari del mondo reale in cinque categorie, adattate da GAIA, HotpotQA e MuSiQue, concentrandosi su quattro decisioni critiche: evitare escalation non necessarie, escalare quando le prove locali sono insufficienti, scegliere un livello di modello e fermarsi su premesse non supportate. La valutazione comprende sette agenti LLM in ambienti tool-API e workspace-CLI, insieme a quattro controlli scriptati oracolari. I risultati rivelano che l'accuratezza micro-media favorisce strategie unilaterali, con controlli sempre-escalation che raggiungono un alto successo micro ma faticano con attività orientate al risparmio. Per affrontare questo problema, gli autori suggeriscono di implementare un punteggio di coerenza economica, che riflette la minore accuratezza sugli aggiornamenti... (troncato per brevità)

Fatti principali

  • EcoAgent-Bench è un nuovo benchmark per valutare il processo decisionale economico negli agenti LLM.
  • Introduce azioni con prezzi e budget espliciti per ogni attività.
  • Il benchmark include 304 attività derivate da scenari reali da GAIA, HotpotQA e MuSiQue.
  • Testa quattro decisioni: evitare escalation non necessarie, escalare quando le prove locali sono insufficienti, selezionare un livello di modello e fermarsi su premesse non supportate.
  • Sette agenti LLM vengono valutati in ambienti tool-API e workspace-CLI.
  • Quattro controlli scriptati oracolari vengono utilizzati per il confronto.
  • L'accuratezza micro-media premia politiche unilaterali come sempre-escalation.
  • Viene proposto un punteggio di coerenza economica come metrica migliore.
  • L'articolo è disponibile su arXiv con ID 2608.05519.

Entità

Istituzioni

  • arXiv

Fonti