ARTFEED — Contemporary Art Intelligence

MerchantBench: Nuovo Benchmark per Agenti LLM nelle Operazioni di E-Commerce

ai-technology · 2026-08-03

MerchantBench, un nuovo benchmark, è stato lanciato per valutare la coerenza a lungo termine degli agenti basati su modelli linguistici di grandi dimensioni (LLM) in contesti di e-commerce. Questo benchmark si basa su 98.843 record autentici di prodotti e-commerce e replica uno scenario a livello di ordine su 365 giorni. Offre 26 strumenti per l'interazione degli agenti, comprendendo attività come la ricerca di prodotti, il controllo dei prezzi, la gestione del flusso di cassa e l'adattamento a feedback a latenza mista. L'obiettivo principale è valutare la capacità degli agenti di sostenere azioni mirate per periodi prolungati rispondendo ai dati accumulati, il che è fondamentale per le applicazioni pratiche. MerchantBench affronta anche le carenze dei benchmark attuali che privilegiano compiti limitati con metriche di successo immediate. Informazioni dettagliate sono disponibili in un articolo su arXiv (arXiv:2607.28956).

Fatti principali

  • MerchantBench è un nuovo benchmark per agenti LLM nell'e-commerce.
  • Si basa su 98.843 record reali di prodotti e-commerce.
  • La simulazione dura 365 giorni a livello di granularità degli ordini.
  • Fornisce 26 strumenti per l'interazione degli agenti.
  • Le attività includono ricerca di prodotti, controllo di inserzioni e prezzi, gestione del flusso di cassa e adattamento a feedback a latenza mista.
  • Il benchmark si concentra sulla coerenza a lungo termine, non solo sul successo immediato.
  • L'articolo è disponibile su arXiv con identificativo 2607.28956.

Entità

Istituzioni

  • arXiv

Fonti