ARTFEED — Contemporary Art Intelligence

MMShopBench: Nuovo Benchmark per Agenti di Shopping Multimodali

ai-technology · 2026-08-03

Un nuovo benchmark, MMShopBench, è stato sviluppato da ricercatori per valutare agenti di shopping multimodali e multi-turno. Si basa su log di acquisto autentici che sono stati accuratamente puliti e annotati manualmente per stabilire etichette precise per l'intento di acquisto e i criteri essenziali del prodotto. A differenza dei benchmark precedenti che si concentrano esclusivamente su testo o richieste sintetiche, MMShopBench riflette le complessità delle esperienze di shopping reali, in cui gli utenti comunicano le loro esigenze attraverso una combinazione di immagini e dialogo. Gli agenti devono dedurre i requisiti dalle immagini e dalle conversazioni degli utenti, recuperare candidati prodotto tramite ricerche sia testuali che per immagini, e confermare che ogni candidato soddisfi tutti i criteri specificati analizzando le immagini del prodotto e gli attributi strutturati. La valutazione comprende una varietà di modelli open-source e proprietari, offrendo un'analisi dettagliata degli attuali assistenti allo shopping basati sull'IA. Questa iniziativa colma un vuoto significativo nella valutazione dell'IA, poiché gli acquirenti online si affidano sempre più a assistenti IA capaci di interpretare input multimodali. Il benchmark mira a promuovere innovazioni nella tecnologia dello shopping basata sull'IA, migliorando la reattività alle reali esigenze degli utenti.

Fatti principali

  • MMShopBench è il primo benchmark basato su log reali per agenti di shopping multimodali e multi-turno.
  • È costruito da log di acquisto accuratamente puliti e annotati manualmente.
  • Il benchmark fornisce annotazioni ground-truth sull'intento di acquisto e sui requisiti obbligatori del prodotto.
  • Gli agenti devono dedurre i requisiti dalle immagini degli utenti e dal dialogo multi-turno.
  • Gli agenti recuperano i prodotti candidati tramite ricerca per immagini e testo.
  • Gli agenti verificano i candidati utilizzando immagini del prodotto e attributi strutturati.
  • La valutazione include modelli open-source e proprietari rappresentativi.
  • Il benchmark affronta la sottorappresentazione dei requisiti complessi di shopping nel mondo reale nei benchmark esistenti.

Entità

Istituzioni

  • arXiv

Fonti