MMShopBench: Nuovo Benchmark per Agenti di Shopping Multimodali
Un nuovo benchmark, MMShopBench, è stato sviluppato da ricercatori per valutare agenti di shopping multimodali e multi-turno. Si basa su log di acquisto autentici che sono stati accuratamente puliti e annotati manualmente per stabilire etichette precise per l'intento di acquisto e i criteri essenziali del prodotto. A differenza dei benchmark precedenti che si concentrano esclusivamente su testo o richieste sintetiche, MMShopBench riflette le complessità delle esperienze di shopping reali, in cui gli utenti comunicano le loro esigenze attraverso una combinazione di immagini e dialogo. Gli agenti devono dedurre i requisiti dalle immagini e dalle conversazioni degli utenti, recuperare candidati prodotto tramite ricerche sia testuali che per immagini, e confermare che ogni candidato soddisfi tutti i criteri specificati analizzando le immagini del prodotto e gli attributi strutturati. La valutazione comprende una varietà di modelli open-source e proprietari, offrendo un'analisi dettagliata degli attuali assistenti allo shopping basati sull'IA. Questa iniziativa colma un vuoto significativo nella valutazione dell'IA, poiché gli acquirenti online si affidano sempre più a assistenti IA capaci di interpretare input multimodali. Il benchmark mira a promuovere innovazioni nella tecnologia dello shopping basata sull'IA, migliorando la reattività alle reali esigenze degli utenti.
Fatti principali
- MMShopBench è il primo benchmark basato su log reali per agenti di shopping multimodali e multi-turno.
- È costruito da log di acquisto accuratamente puliti e annotati manualmente.
- Il benchmark fornisce annotazioni ground-truth sull'intento di acquisto e sui requisiti obbligatori del prodotto.
- Gli agenti devono dedurre i requisiti dalle immagini degli utenti e dal dialogo multi-turno.
- Gli agenti recuperano i prodotti candidati tramite ricerca per immagini e testo.
- Gli agenti verificano i candidati utilizzando immagini del prodotto e attributi strutturati.
- La valutazione include modelli open-source e proprietari rappresentativi.
- Il benchmark affronta la sottorappresentazione dei requisiti complessi di shopping nel mondo reale nei benchmark esistenti.
Entità
Istituzioni
- arXiv