ARTFEED — Contemporary Art Intelligence

InteractComp: Benchmark per Agenti di Ricerca con Query Ambiguo

ai-technology · 2026-07-27

Un nuovo benchmark chiamato InteractComp è stato sviluppato da ricercatori per valutare la capacità degli agenti di ricerca di identificare e chiarire query ambigue attraverso l'interazione. Questo benchmark affronta un problema comune in cui le richieste degli utenti sono vaghe o prive di dettagli, richiedendo chiarimenti da parte degli agenti. Comprende 210 domande meticolosamente curate in 9 diversi domini, utilizzando un approccio target-distrattore per creare ambiguità controllata che può essere risolta solo tramite interazione. La valutazione ha coinvolto 17 modelli, evidenziando notevoli carenze nelle prestazioni degli agenti attuali in queste situazioni. Questa ricerca è disponibile su arXiv con l'identificatore 2510.24668.

Fatti principali

  • InteractComp è un benchmark per valutare gli agenti di ricerca su query ambigue.
  • Verifica se gli agenti riconoscono l'ambiguità e interagiscono per risolverla.
  • Il benchmark include 210 domande curate da esperti in 9 domini.
  • Le domande sono create utilizzando una metodologia target-distrattore.
  • L'ambiguità è controllata e risolvibile solo tramite interazione.
  • 17 modelli sono stati valutati nello studio.
  • I risultati mostrano che gli agenti attuali hanno difficoltà con query ambigue.
  • L'articolo è disponibile su arXiv con ID 2510.24668.

Entità

Istituzioni

  • arXiv

Fonti