ARTFEED — Contemporary Art Intelligence

UserToolBench: Benchmarking dell'uso personalizzato di strumenti nei LLM

ai-technology · 2026-08-13

UserToolBench, descritto in arXiv:2608.10042, è un nuovo benchmark progettato per valutare le capacità decisionali personalizzate nei modelli linguistici di grandi dimensioni (LLM) che utilizzano strumenti. A differenza dei benchmark precedenti che enfatizzano il recupero del profilo, l'imitazione dello stile o l'applicazione generale degli strumenti, UserToolBench valuta la capacità di un modello di dedurre preferenze utente implicite dalla cronologia delle interazioni, identificare quando è necessaria una chiarificazione e generare sequenze di chiamate a strumenti allineate all'utente nonostante dati incompleti. Questo benchmark è costruito da dati di interazione reali protetti dalla privacy e integra profili persona strutturati, ecosistemi di strumenti in stile API pubblica e traiettorie multi-turno estese. Comprende 10 profili utente, 36 set di strumenti, 1.065 turni e 170 strumenti distinti, con compiti che affrontano scenari di mancanza di informazioni, singolo strumento e multi-strumento. I test su LLM avanzati per l'uso di strumenti indicano che questi modelli incontrano ancora difficoltà nell'eseguire efficacemente compiti decisionali personalizzati.

Fatti principali

  • UserToolBench è un benchmark per il processo decisionale personalizzato negli LLM che utilizzano strumenti.
  • Testa l'inferenza delle preferenze utente latenti dalla cronologia delle interazioni.
  • Include il riconoscimento di quando è necessaria una chiarificazione.
  • Valuta la produzione di traiettorie di chiamate a strumenti allineate all'utente in condizioni di informazioni incomplete.
  • Il benchmark è costruito da tracce di interazione reali sanificate per la privacy.
  • Contiene 10 profili utente, 36 set di strumenti, 1.065 turni e 170 strumenti unici.
  • I tipi di compiti includono scenari di mancanza di informazioni, singolo strumento e multi-strumento.
  • Gli esperimenti mostrano che i modelli attuali hanno ancora difficoltà con questi compiti.

Entità

Fonti