UserToolBench: Benchmarking dell'uso personalizzato di strumenti nei LLM
UserToolBench, descritto in arXiv:2608.10042, è un nuovo benchmark progettato per valutare le capacità decisionali personalizzate nei modelli linguistici di grandi dimensioni (LLM) che utilizzano strumenti. A differenza dei benchmark precedenti che enfatizzano il recupero del profilo, l'imitazione dello stile o l'applicazione generale degli strumenti, UserToolBench valuta la capacità di un modello di dedurre preferenze utente implicite dalla cronologia delle interazioni, identificare quando è necessaria una chiarificazione e generare sequenze di chiamate a strumenti allineate all'utente nonostante dati incompleti. Questo benchmark è costruito da dati di interazione reali protetti dalla privacy e integra profili persona strutturati, ecosistemi di strumenti in stile API pubblica e traiettorie multi-turno estese. Comprende 10 profili utente, 36 set di strumenti, 1.065 turni e 170 strumenti distinti, con compiti che affrontano scenari di mancanza di informazioni, singolo strumento e multi-strumento. I test su LLM avanzati per l'uso di strumenti indicano che questi modelli incontrano ancora difficoltà nell'eseguire efficacemente compiti decisionali personalizzati.
Fatti principali
- UserToolBench è un benchmark per il processo decisionale personalizzato negli LLM che utilizzano strumenti.
- Testa l'inferenza delle preferenze utente latenti dalla cronologia delle interazioni.
- Include il riconoscimento di quando è necessaria una chiarificazione.
- Valuta la produzione di traiettorie di chiamate a strumenti allineate all'utente in condizioni di informazioni incomplete.
- Il benchmark è costruito da tracce di interazione reali sanificate per la privacy.
- Contiene 10 profili utente, 36 set di strumenti, 1.065 turni e 170 strumenti unici.
- I tipi di compiti includono scenari di mancanza di informazioni, singolo strumento e multi-strumento.
- Gli esperimenti mostrano che i modelli attuali hanno ancora difficoltà con questi compiti.
Entità
—