HoosierHelp: Nuovo Benchmark Testa gli Agenti LLM nella Navigazione dei Servizi Sociali
HoosierHelp è stato sviluppato da ricercatori come benchmark interattivo per valutare gli agenti basati su grandi modelli linguistici (LLM) nella navigazione dei servizi sociali. Questo benchmark si basa su 3.971 risorse di servizi sociali pubblicamente disponibili dell'Indiana, USA. Replica interazioni utente realistiche alterando le strutture dei bisogni, la soddisfazione dei vincoli e comportamenti come impazienza, divagazione, richieste non supportate e auto-contraddizione. Gli agenti devono effettuare richieste strutturate di ricerca di risorse, gestire interazioni non ideali e scegliere le risorse finali fornite dallo strumento. Test su 240 campioni attraverso sette LLM indicano che gli agenti attuali sono significativamente inaffidabili per la navigazione dei servizi sociali. Questo benchmark mira ad affrontare la complessità delle interazioni e dei vincoli che i benchmark precedenti hanno trascurato, offrendo una valutazione più accurata delle capacità degli LLM in questo settore. La ricerca è disponibile su arXiv con l'identificatore 2608.09946.
Fatti principali
- HoosierHelp è un benchmark interattivo per agenti LLM nella navigazione dei servizi sociali.
- Si basa su 3.971 risorse pubbliche di servizi sociali dell'Indiana.
- Gli utenti simulati variano nella struttura dei bisogni, nella soddisfacibilità dei vincoli e nei modelli comportamentali.
- I modelli comportamentali includono impazienza, divagazione, richieste non supportate e auto-contraddizione.
- Gli esperimenti sono stati condotti su 240 campioni attraverso sette LLM.
- Gli attuali agenti LLM sono sostanzialmente inaffidabili per la navigazione dei servizi sociali.
- Il benchmark affronta la complessità delle interazioni e le esigenze di ancoraggio ai vincoli.
- Lo studio è disponibile su arXiv (2608.09946).
Entità
Istituzioni
- arXiv
Luoghi
- Indiana
- United States