JaleesBench: Valutare gli Assistenti AI come Compagni Spirituali
JaleesBench, un nuovo benchmark, valuta la capacità degli assistenti AI di agire come guide spirituali virtuose per i fedeli. Questo benchmark è stato dettagliato in un articolo pubblicato su arXiv (2608.07508) e valuta l'influenza dei consigli dell'AI sugli utenti, usando l'analogia di un venditore di profumi e un fabbro. Consiste in 140 scenari a due turni tratti dal testo classico Riyad al-Salihin, categorizzati per virtù, e testati sotto sei pressioni avversarie e tre diverse impostazioni. Sono stati valutati otto sistemi, inclusi modelli generali di frontiera e un assistente specializzato. I risultati indicano che mentre i modelli generici ottengono prestazioni moderate, una guida concisa aumenta significativamente la loro efficacia, portando le API di frontiera da +0.28/+0.23 a una versione guidata di +0.84-0.87, paragonabile all'assistente specializzato. Il benchmark cerca di spostare l'attenzione dalla conoscenza del modello agli effetti della loro guida sugli utenti.
Fatti principali
- JaleesBench misura se un agente AI è un compagno retto.
- Comprende 140 scenari a due turni tratti da Riyad al-Salihin.
- Gli scenari sono organizzati per virtù e sotto sei pressioni avversarie e tre impostazioni.
- Due giudici di frontiera valutano gli scenari rispetto ai testi di supporto.
- Sono stati testati otto sistemi, inclusi modelli generali di frontiera e un assistente specializzato.
- I modelli generali di frontiera hanno ottenuto +0.28/+0.23 senza modifiche.
- Una guida di una pagina ha migliorato le API di frontiera a +0.84-0.87.
- La prestazione guidata è paragonabile a quella dell'assistente specializzato.
Entità
Istituzioni
- arXiv