I LLM falliscono come utenti sintetici nel benchmark di simulazione di sondaggi
Un nuovo studio da arXiv (2607.26348) valuta sistematicamente se i grandi modelli linguistici (LLM) possono sostituire gli intervistati umani nella ricerca basata su sondaggi. I ricercatori hanno testato quattro modelli di due famiglie (da 8B a capacità di frontiera) su due dataset indipendenti: il General Social Survey statunitense e il World Values Survey. Con prompting demografico e protocolli di simulazione standardizzati, nessun LLM ha superato il miglior baseline non-LLM addestrato su dati umani esclusi. A livello individuale, tutti i modelli non sono riusciti a replicare i pattern di risposta umani. I fallimenti sono stati coerenti in entrambi i domini, tutti e quattro i modelli e entrambe le famiglie di modelli. Lo studio fornisce un quadro di valutazione per i sistemi di utenti sintetici e mette in luce i limiti degli attuali LLM nel simulare le risposte umane ai sondaggi.
Fatti principali
- Quattro LLM di due famiglie testati (da 8B a capacità di frontiera)
- Due dataset: General Social Survey (USA) e World Values Survey (cross-culturale)
- Nessun LLM ha superato il miglior baseline non-LLM a livello individuale
- Fallimenti replicati in entrambi i domini, tutti i modelli e entrambe le famiglie
- Lo studio propone un quadro di valutazione per i sistemi di utenti sintetici
- ID articolo arXiv: 2607.26348
- Pubblicato come preprint arXiv
- Focus su prompting demografico e protocolli di simulazione di sondaggi
Entità
Istituzioni
- arXiv
- General Social Survey
- World Values Survey
Luoghi
- United States