ARTFEED — Contemporary Art Intelligence

I LLM falliscono come utenti sintetici nel benchmark di simulazione di sondaggi

ai-technology · 2026-07-30

Un nuovo studio da arXiv (2607.26348) valuta sistematicamente se i grandi modelli linguistici (LLM) possono sostituire gli intervistati umani nella ricerca basata su sondaggi. I ricercatori hanno testato quattro modelli di due famiglie (da 8B a capacità di frontiera) su due dataset indipendenti: il General Social Survey statunitense e il World Values Survey. Con prompting demografico e protocolli di simulazione standardizzati, nessun LLM ha superato il miglior baseline non-LLM addestrato su dati umani esclusi. A livello individuale, tutti i modelli non sono riusciti a replicare i pattern di risposta umani. I fallimenti sono stati coerenti in entrambi i domini, tutti e quattro i modelli e entrambe le famiglie di modelli. Lo studio fornisce un quadro di valutazione per i sistemi di utenti sintetici e mette in luce i limiti degli attuali LLM nel simulare le risposte umane ai sondaggi.

Fatti principali

  • Quattro LLM di due famiglie testati (da 8B a capacità di frontiera)
  • Due dataset: General Social Survey (USA) e World Values Survey (cross-culturale)
  • Nessun LLM ha superato il miglior baseline non-LLM a livello individuale
  • Fallimenti replicati in entrambi i domini, tutti i modelli e entrambe le famiglie
  • Lo studio propone un quadro di valutazione per i sistemi di utenti sintetici
  • ID articolo arXiv: 2607.26348
  • Pubblicato come preprint arXiv
  • Focus su prompting demografico e protocolli di simulazione di sondaggi

Entità

Istituzioni

  • arXiv
  • General Social Survey
  • World Values Survey

Luoghi

  • United States

Fonti