L'allineamento culturale degli LLM varia in base al framing del prompt nei sondaggi sui valori
Un nuovo studio su arXiv verifica se il comportamento degli LLM condizionato dall'identità umana—tramite personalizzazione, role-play o previsione—produca un allineamento culturale intercambiabile. Utilizzando 101 domande del World Values Survey (WVS) in 13 combinazioni lingua-paese, i ricercatori hanno valutato GPT-5.4, Claude Sonnet 4.6, Gemini 2.5 Flash e Qwen3-235B. Su 21.008 righe di risposte dei modelli, il framing del prompt è emerso come determinante di primo ordine: gli indizi sul paese spesso spostavano sostanzialmente le risposte, ma non sempre verso le distribuzioni umane corrispondenti. La previsione in terza persona ha prodotto il più forte allineamento direzionale per tre dei quattro modelli, mentre la personalizzazione e il role-play sono risultati più deboli o meno stabili. I guadagni di allineamento si sono concentrati su dimensioni valoriali salienti. I risultati suggeriscono che il modo in cui un LLM viene sollecitato a considerare l'identità influisce criticamente sul suo allineamento valoriale, con implicazioni per l'implementazione dell'IA in contesti culturalmente sensibili.
Fatti principali
- Lo studio utilizza domande del World Values Survey (WVS)
- Valuta GPT-5.4, Claude Sonnet 4.6, Gemini 2.5 Flash, Qwen3-235B
- 101 domande derivate dal WVS in 13 combinazioni lingua-paese
- Analizzate 21.008 righe di risposte dei modelli
- Il framing del prompt è un determinante di primo ordine dell'allineamento culturale
- Gli indizi sul paese spostano le risposte ma non sempre verso le distribuzioni umane
- La previsione in terza persona dà il più forte allineamento direzionale per 3 dei 4 modelli
- Personalizzazione e role-play sono più deboli o meno stabili
Entità
Istituzioni
- arXiv
- World Values Survey (WVS)