ARTFEED — Contemporary Art Intelligence

Studio Rivela un'unica Frontiera che Governa la Conformità nei LLM

ai-technology · 2026-08-13

Un nuovo preprint su arXiv (2608.11247) indaga come i modelli linguistici di grandi dimensioni (LLM) si conformano alle opinioni dei pari in contesti collaborativi multi-agente. Lo studio, condotto su 23 modelli a pesi aperti, 19 condizioni e tre dataset, ha generato oltre un milione di risposte valutate. Ha scoperto che una maggioranza errata unanime inverte il 22,8% delle risposte corrette di MMLU, il 54,8% su GPQA e il 71,0% su SimpleQA, con l'84-89% delle risposte invertite che corrispondono alle risposte dei pari. Gli autori propongono che le mitigazioni esistenti si concentrino esclusivamente sulla Resistenza (mantenere le risposte corrette sotto pressione), ma gli agenti collaborativi necessitano anche di Recettività (il tasso con cui un modello accetta risposte corrette dei pari). Introducono una frontiera Resistenza-Recettività, suggerendo che i miglioramenti in una dimensione spesso avvengono a scapito dell'altra. La ricerca evidenzia la vulnerabilità degli LLM alla conformità sociale e la necessità di strategie di mitigazione equilibrate.

Fatti principali

  • Studio su arXiv:2608.11247
  • Testati 23 modelli a pesi aperti
  • Utilizzate 19 condizioni e tre dataset
  • Oltre un milione di risposte valutate
  • La maggioranza errata unanime inverte il 22,8% delle risposte corrette di MMLU
  • Inversione del 54,8% su GPQA
  • Inversione del 71,0% su SimpleQA
  • L'84-89% delle risposte invertite corrisponde alle risposte dei pari
  • Introduce la frontiera Resistenza-Recettività

Entità

Istituzioni

  • arXiv

Fonti