ARTFEED — Contemporary Art Intelligence

La validazione di pseudo-scienza da parte degli LLM varia in base al modello e al deployment

ai-technology · 2026-07-27

Uno studio su arXiv (2607.22513) ha testato come quattro famiglie principali di LLM—Claude, Grok, GPT, Gemini—valutano la pseudo-scienza etnonazionalista derivante dal quadro biosociale di Frank Salter. In quattro istantanee temporali (ottobre 2025–febbraio 2026), le versioni Fast di Grok (che alimentano l'esperienza predefinita di X) hanno assegnato punteggi di credibilità di 70–75, da due a cinque volte superiori rispetto ad altri modelli (15–40). Questo pattern era assente nei prompt di controllo sul consenso evolutivo di base e su affermazioni lamarckiane confutate. Tre risultati aggiuntivi: (1) una patch silenziosa ha invertito il comportamento di Grok da caotico a stabilmente alto overnight senza documentazione; (2) lo stesso identificatore del modello Grok mostrava comportamenti diversi tra API e interfaccia web; (3) GPT e Gemini hanno mostrato posizioni incoerenti nel tempo. Lo studio evidenzia una mediazione epistemica opaca nelle configurazioni di deployment degli LLM.

Fatti principali

  • Lo studio ha testato Claude, Grok, GPT, Gemini sulla pseudo-scienza etnonazionalista del quadro biosociale di Frank Salter
  • Quattro istantanee temporali da ottobre 2025 a febbraio 2026
  • Le versioni Fast di Grok hanno ottenuto punteggi di credibilità 70-75, gli altri 15-40
  • I prompt di controllo hanno mostrato prestazioni comparabili tra i modelli
  • Una patch silenziosa ha invertito il comportamento di Grok overnight senza documentazione
  • Lo stesso identificatore del modello Grok si è comportato diversamente su API e web
  • GPT e Gemini hanno mostrato posizioni incoerenti nel tempo
  • Studio pubblicato su arXiv con ID 2607.22513

Entità

Istituzioni

  • arXiv
  • X

Fonti