ARTFEED — Contemporary Art Intelligence

I Prompt Auto-Referenziali Aumentano l'Instabilità delle Risposte nei LLM

ai-technology · 2026-08-15

Una recente indagine pubblicata su arXiv (2608.13258) esamina l'instabilità delle risposte nei modelli linguistici di grandi dimensioni (LLM) quando affrontano domande auto-referenziali che richiedono resoconti in prima persona simili a esperienze soggettive. Questa ricerca preliminare, non ancora sottoposta a revisione paritaria, quantifica l'instabilità calcolando uno meno la similarità coseno media a coppie degli embedding delle frasi derivati da una dichiarazione centrale condensata in ogni risposta. L'analisi confronta tre categorie di domande: prompt auto-referenziali, dilemmi filosofici senza risposte chiare e domande con risposte corrette definitive. Utilizzando 30 risposte indipendenti per domanda (360 in totale) tramite l'API Gemini a una temperatura di 0,7, gli autori osservano che i prompt auto-referenziali mostrano la maggiore instabilità (0,343 ± 0,047), suggerendo che queste domande portano a output meno coerenti rispetto ad altre domande aperte. Questo esito solleva preoccupazioni riguardo all'affidabilità di tali risposte e migliora la nostra comprensione del comportamento dei LLM in scenari simili all'introspezione, con implicazioni significative per l'allineamento dell'IA e l'interpretazione degli stati soggettivi generati.

Fatti principali

  • Studio su arXiv:2608.13258
  • Misura l'instabilità delle risposte nei LLM
  • Confronta domande auto-referenziali, irrisolvibili e verificabili
  • Utilizza l'API Gemini, temperatura 0,7
  • 30 risposte indipendenti per domanda, 360 in totale
  • Le domande auto-referenziali mostrano la maggiore instabilità (0,343 ± 0,047)
  • L'instabilità è definita come 1 - similarità coseno media a coppie
  • Quattro domande per gruppo

Entità

Istituzioni

  • arXiv
  • Gemini API

Fonti