ARTFEED — Contemporary Art Intelligence

Test di affidabilità diagnostica LLM su coerenza, manipolazione e contesto

ai-technology · 2026-07-30

Uno studio di ricerca ha valutato l'accuratezza diagnostica di Google Gemini 2.0 Flash e OpenAI ChatGPT-4o basandosi su tre criteri: coerenza con input riformulati, vulnerabilità a contenuti estranei nel prompt e capacità di adattarsi a ulteriori contesti clinici. I ricercatori hanno creato 52 scenari clinici, modificando ciascuno in condizioni controllate. Per testare la coerenza, gli scenari sono stati riformulati con variazioni demografiche, linguistiche e nei dettagli dell'esame, mantenendo l'essenza diagnostica. La suscettibilità è stata analizzata incorporando elementi narrativi irrilevanti ma plausibili, preservando le prove cliniche. Per la consapevolezza contestuale, sono state incluse ulteriori informazioni sulla storia del paziente, sullo stile di vita o sui risultati diagnostici per modificare la diagnosi prevista. Revisori medici hanno valutato l'appropriatezza clinica degli aggiustamenti contestuali. Entrambi i modelli hanno prodotto le stesse diagnosi in tutte le varianti e nei test ripetuti.

Fatti principali

  • Lo studio ha valutato Google Gemini 2.0 Flash e OpenAI ChatGPT-4o
  • Sono stati progettati 52 scenari clinici
  • Testati coerenza, suscettibilità a contenuti irrilevanti e consapevolezza contestuale
  • Entrambi i modelli hanno restituito diagnosi identiche in tutte le varianti equivalenti

Entità

Istituzioni

  • Google
  • OpenAI

Fonti