ARTFEED — Contemporary Art Intelligence

Audit forense rivela fallimenti di riproducibilità nel benchmark AI per radiologia

ai-technology · 2026-07-30

Un recente audit incentrato su un benchmark di un modello visione-linguaggio (VLM) per radiografie toraciche ha rilevato significative discrepanze tra la versione rilasciata del modello e le sue linee guida originali. Questo studio, condiviso su arXiv, ha esaminato vari aspetti come i legami dei prompt, i metadati DICOM e la completezza degli output. Ha anche valutato la coerenza dei rilasci attraverso diversi dataset come API dei provider e codici statistici. Su 300 interazioni modello-prompt pianificate, 297 hanno prodotto report utilizzabili. La revisione ha coinvolto 30 studi con 28 pazienti, rivelando che quattro immagini MONOCHROME1 non avevano l'inversione di polarità richiesta. Inoltre, un estrattore non verificato ha limitato cinque report a 4000 caratteri. L'audit ha sottolineato la necessità critica di controlli rigorosi di riproducibilità nei benchmark AI per l'imaging medico.

Fatti principali

  • Audit forense retrospettivo di riproducibilità di un benchmark VLM per radiografie toraciche
  • 300 chiamate modello-prompt pianificate; 297 hanno prodotto report non vuoti
  • 60 chiamate Claude etichettate A/B sono state eseguite con lo stesso prompt C
  • 30 studi rappresentavano 28 pazienti
  • 4 immagini MONOCHROME1 renderizzate senza l'inversione di polarità richiesta
  • L'appartenenza alla suddivisione del dataset non è stata mantenuta
  • Un estrattore non convalidato ha troncato 5 report a 4000 caratteri
  • Nessun modello è stato richiamato; nessuna immagine o report è stato nuovamente annotato

Entità

Istituzioni

  • arXiv

Fonti