ARTFEED — Contemporary Art Intelligence

ClinMM-Bench: Benchmarking del Ragionamento Clinico Multimodale Multi-Turn nei MLLM

other · 2026-07-29

ClinMM-Bench è stato creato da ricercatori come il più ampio benchmark per valutazioni diagnostiche cliniche multimodali multi-turn, mirato a testare i modelli linguistici di grandi dimensioni in scenari di ragionamento clinico pratico. Questo benchmark presenta 1.089 casi clinici reali complessi insieme a 3.760 immagini mediche che coprono otto diverse specialità. È stato impiegato un quadro di valutazione a due livelli per valutare sia l'accuratezza delle diagnosi che la qualità del ragionamento in 15 modelli linguistici multimodali di grandi dimensioni (MLLM) selezionati. I risultati hanno indicato che questi modelli affrontano difficoltà con la divulgazione continua di informazioni e la necessità di aggiornamenti dinamici delle ipotesi, rivelando carenze nei metodi di valutazione a turno singolo esistenti.

Fatti principali

  • ClinMM-Bench è il più grande benchmark di valutazione diagnostica clinica multimodale multi-turn.
  • Contiene 1.089 casi clinici reali e 3.760 immagini mediche in otto specialità.
  • Sono stati valutati sistematicamente 15 MLLM rappresentativi.
  • Un quadro di valutazione a due livelli ha valutato l'accuratezza diagnostica e la qualità del ragionamento.
  • Lo studio affronta i limiti delle valutazioni a turno singolo nel catturare la complessità clinica.

Entità

Fonti