ClinMM-Bench: Benchmarking del Ragionamento Clinico Multimodale Multi-Turn nei MLLM
ClinMM-Bench è stato creato da ricercatori come il più ampio benchmark per valutazioni diagnostiche cliniche multimodali multi-turn, mirato a testare i modelli linguistici di grandi dimensioni in scenari di ragionamento clinico pratico. Questo benchmark presenta 1.089 casi clinici reali complessi insieme a 3.760 immagini mediche che coprono otto diverse specialità. È stato impiegato un quadro di valutazione a due livelli per valutare sia l'accuratezza delle diagnosi che la qualità del ragionamento in 15 modelli linguistici multimodali di grandi dimensioni (MLLM) selezionati. I risultati hanno indicato che questi modelli affrontano difficoltà con la divulgazione continua di informazioni e la necessità di aggiornamenti dinamici delle ipotesi, rivelando carenze nei metodi di valutazione a turno singolo esistenti.
Fatti principali
- ClinMM-Bench è il più grande benchmark di valutazione diagnostica clinica multimodale multi-turn.
- Contiene 1.089 casi clinici reali e 3.760 immagini mediche in otto specialità.
- Sono stati valutati sistematicamente 15 MLLM rappresentativi.
- Un quadro di valutazione a due livelli ha valutato l'accuratezza diagnostica e la qualità del ragionamento.
- Lo studio affronta i limiti delle valutazioni a turno singolo nel catturare la complessità clinica.
Entità
—