ClinLens: Benchmark per Agenti Clinici Longitudinali di IA
Un team di ricercatori ha presentato CLINLENS, un nuovo benchmark composto da 200 compiti progettati per valutare agenti di data science clinica utilizzando cinque risorse MIMIC interconnesse. Queste risorse includono vari tipi di dati clinici come cartelle cliniche elettroniche e risultati di test. Il benchmark impiega una matrice strutturata che valuta quattro prospettive temporali del paziente insieme a cinque diverse capacità analitiche. Utilizzando una nuova tecnica di sintesi inversa program-first, collega i compiti a un sistema di valutazione codificato. In particolare, il modello leader su 24 configurazioni ha ottenuto il 56,3% su una metrica specifica, raggiungendo un tasso di successo perfetto nell'esecuzione. Un altro agente ha dimostrato competenza completando 83 compiti.
Fatti principali
- CLINLENS è un benchmark di 200 compiti eseguibili.
- I compiti coprono cinque risorse MIMIC collegate: EHR strutturato, note, ECG, radiografie toraciche, ecocardiogrammi.
- Una tassonomia 4x5 incrocia quattro ambiti temporali del paziente con cinque capacità di analisi.
- La sintesi inversa program-first abbina pacchetti semi-grezzi a flussi di lavoro di riferimento privati per il valutatore.
- Verifica gli artefatti richiesti, la semantica di coorte e temporale, e la risposta finale.
- Su una suite di 126 compiti, la migliore configurazione ha raggiunto il 56,3% di STRICTPASS scope-macro.
- La migliore configurazione ha ottenuto il 100% di EXECSUCCESS.
- Un agente di codifica configurato separatamente ha risolto 83 dei 126 compiti.
Entità
—