MedLoCoMo: Benchmark per Dialoghi Medici a Contesto Lungo con LLM
MedLoCoMo è un nuovo benchmark progettato per valutare i modelli linguistici di grandi dimensioni nel ragionamento clinico specifico del paziente attraverso più ricoveri. Costruito a partire da record deidentificati MIMIC-IV e MIMIC-IV-Note, costruisce pacchetti clinici a livello di ricovero, sintetizza conversazioni medico-paziente fondate e genera elementi QA basati su evidenze in contesti di singolo ricovero, cross-ricovero e domande non rispondibili avversariali. Il benchmark include 100 timeline di pazienti con una media di 1.669,8 turni, 29,7 sessioni e 74.512,2 token per conversazione. Le valutazioni iniziali mostrano che il ragionamento cross-ricovero è costantemente più difficile dell'uso localizzato delle evidenze, anche per modelli con finestre di contesto lunghe o metodi di memoria esterna e recupero. Il codice e i dati sono disponibili su arXiv.
Fatti principali
- MedLoCoMo è un benchmark Medical Long-Context Memory per il ragionamento clinico multi-ricovero.
- Costruito a partire da record deidentificati MIMIC-IV e MIMIC-IV-Note.
- Contiene 100 timeline di pazienti con una media di 1.669,8 turni, 29,7 sessioni e 74.512,2 token per conversazione.
- Include contesti QA di singolo ricovero, cross-ricovero e domande non rispondibili avversariali.
- Il ragionamento cross-ricovero è più difficile dell'uso localizzato delle evidenze per i baselines valutati.
- Anche i modelli a contesto lungo e i metodi potenziati da recupero hanno difficoltà nei compiti cross-ricovero.
- Il codice e i dati sono pubblicamente disponibili su arXiv.
- Colma una lacuna nei benchmark QA medici esistenti che si concentrano su contesto breve o documenti singoli.
Entità
Istituzioni
- MIMIC-IV
- MIMIC-IV-Note
- arXiv