ARTFEED — Contemporary Art Intelligence

MedLoCoMo: Benchmark per Dialoghi Medici a Contesto Lungo con LLM

other · 2026-07-29

MedLoCoMo è un nuovo benchmark progettato per valutare i modelli linguistici di grandi dimensioni nel ragionamento clinico specifico del paziente attraverso più ricoveri. Costruito a partire da record deidentificati MIMIC-IV e MIMIC-IV-Note, costruisce pacchetti clinici a livello di ricovero, sintetizza conversazioni medico-paziente fondate e genera elementi QA basati su evidenze in contesti di singolo ricovero, cross-ricovero e domande non rispondibili avversariali. Il benchmark include 100 timeline di pazienti con una media di 1.669,8 turni, 29,7 sessioni e 74.512,2 token per conversazione. Le valutazioni iniziali mostrano che il ragionamento cross-ricovero è costantemente più difficile dell'uso localizzato delle evidenze, anche per modelli con finestre di contesto lunghe o metodi di memoria esterna e recupero. Il codice e i dati sono disponibili su arXiv.

Fatti principali

  • MedLoCoMo è un benchmark Medical Long-Context Memory per il ragionamento clinico multi-ricovero.
  • Costruito a partire da record deidentificati MIMIC-IV e MIMIC-IV-Note.
  • Contiene 100 timeline di pazienti con una media di 1.669,8 turni, 29,7 sessioni e 74.512,2 token per conversazione.
  • Include contesti QA di singolo ricovero, cross-ricovero e domande non rispondibili avversariali.
  • Il ragionamento cross-ricovero è più difficile dell'uso localizzato delle evidenze per i baselines valutati.
  • Anche i modelli a contesto lungo e i metodi potenziati da recupero hanno difficoltà nei compiti cross-ricovero.
  • Il codice e i dati sono pubblicamente disponibili su arXiv.
  • Colma una lacuna nei benchmark QA medici esistenti che si concentrano su contesto breve o documenti singoli.

Entità

Istituzioni

  • MIMIC-IV
  • MIMIC-IV-Note
  • arXiv

Fonti