PatientAgentBench: Benchmark per Agenti AI Sanitari Orientati al Paziente
Un nuovo framework di benchmark chiamato PatientAgentBench valuta i modelli fondamentali che agiscono come agenti AI sanitari orientati al paziente. A differenza dei benchmark esistenti che si concentrano su conoscenze mediche isolate o compiti rivolti ai clinici, PatientAgentBench valuta agenti che conversano con pazienti simulati, ragionano sulle cartelle cliniche e utilizzano strumenti sanitari in un ambiente sandbox. La valutazione utilizza un LLM-as-a-Jury su sei dimensioni con oltre cento criteri clinici indipendenti dalla conversazione. La convalida con medici autorizzati ha mostrato un accordo adiacente del 79-93% tra la giuria e i valutatori esperti, paragonabile o superiore all'accordo inter-valutatore tra clinici. Il framework mira ad affrontare i rischi nell'assistenza primaria, in particolare gli errori diagnostici e le cure non sicure.
Fatti principali
- PatientAgentBench è un benchmark per agenti AI sanitari orientati al paziente.
- Valuta modelli fondamentali integrati in un agente con strumenti sanitari.
- Gli agenti conversano con pazienti simulati e ragionano sulle cartelle cliniche.
- Il punteggio utilizza un LLM-as-a-Jury su sei dimensioni.
- Vengono utilizzati oltre cento criteri clinici.
- Medici autorizzati hanno convalidato il benchmark con un accordo adiacente del 79-93%.
- L'accordo è paragonabile o superiore all'accordo inter-valutatore tra clinici.
- Il framework si rivolge ai rischi dell'assistenza primaria come gli errori diagnostici.
Entità
—