ARTFEED — Contemporary Art Intelligence

PatientAgentBench: Benchmark per Agenti AI Sanitari Orientati al Paziente

ai-technology · 2026-07-29

Un nuovo framework di benchmark chiamato PatientAgentBench valuta i modelli fondamentali che agiscono come agenti AI sanitari orientati al paziente. A differenza dei benchmark esistenti che si concentrano su conoscenze mediche isolate o compiti rivolti ai clinici, PatientAgentBench valuta agenti che conversano con pazienti simulati, ragionano sulle cartelle cliniche e utilizzano strumenti sanitari in un ambiente sandbox. La valutazione utilizza un LLM-as-a-Jury su sei dimensioni con oltre cento criteri clinici indipendenti dalla conversazione. La convalida con medici autorizzati ha mostrato un accordo adiacente del 79-93% tra la giuria e i valutatori esperti, paragonabile o superiore all'accordo inter-valutatore tra clinici. Il framework mira ad affrontare i rischi nell'assistenza primaria, in particolare gli errori diagnostici e le cure non sicure.

Fatti principali

  • PatientAgentBench è un benchmark per agenti AI sanitari orientati al paziente.
  • Valuta modelli fondamentali integrati in un agente con strumenti sanitari.
  • Gli agenti conversano con pazienti simulati e ragionano sulle cartelle cliniche.
  • Il punteggio utilizza un LLM-as-a-Jury su sei dimensioni.
  • Vengono utilizzati oltre cento criteri clinici.
  • Medici autorizzati hanno convalidato il benchmark con un accordo adiacente del 79-93%.
  • L'accordo è paragonabile o superiore all'accordo inter-valutatore tra clinici.
  • Il framework si rivolge ai rischi dell'assistenza primaria come gli errori diagnostici.

Entità

Fonti