ARTFEED — Contemporary Art Intelligence

WHBench: Nuovo Benchmark Rivela Fallimenti dei LLM nella Salute Femminile

ai-technology · 2026-07-27

WHBench, un nuovo benchmark, valuta i grandi modelli linguistici nel campo della salute femminile, indicando che nessuno raggiunge un'accuratezza superiore al 75%. Composto da 47 scenari sviluppati da esperti su 10 argomenti, utilizza una rubrica con 23 criteri per la valutazione. Il modello con le migliori prestazioni ha ottenuto un punteggio del 72,1%, mentre i modelli leader hanno mostrato bassi tassi di correttezza completa e notevoli discrepanze nei tassi di danno. La ricerca evidenzia varie modalità di fallimento, tra cui la dipendenza da linee guida obsolete, omissioni pericolose, errori di dosaggio e la trascuratezza delle questioni di equità. Inoltre, l'affidabilità inter-valutatore risulta moderata e vengono implementate penalità ponderate per la sicurezza.

Fatti principali

  • 1. WHBench è una suite di valutazione mirata per la salute femminile.
  • 2. Include 47 scenari realizzati da esperti su 10 argomenti.
  • 3. 22 modelli sono stati valutati utilizzando una rubrica con 23 criteri.
  • 4. Nessun modello supera il 75% di prestazione media; il miglior modello ottiene il 72,1%.
  • 5. I modelli migliori mostrano bassi tassi di risposte completamente corrette e una notevole variazione nei tassi di danno.
  • 6. Le modalità di fallimento includono linee guida obsolete, omissioni pericolose, errori di dosaggio e punti ciechi sull'equità.
  • 7. Vengono utilizzate penalità ponderate per la sicurezza e ricalcolo del punteggio lato server.
  • 8. 3.102 risposte tentate, 3.100 valutate.

Entità

Istituzioni

  • arXiv

Fonti