Le Preferenze dei Clinici non Sono un Indicatore Affidabile della Sicurezza Clinica dei LLM
Una recente indagine condotta dalla piattaforma Massive Open Online Validation and Evaluation (MOOVE) indica che le preferenze dei clinici nei confronti a coppie non riflettono in modo affidabile la sicurezza clinica dei modelli linguistici di grandi dimensioni (LLM). Lo studio ha esaminato 26.804 valutazioni a coppie provenienti da 13 LLM, contribuite da oltre 736 clinici di più di 28 paesi. Ha rivelato che i modelli che ottengono buoni punteggi nelle preferenze a coppie possono comunque mostrare fallimenti clinicamente significativi (punteggi di -1 o inferiori) in aree come l'Innocuità e l'Accuratezza. Questi fallimenti variano a seconda della specialità, portando a specifiche 'zone vietate' per l'applicazione clinica. Disponibile su arXiv (ID 2608.02617), questa ricerca guidata da clinici sottolinea la necessità di metodi di valutazione più completi che vadano oltre i semplici ranking di preferenza.
Fatti principali
- Lo studio valuta se le preferenze a coppie dei clinici segnalano in modo affidabile la sicurezza clinica nei LLM.
- Dati dalla piattaforma MOOVE: 26.804 giudizi a coppie, 13 LLM, oltre 736 clinici, più di 28 paesi.
- I clinici hanno utilizzato una scala discreta [-2, +2]; i valori negativi indicano contenuti non sicuri o fuorvianti.
- I modelli che ottengono punteggi elevati nelle preferenze a coppie possono comunque avere tassi sostanziali di fallimenti clinicamente significativi (≤ -1).
- I fallimenti sono distribuiti in modo non uniforme tra le specialità, creando 'zone vietate' specifiche per dominio.
- Lo studio è pubblicato su arXiv con ID 2608.02617.
- La ricerca è stata condotta da un team guidato da clinici.
- I risultati suggeriscono che la preferenza a coppie è un indicatore scarso per le prestazioni critiche per la sicurezza.
Entità
Istituzioni
- MOOVE (Massive Open Online Validation and Evaluation)
- arXiv