Modello di fusione basato su LLM prevede l'accettazione di item nei test standardizzati
Uno studio recente presenta un modello di valutazione automatica degli item (AIE) progettato per prevedere l'accettazione o il rifiuto di item di test per scopi operativi, utilizzando critiche generate da modelli linguistici di grandi dimensioni (LLM). Questa ricerca è descritta in un preprint disponibile su arXiv (2608.06609) e si basa su dati storici di rifiuto provenienti da un'importante iniziativa di test standardizzati. Il set di dati includeva 52.759 item in arti linguistiche inglesi (ELA) e matematica, con il 34% rifiutato permanentemente. Le ragioni del rifiuto includevano proprietà psicometriche inadeguate, problemi di contenuto, preoccupazioni relative a pregiudizi e sensibilità, nonché fattori non legati al contenuto. I ricercatori hanno ottimizzato un classificatore DeBERTaV3-large sul testo grezzo degli item, un altro classificatore DeBERTa sulle critiche generate da Qwen3, e un modello di fusione che integrava entrambe le rappresentazioni. Il modello di fusione ha dimostrato le migliori prestazioni complessive, raggiungendo un'accuratezza di .75, un punteggio F1 di .64, un AUC di .80, una sensibilità di .64 e una specificità di .80. Questo metodo mira a ridurre la dipendenza dalle valutazioni manuali degli esperti e dai test sul campo, migliorando potenzialmente lo sviluppo degli item nelle valutazioni educative. Lo studio sottolinea il ruolo crescente dell'IA nella misurazione educativa, sebbene gli autori enfatizzino la necessità di ulteriore validazione su vari tipi di item e programmi di test.
Fatti principali
- Lo studio è stato pubblicato su arXiv con identificativo 2608.06609.
- Il set di dati conteneva 52.759 item di arti linguistiche inglesi (ELA) e matematica.
- Il 34% degli item è stato rifiutato permanentemente dall'uso operativo futuro.
- Le ragioni del rifiuto includevano proprietà psicometriche scadenti, problemi di contenuto, preoccupazioni relative a pregiudizi e sensibilità, e problemi non legati al contenuto.
- Il modello utilizzava classificatori DeBERTaV3-large e DeBERTa, insieme a critiche generate da Qwen3.
- Il modello di fusione ha raggiunto Accuratezza = .75, F1 = .64, AUC = .80, Sensibilità = .64, Specificità = .80.
- La ricerca mira ad automatizzare la valutazione degli item senza revisione manuale degli esperti o test sul campo.
Entità
Istituzioni
- arXiv