Uno studio arXiv rivela un divario di autenticità nella valutazione umana della generazione del linguaggio naturale
Le valutazioni umane sono considerate il punto di riferimento per valutare i sistemi di generazione del linguaggio naturale (NLG); tuttavia, un preprint arXiv (ID 2205.11930v3) suggerisce che questo approccio spesso rappresenta in modo errato le reali preferenze umane. Gli autori applicano la teoria dell'utilità per esaminare il protocollo di valutazione, scoprendo che le assunzioni sottostanti sugli annotatori possono distorcere le valutazioni. Indicano che le scale di Likert potrebbero potenzialmente invertire le preferenze autentiche. Sebbene suggeriscano miglioramenti al protocollo, riconoscono i suoi limiti nella valutazione di compiti aperti, come la generazione di storie. Viene proposta una nuova metodologia di valutazione umana, sottolineando la necessità di strategie di valutazione affidabili in diversi compiti. Questo studio solleva preoccupazioni sull'affidabilità dei metodi esistenti ed enfatizza il divario tra le medie numeriche e le vere valutazioni umane.
Fatti principali
- Le valutazioni umane sono considerate lo standard di riferimento nella valutazione della NLG.
- Il protocollo standard calcola la media delle valutazioni degli annotatori per classificare i sistemi di NLG.
- Lo studio applica la teoria dell'utilità dell'economia per analizzare la valutazione.
- Le assunzioni implicite sugli annotatori sono spesso violate nella pratica.
- Le scale di Likert possono dimostrabilmente invertire la direzione delle vere preferenze in certi casi.
- Gli autori propongono miglioramenti al protocollo standard.
- Anche il protocollo migliorato non può valutare compiti aperti come la generazione di storie.
- Viene proposto un nuovo metodo di valutazione umana per compiti aperti.
Entità
—