Misurare la dispersione dell'insieme nei modelli linguistici senza una risposta unica
Un nuovo studio pubblicato su arXiv (2608.00285) esplora come valutare la diversità delle risposte di gruppi di grandi modelli linguistici quando non esiste una risposta chiaramente corretta. I ricercatori hanno esaminato sedici modelli appartenenti a dieci famiglie diverse e hanno scoperto che, in media, producevano 1,69 interpretazioni distinte di un caso psicoterapeutico, rispetto a 1,43 di un singolo modello. Gli autori sostengono che, sebbene la misurazione della diversità sia ben consolidata utilizzando il Vendi Score—calcolato dall'entropia di von Neumann di una matrice di similarità—un singolo punteggio non mostra da dove provenga la diversità. Per affrontare questo problema, propongono un contributo di dissenso per modello, che indica quanto ogni modello sia diverso dagli altri, aiutando a identificare quali modelli aumentano la diversità. L'articolo è un annuncio incrociato e può essere trovato su arXiv.
Fatti principali
- Sono stati utilizzati sedici modelli linguistici appartenenti a dieci famiglie.
- La diversità semantica media era di 1,69 formulazioni distinte.
- La diversità di base del singolo modello era di 1,43.
- Il Vendi Score viene utilizzato per misurare la diversità.
- Il Vendi Score è l'esponenziale dell'entropia di von Neumann di una matrice di similarità.
- Un contributo di dissenso per modello è definito come il complemento della similarità media con gli altri membri dell'insieme.
- L'articolo è su arXiv con ID 2608.00285.
- Il compito riguarda la formulazione di casi psicoterapeutici.
Entità
—