StanceBench: Valutazione degli LLM Audio sulla Posizione Interpersonale nel Parlato
I ricercatori hanno presentato StanceBench, un nuovo benchmark progettato per valutare la posizione interpersonale nel parlato conversazionale e per valutare i modelli linguistici di grandi dimensioni (LLM) con capacità audio come valutatori automatici. Utilizzando il corpus Seamless Interaction, StanceBench delinea nove dimensioni della posizione attraverso poli di prompt di ruolo, standardizzando le valutazioni sia per scenari a singolo parlante che basati sull'interazione. Misura inoltre la robustezza, il bias e l'inferenza della posizione degli LLM in veste di giudici. Tra le posizioni analizzate, empatia e cortesia sono le più facilmente distinguibili; calore e assertività mostrano una separabilità moderata con un bias di positività; l'onestà risulta essere la più difficile, mostrando un significativo bias di ordine del prompt; l'attenzione è in qualche modo separabile ma si correla debolmente con i giudizi umani. Le posizioni interazionali mostrano una maggiore sensibilità al contesto, rivelando gap di soglia e varianza considerevole.
Fatti principali
- StanceBench è un benchmark per la posizione interpersonale nel parlato conversazionale.
- Valuta gli LLM con capacità audio come giudici automatici.
- Utilizza il corpus Seamless Interaction.
- Specifica 9 dimensioni della posizione tramite poli di prompt di ruolo.
- Standardizza le valutazioni per singolo parlante e basate sull'interazione.
- Riporta robustezza, bias e inferenza della posizione degli LLM come giudici.
- Empatia e cortesia sono le posizioni più facili.
- L'onestà è la più difficile con un alto bias di ordine del prompt.
Entità
—