VARM-Bench: Nuovo Benchmark per il Ragionamento Verificabile nella Moderazione degli Abusi Linguistici in Cinese
I ricercatori hanno creato un nuovo strumento chiamato VARM-Bench per valutare l'efficacia del ragionamento strutturato nella moderazione del linguaggio offensivo in cinese. Questo sviluppo arriva in risposta al crescente problema dei contenuti dannosi sui social media cinesi e sottolinea i limiti dei benchmark attuali, che mancano di un quadro solido per verificare le decisioni di moderazione. VARM-Bench presenta razionali dettagliati per sei decisioni chiave: identificazione del bersaglio, tipo di bersaglio, quanto esplicito sia il bersaglio, posizione dell'autore, etichettatura della dannosità e categorizzazione dettagliata. Utilizza un processo definito per valutare vari aspetti come correttezza e accordo, senza dipendere da un modello linguistico per il giudizio. Ulteriori dettagli sono disponibili in un articolo su arXiv (identificatore 2608.15600).
Fatti principali
- VARM-Bench è un nuovo benchmark per la moderazione degli abusi linguistici in cinese.
- Fornisce razionali di catena di pensiero ancorati al campo.
- Ogni istanza include sei decisioni: bersaglio, tipo di bersaglio, esplicitezza del bersaglio, posizione dell'autore, etichetta di dannosità e categoria a grana fine.
- Il benchmark utilizza un protocollo deterministico senza giudice LLM.
- Valuta la correttezza del campo, l'allineamento del bersaglio, la validità dell'output, l'accordo completo del record e gli errori nascosti del record.
- L'articolo è disponibile su arXiv con identificatore 2608.15600.
- I benchmark esistenti mancano di una rappresentazione unificata per verificare le decisioni di moderazione.
- Il benchmark mira a migliorare l'affidabilità della moderazione dei testi sui social media cinesi.
Entità
Istituzioni
- arXiv