MPAR-Bench: Nuovo Benchmark per il Ragionamento Associativo Multi-Punto nei LLM
Un nuovo benchmark bilingue, MPAR-Bench, è stato sviluppato da ricercatori per valutare l'ampiezza del ragionamento dei modelli linguistici di grandi dimensioni (LLM) sia in inglese che in cinese. A differenza dei benchmark attuali che enfatizzano la profondità del ragionamento—la capacità di navigare in catene inferenziali estese—MPAR-Bench si concentra sull'ampiezza del ragionamento sfidando i modelli a sintetizzare vari indizi semanticamente distinti in una risposta unificata. Ispirandosi al gioco cooperativo Just One, ogni compito consiste nello scoprire un bersaglio nascosto da molteplici indizi generati indipendentemente. Il benchmark presenta 1.000 compiti creati attraverso un sistema di generazione di indizi multi-agente, filtraggio della diversità basato su embedding e validazione umana. Il pool di risposte proviene da liste di parole pubbliche, con tutti gli insiemi di indizi generati ex novo per mantenere l'originalità. Le metriche di valutazione includono l'accuratezza di corrispondenza esatta e altre. Il relativo articolo è disponibile su arXiv con l'identificatore 2608.10444, categorizzato come 'cross'.
Fatti principali
- MPAR-Bench è un benchmark bilingue inglese-cinese per valutare l'ampiezza del ragionamento nei LLM.
- È ispirato al gioco cooperativo Just One.
- Il benchmark contiene 1.000 elementi.
- Gli elementi sono costruiti utilizzando un pipeline di generazione di indizi multi-agente, filtraggio della diversità basato su embedding e verifica umana.
- Lo spazio delle risposte è tratto da liste di parole pubbliche, mentre gli insiemi di indizi sono generati da zero.
- La metrica di valutazione include l'accuratezza di corrispondenza esatta.
- L'articolo è disponibile su arXiv con identificatore 2608.10444.
- Il tipo di annuncio è 'cross'.
Entità
Istituzioni
- arXiv