HSSBench: Nuovo Benchmark per LLM Multimodali in Scienze Umane e Sociali
Un nuovo benchmark chiamato HSSBench è stato sviluppato da ricercatori per valutare i Modelli Linguistici Multimodali (MLLM) specificamente nelle aree delle Scienze Umane e Sociali (HSS). Questo benchmark colma una lacuna nei framework di valutazione esistenti che enfatizzano principalmente la conoscenza generale e il ragionamento STEM. I compiti HSS richiedono pensiero interdisciplinare e la capacità di integrare conoscenze da vari domini, presentando sfide distinte per i MLLM, specialmente nel collegare idee astratte con elementi visivi. HSSBench valuta le prestazioni in diverse lingue, incluse tutte e sei le lingue ufficiali delle Nazioni Unite. Inoltre, la ricerca introduce un innovativo pipeline di generazione dati progettato per contesti HSS. Lo studio è disponibile su arXiv con identificativo 2506.03922.
Fatti principali
- HSSBench è un nuovo benchmark per valutare i MLLM su compiti di Scienze Umane e Sociali.
- I benchmark attuali per i MLLM enfatizzano principalmente la conoscenza generale e il ragionamento STEM.
- I compiti HSS richiedono pensiero orizzontale, interdisciplinare e una profonda integrazione delle conoscenze.
- HSSBench supporta più lingue, incluse le sei lingue ufficiali delle Nazioni Unite.
- Viene introdotto un nuovo pipeline di generazione dati su misura per scenari HSS.
- L'articolo è disponibile su arXiv con identificativo 2506.03922.
- Il benchmark mira a colmare il divario nella valutazione dei MLLM su compiti HSS.
- Il lavoro è stato annunciato come tipo replace-cross su arXiv.
Entità
Istituzioni
- arXiv