BEAR-Bench: benchmark bilingue testa il ragionamento dell'IA su documenti professionali
BEAR-Bench è un benchmark bilingue di nuova concezione volto a valutare i grandi modelli linguistici multimodali, con 1.000 domande annotate da esseri umani provenienti da testi aziendali e scientifici densi. Progettato sia per l'inglese che per il russo, intende rimediare ai limiti degli attuali benchmark che si concentrano prevalentemente sull'inglese o sul cinese e privilegiano l'estrazione di informazioni. I ricercatori hanno testato 16 modelli, sia proprietari che a pesi aperti, come Gemini 3.1 Pro e Qwen3.5-397B, rivelando un significativo margine di miglioramento, anche tra i modelli con le migliori prestazioni. Questo benchmark è progettato per essere autosufficiente, senza richiedere competenze di dominio esterne, e mira a colmare la mancanza di rappresentanza del russo nelle valutazioni dell'IA.
Fatti principali
- BEAR-Bench è un benchmark bilingue per i grandi modelli linguistici multimodali.
- Include 1.000 domande annotate da esseri umani.
- Le domande si basano su documenti aziendali e scientifici ricchi di testo.
- Il benchmark copre inglese e russo.
- Sono stati valutati 16 MLLM proprietari e a pesi aperti.
- I modelli valutati includono Gemini 3.1 Pro e Qwen3.5-397B.
- I benchmark esistenti sono in gran parte incentrati sull'inglese o sul cinese.
- I risultati mostrano margini di miglioramento anche per i sistemi più forti.
Entità
Istituzioni
- arXiv