ARTFEED — Contemporary Art Intelligence

BEAR-Bench: benchmark bilingue testa il ragionamento dell'IA su documenti professionali

ai-technology · 2026-08-19

BEAR-Bench è un benchmark bilingue di nuova concezione volto a valutare i grandi modelli linguistici multimodali, con 1.000 domande annotate da esseri umani provenienti da testi aziendali e scientifici densi. Progettato sia per l'inglese che per il russo, intende rimediare ai limiti degli attuali benchmark che si concentrano prevalentemente sull'inglese o sul cinese e privilegiano l'estrazione di informazioni. I ricercatori hanno testato 16 modelli, sia proprietari che a pesi aperti, come Gemini 3.1 Pro e Qwen3.5-397B, rivelando un significativo margine di miglioramento, anche tra i modelli con le migliori prestazioni. Questo benchmark è progettato per essere autosufficiente, senza richiedere competenze di dominio esterne, e mira a colmare la mancanza di rappresentanza del russo nelle valutazioni dell'IA.

Fatti principali

  • BEAR-Bench è un benchmark bilingue per i grandi modelli linguistici multimodali.
  • Include 1.000 domande annotate da esseri umani.
  • Le domande si basano su documenti aziendali e scientifici ricchi di testo.
  • Il benchmark copre inglese e russo.
  • Sono stati valutati 16 MLLM proprietari e a pesi aperti.
  • I modelli valutati includono Gemini 3.1 Pro e Qwen3.5-397B.
  • I benchmark esistenti sono in gran parte incentrati sull'inglese o sul cinese.
  • I risultati mostrano margini di miglioramento anche per i sistemi più forti.

Entità

Istituzioni

  • arXiv

Fonti