ARTFEED — Contemporary Art Intelligence

MMLongBench-Doc-V2: Annotazioni Corrette e Valutazione Semantica per il QA su Documenti Lunghi

other · 2026-08-06

MMLongBench-Doc-V2 è una versione aggiornata del benchmark MMLongBench-Doc, che inizialmente presentava 1.082 domande su 135 PDF. Questa revisione affronta due problemi principali che hanno distorto la valutazione delle prestazioni: la metrica di riferimento confrontava risposte estratte che portavano a marcature errate a causa di discrepanze nella formattazione numerica (ad esempio, 1.358.000 vs. 1358000), e un numero considerevole di annotazioni di verità fondamentale erano inaccurate, vaghe o incomplete, specialmente per domande a cui sistemi competenti rispondevano correttamente. La versione aggiornata corregge 106 annotazioni, fornendo la pagina e i calcoli corrispondenti per ciascuna correzione. Sostituisce la metrica basata su stringhe con un giudice LLM fissato per l'allineamento semantico. Inoltre, dieci domande con nomi di file errati e un duplicato sono state eliminate, risultando in 1.071 domande su 134 documenti. Un contributo chiave è una procedura decisionale su quando ampliare una chiave di insieme vuota. Il benchmark è accessibile su arXiv (2608.03397).

Fatti principali

  • MMLongBench-Doc-V2 corregge 106 annotazioni nel benchmark originale.
  • Ogni annotazione corretta include la pagina e l'aritmetica che giustificano la correzione.
  • La metrica basata su stringhe è sostituita con un giudice LLM fissato per la valutazione semantica.
  • Dieci domande con nomi di file errati e una domanda duplicata sono state rimosse.
  • Il benchmark rivisto contiene 1.071 domande su 134 documenti.
  • Il benchmark originale aveva 1.082 domande su 135 PDF.
  • La revisione affronta problemi con la formattazione numerica e la qualità delle annotazioni.
  • Il contributo più riutilizzabile è una procedura decisionale per ampliare le chiavi di insiemi vuoti.

Entità

Istituzioni

  • arXiv

Fonti