MMLongBench-Doc-V2: Annotazioni Corrette e Valutazione Semantica per il QA su Documenti Lunghi
MMLongBench-Doc-V2 è una versione aggiornata del benchmark MMLongBench-Doc, che inizialmente presentava 1.082 domande su 135 PDF. Questa revisione affronta due problemi principali che hanno distorto la valutazione delle prestazioni: la metrica di riferimento confrontava risposte estratte che portavano a marcature errate a causa di discrepanze nella formattazione numerica (ad esempio, 1.358.000 vs. 1358000), e un numero considerevole di annotazioni di verità fondamentale erano inaccurate, vaghe o incomplete, specialmente per domande a cui sistemi competenti rispondevano correttamente. La versione aggiornata corregge 106 annotazioni, fornendo la pagina e i calcoli corrispondenti per ciascuna correzione. Sostituisce la metrica basata su stringhe con un giudice LLM fissato per l'allineamento semantico. Inoltre, dieci domande con nomi di file errati e un duplicato sono state eliminate, risultando in 1.071 domande su 134 documenti. Un contributo chiave è una procedura decisionale su quando ampliare una chiave di insieme vuota. Il benchmark è accessibile su arXiv (2608.03397).
Fatti principali
- MMLongBench-Doc-V2 corregge 106 annotazioni nel benchmark originale.
- Ogni annotazione corretta include la pagina e l'aritmetica che giustificano la correzione.
- La metrica basata su stringhe è sostituita con un giudice LLM fissato per la valutazione semantica.
- Dieci domande con nomi di file errati e una domanda duplicata sono state rimosse.
- Il benchmark rivisto contiene 1.071 domande su 134 documenti.
- Il benchmark originale aveva 1.082 domande su 135 PDF.
- La revisione affronta problemi con la formattazione numerica e la qualità delle annotazioni.
- Il contributo più riutilizzabile è una procedura decisionale per ampliare le chiavi di insiemi vuoti.
Entità
Istituzioni
- arXiv