ARTFEED — Contemporary Art Intelligence

XL-DocBench: Nuovo Benchmark per la Comprensione di Documenti Extra-Lunghi

ai-technology · 2026-08-04

I ricercatori hanno introdotto XL-DocBench, un benchmark completamente verificato da esseri umani, progettato per valutare i modelli linguistici di grandi dimensioni (LLM) su compiti di comprensione di documenti extra-lunghi. Il benchmark colma il divario nei metodi di valutazione esistenti, che tipicamente si concentrano su domande a contesto breve o su singole pagine, testando i modelli su documenti che arrivano fino a 2.303 pagine. XL-DocBench include 1.519 domande mantenute in sei domini professionali, tra cui conformità, clinico, finanziario e ingegneristico. In particolare, il 72,6% delle domande (1.103 esempi) richiede prove da più pagine, e il 36,6% (556 domande) coinvolge tabelle, grafici o figure. Il benchmark enfatizza la tracciabilità a pagine di prova specifiche, riflettendo l'alto costo delle risposte non supportate nei flussi di lavoro professionali. Questo sviluppo è significativo per avanzare le capacità degli LLM in compiti documentali del mondo reale, come l'analisi di relazioni annuali, regolamenti, linee guida cliniche e manuali tecnici. Il benchmark è stato annunciato su arXiv con l'identificatore 2608.00036.

Fatti principali

  • XL-DocBench è un benchmark completamente verificato da esseri umani per la comprensione di documenti extra-lunghi.
  • Include 1.519 domande mantenute da sei domini professionali.
  • I contesti nel benchmark arrivano fino a 2.303 pagine.
  • Il 72,6% delle domande (1.103 esempi) utilizza più pagine di prova.
  • Il 36,6% delle domande (556) coinvolge tabelle, grafici o figure.
  • Il benchmark si concentra sulla tracciabilità a pagine di prova specifiche.
  • Colma le lacune nei benchmark esistenti che si concentrano su QA a contesto breve o a pagina singola.
  • Il benchmark è stato annunciato su arXiv con l'identificatore 2608.00036.

Entità

Fonti