XL-DocBench: Nuovo Benchmark per la Comprensione di Documenti Extra-Lunghi
I ricercatori hanno introdotto XL-DocBench, un benchmark completamente verificato da esseri umani, progettato per valutare i modelli linguistici di grandi dimensioni (LLM) su compiti di comprensione di documenti extra-lunghi. Il benchmark colma il divario nei metodi di valutazione esistenti, che tipicamente si concentrano su domande a contesto breve o su singole pagine, testando i modelli su documenti che arrivano fino a 2.303 pagine. XL-DocBench include 1.519 domande mantenute in sei domini professionali, tra cui conformità, clinico, finanziario e ingegneristico. In particolare, il 72,6% delle domande (1.103 esempi) richiede prove da più pagine, e il 36,6% (556 domande) coinvolge tabelle, grafici o figure. Il benchmark enfatizza la tracciabilità a pagine di prova specifiche, riflettendo l'alto costo delle risposte non supportate nei flussi di lavoro professionali. Questo sviluppo è significativo per avanzare le capacità degli LLM in compiti documentali del mondo reale, come l'analisi di relazioni annuali, regolamenti, linee guida cliniche e manuali tecnici. Il benchmark è stato annunciato su arXiv con l'identificatore 2608.00036.
Fatti principali
- XL-DocBench è un benchmark completamente verificato da esseri umani per la comprensione di documenti extra-lunghi.
- Include 1.519 domande mantenute da sei domini professionali.
- I contesti nel benchmark arrivano fino a 2.303 pagine.
- Il 72,6% delle domande (1.103 esempi) utilizza più pagine di prova.
- Il 36,6% delle domande (556) coinvolge tabelle, grafici o figure.
- Il benchmark si concentra sulla tracciabilità a pagine di prova specifiche.
- Colma le lacune nei benchmark esistenti che si concentrano su QA a contesto breve o a pagina singola.
- Il benchmark è stato annunciato su arXiv con l'identificatore 2608.00036.
Entità
—