Trident: Nuovo Reranker Migliora la QA Multimodale su Documenti Lunghi
Un recente articolo su arXiv (2608.14841) presenta Trident, un sistema innovativo volto a migliorare il reranking nella risposta a domande visive su documenti lunghi (VQA). Identifica un problema significativo nei framework retrieve-then-read: sebbene il richiamo del recupero sia encomiabile, la selezione delle prove sul lato del reranker è inadeguata. Ad esempio, BGE-M3 ottiene un Recall@20 di 0.86 ma solo un F1@5 di 0.254 sul benchmark MMLongBench-Doc, mentre il retriever visivo ColPali raggiunge un F1@5 di 0.332. Un LLM di rerank solo testuale, che si basa esclusivamente su frammenti grezzi, trascura prove cruciali come tabelle e grafici. Trident è composto da due parti: Trident-R, un reranker LLM agnostico rispetto al retriever, e Trident-S, un modulo lato generazione. L'articolo è una nuova sottomissione e può essere consultato tramite l'URL fornito.
Fatti principali
- L'articolo arXiv:2608.14841 introduce Trident per la QA multimodale su documenti lunghi.
- Trident affronta il collo di bottiglia della selezione delle prove lato reranker.
- Su MMLongBench-Doc, BGE-M3 raggiunge Recall@20 = 0.86 ma F1@5 = 0.254.
- Il retriever visivo ColPali raggiunge F1@5 = 0.332.
- Un LLM di rerank solo testuale perde prove come tabelle, grafici e layout.
- Trident-R converte i candidati in record semantici con didascalia visiva, percorso di sezione, tag di entità, hit di concetti multi-asse e frammento di testo.
- Trident-R esegue una singola chiamata di rerank adattivo-K.
- Trident-S sollecita il VLM sotto vincoli topici, di entità e altri.
Entità
Istituzioni
- arXiv