VLD-RAG: Framework Agente per il QA Multimodale su Documenti
Un nuovo framework di IA chiamato VLD-RAG affronta il question answering su documenti multi-pagina visivamente ricchi. Il sistema, descritto in un preprint su arXiv, utilizza un approccio agente di retrieval-augmented generation multimodale per gestire prove distribuite su più pagine con testo, tabelle, grafici e figure. VLD-RAG costruisce un indice multimodale che preserva le pagine, combinando testo analizzato, metadati e rappresentazioni visive dense. Impiega un retrieval ibrido con ricerca sparsa basata su parole chiave e query semantiche dense. Un flusso di lavoro guidato da un verificatore coordina tre agenti: Agente di Retrieval, Agente di Risposta e Agente di Validazione per ampliare le prove e il ragionamento tra le pagine. Il lavoro studia il RAG multimodale per documenti lunghi in cui il retrieval deve selezionare pagine di prova utilizzando segnali sia testuali che visivi.
Fatti principali
- VLD-RAG è un framework RAG multimodale agente per il recupero di prove multi-pagina e il ragionamento tra pagine.
- Costruisce un indice multimodale che preserva le pagine, memorizzando testo analizzato, metadati a livello di pagina e rappresentazioni visive dense.
- Il retrieval ibrido combina la ricerca sparsa basata su parole chiave con query semantiche dense.
- Un flusso di lavoro agente guidato da un verificatore coordina gli Agenti di Retrieval, Risposta e Validazione.
- Il framework è mirato a documenti visivamente ricchi come report, slide e manuali.
- Le prove necessarie per rispondere a una domanda sono spesso distribuite su più pagine.
- Il retrieval deve selezionare pagine di prova che includano segnali sia testuali che visivi.
- L'articolo è disponibile su arXiv con ID 2607.24748.
Entità
Istituzioni
- arXiv