ARTFEED — Contemporary Art Intelligence

VLD-RAG: Framework Agente per il QA Multimodale su Documenti

ai-technology · 2026-07-29

Un nuovo framework di IA chiamato VLD-RAG affronta il question answering su documenti multi-pagina visivamente ricchi. Il sistema, descritto in un preprint su arXiv, utilizza un approccio agente di retrieval-augmented generation multimodale per gestire prove distribuite su più pagine con testo, tabelle, grafici e figure. VLD-RAG costruisce un indice multimodale che preserva le pagine, combinando testo analizzato, metadati e rappresentazioni visive dense. Impiega un retrieval ibrido con ricerca sparsa basata su parole chiave e query semantiche dense. Un flusso di lavoro guidato da un verificatore coordina tre agenti: Agente di Retrieval, Agente di Risposta e Agente di Validazione per ampliare le prove e il ragionamento tra le pagine. Il lavoro studia il RAG multimodale per documenti lunghi in cui il retrieval deve selezionare pagine di prova utilizzando segnali sia testuali che visivi.

Fatti principali

  • VLD-RAG è un framework RAG multimodale agente per il recupero di prove multi-pagina e il ragionamento tra pagine.
  • Costruisce un indice multimodale che preserva le pagine, memorizzando testo analizzato, metadati a livello di pagina e rappresentazioni visive dense.
  • Il retrieval ibrido combina la ricerca sparsa basata su parole chiave con query semantiche dense.
  • Un flusso di lavoro agente guidato da un verificatore coordina gli Agenti di Retrieval, Risposta e Validazione.
  • Il framework è mirato a documenti visivamente ricchi come report, slide e manuali.
  • Le prove necessarie per rispondere a una domanda sono spesso distribuite su più pagine.
  • Il retrieval deve selezionare pagine di prova che includano segnali sia testuali che visivi.
  • L'articolo è disponibile su arXiv con ID 2607.24748.

Entità

Istituzioni

  • arXiv

Fonti