Hyper-M2RAG: Apprendimento di Ipergrafi di Ordine Superiore per il Recupero Multimodale di Documenti
Un nuovo framework, Hyper-M2RAG, affronta le limitazioni dei sistemi di generazione aumentata dal recupero multimodale (M-RAG) utilizzando l'apprendimento di rappresentazioni su ipergrafi di ordine superiore. I grafi semplici tradizionali non riescono a catturare le complesse relazioni N-arie tra entità eterogenee come grafici visivi, descrizioni testuali e dati numerici. Il metodo proposto formalizza la struttura del documento come un Ipergrafo Multimodale, dove gli iperarchi fungono da contenitori semantici unificati per associazioni multi-way. Questo approccio riduce la ridondanza computazionale e il rumore contestuale rispetto alla ricostruzione esaustiva dell'intera pagina. L'articolo è disponibile su arXiv (2608.16628) e introduce strategie di raffinamento incrementale per l'elaborazione di documenti lunghi.
Fatti principali
- Hyper-M2RAG è un nuovo framework per il recupero multimodale di documenti.
- Utilizza l'apprendimento di rappresentazioni su ipergrafi di ordine superiore.
- I grafi semplici tradizionali non riescono a catturare le relazioni N-arie.
- Gli iperarchi incapsulano associazioni multi-way tra testo, grafici e dati numerici.
- Il metodo riduce la ridondanza computazionale e il rumore contestuale.
- Evita la ricostruzione esaustiva dell'intera pagina.
- L'articolo è su arXiv con ID 2608.16628.
- Il framework è progettato per l'elaborazione di documenti lunghi.
Entità
Istituzioni
- arXiv