ARTFEED — Contemporary Art Intelligence

Q-CueGraph: Grafi di Evidenza Visiva Condizionati dalla Query per il Ragionamento Multimodale

ai-technology · 2026-08-06

Un nuovo sistema di intelligenza artificiale chiamato Q-CueGraph, descritto in un articolo su arXiv, migliora i grandi modelli linguistici multimodali (LLM) offrendo una politica specifica per il compito di ispezione delle immagini. Questo sistema traduce una domanda e una rappresentazione dell'immagine in osservazioni a livello di coordinate con budget per un modello di lettura statico. Per immagini ricche di testo, utilizza un grafo OCR/layout riutilizzabile, mentre per ricerche di immagini naturali, crea nodi visivi condizionati dalla query all'interno dello stesso quadro di selezione, composizione e budget. Un raffinamento opzionale dell'utilità identifica quali ritagli candidati il lettore statico può utilizzare in base all'accuratezza delle risposte di addestramento, senza bisogno di supervisione a livello di bounding box. Utilizzando un lettore Qwen2.5-VL-7B congelato, Q-CueGraph raggiunge un'accuratezza di 0.833 su V*Bench rispetto a 0.696 per l'inferenza su immagine intera con un budget del 19% dell'area dell'immagine, e raggiunge il 92% dell'ANLS su immagine intera su InfographicVQA utilizzando circa metà dell'area dell'immagine. L'articolo è disponibile su arXiv con identificativo 2608.04452.

Fatti principali

  • Q-CueGraph è un sistema di grafi di evidenza visiva condizionati dalla query per il ragionamento multimodale.
  • Fornisce una politica condizionata dal compito per decidere dove ispezionare un'immagine.
  • Mappa una domanda e una rappresentazione dell'immagine in osservazioni a livello di coordinate con budget.
  • Utilizza un grafo OCR/layout riutilizzabile per immagini ricche di testo.
  • Istanzia nodi visivi condizionati dalla query per la ricerca di immagini naturali.
  • Il raffinamento opzionale dell'utilità apprende dalla correttezza delle risposte di addestramento senza supervisione a livello di bounding box.
  • Con un lettore Qwen2.5-VL-7B congelato, raggiunge un'accuratezza di 0.833 su V*Bench rispetto a 0.696 per l'inferenza su immagine intera con un budget del 19% dell'area dell'immagine.
  • Raggiunge il 92% dell'ANLS su immagine intera su InfographicVQA da circa metà dell'area dell'immagine.

Entità

Istituzioni

  • arXiv

Fonti