Guarda Due Volte: Evidenziazione delle Prove Senza Addestramento per KB-VQA
Uno studio recente presenta Look Twice (LoT), un framework a tempo di inferenza che migliora il Visual Question Answering basato sulla conoscenza (KB-VQA) senza bisogno di addestramento. Questo approccio utilizza l'attenzione interna del modello per enfatizzare le prove pertinenti, affrontando problemi legati al recupero rumoroso e agli elementi visivi di distrazione che possono portare i Modelli Linguistici Multimodali di Grandi Dimensioni (MLLM) a perdere informazioni cruciali. LoT individua efficacemente le regioni dell'immagine e le frasi di testo rilevanti per la domanda, eliminando i sink di attenzione e le distrazioni, riformulando l'input per sottolineare le prove selezionate prima di generare le risposte. Questo framework opera senza richiedere regolazioni dei parametri, modelli aggiuntivi o modifiche all'architettura, rendendolo un'opzione plug-and-play semplice. L'articolo è accessibile su arXiv con identificatore 2604.01280 ed è classificato come tipo replace-cross, contribuendo all'IA, all'apprendimento automatico e alla comprensione multimodale, in particolare nei sistemi di visual question answering legati all'arte.
Fatti principali
- Look Twice (LoT) è un framework a tempo di inferenza senza addestramento per KB-VQA.
- Utilizza l'attenzione interna del modello per selezionare le prove.
- Filtra i sink di attenzione e i contenuti di distrazione.
- Riformula l'input per evidenziare le prove selezionate.
- Non richiede aggiornamenti dei parametri, modelli ausiliari o modifiche architetturali.
- L'articolo è disponibile su arXiv con ID 2604.01280.
- Il tipo di annuncio è replace-cross.
- Il metodo mira a migliorare le prestazioni degli MLLM sui compiti KB-VQA.
Entità
Istituzioni
- arXiv