Framework di Attenzione Incrociata Multimodale per il Rilevamento di Meme Politici in Bengalese
I ricercatori hanno introdotto un framework di Fusione di Attenzione Incrociata Multimodale per rilevare l'intento politico nei meme bengalesi. L'approccio utilizza un Modello Visione-Linguaggio per estrarre il testo OCR da immagini rumorose, quindi codifica le caratteristiche visive e testuali, allineando i token semantici con le regioni visive tramite attenzione multi-testa cross-modale. Un lessico politico specifico del dominio è integrato come priorità di conoscenza. Il framework è valutato sul dataset PoliMemeDecode1, affrontando la sfida di classificare i meme internet in lingue a basse risorse come il bengalese.
Fatti principali
- Il framework si chiama Fusione di Attenzione Incrociata Multimodale.
- Si concentra sul rilevamento dell'intento politico nei meme bengalesi.
- Un Modello Visione-Linguaggio estrae il testo OCR dalle immagini dei meme.
- L'attenzione multi-testa cross-modale allinea i token semantici con le regioni visive.
- Un lessico politico specifico del dominio è utilizzato come priorità di conoscenza.
- La valutazione avviene sul dataset PoliMemeDecode1.
- Il lavoro è pubblicato su arXiv con ID 2607.23493.
- Il bengalese è una lingua a basse risorse per la classificazione dei meme.
Entità
Istituzioni
- arXiv