Multimodal Cross-Attention Framework for Political Meme Detection in Bengali
Researchers have introduced a Multimodal Cross-Attention Fusion framework to detect political intent in Bengali memes. The approach uses a Vision-Language Model to extract OCR text from noisy images, then encodes visual and textual features, aligning semantic tokens with visual regions via cross-modal multi-head attention. A domain-specific political lexicon is integrated as a knowledge prior. The framework is evaluated on the PoliMemeDecode1 dataset, addressing the challenge of classifying internet memes in low-resource languages like Bengali.
Key facts
- The framework is called Multimodal Cross-Attention Fusion.
- It targets political intent detection in Bengali memes.
- A Vision-Language Model extracts OCR text from meme images.
- Cross-modal multi-head attention aligns semantic tokens with visual regions.
- A domain-specific political lexicon is used as a knowledge prior.
- Evaluation is on the PoliMemeDecode1 dataset.
- The work is published on arXiv with ID 2607.23493.
- Bengali is a low-resource language for meme classification.
Entities
Institutions
- arXiv