ARTFEED — Contemporary Art Intelligence

Multimodal Cross-Attention Framework for Political Meme Detection in Bengali

ai-technology · 2026-07-29

Researchers have introduced a Multimodal Cross-Attention Fusion framework to detect political intent in Bengali memes. The approach uses a Vision-Language Model to extract OCR text from noisy images, then encodes visual and textual features, aligning semantic tokens with visual regions via cross-modal multi-head attention. A domain-specific political lexicon is integrated as a knowledge prior. The framework is evaluated on the PoliMemeDecode1 dataset, addressing the challenge of classifying internet memes in low-resource languages like Bengali.

Key facts

  • The framework is called Multimodal Cross-Attention Fusion.
  • It targets political intent detection in Bengali memes.
  • A Vision-Language Model extracts OCR text from meme images.
  • Cross-modal multi-head attention aligns semantic tokens with visual regions.
  • A domain-specific political lexicon is used as a knowledge prior.
  • Evaluation is on the PoliMemeDecode1 dataset.
  • The work is published on arXiv with ID 2607.23493.
  • Bengali is a low-resource language for meme classification.

Entities

Institutions

  • arXiv

Sources