ARTFEED — Contemporary Art Intelligence

FlowGuard: Detecting Multimodal AI Attacks via Internal Consistency

ai-technology · 2026-07-27

A new research paper on arXiv proposes FlowGuard, a lightweight framework to detect adversarial attacks on multimodal large language models (MLLMs) by monitoring internal cross-modal consistency. Unlike unimodal systems, MLLMs face unique attack surfaces where adversaries distribute malicious intent across text and image inputs to evade unimodal safeguards. The key insight is that benign inputs produce compatible predictive behavior from text-only and vision-only reasoning, which stabilizes when fused, while adversarial manipulation disrupts this consistency. Existing defenses examining raw inputs or outputs are brittle and computationally expensive. FlowGuard uses FlowVectors derived from Partial Information Decomposition to measure internal multimodal consistency without relying on scalar confidence metrics. The paper is published on arXiv with ID 2607.21600.

Key facts

  • arXiv paper ID 2607.21600
  • Proposes FlowGuard framework
  • Detects adversarial attacks on multimodal LLMs
  • Uses internal cross-modal consistency as detection signal
  • FlowVectors derived from Partial Information Decomposition
  • Addresses attack surfaces unique to multimodal systems
  • Lightweight inference-time defense
  • Published on arXiv

Entities

Institutions

  • arXiv

Sources