ARTFEED — Contemporary Art Intelligence

FlowGuard: Rilevamento di Attacchi AI Multimodali tramite Coerenza Interna

ai-technology · 2026-07-27

Un nuovo articolo di ricerca su arXiv propone FlowGuard, un framework leggero per rilevare attacchi adversariali a modelli linguistici multimodali di grandi dimensioni (MLLM) monitorando la coerenza interna cross-modale. A differenza dei sistemi unimodali, gli MLLM affrontano superfici di attacco uniche in cui gli avversari distribuiscono intenzioni malevole tra input testuali e visivi per eludere le difese unimodali. L'intuizione chiave è che gli input benigni producono un comportamento predittivo compatibile dal ragionamento solo testuale e solo visivo, che si stabilizza quando vengono fusi, mentre la manipolazione avversariale interrompe questa coerenza. Le difese esistenti che esaminano input o output grezzi sono fragili e computazionalmente costose. FlowGuard utilizza FlowVectors derivati dalla Decomposizione Parziale dell'Informazione per misurare la coerenza multimodale interna senza fare affidamento su metriche di confidenza scalari. L'articolo è pubblicato su arXiv con ID 2607.21600.

Fatti principali

  • ID articolo arXiv 2607.21600
  • Propone il framework FlowGuard
  • Rileva attacchi adversariali a LLM multimodali
  • Utilizza la coerenza interna cross-modale come segnale di rilevamento
  • FlowVectors derivati dalla Decomposizione Parziale dell'Informazione
  • Affronta superfici di attacco uniche per i sistemi multimodali
  • Difesa leggera al momento dell'inferenza
  • Pubblicato su arXiv

Entità

Istituzioni

  • arXiv

Fonti