FlowGuard: Rilevamento di Attacchi AI Multimodali tramite Coerenza Interna
Un nuovo articolo di ricerca su arXiv propone FlowGuard, un framework leggero per rilevare attacchi adversariali a modelli linguistici multimodali di grandi dimensioni (MLLM) monitorando la coerenza interna cross-modale. A differenza dei sistemi unimodali, gli MLLM affrontano superfici di attacco uniche in cui gli avversari distribuiscono intenzioni malevole tra input testuali e visivi per eludere le difese unimodali. L'intuizione chiave è che gli input benigni producono un comportamento predittivo compatibile dal ragionamento solo testuale e solo visivo, che si stabilizza quando vengono fusi, mentre la manipolazione avversariale interrompe questa coerenza. Le difese esistenti che esaminano input o output grezzi sono fragili e computazionalmente costose. FlowGuard utilizza FlowVectors derivati dalla Decomposizione Parziale dell'Informazione per misurare la coerenza multimodale interna senza fare affidamento su metriche di confidenza scalari. L'articolo è pubblicato su arXiv con ID 2607.21600.
Fatti principali
- ID articolo arXiv 2607.21600
- Propone il framework FlowGuard
- Rileva attacchi adversariali a LLM multimodali
- Utilizza la coerenza interna cross-modale come segnale di rilevamento
- FlowVectors derivati dalla Decomposizione Parziale dell'Informazione
- Affronta superfici di attacco uniche per i sistemi multimodali
- Difesa leggera al momento dell'inferenza
- Pubblicato su arXiv
Entità
Istituzioni
- arXiv