VisDeception: Benchmark Testa la Robustezza dei VLM contro Grafici Ingannevoli
Un team di ricercatori ha lanciato VisDeception, il primo benchmark controllato e accoppiato progettato per valutare la resilienza dei modelli linguistico-visivi (VLM) contro progetti grafici fuorvianti. Questo benchmark presenta 1.600 coppie di grafici accurati e ingannevoli in otto categorie principali di tecniche di visualizzazione fuorvianti, come assi invertiti o troncati, proporzioni distorte, codifiche improprie e schemi cromatici ingannevoli. Ogni grafico ingannevole è abbinato a una versione veritiera derivata dallo stesso set di dati. L'iniziativa mira a valutare la suscettibilità dei VLM a tali visualizzazioni fuorvianti, essenziale per un'analisi dei dati affidabile, poiché i VLM sono sempre più utilizzati per interpretare grafici e condurre ragionamenti analitici. Il benchmark separa efficacemente gli errori di ragionamento causati dall'inganno da altre influenze.
Fatti principali
- VisDeception è il primo benchmark controllato e accoppiato per la robustezza dei VLM contro grafici fuorvianti.
- Il benchmark contiene 1.600 coppie di grafici fedeli e ingannevoli.
- Sono coperte otto categorie principali di tattiche di visualizzazione ingannevoli.
- Le tattiche ingannevoli includono assi troncati, assi invertiti, proporzioni distorte, codifiche inappropriate e mappature cromatiche fuorvianti.
- Ogni grafico ingannevole è abbinato a una controparte fedele dagli stessi dati.
- Lo studio si concentra sui VLM utilizzati per la comprensione di grafici e il ragionamento analitico.
- Il benchmark isola gli errori di ragionamento indotti dall'inganno.
- La ricerca è pubblicata su arXiv con identificativo 2607.22600.
Entità
Istituzioni
- arXiv