ARTFEED — Contemporary Art Intelligence

Audit del Credito Visivo Rivela una Sopravvalutazione del Ragionamento Spaziale nell'IA

other · 2026-07-30

Un nuovo metodo chiamato Visual Credit Audit (VCA) rivela che molte risposte corrette nei benchmark di ragionamento spaziale per i modelli linguistici multimodali di grandi dimensioni (MLLM) non si basano effettivamente sulle informazioni visive. Lo studio, pubblicato su arXiv (2607.27069), mostra che il 12,73-26,25% delle decisioni corrette non sono attribuibili all'immagine, il che significa che il modello potrebbe rispondere correttamente senza vederla. Il VCA confronta le prestazioni del modello con controlli basati solo su testo e vuoti, e utilizza la permutazione delle immagini per misurare la dipendenza dalle prove visive. Su quattro MLLM aperti e due benchmark spaziali, la permutazione delle immagini abbinate ha ridotto la correttezza attribuibile alla dipendenza (D-CC) di 21,25-47,80 punti, con tutti gli intervalli di confidenza al 95% sopra lo zero. Il metodo è privo di addestramento e di etichette per il primo audit, e l'applicazione delle etichette produce D-CC. I risultati suggeriscono che gli attuali benchmark potrebbero sopravvalutare le capacità di ragionamento visivo, poiché i modelli spesso si basano su prior linguistici o correlazioni spurie.

Fatti principali

  • 1. Il Visual Credit Audit (VCA) separa se l'immagine supporta la decisione del modello più dei controlli basati solo su testo e vuoti.
  • 2. Il 12,73-26,25% delle decisioni corrette non sono attribuibili all'immagine su quattro MLLM aperti e due benchmark spaziali.
  • 3. La permutazione delle immagini abbinate con la stessa suddivisione riduce la D-CC di 21,25-47,80 punti.
  • 4. Tutti gli intervalli di confidenza al 95% appaiati sopra zero indicano una dipendenza visiva significativa.
  • 5. Il primo audit è privo di addestramento e di etichette e non richiede un'inversione della risposta.
  • 6. L'applicazione delle etichette produce la correttezza attribuibile alla dipendenza (D-CC).
  • 7. L'allineamento delle previsioni estende l'audit agli errori.
  • 8. Lo studio utilizza contrasti di relazione a pixel fissi e un fattore di fonte di prova 3x3.

Entità

Istituzioni

  • arXiv

Fonti