ARTFEED — Contemporary Art Intelligence

I VLM riscrivono testi imperfetti invece di trascriverli fedelmente

ai-technology · 2026-07-27

Uno studio recente indica che i Vision Language Models (VLM) trasformano frequentemente testi imperfetti in versioni più credibili invece di trascriverli accuratamente, una tendenza che i benchmark OCR standard su testi puliti non riescono a rilevare. I ricercatori presentano FaithC4, un benchmark multilingue di perturbazioni composto da 1.455 documenti a pagina singola in inglese, cinese e coreano, suddivisi in tre tipi di perturbazioni: mescolamento, sostituzione casuale e sostituzione visivamente simile. Valutano 15 sistemi, inclusi VLM generici, VLM specializzati in OCR e metodi OCR convenzionali. I VLM generici subiscono un degrado fino a 4,5 punti nel Word Error Rate (WER) sotto perturbazione, mentre i VLM specializzati in OCR calano di 0,2–2 punti e l'OCR tradizionale mostra un calo inferiore a 0,6 punti in inglese. L'analisi strato per strato di Qwen3-VL-4B rivela un pattern di riscrittura coerente. Il documento è disponibile su arXiv (2607.21617).

Fatti principali

  • I VLM riscrivono testi imperfetti in forme plausibili invece di una trascrizione fedele
  • Il benchmark FaithC4 include 1.455 documenti in inglese, cinese e coreano
  • Tre famiglie di perturbazioni: mescolamento, sostituzione casuale, sostituzione visivamente simile
  • 15 sistemi valutati: VLM generici, VLM specializzati in OCR, OCR tradizionale
  • I VLM generici degradano fino a 4,5 punti WER sotto perturbazione
  • I VLM specializzati in OCR degradano 0,2–2 punti WER
  • L'OCR tradizionale degrada meno di 0,6 punti WER in inglese
  • Il probing strato per strato di Qwen3-VL-4B mostra un comportamento di riscrittura coerente

Entità

Istituzioni

  • arXiv

Fonti