I VLM riscrivono testi imperfetti invece di trascriverli fedelmente
Uno studio recente indica che i Vision Language Models (VLM) trasformano frequentemente testi imperfetti in versioni più credibili invece di trascriverli accuratamente, una tendenza che i benchmark OCR standard su testi puliti non riescono a rilevare. I ricercatori presentano FaithC4, un benchmark multilingue di perturbazioni composto da 1.455 documenti a pagina singola in inglese, cinese e coreano, suddivisi in tre tipi di perturbazioni: mescolamento, sostituzione casuale e sostituzione visivamente simile. Valutano 15 sistemi, inclusi VLM generici, VLM specializzati in OCR e metodi OCR convenzionali. I VLM generici subiscono un degrado fino a 4,5 punti nel Word Error Rate (WER) sotto perturbazione, mentre i VLM specializzati in OCR calano di 0,2–2 punti e l'OCR tradizionale mostra un calo inferiore a 0,6 punti in inglese. L'analisi strato per strato di Qwen3-VL-4B rivela un pattern di riscrittura coerente. Il documento è disponibile su arXiv (2607.21617).
Fatti principali
- I VLM riscrivono testi imperfetti in forme plausibili invece di una trascrizione fedele
- Il benchmark FaithC4 include 1.455 documenti in inglese, cinese e coreano
- Tre famiglie di perturbazioni: mescolamento, sostituzione casuale, sostituzione visivamente simile
- 15 sistemi valutati: VLM generici, VLM specializzati in OCR, OCR tradizionale
- I VLM generici degradano fino a 4,5 punti WER sotto perturbazione
- I VLM specializzati in OCR degradano 0,2–2 punti WER
- L'OCR tradizionale degrada meno di 0,6 punti WER in inglese
- Il probing strato per strato di Qwen3-VL-4B mostra un comportamento di riscrittura coerente
Entità
Istituzioni
- arXiv