Il Benchmark Polacco di VQA Medica Rivela che i Modelli Vision-Language Sottoutilizzano le Prove Visive
È stato stabilito un nuovo standard per il question answering visivo medico (VQA) in lingua polacca, utilizzando domande provenienti dall'Esame di Certificazione del Consiglio Polacco, rivolto a medici e dentisti abilitati che cercano credenziali specialistiche. Questo benchmark presenta domande che includono immagini in vari campi medici e categorie visive, insieme a un set di controllo focalizzato esclusivamente sul testo. Una valutazione di modelli vision-language centrati sul polacco, open-weight di uso generale e commerciali rivela che il compito è ancora piuttosto difficile: il modello con le migliori prestazioni raggiunge un'accuratezza del 79,0% sull'intero set VQA, mentre solo GPT-5.6 supera il riferimento umano sul sottoinsieme con risposte candidate disponibili; gli altri modelli sono inferiori rispetto alle prestazioni umane. Per valutare il grounding visivo, i ricercatori hanno analizzato input completi rispetto a versioni prive dell'immagine, della domanda o di entrambi, classificando le domande in base all'importanza dell'immagine. I risultati mostrano che i modelli tendono a estrarre più informazioni utili dal testo che dalle immagini, indicando una tendenza a sottoutilizzare i dati visivi. Il benchmark e il codice correlato sono disponibili su arXiv con l'identificatore 2608.12928.
Fatti principali
- Il benchmark è costruito su domande dell'Esame di Certificazione del Consiglio Polacco per medici e dentisti.
- Il benchmark include domande con immagini e un set di controllo QA solo testo.
- Il miglior modello raggiunge un'accuratezza del 79,0% sull'intero set VQA.
- Solo GPT-5.6 supera il riferimento umano approssimativo sul sottoinsieme con risposte candidate disponibili.
- Tutti gli altri modelli valutati ottengono prestazioni peggiori degli umani.
- I modelli derivano più informazioni utili dal testo della domanda che dall'immagine.
- Lo studio confronta input completi con configurazioni che omettono l'immagine, la domanda o entrambi.
- Il benchmark è disponibile su arXiv con l'identificatore 2608.12928.
Entità
Istituzioni
- arXiv