ParseFIxLIP: Tree-Gram Parsing Enhances BiomedCLIP Explainability
A new method called ParseFIxLIP improves interpretability of Vision-Language Models (VLMs) in medical tasks by addressing tokenization fragmentation. The approach integrates Tree-Gram Parsing into the Banzhaf interaction game used by the FIxLIP framework. This semantically informed strategy uses dependency parsing trees to prevent clinical concepts like "saddle embolus" from being split into meaningless subwords, which previously caused noisy cross-modal attributions and combinatorial explosion of interactions. The work is detailed in arXiv paper 2607.23368v1, aiming to provide faithful explanations for responsible deployment in clinical settings.
Key facts
- ParseFIxLIP extends FIxLIP by incorporating Tree-Gram Parsing
- Addresses tokenization fragmentation in VLMs for medical tasks
- Uses dependency parsing trees to preserve clinical concepts
- Aims to improve interpretability for responsible clinical deployment
- Described in arXiv paper 2607.23368v1
Entities
Institutions
- arXiv