DistMedVL: Allineamento Visione-Linguaggio Probabilistico per la Segmentazione di Immagini Mediche Consapevole dell'Incertezza
Un nuovo framework probabilistico visione-linguaggio, DistMedVL, è stato sviluppato da ricercatori per migliorare la segmentazione di immagini mediche affrontando esplicitamente l'incertezza nell'allineamento cross-modale. Questo framework affronta le carenze degli attuali approcci deterministici che non tengono conto dell'incertezza aleatoria dovuta a confini poco chiari e dell'incertezza epistemica dovuta a dati di addestramento insufficienti, risultando in prestazioni fragili durante i cambi di dominio. DistMedVL utilizza un Adattatore Cross-Modale Probabilistico (PCM-Adapter) leggero costruito su encoder congelati per rappresentare l'incertezza. Presenta due componenti sequenziali: un Modulo di Allineamento di Mahalanobis (MAM) che rappresenta i token testuali come distribuzioni gaussiane e valuta la compatibilità patch-testo, insieme a un secondo modulo per l'allineamento probabilistico progressivo. Questo metodo mira a migliorare la robustezza in contesti clinici dove l'incertezza è comune. La ricerca è disponibile su arXiv con identificativo 2608.05683.
Fatti principali
- DistMedVL è un framework probabilistico visione-linguaggio per la segmentazione di immagini mediche.
- Introduce un Adattatore Cross-Modale Probabilistico (PCM-Adapter) su encoder congelati.
- L'adattatore include un Modulo di Allineamento di Mahalanobis (MAM) che modella i token testuali come distribuzioni gaussiane.
- Il framework affronta l'incertezza aleatoria ed epistemica nell'allineamento cross-modale.
- I metodi deterministici esistenti sono fragili sotto cambi di dominio.
- L'articolo è disponibile su arXiv con identificativo 2608.05683.
- Il framework mira a migliorare le prestazioni in condizioni cliniche del mondo reale.
Entità
Istituzioni
- arXiv