ARTFEED — Contemporary Art Intelligence

DistMedVL: Allineamento Visione-Linguaggio Probabilistico per la Segmentazione di Immagini Mediche Consapevole dell'Incertezza

ai-technology · 2026-08-07

Un nuovo framework probabilistico visione-linguaggio, DistMedVL, è stato sviluppato da ricercatori per migliorare la segmentazione di immagini mediche affrontando esplicitamente l'incertezza nell'allineamento cross-modale. Questo framework affronta le carenze degli attuali approcci deterministici che non tengono conto dell'incertezza aleatoria dovuta a confini poco chiari e dell'incertezza epistemica dovuta a dati di addestramento insufficienti, risultando in prestazioni fragili durante i cambi di dominio. DistMedVL utilizza un Adattatore Cross-Modale Probabilistico (PCM-Adapter) leggero costruito su encoder congelati per rappresentare l'incertezza. Presenta due componenti sequenziali: un Modulo di Allineamento di Mahalanobis (MAM) che rappresenta i token testuali come distribuzioni gaussiane e valuta la compatibilità patch-testo, insieme a un secondo modulo per l'allineamento probabilistico progressivo. Questo metodo mira a migliorare la robustezza in contesti clinici dove l'incertezza è comune. La ricerca è disponibile su arXiv con identificativo 2608.05683.

Fatti principali

  • DistMedVL è un framework probabilistico visione-linguaggio per la segmentazione di immagini mediche.
  • Introduce un Adattatore Cross-Modale Probabilistico (PCM-Adapter) su encoder congelati.
  • L'adattatore include un Modulo di Allineamento di Mahalanobis (MAM) che modella i token testuali come distribuzioni gaussiane.
  • Il framework affronta l'incertezza aleatoria ed epistemica nell'allineamento cross-modale.
  • I metodi deterministici esistenti sono fragili sotto cambi di dominio.
  • L'articolo è disponibile su arXiv con identificativo 2608.05683.
  • Il framework mira a migliorare le prestazioni in condizioni cliniche del mondo reale.

Entità

Istituzioni

  • arXiv

Fonti