DD-CMD: Decodifica Cross-Modale a Doppio Dominio per la Segmentazione di Immagini Mediche Guidata da Testo
Un nuovo framework chiamato Decodifica Cross-Modale a Doppio Dominio (DD-CMD) è stato sviluppato dai ricercatori per segmentare infezioni polmonari utilizzando la guida di testo clinico. Questo metodo innovativo impiega due tipi di assistenza linguistica durante il processo di decodifica: Text-Guided Spatial Cross-Attention (TGSA), che allinea i token visivi di varie scale con la semantica testuale e affina le caratteristiche tramite fusione residua con gate, e Spectral-Text Adaptive Modulation (STAM), che utilizza una DCT 2D per derivare statistiche di energia a bande apprendibili, prevedendo parametri FiLM condizionati dal testo per adattare i canali del decodificatore per una decodifica sensibile alla frequenza. DD-CMD incorpora TGSA e STAM in un decodificatore da grossolano a fine (da 7x7 a 56x56) e impiega un modulo di raffinamento a due stadi leggero per ripristinare maschere a risoluzione completa. Questo metodo supera le carenze dei recenti approcci guidati dal testo che si concentrano sull'allineamento spaziale ma trascurano il contenuto di frequenza essenziale per texture e bordi. Gli esperimenti sono stati eseguiti sul dataset QaTa-CO, sebbene i risultati specifici non siano inclusi nell'abstract. L'articolo è disponibile su arXiv con l'identificatore 2608.11335.
Fatti principali
- DD-CMD integra la guida linguistica nel dominio spaziale e di frequenza per la segmentazione di immagini mediche.
- TGSA allinea i token visivi multi-scala con la semantica testuale utilizzando la fusione residua con gate.
- STAM utilizza la DCT 2D per calcolare statistiche di energia a bande e prevede parametri FiLM.
- Il decodificatore opera da 7x7 a 56x56 con un modulo di raffinamento a due stadi.
- Gli esperimenti sono stati eseguiti sul dataset QaTa-CO.
- L'articolo è disponibile su arXiv:2608.11335.
Entità
Istituzioni
- arXiv