ARTFEED — Contemporary Art Intelligence

DD-CMD: Decodifica Cross-Modale a Doppio Dominio per la Segmentazione di Immagini Mediche Guidata da Testo

ai-technology · 2026-08-13

Un nuovo framework chiamato Decodifica Cross-Modale a Doppio Dominio (DD-CMD) è stato sviluppato dai ricercatori per segmentare infezioni polmonari utilizzando la guida di testo clinico. Questo metodo innovativo impiega due tipi di assistenza linguistica durante il processo di decodifica: Text-Guided Spatial Cross-Attention (TGSA), che allinea i token visivi di varie scale con la semantica testuale e affina le caratteristiche tramite fusione residua con gate, e Spectral-Text Adaptive Modulation (STAM), che utilizza una DCT 2D per derivare statistiche di energia a bande apprendibili, prevedendo parametri FiLM condizionati dal testo per adattare i canali del decodificatore per una decodifica sensibile alla frequenza. DD-CMD incorpora TGSA e STAM in un decodificatore da grossolano a fine (da 7x7 a 56x56) e impiega un modulo di raffinamento a due stadi leggero per ripristinare maschere a risoluzione completa. Questo metodo supera le carenze dei recenti approcci guidati dal testo che si concentrano sull'allineamento spaziale ma trascurano il contenuto di frequenza essenziale per texture e bordi. Gli esperimenti sono stati eseguiti sul dataset QaTa-CO, sebbene i risultati specifici non siano inclusi nell'abstract. L'articolo è disponibile su arXiv con l'identificatore 2608.11335.

Fatti principali

  • DD-CMD integra la guida linguistica nel dominio spaziale e di frequenza per la segmentazione di immagini mediche.
  • TGSA allinea i token visivi multi-scala con la semantica testuale utilizzando la fusione residua con gate.
  • STAM utilizza la DCT 2D per calcolare statistiche di energia a bande e prevede parametri FiLM.
  • Il decodificatore opera da 7x7 a 56x56 con un modulo di raffinamento a due stadi.
  • Gli esperimenti sono stati eseguiti sul dataset QaTa-CO.
  • L'articolo è disponibile su arXiv:2608.11335.

Entità

Istituzioni

  • arXiv

Fonti