TGFusion: Flow Matching Guidato da Testo per la Fusione di Immagini in Condizioni di Degrado Complesse
I ricercatori hanno introdotto TGFusion, un framework di flow matching nello spazio latente guidato da testo, progettato per affrontare le sfide della fusione di immagini infrarosso-visibile in scenari di degrado realistici. Il framework unifica la soppressione del degrado e la fusione cross-modale codificando segnali di compito, degrado e generazione in prompt strutturati. A differenza dei metodi esistenti che iniettano rappresentazioni testuali globali fisse, TGFusion adatta la guida testuale a degradazioni spazialmente variabili, strutture locali e salienza termica. L'approccio sfrutta il testo per fornire informazioni preliminari sulle caratteristiche del degrado, integrando le prove limitate provenienti da immagini di input corrotte. L'articolo, disponibile su arXiv (2608.00530), propone un'architettura Prompt-conditioned Multi-stream J (probabilmente un refuso per 'Joint') per sfruttare appieno queste priorità. Questo lavoro è significativo per le applicazioni di visione artificiale in cui la fusione di immagini deve operare in condizioni complesse del mondo reale.
Fatti principali
- TGFusion è un framework di flow matching nello spazio latente guidato da testo.
- Unifica la soppressione del degrado e la fusione cross-modale.
- Codifica segnali di compito, degrado e generazione in prompt strutturati.
- Si adatta a degradazioni spazialmente variabili, strutture locali e salienza termica.
- I metodi esistenti utilizzano rappresentazioni testuali globali fisse.
- Il testo fornisce informazioni preliminari sulle caratteristiche del degrado.
- L'articolo è su arXiv con ID 2608.00530.
- Il framework utilizza un'architettura Prompt-conditioned Multi-stream J.
Entità
Istituzioni
- arXiv