DinoSplat-OV: Segmentazione Open-Vocabulary Senza Addestramento per il Telerilevamento
Un nuovo framework chiamato DinoSplat-OV è stato sviluppato dai ricercatori, progettato per adattare il vision transformer DINOv3 alla segmentazione semantica open-vocabulary in immagini di telerilevamento senza richiedere addestramento. Questo approccio utilizza il recentemente rilasciato DINO.txt di DINOv3, che incorpora l'apprendimento contrastivo immagine-testo nel backbone DINO, facilitando la segmentazione senza la necessità di fine-tuning o pre-addestramento. Per affrontare i problemi legati alla distribuzione densa, alle caratteristiche multi-scala e alle grandi dimensioni delle immagini di telerilevamento, DinoSplat-OV impiega due componenti principali: un modulo di Propagazione Laplaciana Text-aware per migliorare le previsioni a livello di patch attraverso similarità testuali e visive, e un modulo di Upsampling con Gaussian Splatting per ricostruire le caratteristiche a livello di pixel. Questo framework è dettagliato in un articolo disponibile su arXiv (2608.03023) e mira a ridurre i costi associati alle annotazioni a livello di pixel nella segmentazione del telerilevamento.
Fatti principali
- DinoSplat-OV è un framework senza addestramento per la segmentazione semantica open-vocabulary nel telerilevamento.
- Adatta DINOv3, che include DINO.txt per l'apprendimento contrastivo immagine-testo.
- Il framework non richiede fine-tuning o pre-addestramento aggiuntivo.
- Affronta la distribuzione densa, la natura multi-scala e le grandi dimensioni delle immagini di telerilevamento.
- Il modulo di Propagazione Laplaciana Text-aware denoisa le previsioni a livello di patch.
- Il modulo di Upsampling con Gaussian Splatting ricostruisce le caratteristiche a livello di pixel.
- L'articolo è disponibile su arXiv con ID 2608.03023.
- Il metodo mira a ridurre la necessità di costose annotazioni a livello di pixel.
Entità
Istituzioni
- arXiv