Pseudo-etichette multimodali migliorano la segmentazione a vocabolario aperto
Uno studio recente pubblicato su arXiv (2608.11681) introduce un approccio multimodale volto a migliorare la segmentazione delle istanze a vocabolario aperto (OVIS) e la segmentazione panottica a set aperto (OSPS). Questa struttura è progettata per identificare sia categorie di oggetti note che nuove, senza la necessità di annotazioni estese. Le tecniche attuali incontrano difficoltà con pseudo-maschere inaccurate e un insufficiente ancoraggio visivo-testuale. Sfruttando modelli pre-addestrati di visione-linguaggio, la struttura facilita la creazione automatica di pseudo-etichette, il filtraggio dei sinonimi assistito da CLIP e la ricostruzione delle didascalie guidata da GPT. Genera pseudo-maschere di segmentazione, didascalie pertinenti e insiemi di sinonimi corrispondenti utilizzando Grounded SAM, LLaVA e CLIP, migliorando così la coerenza visivo-testuale. Questo avanzamento affronta un problema significativo nella visione artificiale, consentendo ai modelli di riconoscere e segmentare oggetti al di là di un set di dati di addestramento statico, il che è fondamentale per applicazioni pratiche.
Fatti principali
- Il documento arXiv:2608.11681 propone una struttura multimodale per la segmentazione di istanze e panottica a vocabolario aperto.
- La struttura utilizza modelli pre-addestrati di visione-linguaggio per la generazione automatica di pseudo-etichette.
- Impiega il filtraggio dei sinonimi guidato da CLIP e la ricostruzione delle didascalie basata su GPT.
- Il metodo costruisce pseudo-maschere di segmentazione, didascalie descrittive e insiemi di sinonimi semanticamente allineati utilizzando Grounded SAM, LLaVA e CLIP.
- L'impostazione di pseudo-etichettatura assistita dal vocabolario target fornisce una supervisione multimodale senza annotazione manuale.
- Il lavoro affronta sfide come pseudo-maschere rumorose, limitato ancoraggio visivo-testuale e gestione di sinonimi o parole fuori vocabolario.
- Il documento è un annuncio di tipo incrociato su arXiv.
- L'approccio migliora l'allineamento visivo-testuale attraverso tre componenti complementari.
Entità
Istituzioni
- arXiv