CityRiSE: Migliorare i LVLM per il Ragionamento Socio-Economico Urbano tramite Apprendimento per Rinforzo
È stato introdotto un nuovo framework denominato CityRiSE per migliorare la capacità dei Large Vision-Language Models (LVLM) di analizzare le condizioni socio-economiche urbane utilizzando informazioni visive. Questo framework è descritto in una pubblicazione arXiv (arXiv:2510.22282v2) e utilizza l'apprendimento per rinforzo (RL) insieme a un dataset multi-modale accuratamente assemblato e a un design per ricompense verificabili. CityRiSE indirizza i LVLM a concentrarsi su segnali visivi significativi, facilitando un ragionamento strutturato e orientato agli obiettivi per prevedere lo stato socio-economico. I risultati sperimentali indicano che CityRiSE, dotato di capacità di ragionamento avanzate, supera le metodologie attuali. Questo studio affronta il problema del rilevamento socio-economico urbano, cruciale per promuovere gli obiettivi di sviluppo sostenibile globale. L'articolo è stato rilasciato come aggiornamento replace-cross su arXiv.
Fatti principali
- CityRiSE è un nuovo framework per ragionare sullo stato socio-economico urbano nei LVLM tramite apprendimento per rinforzo.
- Il framework utilizza un dataset multi-modale curato e un design di ricompense verificabili.
- Guida i LVLM a concentrarsi su segnali visivi semanticamente significativi.
- Gli esperimenti mostrano un miglioramento significativo rispetto ai metodi esistenti.
- L'articolo è disponibile su arXiv con ID 2510.22282.
- La ricerca affronta il rilevamento socio-economico urbano per gli obiettivi di sviluppo sostenibile.
- Il tipo di annuncio è replace-cross.
- L'approccio consente un ragionamento strutturato e orientato agli obiettivi.
Entità
Istituzioni
- arXiv