DisasterTD: Framework LLM Multimodale per la Disambiguazione dei Toponimi nei Disastri
I ricercatori propongono DisasterTD, un framework che utilizza modelli linguistici di grandi dimensioni multimodali (MLLM) e geolocalizzazione cross-view per disambiguare riferimenti geografici vaghi nelle immagini dei social media (SMI) durante i disastri. Il sistema estrae prima i toponimi e genera posizioni candidate da testo rumoroso utilizzando MLLM, poi incrocia le SMI con immagini di telerilevamento (RSI) e immagini di street-view (SVI) per verificare i risultati. La valutazione sul dataset dell'uragano Harvey mostra una migliore accuratezza della geolocalizzazione. L'approccio affronta una sfida chiave nell'uso delle SMI per la consapevolezza situazionale e la risposta alle emergenze.
Fatti principali
- DisasterTD integra il ragionamento semantico basato su MLLM con la geolocalizzazione cross-view.
- Gli MLLM estraggono toponimi e generano geolocalizzazioni candidate da input testuali rumorosi.
- Il matching cross-view tra SMI, RSI e opzionalmente SVI verifica e perfeziona i risultati candidati.
- Valutato sul dataset dell'uragano Harvey.
- Le SMI forniscono prospettive tempestive dal terreno per la consapevolezza situazionale e la risposta alle emergenze.
- I riferimenti geografici nelle SMI sono spesso vaghi o ambigui.
- Il framework mira a migliorare l'accurata geolocalizzazione delle SMI relative ai disastri.
- Pubblicato su arXiv con ID 2607.24856.
Entità
Istituzioni
- arXiv