ARTFEED — Contemporary Art Intelligence

DisasterTD: Framework LLM Multimodale per la Disambiguazione dei Toponimi nei Disastri

ai-technology · 2026-07-29

I ricercatori propongono DisasterTD, un framework che utilizza modelli linguistici di grandi dimensioni multimodali (MLLM) e geolocalizzazione cross-view per disambiguare riferimenti geografici vaghi nelle immagini dei social media (SMI) durante i disastri. Il sistema estrae prima i toponimi e genera posizioni candidate da testo rumoroso utilizzando MLLM, poi incrocia le SMI con immagini di telerilevamento (RSI) e immagini di street-view (SVI) per verificare i risultati. La valutazione sul dataset dell'uragano Harvey mostra una migliore accuratezza della geolocalizzazione. L'approccio affronta una sfida chiave nell'uso delle SMI per la consapevolezza situazionale e la risposta alle emergenze.

Fatti principali

  • DisasterTD integra il ragionamento semantico basato su MLLM con la geolocalizzazione cross-view.
  • Gli MLLM estraggono toponimi e generano geolocalizzazioni candidate da input testuali rumorosi.
  • Il matching cross-view tra SMI, RSI e opzionalmente SVI verifica e perfeziona i risultati candidati.
  • Valutato sul dataset dell'uragano Harvey.
  • Le SMI forniscono prospettive tempestive dal terreno per la consapevolezza situazionale e la risposta alle emergenze.
  • I riferimenti geografici nelle SMI sono spesso vaghi o ambigui.
  • Il framework mira a migliorare l'accurata geolocalizzazione delle SMI relative ai disastri.
  • Pubblicato su arXiv con ID 2607.24856.

Entità

Istituzioni

  • arXiv

Fonti