RRS-10K: Benchmark per l'interpretazione di immagini di telerilevamento rare
I ricercatori hanno introdotto RRS-10K, un benchmark progettato per valutare i modelli visione-linguaggio (VLM) nell'interpretazione di immagini di telerilevamento rare. Il benchmark contiene 10.738 immagini relative a contesti militari raccolte da fonti dirette, abbinate a coppie domanda-risposta in formati multipli. Copre tre dimensioni di capacità, sei sottodimensioni e 20 compiti foglia, concentrandosi su percezione, ragionamento e robustezza. È stata impiegata una strategia di filtraggio dei distrattori basata sulla similarità (SDFS) per migliorare la qualità delle domande a scelta multipla. La valutazione di 52 modelli ha mostrato solo una moderata performance zero-shot, evidenziando lacune nelle capacità dei VLM per scene rare.
Fatti principali
- RRS-10K contiene 10.738 immagini di telerilevamento relative a contesti militari.
- Le immagini provengono da fonti dirette.
- Il benchmark copre tre dimensioni di capacità, sei sottodimensioni e 20 compiti foglia.
- I compiti includono percezione, ragionamento e robustezza.
- È stata utilizzata una strategia di filtraggio dei distrattori basata sulla similarità (SDFS) per le domande a scelta multipla.
- Sono stati valutati 52 modelli rappresentativi.
- Gli attuali VLM raggiungono solo una moderata performance zero-shot.
- I benchmark esistenti sono dominati da immagini urbane e rurali comuni.
Entità
—