ARTFEED — Contemporary Art Intelligence

RRS-10K: Benchmark per l'interpretazione di immagini di telerilevamento rare

ai-technology · 2026-07-29

I ricercatori hanno introdotto RRS-10K, un benchmark progettato per valutare i modelli visione-linguaggio (VLM) nell'interpretazione di immagini di telerilevamento rare. Il benchmark contiene 10.738 immagini relative a contesti militari raccolte da fonti dirette, abbinate a coppie domanda-risposta in formati multipli. Copre tre dimensioni di capacità, sei sottodimensioni e 20 compiti foglia, concentrandosi su percezione, ragionamento e robustezza. È stata impiegata una strategia di filtraggio dei distrattori basata sulla similarità (SDFS) per migliorare la qualità delle domande a scelta multipla. La valutazione di 52 modelli ha mostrato solo una moderata performance zero-shot, evidenziando lacune nelle capacità dei VLM per scene rare.

Fatti principali

  • RRS-10K contiene 10.738 immagini di telerilevamento relative a contesti militari.
  • Le immagini provengono da fonti dirette.
  • Il benchmark copre tre dimensioni di capacità, sei sottodimensioni e 20 compiti foglia.
  • I compiti includono percezione, ragionamento e robustezza.
  • È stata utilizzata una strategia di filtraggio dei distrattori basata sulla similarità (SDFS) per le domande a scelta multipla.
  • Sono stati valutati 52 modelli rappresentativi.
  • Gli attuali VLM raggiungono solo una moderata performance zero-shot.
  • I benchmark esistenti sono dominati da immagini urbane e rurali comuni.

Entità

Fonti