UAVQA-Bench: Un nuovo benchmark per la comprensione di immagini UAV basata su MLLM
I ricercatori hanno creato un nuovo strumento di valutazione chiamato UAVQA-Bench per misurare quanto bene i Modelli Linguistici Multimodali di grandi dimensioni (MLLM) comprendono e ragionano sulle immagini aeree UAV. Questo strumento presenta 1.500 coppie di domande e risposte annotate da esseri umani, provenienti da 13 dataset UAV pubblicamente accessibili. Copre sei dimensioni di capacità e include 16 diversi compiti in formati sia a scelta multipla che di grounding visivo. Lo studio ha testato vari MLLM, sia open-source che closed-source, nonché sistemi basati su agenti, identificando tre principali punti di fallimento: disallineamenti tra dominio e set di strumenti, propagazione di errori non controllata e problemi di ragionamento statico. I risultati mirano a standardizzare le valutazioni e migliorare le valutazioni relative alla comprensione UAV. Puoi trovare l'articolo su arXiv con l'identificatore 2608.11738.
Fatti principali
- UAVQA-Bench è un nuovo benchmark per la comprensione e il ragionamento su immagini UAV basato su MLLM.
- Include 1.500 coppie di domande e risposte annotate da esseri umani provenienti da 13 dataset UAV pubblici.
- Il benchmark copre 6 dimensioni di capacità e 16 compiti.
- I compiti sono in formati a scelta multipla e di grounding visivo.
- È stata condotta una valutazione sistematica di MLLM open-source e closed-source e di sistemi basati su agenti.
- Sono state identificate tre principali modalità di fallimento: disallineamento tra dominio e set di strumenti, propagazione di errori non controllata e ragionamento statico.
- L'articolo è disponibile su arXiv con l'identificatore 2608.11738.
Entità
—