ARTFEED — Contemporary Art Intelligence

PinpointQA: Benchmark per la Comprensione Spaziale di Piccoli Oggetti in Video Interni

ai-technology · 2026-08-13

È stato lanciato un nuovo framework di valutazione chiamato PinpointQA per valutare la capacità dei modelli linguistici multimodali di grandi dimensioni (MLLM) di identificare piccoli oggetti di uso quotidiano in video di ambienti interni. Utilizzando i dataset ScanNet++ e ScanNet200, che includono oltre 1.000 scene e più di 10.000 combinazioni di domande e risposte, lo strumento fornisce quattro livelli di difficoltà crescente. Questi includono compiti relativi alla verifica di oggetti, all'identificazione di riferimenti, a descrizioni spaziali dettagliate e a previsioni spaziali strutturate. PinpointQA colma una lacuna cruciale nelle valutazioni attuali dell'intelligenza spaziale video e della localizzazione degli oggetti, come dettagliato in un documento di accompagnamento su arXiv, identificatore 2604.08991.

Fatti principali

  • PinpointQA è un benchmark per la comprensione spaziale incentrata su piccoli oggetti in video interni.
  • È costruito dai dataset ScanNet++ e ScanNet200.
  • Il benchmark contiene 1.024 scene e 10.094 coppie di domande e risposte.
  • Include quattro compiti: Verifica della Presenza del Target, Identificazione del Riferimento più Vicino, Descrizione Spaziale Dettagliata e Previsione Spaziale Strutturata.
  • Le annotazioni di verità di base sono costruite da rappresentazioni spaziali intermedie derivate dalla geometria 3D allineata.
  • Il benchmark valuta modelli linguistici multimodali di grandi dimensioni (MLLM).
  • Affronta la mancanza di valutazione diretta della localizzazione precisa di piccoli oggetti nei benchmark esistenti.
  • Il documento è disponibile su arXiv con ID 2604.08991.

Entità

Istituzioni

  • arXiv

Fonti