ARTFEED — Contemporary Art Intelligence

SceneActBench testa agenti VLM su azioni in scene 3D

ai-technology · 2026-07-27

SceneActBench è stato introdotto da ricercatori come benchmark volto a valutare le azioni di agenti basati su modelli visione-linguaggio (VLM) in ambienti 3D completi con più oggetti, anziché limitarsi a descrivere o gestire singoli oggetti. Questo benchmark presenta cinque compiti 3D unici derivati da 210 istanze sorgente, generando 520 casi di compito con corrispondenti condizioni di input. Ogni compito opera all'interno di un ciclo agente-ambiente coeso, dove gli agenti ricevono immagini PNG o fotogrammi video campionati e, quando pertinente, risorse 3D, per interagire con l'ambiente 3D. I risultati finali vengono misurati rispetto a verità di base nascoste utilizzando metriche geometriche specifiche. I punteggi ottenuti da undici configurazioni VLM proprietarie variano da 38,6 a 50,2, con nessuna configurazione che eccelle in tutti i compiti. Questa ricerca evidenzia carenze nelle tecniche di valutazione esistenti e offre un quadro per una valutazione più approfondita delle capacità degli agenti in spazi 3D. Lo studio è disponibile su arXiv con l'identificatore 2607.22393.

Fatti principali

  • SceneActBench è un benchmark per agenti VLM che agiscono su scene 3D.
  • Include cinque compiti 3D da 210 istanze sorgente.
  • Vengono generati 520 casi di compito con condizioni di input abbinate.
  • Gli agenti ricevono immagini PNG o fotogrammi video e risorse 3D opzionali.
  • La valutazione utilizza metriche geometriche specifiche per compito rispetto a verità di base nascoste.
  • Sono state testate undici configurazioni VLM proprietarie.
  • I punteggi complessivi vanno da 38,6 a 50,2.
  • Nessuna configurazione VLM singola si comporta in modo coerente tra i compiti.

Entità

Istituzioni

  • arXiv

Fonti