ARTFEED — Contemporary Art Intelligence

Il Benchmark PolyComp Testa il Ragionamento Spaziale dell'IA con Puzzle di Policubi

ai-technology · 2026-08-18

I ricercatori hanno introdotto PolyComp, un benchmark generato proceduralmente progettato per mettere alla prova il riconoscimento visivo e il ragionamento spaziale compositivo nei modelli di IA multimodali. Il benchmark presenta ai modelli un solido target e quattro opzioni, richiedendo l'identificazione di quale coppia di componenti di policubi può combinarsi per formare il target. Comprende 120 problemi in quattro famiglie geometriche, ciascuno presentato in tre formati utilizzando immagini singole o multiple, per un totale di 360 problemi presentati per modello. La linea di base del caso è del 25%.

Fatti principali

  • PolyComp è un benchmark generato proceduralmente per il ragionamento spaziale 3D compositivo.
  • Contiene 120 problemi in quattro famiglie geometriche.
  • Ogni problema ha tre formati di presentazione che utilizzano immagini singole o multiple.
  • La linea di base del caso è del 25%.
  • GPT-5.6 Sol ha raggiunto un'accuratezza del 50,0% a $0,951 per problema.
  • Claude Fable 5 ha raggiunto un'accuratezza del 39,4% a $0,701 per problema.
  • Gemini 3.1 Pro Preview ha raggiunto un'accuratezza del 27,5% a $0,350 per problema.
  • Il benchmark è disponibile su arXiv con ID 2608.14741.

Entità

Istituzioni

  • arXiv

Fonti