ARTFEED — Contemporary Art Intelligence

Ragionamento Spaziale degli LLM Limitato in Compiti di Gioco Complessi

other · 2026-07-29

Un nuovo studio su arXiv (2607.22732) indaga i fallimenti del ragionamento spaziale negli agenti di gioco basati su LLM, testando se l'aumento causale dei prompt e la pianificazione multi-step migliorino i tassi di vittoria. Utilizzando la famiglia di modelli Qwen3 a diverse scale, modalità di ragionamento e orizzonti di pianificazione, i ricercatori hanno introdotto un benchmark GVGAI con tre giochi personalizzati a cinque livelli di difficoltà. Gli esperimenti includevano un esperimento di posizionamento per l'accuratezza delle coordinate e la valutazione del successo nel gameplay. I risultati mostrano che i modelli più grandi con modalità di pensiero identificano le posizioni in modo più accurato, ma i modelli più piccoli hanno difficoltà con l'abbinamento delle coordinate. I tassi di vittoria diminuiscono con l'aumentare della complessità del gioco.

Fatti principali

  • Lo studio esamina il ragionamento spaziale negli agenti di gioco basati su LLM
  • Utilizza la famiglia di modelli Qwen3 a diverse scale e modalità di ragionamento
  • Introduce un benchmark GVGAI personalizzato con tre giochi e cinque livelli di difficoltà
  • Valuta l'accuratezza del posizionamento e il successo nel gameplay
  • I modelli più grandi con modalità di pensiero ottengono risultati migliori nell'abbinamento delle coordinate
  • I modelli più piccoli mostrano prestazioni limitate nell'abbinamento delle coordinate
  • I tassi di vittoria diminuiscono all'aumentare dei livelli di gioco e della complessità del layout
  • L'aumento causale dei prompt e la pianificazione multi-step vengono testati per miglioramenti

Entità

Istituzioni

  • arXiv

Fonti