Ragionamento Spaziale degli LLM Limitato in Compiti di Gioco Complessi
Un nuovo studio su arXiv (2607.22732) indaga i fallimenti del ragionamento spaziale negli agenti di gioco basati su LLM, testando se l'aumento causale dei prompt e la pianificazione multi-step migliorino i tassi di vittoria. Utilizzando la famiglia di modelli Qwen3 a diverse scale, modalità di ragionamento e orizzonti di pianificazione, i ricercatori hanno introdotto un benchmark GVGAI con tre giochi personalizzati a cinque livelli di difficoltà. Gli esperimenti includevano un esperimento di posizionamento per l'accuratezza delle coordinate e la valutazione del successo nel gameplay. I risultati mostrano che i modelli più grandi con modalità di pensiero identificano le posizioni in modo più accurato, ma i modelli più piccoli hanno difficoltà con l'abbinamento delle coordinate. I tassi di vittoria diminuiscono con l'aumentare della complessità del gioco.
Fatti principali
- Lo studio esamina il ragionamento spaziale negli agenti di gioco basati su LLM
- Utilizza la famiglia di modelli Qwen3 a diverse scale e modalità di ragionamento
- Introduce un benchmark GVGAI personalizzato con tre giochi e cinque livelli di difficoltà
- Valuta l'accuratezza del posizionamento e il successo nel gameplay
- I modelli più grandi con modalità di pensiero ottengono risultati migliori nell'abbinamento delle coordinate
- I modelli più piccoli mostrano prestazioni limitate nell'abbinamento delle coordinate
- I tassi di vittoria diminuiscono all'aumentare dei livelli di gioco e della complessità del layout
- L'aumento causale dei prompt e la pianificazione multi-step vengono testati per miglioramenti
Entità
Istituzioni
- arXiv