Apprendimento Q Centralizzato vs Indipendente in un Gridworld Multi-Agente Tabulare
Uno studio recente disponibile su arXiv (2601.17454) esplora i meccanismi di coordinazione nell'apprendimento per rinforzo multi-agente attraverso un gridworld predatore-preda 8x8 completamente tabulare, incorporando limiti di velocità e resistenza. Questa ricerca valuta l'Apprendimento Q Indipendente (IQL) e l'Apprendimento Q Centralizzato (CQL) in tre scenari cinematici su 10 semi. I risultati indicano che l'apprendimento completamente indipendente (IQL-IQL) produce costantemente episodi più brevi e maggiori ricompense per i predatori rispetto all'approccio completamente centralizzato (CQL-CQL) in tutti gli scenari e semi (Wilcoxon p = 0.00195, Cliff's delta = 1.0). Inoltre, gli accoppiamenti asimmetrici (IQL-CQL) mostrano fallimenti di coordinazione persistenti durante l'intero budget di addestramento di 40.000 episodi. Una valutazione di miglior risposta contro predatori IQL-IQL statici convalida ulteriormente i benefici dell'apprendimento indipendente, sfidando i presunti vantaggi dell'apprendimento centralizzato del valore separando la struttura di coordinazione dall'approssimazione di funzione e dall'osservabilità parziale.
Fatti principali
- arXiv:2601.17454
- Gridworld predatore-preda 8x8
- Apprendimento Q Indipendente (IQL) vs Apprendimento Q Centralizzato (CQL)
- Tre regimi cinematici
- 10 semi
- IQL-IQL supera CQL-CQL in tutti i regimi e semi
- Wilcoxon p = 0.00195, Cliff's delta = 1.0
- Accoppiamenti asimmetrici IQL-CQL causano rotture di coordinazione persistenti
- Budget di addestramento di 40.000 episodi
- Test di miglior risposta contro predatori IQL-IQL congelati
Entità
Istituzioni
- arXiv