ARTFEED — Contemporary Art Intelligence

Apprendimento Q Centralizzato vs Indipendente in un Gridworld Multi-Agente Tabulare

publication · 2026-07-27

Uno studio recente disponibile su arXiv (2601.17454) esplora i meccanismi di coordinazione nell'apprendimento per rinforzo multi-agente attraverso un gridworld predatore-preda 8x8 completamente tabulare, incorporando limiti di velocità e resistenza. Questa ricerca valuta l'Apprendimento Q Indipendente (IQL) e l'Apprendimento Q Centralizzato (CQL) in tre scenari cinematici su 10 semi. I risultati indicano che l'apprendimento completamente indipendente (IQL-IQL) produce costantemente episodi più brevi e maggiori ricompense per i predatori rispetto all'approccio completamente centralizzato (CQL-CQL) in tutti gli scenari e semi (Wilcoxon p = 0.00195, Cliff's delta = 1.0). Inoltre, gli accoppiamenti asimmetrici (IQL-CQL) mostrano fallimenti di coordinazione persistenti durante l'intero budget di addestramento di 40.000 episodi. Una valutazione di miglior risposta contro predatori IQL-IQL statici convalida ulteriormente i benefici dell'apprendimento indipendente, sfidando i presunti vantaggi dell'apprendimento centralizzato del valore separando la struttura di coordinazione dall'approssimazione di funzione e dall'osservabilità parziale.

Fatti principali

  • arXiv:2601.17454
  • Gridworld predatore-preda 8x8
  • Apprendimento Q Indipendente (IQL) vs Apprendimento Q Centralizzato (CQL)
  • Tre regimi cinematici
  • 10 semi
  • IQL-IQL supera CQL-CQL in tutti i regimi e semi
  • Wilcoxon p = 0.00195, Cliff's delta = 1.0
  • Accoppiamenti asimmetrici IQL-CQL causano rotture di coordinazione persistenti
  • Budget di addestramento di 40.000 episodi
  • Test di miglior risposta contro predatori IQL-IQL congelati

Entità

Istituzioni

  • arXiv

Fonti