Yokai Learning Environment: Nuovo Benchmark per il Coordinamento Zero-Shot nel RL Multi-Agente
Il Yokai Learning Environment (YLE) è stato presentato dai ricercatori come un benchmark open-source per l'apprendimento per rinforzo multi-agente, volto a superare i limiti del Hanabi Learning Environment (HLE). Storicamente, HLE è servito come benchmark principale per il coordinamento zero-shot (ZSC), valutando gli algoritmi abbinando agenti addestrati indipendentemente. Tuttavia, sviluppi recenti hanno portato a prestazioni quasi perfette nel cross-play inter-seed in HLE, limitando la sua efficacia nel tracciare i progressi algoritmici. YLE incorpora nuove caratteristiche non presenti in HLE, come la capacità di tracciare e aggiornare le credenze riguardo alle carte in movimento, ragionare con suggerimenti ambigui e determinare quando terminare il gioco in base alla conoscenza condivisa inferita. Queste capacità sfidano gli agenti a stabilire un terreno comune, un aspetto chiave dell'IA cooperativa. I principali metodi ZSC, inclusi High-Entropy IPPO, sono valutati all'interno di questo benchmark. L'articolo è accessibile su arXiv con l'identificatore 2508.12480, categorizzato come 'replace'.
Fatti principali
- Il Yokai Learning Environment (YLE) è introdotto come nuovo benchmark per il coordinamento zero-shot.
- YLE è open-source e progettato per l'apprendimento per rinforzo multi-agente.
- Il Hanabi Learning Environment (HLE) è stato il benchmark dominante per ZSC.
- Lavori recenti hanno raggiunto prestazioni quasi perfette nel cross-play inter-seed in HLE.
- YLE richiede di tracciare e aggiornare le credenze sulle carte in movimento.
- YLE include il ragionamento sotto suggerimenti ambigui.
- YLE richiede di decidere quando terminare il gioco in base alla conoscenza condivisa inferita.
- I principali metodi ZSC, inclusi High-Entropy IPPO, sono valutati in YLE.
Entità
Istituzioni
- arXiv