Banditi Multi-Agente Robusti con Ricompense a Coda Pesante e Asimmetria Informativa
Uno studio recente in informatica affronta il problema dei banditi multi-braccio in scenari con distribuzioni di ricompensa a coda pesante e interazioni decentralizzate caratterizzate da asimmetria informativa. I ricercatori introducono algoritmi decentralizzati robusti applicabili a tre scenari: ricompense comuni con azioni non osservate, ricompense indipendenti con azioni osservate e ricompense indipendenti con azioni non osservate. Stabiliscono garanzie di regret che si allineano strettamente con i tassi centralizzati a coda pesante. Esperimenti condotti in un ambiente di ricompensa distribuita secondo Pareto supportano le conclusioni teoriche e evidenziano i compromessi coinvolti nella sincronizzazione, coordinazione ed esplorazione. Questo articolo è accessibile su arXiv (2608.10529) ed è categorizzato sotto l'apprendimento automatico.
Fatti principali
- Lo studio esamina i banditi multi-braccio multi-agente con ricompense a coda pesante.
- Vengono considerati tre regimi di asimmetria informativa: azioni non osservate con ricompense comuni, azioni osservate con ricompense indipendenti e azioni non osservate con ricompense indipendenti.
- Vengono sviluppati algoritmi decentralizzati robusti per ciascun contesto.
- Le garanzie di regret corrispondono quasi ai tassi centralizzati a coda pesante.
- Esperimenti su un ambiente di ricompensa distribuita secondo Pareto convalidano i risultati teorici.
- L'articolo è disponibile su arXiv con ID 2608.10529.
- L'articolo è categorizzato sotto Informatica > Apprendimento Automatico.
- L'articolo discute i compromessi tra sincronizzazione, coordinazione ed esplorazione.
Entità
Istituzioni
- arXiv